Δύο νέα μοντέλα ζωντανού διαλόγου, το Gemini 3.8 Live και το Gemini 3.8 Live Extended Thinking, παρουσίασε η Google, με στόχο πιο ομαλή προφορική αλληλεπίδραση με συστήματα τεχνητής νοημοσύνης (AI). Η ανακοίνωση έγινε στις 15 Σεπτεμβρίου 2026 και τα δύο μοντέλα διατίθενται από την πρώτη ημέρα μέσω του Gemini API (διεπαφή προγραμματισμού εφαρμογών), του Google Workspace και της εφαρμογής Gemini, σύμφωνα με τη σχετική δημοσίευση της Google DeepMind.

Απευθύνονται πρωτίστως σε προγραμματιστές και επιχειρήσεις που κατασκευάζουν φωνητικούς πράκτορες ΤΝ (AI agents)· η εταιρεία τα περιγράφει ως δομικά στοιχεία για αξιόπιστα συστήματα έτοιμα για παραγωγή. Η Google τα χαρακτηρίζει ως τα πιο προηγμένα μοντέλα ζωντανού διαλόγου της μέχρι σήμερα.

Όπως αναφέρει η Google, το Gemini 3.8 Live επεξεργάζεται οπτικά δεδομένα σχεδόν σε πραγματικό χρόνο, εντοπίζει αυτόματα και εναλλάσσεται μεταξύ 97 υποστηριζόμενων γλωσσών κατά τη συνομιλία και εκτελεί εργαλεία και κλήσεις API στο παρασκήνιο όσο η συνομιλία συνεχίζεται — μπορεί έτσι να επιβεβαιώσει ένα αίτημα και να συνεχίσει να μιλάει όσο ολοκληρώνεται η εργασία.

Το Gemini 3.8 Live Extended Thinking απευθύνεται σε εργασίες που απαιτούν βαθύτερη συλλογιστική. Σύμφωνα με την εταιρεία, σκέφτεται και μιλάει ταυτόχρονα, χρησιμοποιώντας πρώιμες λεκτικές ενδείξεις όπως «Ας το ελέγξω αυτό…» (σε απόδοση από τα αγγλικά) για να επιβεβαιώσει ένα αίτημα, και αφηγείται την πρόοδό του σε πολυβηματικές εργασίες στο παρασκήνιο.

Τα μεγέθη των μετρήσεων προέρχονται από την Google

Η Google αναφέρει ότι το Gemini 3.8 Live Extended Thinking καταλαμβάνει τη συνολική πρώτη θέση στον δείκτη Speech to Speech Quality Index της Artificial Analysis με 82,6 και προηγείται στην ολοκλήρωση πρακτορικών εργασιών με 68,6% στο τ-Voice και 35,1% στο τ-Voice-banking της Sierra. Αναφέρει επίσης 97,7% στο Big Bench Audio και υποστηρίζει ότι το μοντέλο διατηρεί ανταγωνιστική τιμή έναντι άλλων μοντέλων αιχμής.

Το Gemini 3.8 Live κατέλαβε τη δεύτερη θέση στο Speech Agent Arena, αποτέλεσμα που η εταιρεία αποδίδει στην υψηλή προτίμηση των χρηστών, και περιγράφεται ως οικονομικά αποδοτικό για μεγάλη κλίμακα. Στο EVA-Bench της ServiceNow, δοκιμή αξιολόγησης φωνητικών πρακτόρων, η Google υποστηρίζει ότι και τα δύο μοντέλα μετατοπίζουν το Pareto Frontier σε σύνθετες ροές εργασίας, ισορροπώντας ακρίβεια και ποιότητα συνομιλίας· η ανακοίνωση σημειώνει ότι η δοκιμή έτρεξε στο Live API της πλατφόρμας Gemini Enterprise Agent Platform.

Workspace, Search και πλατφόρμες προγραμματιστών

Στο Google Workspace, το Gemini 3.8 Live Extended Thinking μπορεί να χρησιμοποιηθεί στα Docs Live, Gmail Live και Keep Live, αναφέρει η εταιρεία. Σε Workspace και Search, η Google παρουσιάζει τα μοντέλα Live ως πιο συνεργατικό τρόπο διεκπεραίωσης σύνθετων εργασιών με τη φωνή.

Πλατφόρμες όπως οι Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel και Vision Agents βασίζονται στο Gemini Live API και διαχειρίζονται την υποδομή ροής πολυμέσων σε πραγματικό χρόνο πίσω από τις φωνητικές διεπαφές. Η Google ανέφερε επίσης τις Salesforce, Genspark και Lumeris ως συνεργαζόμενες εταιρείες, οι οποίες, όπως αναφέρει, επισημαίνουν την καθυστέρηση απόκρισης, τη ρευστότητα και τις δυνατότητες κλήσης εργαλείων των μοντέλων.

Οι επιδείξεις που συνοδεύουν την ανακοίνωση δείχνουν το Gemini 3.8 Live να παίζει σκάκι με οπτικό πλαίσιο, να καθοδηγεί την ένταξη νέων εργαζομένων απαντώντας σε ερωτήσεις σε πραγματικό χρόνο και να συνθέτει επιχειρηματικά σχέδια και εργαλειοθήκες μάρκετινγκ μέσω ομιλίας. Το Extended Thinking εμφανίζεται να μετατρέπει πρόχειρα σκίτσα και προφορικά σχόλια σε λειτουργικά React components και να συντονίζει πολυβηματικές κρατήσεις με ασύγχρονες κλήσεις συναρτήσεων.

Όλο το ηχητικό υλικό που παράγουν τα προϊόντα ΤΝ της Google φέρει υδατογράφημα SynthID, έναν μη αντιληπτό δείκτη ενσωματωμένο στην ηχητική έξοδο ώστε το περιεχόμενο ΤΝ να παραμένει ανιχνεύσιμο· η εταιρεία παραπέμπει στην κάρτα μοντέλου (model card) για την προσέγγισή της στην ασφάλεια. Η διάθεση του Gemini 3.8 Live Extended Thinking ξεκίνησε την ημέρα της ανακοίνωσης.