Google hat am 15. September 2026 Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking vorgestellt. Beide Modelle richten sich an Sprachagenten, die während eines Dialogs nahezu in Echtzeit Schlussfolgerungen ziehen können. Die Ankündigung stammt von Tom Ouyang, Principal Engineer, und Malini Jaganathan, Member of Technical Staff im Gemini Audio Team.

Gemini 3.8 Live ist auf Skalierung und Kosteneffizienz ausgelegt. Das Modell verbindet Dialogverständnis, flüssige Gespräche und visuelle Kontextverarbeitung. In der Speech Agent Arena von Artificial Analysis erreichte es den zweiten Platz. Im EVA-Bench von ServiceNow verorten Googles Angaben beide Modelle auf der Pareto-Frontier für komplexe Abläufe, mit einem Ausgleich zwischen Genauigkeit und Gesprächsqualität. Für den Test kam die Live API auf der Gemini Enterprise Agent Platform zum Einsatz.

Gemini 3.8 Live Extended Thinking belegte mit 82,6 Punkten den ersten Gesamtrang im Speech to Speech Quality Index von Artificial Analysis. Bei der agentischen Aufgabenerledigung erzielte es 68,6 Prozent auf τ-Voice und 35,1 Prozent auf dem τ-Voice-banking-Benchmark von Sierra. Auf Big Bench Audio erreichte das Modell 97,7 Prozent. Google ordnet es komplexen Aufgaben in Unternehmen zu und bezeichnet den Preis im Vergleich zu anderen Frontier-Modellen als wettbewerbsfähig.

Gemini 3.8 Live verarbeitet visuelle Eingaben nahezu in Echtzeit und wechselt während eines Gesprächs automatisch zwischen 97 unterstützten Sprachen. Tools und API-Aufrufe laufen im Hintergrund weiter, während der Dialog fortgesetzt wird. Demonstrationen zeigen Unterstützung beim interaktiven Onboarding von Beschäftigten und eine Schachpartie mit visuellem Kontext. Extended Thinking kann gleichzeitig schlussfolgern und sprechen, eine Anfrage mit einem frühen Hinweis wie „Let me check that…“ aufnehmen und den Fortschritt mehrstufiger Hintergrundaufgaben schildern. Weitere Vorführungen zeigen die Umwandlung von Skizzen in funktionierende React-Komponenten, mehrstufige Buchungen mit asynchronen Funktionsaufrufen sowie per Sprache erstellte Geschäftspläne und individuelle Marketing-Toolkits.

Google will mit den Modellen die Sprachinteraktion in der Gemini-App, in Google Workspace und in Search verbessern. Gemini 3.8 Live Extended Thinking ist in Docs Live, Gmail Live und Keep Live verfügbar. Gemini 3.8 Live bietet in Search Live eine schrittweise Fehlerdiagnose.

Die Gemini Live API wird von Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel und Vision Agents unterstützt. Diese Plattformen übernehmen die Infrastruktur für Echtzeit-Medienströme, damit Entwickler sprachgesteuerte Oberflächen bauen können. Google nennt außerdem Salesforce, Genspark und Lumeris als Partner, die sich für Latenz, Gesprächsfluss und Tool-Aufrufe der Modelle interessieren.

Von Googles KI-Produkten erzeugte Audiodaten erhalten ein nicht wahrnehmbares SynthID-Wasserzeichen. Dadurch soll die Herkunft der Audiodaten erkennbar bleiben und Desinformation erschwert werden. Weitere Angaben zu Sicherheit und Verantwortung stehen im Modellbericht Gemini 3.8 Audio.

Beide Modelle werden ab dem 15. September 2026 ausgerollt. Entwickler können sie über die Gemini API und Google AI Studio nutzen. Für Unternehmen startet der Zugang als private Vorschau in Gemini Enterprise. Gemini Enterprise for Customer Experience soll später folgen. Gemini 3.8 Live kommt außerdem in Search Live. Extended Thinking ist in Gemini Live, in Workspace Docs für Google AI Pro und Ultra sowie in Gmail und Keep für alle Google-AI-Abonnenten verfügbar. Eine Unterstützung für Geschäftskunden von Google Workspace ist ebenfalls angekündigt.