Google a présenté Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking le 15 septembre 2026. Les deux modèles visent les agents vocaux capables de raisonner pendant un échange presque en temps réel. L’annonce est signée par Tom Ouyang, Principal Engineer, et Malini Jaganathan, Member of Technical Staff au sein de la Gemini Audio Team.

Gemini 3.8 Live cible la montée en charge et l’efficacité des coûts. Il associe compréhension conversationnelle, dialogue fluide et prise en compte du contexte visuel. Le modèle a obtenu la deuxième place dans la Speech Agent Arena d’Artificial Analysis. Sur EVA-Bench de ServiceNow, Google indique que les deux modèles se situent sur la frontière de Pareto pour les flux de travail complexes, en équilibrant précision et qualité conversationnelle. Le test a utilisé la Live API sur Gemini Enterprise Agent Platform.

Gemini 3.8 Live Extended Thinking occupe la première place générale du Speech to Speech Quality Index d’Artificial Analysis, avec un score de 82,6. Il atteint 68,6 % sur τ-Voice pour l’exécution de tâches agentiques et 35,1 % sur le benchmark τ-Voice-banking de Sierra. Son score sur Big Bench Audio est de 97,7 %. Google présente ce modèle comme adapté aux tâches complexes en entreprise et souligne un prix compétitif face aux autres modèles de pointe.

Gemini 3.8 Live traite les entrées visuelles presque en temps réel et passe automatiquement d’une langue à l’autre parmi 97 langues prises en charge. Il exécute des outils et des appels d’API en arrière-plan pendant que le dialogue se poursuit. Des démonstrations montrent un accompagnement en direct pour l’intégration de salariés et une partie d’échecs fondée sur le contexte visuel. Extended Thinking peut raisonner et parler simultanément, accuser réception d’une demande avec une formule précoce comme « Let me check that… » et décrire l’avancement d’opérations en arrière-plan comportant plusieurs étapes. D’autres démonstrations montrent la transformation d’esquisses en composants React fonctionnels, des réservations en plusieurs étapes avec des appels de fonctions asynchrones, ainsi que la création vocale de plans d’entreprise et de kits marketing personnalisés.

Google indique que les modèles rendent les échanges vocaux plus fluides dans l’application Gemini, Google Workspace et Search. Gemini 3.8 Live Extended Thinking est proposé dans Docs Live, Gmail Live et Keep Live. Gemini 3.8 Live fournit une aide au dépannage en temps réel, étape par étape, dans Search Live.

La Gemini Live API est prise en charge par Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents. Ces plateformes prennent en charge l’infrastructure de diffusion multimédia en temps réel pour les développeurs qui créent des interfaces vocales. Google cite aussi Salesforce, Genspark et Lumeris parmi les partenaires intéressés par la latence, la fluidité des échanges et les appels d’outils des modèles.

Les contenus audio générés par les produits d’IA de Google portent un filigrane SynthID imperceptible. Google indique que ce filigrane permet de détecter les contenus générés et contribue à limiter la désinformation. Les détails de sécurité figurent dans la fiche de modèle Gemini 3.8 Audio.

Les deux modèles commencent leur déploiement le 15 septembre 2026. Les développeurs peuvent les utiliser avec la Gemini API et Google AI Studio. Pour les entreprises, l’accès débute en préversion privée dans Gemini Enterprise. Gemini Enterprise for Customer Experience sera proposé ultérieurement. Gemini 3.8 Live arrive aussi dans Search Live. Extended Thinking est disponible dans Gemini Live, dans Workspace Docs pour les abonnés Google AI Pro et Ultra, ainsi que dans Gmail et Keep pour tous les abonnés Google AI. Google prévoit également son arrivée pour les clients professionnels de Google Workspace.