Deux modèles, une Live API

Google a publié mardi Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles voix à voix natifs conçus pour des agents vocaux en production plutôt que pour la conversation grand public. Les deux sont disponibles dès maintenant via la Gemini Live API et Google AI Studio. Gemini Enterprise les reçoit en préversion privée, et Google indique qu’ils arrivent dans Search Live et l’application Gemini Live.

Le duo se partage le travail par le coût. Gemini 3.8 Live est le modèle conversationnel le moins cher, orienté dialogue fluide et ancrage visuel. Extended Thinking est la variante qui raisonne sur une demande plus difficile sans arrêter la conversation pour le faire : la différence entre un agent vocal qui se tait pendant qu’il travaille et un autre qui continue de parler.

Les deux modèles gèrent 97 langues et, selon Google, détectent un changement de langue en cours de conversation sans qu’on le leur signale. Ils acceptent aussi une entrée visuelle en quasi-temps réel, de sorte qu’un agent peut regarder un flux caméra tout en écoutant, et ils exécutent les appels d’outils et d’API en arrière-plan au lieu de s’y bloquer.

Deux collègues discutent à un bureau devant un ordinateur portable ouvert dans un bureau lumineux
Les modèles Live arrivent avec des intégrations pour Pipecat, LiveKit, LangChain, Agora, Fishjam et Vercel. Image d'illustration. https://kaboompics.com/ · pexels · Pexels License

Les scores avancés par Google

Google place Extended Thinking en tête du Speech to Speech Quality Index d’Artificial Analysis, avec un score de 82,6. Dans la même annonce, l’entreprise rapporte 68,6 % sur le test agentique τ-Voice, 35,1 % sur la variante τ-Voice-banking de Sierra et 97,7 % sur Big Bench Audio. Gemini 3.8 Live, le modèle le moins cher, arrive deuxième dans Speech Agent Arena.

Ce sont les chiffres de Google, tirés de classements tiers mais publiés par le fournisseur le jour du lancement. Aucune reprise indépendante n’a encore paru, et les classements eux-mêmes n’avaient pas été mis à jour avec les nouveaux modèles au moment de la rédaction.

Un prix inférieur au modèle vocal d’OpenAI

Le billet développeurs de Google fixe l’audio en entrée à 0,005 dollar la minute et l’audio en sortie à 0,018 dollar la minute. Une minute de conversation réelle dans les deux sens revient donc à environ 0,023 dollar au tarif public.

Cela passe sous le produit le plus comparable. OpenAI avait placé son modèle full-duplex GPT-Live-1 dans l’API à 0,05 dollar la minute le 11 septembre. La voix est la seule modalité où le prix à la minute reste lisible pour l’acheteur au lieu d’être enfoui dans des calculs de jetons, et Google a fixé son tarif en visant cette comparaison.

Un microphone de studio monté sur une perche
La pondération de vocabulaire de Gemini 3.5 Transcribe vise les centres de contact. Image d'illustration. Ludvig Hedenborg · pexels · Pexels License

Un modèle de transcription à côté

Google a aussi publié Gemini 3.5 Transcribe, un modèle voix-texte couvrant plus de 85 langues. L’entreprise annonce un taux d’erreur par mot de 4,0 % en mode flux et de 2,6 % hors flux, avec bascule automatique entre langues et pondération de vocabulaire personnalisé jusqu’à 1 000 termes — la fonction qui compte dans les centres d’appels remplis de noms de produits qu’un modèle généraliste n’a jamais vus.

Les modèles Live arrivent avec des intégrations pour Pipecat, LiveKit, LangChain, Agora, Fishjam et Vercel, signal raisonnable de l’acheteur visé : des équipes qui assemblent déjà des agents vocaux à partir de briques de frameworks.

Ce qu’il faut surveiller

Ce qu’il convient de vérifier, ce sont les affirmations de classement. Artificial Analysis et Speech Agent Arena mènent leurs propres évaluations à leur propre rythme, et savoir si Extended Thinking conserve 82,6 et la première place quand ils le feront constituera le test du récit de lancement. Le second point est la latence sous charge : un modèle qui raisonne en milieu de phrase doit le faire assez vite pour que la pause ne devienne pas le produit.