Två modeller, ett Live-API
Google släppte på tisdagen Gemini 3.8 Live och Gemini 3.8 Live Extended Thinking, två inbyggda tal-till-tal-modeller byggda för röstagenter i drift snarare än för chatt. Båda finns nu i Gemini Live API och Google AI Studio. Gemini Enterprise får dem i privat förhandsvisning, och Google uppger att de rullas in i Search Live och Gemini Live-appen.
Paret delar upp arbetet efter kostnad. Gemini 3.8 Live är den billigare samtalsmodellen, inriktad på flytande dialog och visuell förankring. Extended Thinking är varianten som resonerar sig igenom en svårare fråga utan att stanna samtalet för att göra det — skillnaden mellan en röstagent som tystnar medan den arbetar och en som fortsätter prata.
Båda modellerna hanterar 97 språk och upptäcker enligt Google ett byte mellan dem mitt i samtalet utan att bli tillsagda. De tar också emot visuell indata i nära realtid, så att en agent kan titta på ett kameraflöde medan den lyssnar, och de kör verktygs- och API-anrop i bakgrunden i stället för att blockeras av dem.

Siffrorna Google anger
Google placerar Extended Thinking först totalt på Artificial Analysis Speech to Speech Quality Index med 82,6 poäng. I samma tillkännagivande redovisas 68,6 procent på det agentiska testet τ-Voice, 35,1 procent på Sierras variant τ-Voice-banking och 97,7 procent på Big Bench Audio. Gemini 3.8 Live, den billigare modellen, hamnar tvåa i Speech Agent Arena.
Det är Googles egna siffror, hämtade från tredjepartslistor men publicerade av leverantören på lanseringsdagen. Någon oberoende omkörning har ännu inte dykt upp, och listorna själva hade inte uppdaterats med de nya modellerna när detta skrevs.
Prissatt under OpenAI:s röstmodell
Googles utvecklarinlägg sätter ljudindata till 0,005 dollar per minut och ljudutdata till 0,018 dollar per minut. En minut verkligt samtal i båda riktningarna kostar därmed omkring 0,023 dollar enligt listpris.
Det underskrider den mest jämförbara produkten. OpenAI lade in sin full-duplexmodell GPT-Live-1 i API:et för 0,05 dollar per minut den 11 september. Röst har varit den enda modaliteten där minutpriset är begripligt för köparen i stället för begravt i tokenmatematik, och Google har prissatt in i just den jämförelsen.

En transkriberingsmodell vid sidan om
Google släppte också Gemini 3.5 Transcribe, en tal-till-text-modell som täcker mer än 85 språk. Google uppger en ordfelfrekvens på 4,0 procent i strömmande läge och 2,6 procent utanför det, med automatiskt språkbyte och anpassad vokabulärviktning för upp till 1 000 termer — funktionen som betyder något i kundtjänster fulla av produktnamn en allmän modell aldrig har sett.
Live-modellerna kommer med integrationer för Pipecat, LiveKit, LangChain, Agora, Fishjam och Vercel, vilket är en rimlig signal om vem Google tror att köparen är: team som redan bygger röstagenter av ramverksdelar.
Vad som bör följas
Det som är värt att kontrollera är listpåståendena. Artificial Analysis och Speech Agent Arena kör sina egna utvärderingar enligt egen tidtabell, och om Extended Thinking håller 82,6 och förstaplatsen när de gör det är provet på Googles lanseringsbild. Det andra är latens under belastning: en modell som resonerar mitt i en mening måste göra det snabbt nog för att pausen inte ska bli produkten.