To modeller, ett Live-API
Google slapp tirsdag Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking, to innebygde tale-til-tale-modeller bygget for stemmeagenter i drift snarere enn for chat. Begge er tilgjengelige nå gjennom Gemini Live API og Google AI Studio. Gemini Enterprise får dem i privat forhåndsvisning, og Google opplyser at de rulles inn i Search Live og Gemini Live-appen.
Paret deler arbeidet etter kostnad. Gemini 3.8 Live er den rimeligere samtalemodellen, rettet mot flytende dialog og visuell forankring. Extended Thinking er varianten som resonnerer seg gjennom en vanskeligere forespørsel uten å stanse samtalen for å gjøre det — forskjellen mellom en stemmeagent som blir stille mens den arbeider, og en som fortsetter å snakke.
Begge modellene håndterer 97 språk og oppdager ifølge Google et bytte mellom dem midt i samtalen uten å få beskjed. De tar også imot visuell inndata nesten i sanntid, slik at en agent kan se på en kamerastrøm mens den lytter, og de kjører verktøy- og API-kall i bakgrunnen i stedet for å blokkeres av dem.

Tallene Google oppgir
Google plasserer Extended Thinking først totalt på Artificial Analysis’ Speech to Speech Quality Index med 82,6 poeng. I samme kunngjøring oppgis 68,6 prosent på den agentiske testen τ-Voice, 35,1 prosent på Sierras variant τ-Voice-banking og 97,7 prosent på Big Bench Audio. Gemini 3.8 Live, den rimeligere modellen, havner nummer to i Speech Agent Arena.
Dette er Googles egne tall, hentet fra tredjepartslister, men publisert av leverandøren på lanseringsdagen. Noen uavhengig gjentakelse har ennå ikke dukket opp, og listene selv var ikke oppdatert med de nye modellene da dette ble skrevet.
Priset under OpenAIs stemmemodell
Googles utviklerinnlegg setter lydinndata til 0,005 dollar per minutt og lydutdata til 0,018 dollar per minutt. Et minutt reell toveissamtale koster dermed om lag 0,023 dollar til listepris.
Det ligger under det mest sammenlignbare produktet. OpenAI la sin full-duplex-modell GPT-Live-1 inn i API-et til 0,05 dollar per minutt 11. september. Stemme har vært den eneste modaliteten der minuttprisen er lesbar for kjøperen i stedet for begravd i tokenregning, og Google har priset seg inn i nettopp den sammenligningen.

En transkripsjonsmodell ved siden av
Google slapp også Gemini 3.5 Transcribe, en tale-til-tekst-modell som dekker mer enn 85 språk. Google oppgir en ordfeilrate på 4,0 prosent i strømmemodus og 2,6 prosent utenfor, med automatisk språkbytte og tilpasset vokabularvekting for inntil 1 000 termer — funksjonen som betyr noe i kundesentre fulle av produktnavn en generell modell aldri har sett.
Live-modellene kommer med integrasjoner for Pipecat, LiveKit, LangChain, Agora, Fishjam og Vercel, et rimelig signal om hvem Google mener kjøperen er: team som allerede setter sammen stemmeagenter av rammeverksdeler.
Hva som bør følges
Det som bør kontrolleres, er listepåstandene. Artificial Analysis og Speech Agent Arena kjører sine egne evalueringer etter egen timeplan, og om Extended Thinking holder 82,6 og førsteplassen når de gjør det, er prøven på Googles lanseringsbilde. Det andre er forsinkelse under belastning: en modell som resonnerer midt i en setning må gjøre det raskt nok til at pausen ikke blir produktet.