To modeller, ét Live-API
Google udgav tirsdag Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking, to indbyggede tale-til-tale-modeller bygget til stemmeagenter i drift frem for til chat. Begge er tilgængelige nu via Gemini Live API og Google AI Studio. Gemini Enterprise får dem i privat forhåndsvisning, og Google oplyser, at de rulles ind i Search Live og Gemini Live-appen.
Parret deler arbejdet efter pris. Gemini 3.8 Live er den billigere samtalemodel, rettet mod flydende dialog og visuel forankring. Extended Thinking er varianten, der ræsonnerer sig gennem en sværere forespørgsel uden at standse samtalen for at gøre det — forskellen mellem en stemmeagent, der tier mens den arbejder, og en der bliver ved med at tale.
Begge modeller håndterer 97 sprog og opdager ifølge Google et skift mellem dem midt i samtalen uden at få besked. De tager også imod visuelt input i næsten realtid, så en agent kan se på et kameraflow, mens den lytter, og de udfører værktøjs- og API-kald i baggrunden i stedet for at blokere på dem.

Tallene Google angiver
Google placerer Extended Thinking først samlet på Artificial Analysis’ Speech to Speech Quality Index med 82,6 point. I samme meddelelse angives 68,6 procent på den agentiske test τ-Voice, 35,1 procent på Sierras variant τ-Voice-banking og 97,7 procent på Big Bench Audio. Gemini 3.8 Live, den billigere model, ender nummer to i Speech Agent Arena.
Det er Googles egne tal, hentet fra tredjepartslister, men offentliggjort af leverandøren på lanceringsdagen. Nogen uafhængig gentagelse er endnu ikke dukket op, og listerne selv var ikke opdateret med de nye modeller, da dette blev skrevet.
Prissat under OpenAI’s stemmemodel
Googles udviklerindlæg sætter lydinput til 0,005 dollar per minut og lydoutput til 0,018 dollar per minut. Et minuts reel tovejssamtale koster dermed omkring 0,023 dollar til listepris.
Det ligger under det mest sammenlignelige produkt. OpenAI lagde sin full-duplex-model GPT-Live-1 i API’et til 0,05 dollar per minut den 11. september. Stemme har været den eneste modalitet, hvor minutprisen er læsbar for køberen i stedet for begravet i tokenregnskab, og Google har prissat sig ind i netop den sammenligning.

En transskriptionsmodel ved siden af
Google udgav også Gemini 3.5 Transcribe, en tale-til-tekst-model, der dækker mere end 85 sprog. Google angiver en ordfejlrate på 4,0 procent i streamingtilstand og 2,6 procent uden for den, med automatisk sprogskift og tilpasset ordforrådsvægtning for op til 1.000 termer — funktionen, der betyder noget i kundecentre fulde af produktnavne, en generel model aldrig har set.
Live-modellerne kommer med integrationer til Pipecat, LiveKit, LangChain, Agora, Fishjam og Vercel, et rimeligt signal om, hvem Google mener køberen er: teams, der allerede samler stemmeagenter af rammeværksdele.
Hvad der bør følges
Det, der bør kontrolleres, er listepåstandene. Artificial Analysis og Speech Agent Arena kører deres egne evalueringer efter deres egen tidsplan, og om Extended Thinking holder 82,6 og førstepladsen, når de gør det, er prøven på Googles lanceringsbillede. Det andet er forsinkelse under belastning: en model, der ræsonnerer midt i en sætning, skal gøre det hurtigt nok til, at pausen ikke bliver produktet.