Dois modelos, uma Live API
A Google publicou na terça-feira o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, dois modelos nativos de voz para voz construídos para agentes de voz em produção e não para conversa de consumo. Ambos já estão disponíveis na Gemini Live API e no Google AI Studio. O Gemini Enterprise recebe-os em pré-visualização privada, e a Google diz que estão a chegar ao Search Live e à aplicação Gemini Live.
A dupla divide-se pelo custo. O Gemini 3.8 Live é o modelo conversacional mais barato, orientado para diálogo fluido e ancoragem visual. O Extended Thinking é a variante que raciocina sobre um pedido mais difícil sem parar a conversa para o fazer: a diferença entre um agente de voz que emudece enquanto trabalha e outro que continua a falar.
Ambos os modelos lidam com 97 idiomas e, segundo a Google, detetam uma mudança entre eles a meio da conversa sem serem avisados. Também aceitam entrada visual em tempo quase real, pelo que um agente pode observar uma câmara enquanto escuta, e executam chamadas a ferramentas e APIs em segundo plano em vez de ficarem bloqueados nelas.

Os resultados que a Google cita
A Google coloca o Extended Thinking em primeiro lugar geral no Speech to Speech Quality Index da Artificial Analysis, com 82,6 pontos. No mesmo anúncio, refere 68,6% no teste agêntico τ-Voice, 35,1% na variante τ-Voice-banking da Sierra e 97,7% no Big Bench Audio. O Gemini 3.8 Live, o modelo mais barato, fica em segundo na Speech Agent Arena.
São números da própria Google, retirados de tabelas de terceiros mas publicados pelo fornecedor no dia do lançamento. Ainda não surgiu nenhuma repetição independente, e as próprias tabelas não tinham sido atualizadas com os novos modelos à hora de escrever.
Um preço abaixo do modelo de voz da OpenAI
O texto da Google para programadores fixa o áudio de entrada em 0,005 dólar por minuto e o de saída em 0,018 dólar por minuto. Um minuto de conversa real nos dois sentidos custa assim cerca de 0,023 dólar a preço de tabela.
Isso fica abaixo do produto mais comparável. A OpenAI colocou o seu modelo full-duplex GPT-Live-1 na API a 0,05 dólar por minuto em 11 de setembro. A voz tem sido a única modalidade em que o preço por minuto é legível para o comprador em vez de ficar enterrado em contas de tokens, e a Google fixou o seu preço a pensar nessa comparação.

Um modelo de transcrição ao lado
A Google publicou ainda o Gemini 3.5 Transcribe, um modelo de voz para texto que cobre mais de 85 idiomas. A empresa indica uma taxa de erro por palavra de 4,0% em modo de transmissão contínua e de 2,6% fora dele, com troca automática de idioma e ponderação de vocabulário personalizado até 1.000 termos — a função que importa em centros de atendimento cheios de nomes de produtos que um modelo geral nunca viu.
Os modelos Live chegam com integrações para Pipecat, LiveKit, LangChain, Agora, Fishjam e Vercel, um sinal razoável de quem a Google considera ser o comprador: equipas que já montam agentes de voz com peças de frameworks.
O que observar
O que convém verificar são as afirmações sobre as tabelas. A Artificial Analysis e a Speech Agent Arena fazem as suas próprias avaliações no seu próprio calendário, e saber se o Extended Thinking mantém 82,6 e o primeiro lugar quando o fizerem é o teste ao enquadramento de lançamento da Google. O segundo ponto é a latência sob carga: um modelo que raciocina a meio de uma frase tem de o fazer depressa o suficiente para que a pausa não seja o produto.