Dos modelos, una Live API
Google publicó el martes Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos nativos de voz a voz pensados para agentes de voz en producción y no para el chat. Ambos están disponibles ya en la Gemini Live API y en Google AI Studio. Gemini Enterprise los recibe en versión preliminar privada y Google afirma que están llegando a Search Live y a la aplicación Gemini Live.
La pareja se divide por coste. Gemini 3.8 Live es el modelo conversacional más barato, orientado al diálogo fluido y al anclaje visual. Extended Thinking es la variante que razona ante una petición más difícil sin interrumpir la conversación para hacerlo: la diferencia entre un agente de voz que se queda en silencio mientras trabaja y otro que sigue hablando.
Ambos modelos manejan 97 idiomas y, según Google, detectan un cambio entre ellos a mitad de conversación sin que nadie se lo indique. También aceptan entrada visual casi en tiempo real, de modo que un agente puede mirar una cámara mientras escucha, y ejecutan llamadas a herramientas y API en segundo plano en lugar de bloquearse.

Las cifras que cita Google
Google sitúa a Extended Thinking en el primer puesto general del Speech to Speech Quality Index de Artificial Analysis, con una puntuación de 82,6. En el mismo anuncio informa de un 68,6% en el banco de pruebas agéntico τ-Voice, un 35,1% en la variante τ-Voice-banking de Sierra y un 97,7% en Big Bench Audio. Gemini 3.8 Live, el modelo más barato, queda segundo en Speech Agent Arena.
Son cifras propias de Google, tomadas de clasificaciones de terceros pero publicadas por el fabricante el día del lanzamiento. Todavía no ha aparecido ninguna repetición independiente, y las propias clasificaciones no se habían actualizado con los nuevos modelos al cierre de esta información.
Un precio por debajo del modelo de voz de OpenAI
La entrada para desarrolladores de Google fija el audio de entrada en 0,005 dólares por minuto y el de salida en 0,018 dólares por minuto. Un minuto de conversación real en ambos sentidos cuesta por tanto unos 0,023 dólares a precio de tarifa.
Eso queda por debajo del producto más comparable. OpenAI colocó su modelo full-duplex GPT-Live-1 en la API a 0,05 dólares por minuto el 11 de septiembre. La voz ha sido la única modalidad en la que el precio por minuto resulta legible para el comprador en lugar de quedar enterrado en cálculos de tokens, y Google ha fijado su precio pensando en esa comparación.

Un modelo de transcripción a su lado
Google publicó además Gemini 3.5 Transcribe, un modelo de voz a texto que cubre más de 85 idiomas. Google indica una tasa de error por palabra del 4,0% en modo de flujo continuo y del 2,6% fuera de él, con cambio automático de idioma y sesgo de vocabulario personalizado para hasta 1.000 términos, la función que importa en centros de llamadas llenos de nombres de producto que un modelo general nunca ha visto.
Los modelos Live llegan con integraciones para Pipecat, LiveKit, LangChain, Agora, Fishjam y Vercel, una señal razonable de a quién considera Google su comprador: equipos que ya montan agentes de voz con piezas de otros marcos.
Qué vigilar
Lo que conviene comprobar son las afirmaciones sobre clasificaciones. Artificial Analysis y Speech Agent Arena ejecutan sus propias evaluaciones en su propio calendario, y si Extended Thinking mantiene el 82,6 y el primer puesto cuando lo hagan será la prueba del relato del lanzamiento. La segunda es la latencia bajo carga: un modelo que razona a mitad de frase tiene que hacerlo lo bastante rápido como para que la pausa no sea el producto.