Qué se ha publicado
OpenAI lanzó GPT-Live-1 en su API el 10 de septiembre y lo describió como el modelo que lleva “conversaciones de voz naturales y full-duplex a la API, con mejor seguimiento de instrucciones, voces personalizadas y soporte de telefonía”, según el anuncio de la compañía a desarrolladores. Su precio es de 0,05 dólares por minuto.
El full-duplex es toda la propuesta. El modelo puede escuchar mientras habla y reaccionar a mitad de frase a interrupciones, asentimientos, pausas, cambios de rumbo y voces de fondo mientras su propio audio sigue sonando. La generación anterior, gpt-realtime-2.1, funcionaba por turnos: terminaba y luego escuchaba.
Por qué los turnos eran el cuello de botella
Cualquiera que haya usado un asistente de voz conoce el fallo. Empiezas a corregirlo, él sigue hablando por encima y tú esperas un hueco. Los modelos half-duplex resuelven eso detectando silencios, y por eso confunden una pausa reflexiva con el final de la frase y una muletilla con una instrucción nueva.

Quitar esa restricción cambia para qué sirve un agente de voz. Una llamada de soporte en la que quien llama dice “no, espera, el otro pedido” tres palabras después de empezar la respuesta es comportamiento humano normal y, hasta ahora, un caso incómodo de programar.
Las cifras, y quién las ha dado
OpenAI afirma que el modelo mejora en unos 30 puntos porcentuales a gpt-realtime-2.1 en Full Duplex Bench, y que combinado con GPT-6 Astra en esfuerzo de razonamiento medio queda primero en las evaluaciones Tau3, según el resumen de Data Studios. Ambas cifras son de la propia OpenAI sobre su propio modelo, y todavía no hay reproducción independiente.
Lo que cuesta en la práctica
Los 0,05 dólares por minuto cubren la capa de voz y se facturan por segundo, sin redondeo. Las llamadas al backend a la API de Responses y cualquier uso de herramientas se cobran a sus tarifas habituales, de modo que un agente de voz que razona con un modelo de frontera y llama a tres herramientas por turno no cuesta cinco céntimos por minuto en total.

El lanzamiento incluye además soporte de telefonía y un conjunto ampliado de voces con más acentos, dialectos e idiomas. Las voces personalizadas requieren un proceso de elegibilidad aparte.
Qué vigilar
La afirmación que necesita prueba independiente es la latencia bajo carga: un comportamiento full-duplex que se sostiene en una demostración puede degradarse cuando el modelo además llama a herramientas y espera al backend. Lo segundo es qué hacen los desarrolladores con la delegación: GPT-Live-1 está diseñado para ceder el razonamiento a un modelo de backend distinto, así que la pregunta interesante no es lo bien que habla, sino lo bien que espera.