Un modelo de voz pensado para agentes, no para demos
Amazon puso Nova 2.5 Sonic en disponibilidad general el 5 de octubre, su último modelo de voz a voz para agentes de voz en tiempo real. Está disponible a través de Amazon Bedrock en US East (Norte de Virginia), US West (Oregón), Europa (Estocolmo) y Asia-Pacífico (Tokio), al mismo precio que Nova 2 Sonic.
La lista de novedades se lee como una lista de quejas sobre los agentes de voz. Amazon cita mejor razonamiento, mejor seguimiento de instrucciones y precisión en la llamada a herramientas, menor latencia, turnos de palabra controlables y soporte de voz y texto en la misma sesión. La ventana de contexto es de 256.000 tokens, y el modelo habla en siete idiomas con lo que Amazon llama voces expresivas.

El detalle que importa es la llamada asíncrona a herramientas
De todo lo que trae el lanzamiento, la llamada asíncrona a herramientas es lo que cambia lo que un agente de voz puede hacer. Un agente síncrono que necesita consultar algo se queda callado mientras lo hace: quien llama oye silencio, o una muletilla, y la ilusión de conversación se rompe. Llamar a la herramienta de forma asíncrona permite al modelo seguir hablando mientras se ejecuta la consulta.
El contexto de 256K sirve al mismo fin. Un agente de voz que atiende una llamada de soporte larga necesita mantener toda la llamada a la vista —qué dijo quien llama hace ocho minutos, qué cuenta se verificó, qué se intentó ya— en vez de volver a preguntar. Son los dos modos de fallo que han mantenido a los agentes de voz en las demos y fuera de las colas de producción.
Lo que Amazon no ha publicado es la cifra de latencia. El anuncio dice menor latencia sin decir menor que qué, cuánto menor, ni medida cómo. Para un producto de voz en tiempo real, esa es la cifra que decide si es usable, y su ausencia llama la atención.

Con un precio pensado para que se adopte
Mantener el precio al nivel de Nova 2 Sonic es la señal comercial. Amazon no lo plantea como un nivel premium; convierte el modelo nuevo en la opción por defecto para quien ya construye sobre el anterior, que es como un proveedor de nube transforma una base instalada en lugar de vender a una nueva.
Las cuatro regiones de lanzamiento también se leen. Estocolmo y Tokio junto a dos regiones estadounidenses significa que Amazon atiende cargas de voz europeas y japonesas desde dentro de esas jurisdicciones, lo que importa para un producto que procesa habla grabada, el dato más personal que un agente empresarial toca de forma rutinaria.
Amazon enumera siete idiomas soportados sin nombrarlos en el comunicado. Eso, y la cifra de latencia ausente, son las dos cosas que conviene pedir antes de confiarle un centro de llamadas.