El lanzamiento

Microsoft AI publicó MAI-Transcribe-2 el 3 de septiembre, un modelo de voz a texto desarrollado internamente que cubre 60 idiomas.

El titular es el precio: 0,10 dólares por hora de audio. Microsoft lo describe como una oferta por tiempo limitado vigente hasta el final de 2026, lo que la convierte en un movimiento de posicionamiento más que en una tarifa consolidada. El modelo está disponible a través de Microsoft Foundry, el MAI Playground y OpenRouter.

Qué afirma Microsoft

En precisión, Microsoft dice que MAI-Transcribe-2 ocupa el primer puesto en la prueba FLEURS en 60 idiomas con una tasa media de error por palabra del 5,2%, y el segundo en la clasificación de tasa de error de Artificial Analysis, donde afirma que el modelo define la frontera de Pareto entre precisión y latencia.

Operadores de centro de llamadas con auriculares en sus puestos
Microsoft orienta el modelo a reuniones, notas clínicas, documentación de centros de llamadas y agentes de voz. Yan Krukau · pexels · Pexels License

En velocidad, la compañía sostiene que el modelo es hasta 10 veces más rápido que GPT-Transcribe de OpenAI, siete veces más rápido que Scribe v2 de ElevenLabs y cinco veces más rápido que Gemini 3.5 Transcribe de Google.

Todas esas cifras son de Microsoft, comparando su propio modelo con competidores nombrados. La posición en Artificial Analysis es la única medida fuera de la compañía, y es un segundo puesto, no un primero: una distinción que el título del anuncio no hace.

Las funciones que deciden los despliegues reales

La tasa de error sobre habla leída no es lo que rompe una cadena de transcripción en producción. Lo son la diarización de hablantes, las marcas de tiempo por palabra, el comportamiento con ruido y el manejo del cambio de código.

MAI-Transcribe-2 enumera todas ellas, además de identificación automática de idioma, sesgo por palabras clave y estilos de salida configurables: una transcripción limpia sin muletillas, o literal estricta. Microsoft orienta el modelo a subtitulado de vídeo, reuniones, notas clínicas, documentación de centros de llamadas, herramientas de accesibilidad y agentes de voz.

Una forma de onda de audio en la pantalla de un ordenador en un estudio
Las comparaciones de precisión y velocidad del anuncio son mediciones propias de Microsoft. cottonbro studio · pexels · Pexels License

El caso de los agentes de voz explica por qué las afirmaciones de velocidad importan más que las de precisión. El presupuesto de latencia de un agente conversacional se gasta en su mayor parte antes de que el modelo de lenguaje vea una palabra, y la transcripción es una parte grande de él.

Qué observar a continuación

Dos cosas. En qué queda el precio en enero, ya que 0,10 dólares por hora es explícitamente promocional y el resto del mercado tiene que decidir si sigue una tarifa que puede no mantenerse. Y si una evaluación independiente con audio real y desordenado —acentos, hablantes solapados, ancho de banda telefónico— reproduce una tasa media de error del 5,2%, algo que pruebas de habla leída como FLEURS no están diseñadas para comprobar.