Fermion Research publicó Phonon-2 el 30 de septiembre, un modelo abierto de reconocimiento de voz en inglés que se descarga en 164 megabytes y que, según la empresa, transcribe una hora de audio en unos veinte segundos en un MacBook Air.
La afirmación sobre la precisión es la que vuelve interesante el tamaño. Fermion informa de una tasa media de error de palabra del 5,21% en los siete conjuntos públicos de prueba en inglés que usa el Open ASR Leaderboard, y dice que todos los modelos abiertos que puntúan mejor son al menos 5,8 veces más grandes. La empresa ha abierto una solicitud para añadir el modelo a esa clasificación, de modo que la cifra podrá comprobarla pronto alguien distinto de quien la publica.
Cómo se hizo pequeño
Phonon-2 está destilado del modelo Parakeet TDT 0.6B v3 de Nvidia, de 2,5 gigabytes, y guarda cada peso del codificador en uno de cinco niveles aprendidos usando unos 2,1 bits. Eso supone una reducción del 93% en el tamaño del archivo frente al modelo maestro.

Cuantizar a unos dos bits por peso es agresivo, y el resultado habitual es un modelo que aguanta con voz limpia y se derrumba con acentos, ruido y hablantes solapados. Si este lo hace o no es exactamente lo que mostrará su entrada en la clasificación.
Por qué corre en cualquier parte
Un solo archivo cubre Apple silicon, Linux, Windows y GPU de Nvidia. Las implementaciones difieren por debajo — las versiones de Apple usan MLX para acelerar por GPU, y las rutas de CPU usan AVX-512, AVX2 o NEON según el procesador — pero el artefacto distribuido es el mismo.
Está disponible mediante una herramienta de línea de comandos instalable desde PyPI, mediante Docker y dentro de Detta, la propia aplicación de dictado de Fermion para macOS. Los pesos se publican en Hugging Face con licencia CC-BY-4.0, que permite el uso comercial con atribución.

Por qué importa aquí un modelo pequeño
El reconocimiento de voz es una de las pocas cargas de IA en las que ejecutar localmente suele ser el requisito y no la preferencia. El dictado médico, las entrevistas jurídicas, la transcripción en redacciones y cualquier cosa sujeta a una norma de residencia de datos comparten la misma restricción: el audio no debería salir de la máquina.
Un modelo que cabe en 164 megabytes y corre más rápido que el tiempo real en un portátil de consumo convierte eso de un proyecto de ingeniería en una descarga.
Qué vigilar
Si la entrada en el Open ASR Leaderboard llega y reproduce la cifra del 5,21%, y cómo aguanta el modelo con audio ruidoso y con acentos, algo que los siete conjuntos públicos de prueba solo cubren en parte.