Cien millones de parámetros, ocho hablantes, un tercio de segundo

Nvidia ha publicado Nemotron 3 Diarization, un modelo de 99,2 millones de parámetros que divide una conversación en quién habló y cuándo, con pesos abiertos en Hugging Face bajo la licencia OpenMDW. Admite hasta ocho hablantes, funciona con audio grabado y en directo y detecta voces superpuestas cuando varias personas hablan a la vez.

La diarización es la mitad poco vistosa de la transcripción. Un modelo de reconocimiento del habla convierte el audio en palabras; un modelo de diarización decide qué palabras pertenecen a qué persona. Si falla, la transcripción de una reunión atribuye una decisión a quien se opuso a ella.

El modelo toma audio mono a 16 kHz como características de espectrograma de Mel y las pasa por un codificador Transformer de 31 capas con incrustaciones posicionales rotatorias. Dos estructuras de memoria siguen a los hablantes: una caché de hablantes por orden de llegada con el contexto anterior y una cola FIFO para los fotogramas recientes.

Auriculares sobre un escritorio junto a un portátil
El modelo funciona tanto con audio grabado como en directo. Imagen de archivo. Jep Gambardella · pexels · Pexels License

Las cifras, y de quién son

Nvidia declara una tasa de error de diarización del 14,72 por ciento en el Diarization-Bench de VoiceArena, sobre 139 conversaciones en inglés que suman unas 22 horas, frente al 19,3 por ciento del segundo clasificado: una mejora relativa de alrededor del 24 por ciento. La tasa de error de diarización mide la proporción de tiempo de audio asignada al hablante equivocado, omitida o marcada como habla por error, así que menos es mejor.

Frente a su propio predecesor de cuatro hablantes, Streaming Sortformer v2.1, la empresa declara una reducción relativa media del error del 41 por ciento en ocho conjuntos de evaluación con un búfer de 1,04 segundos. En DIHARD III con el búfer completo de 30,4 segundos sitúa el error en el 12,73 por ciento, frente al 19,09.

Son cifras del fabricante sobre una tabla pública, publicadas en la propia entrada de Nvidia. No son una evaluación independiente, y conviene la cautela habitual hasta que alguien ajeno a la empresa ejecute el conjunto.

La latencia es el verdadero mando

El búfer es configurable de 0,32 a 30,4 segundos, y el modelo está pensado para operarse en uno de cuatro puntos: 30,4 segundos sin tiempo real, 1,04 segundos para latencia baja, 0,64 para muy baja y 0,32 como mínimo recomendado por Nvidia. La precisión sube con el búfer, porque hay más audio futuro disponible cuando el modelo decide quién hablaba.

En rendimiento, Nvidia declara 15.113 veces el tiempo real con lote de 32 y torch.compile, frente a 2.619 de la línea base anterior.

Una forma de onda de audio en un monitor de ordenador
La precisión sube con el búfer, porque hay más audio futuro disponible. Imagen de archivo. cottonbro studio · pexels · Pexels License

Lo que no hace

El modelo etiqueta a los hablantes de forma anónima. Emparejado con un reconocedor como Parakeet produce una transcripción marcada como hablante uno, hablante dos y así: no identifica a nadie por su nombre, y nada en el lanzamiento intenta identificación de voz.

Es una decisión de diseño digna de mención en un momento en que las voces sintéticas están en los tribunales y los derechos sobre la voz se están escribiendo en directrices. Un modelo que separa hablantes sin pretender reconocerlos esquiva la cuestión por completo, y los pesos abiertos permiten que cualquiera lo compruebe.