Hundra miljoner parametrar, åtta talare, en tredjedels sekund

Nvidia har släppt Nemotron 3 Diarization, en modell på 99,2 miljoner parametrar som delar upp ett samtal i vem som talade när, med öppna vikter på Hugging Face under licensen OpenMDW. Den klarar upp till åtta talare, fungerar på både inspelat och direktsänt ljud och upptäcker överlappande tal när flera pratar samtidigt.

Diarisering är transkriberingens oglamorösa hälft. En taligenkänningsmodell gör ljud till ord; en diariseringsmodell avgör vilka ord som hör till vilken person. Blir det fel tillskriver mötesprotokollet ett beslut till den som motsatte sig det.

Modellen tar 16 kHz monoljud som Mel-spektrogramdata och kör dem genom en 31-lagers Transformerkodare med roterande positionsinbäddningar. Två minnesstrukturer håller reda på talarna: en talarcache i ankomstordning med tidigare sammanhang och en FIFO-kö för de senaste ljudrutorna.

Hörlurar på ett skrivbord bredvid en bärbar dator
Modellen fungerar på både inspelat och direktsänt ljud. Arkivbild. Jep Gambardella · pexels · Pexels License

Siffrorna, och vems de är

Nvidia uppger en diariseringsfelfrekvens på 14,72 procent på VoiceArenas Diarization-Bench, över 139 engelska samtal på sammanlagt ungefär 22 timmar, mot 19,3 procent för tvåan — en relativ förbättring på omkring 24 procent. Felfrekvensen mäter hur stor andel av ljudtiden som tilldelas fel talare, missas eller felaktigt markeras som tal, så lägre är bättre.

Mot bolagets egen fyrtalarsföregångare Streaming Sortformer v2.1 uppger Nvidia en genomsnittlig relativ felminskning på 41 procent över åtta utvärderingsuppsättningar vid 1,04 sekunders buffert. På DIHARD III med full buffert på 30,4 sekunder anger bolaget felet till 12,73 procent, ned från 19,09.

Detta är tillverkarens egna siffror på en offentlig lista, publicerade i Nvidias eget inlägg. Det är ingen oberoende utvärdering, och sedvanlig försiktighet gäller tills någon utanför bolaget kör uppsättningen.

Latensen är det verkliga reglaget

Bufferten går att ställa från 0,32 till 30,4 sekunder, och modellen är tänkt att köras i ett av fyra lägen: 30,4 sekunder utan realtidskrav, 1,04 sekunder för låg latens, 0,64 för mycket låg och 0,32 som det minsta Nvidia rekommenderar. Träffsäkerheten stiger med bufferten, eftersom mer kommande ljud finns tillgängligt när modellen avgör vem som talade.

I genomströmning uppger Nvidia 15 113 gånger realtid vid satsstorlek 32 med torch.compile, mot 2 619 för den tidigare basmodellen.

En ljudvågform visad på en datorskärm
Träffsäkerheten stiger med bufferten, eftersom mer kommande ljud finns tillgängligt. Arkivbild. cottonbro studio · pexels · Pexels License

Vad den inte gör

Modellen märker talare anonymt. Ihop med en igenkännare som Parakeet ger den en utskrift märkt talare ett, talare två och så vidare — den identifierar ingen vid namn, och inget i släppet försöker sig på röstidentifiering.

Det är ett designval värt att notera i ett läge där syntetiska röster står inför domstol och rätten till den egna rösten håller på att skrivas in i vägledningar. En modell som skiljer talare åt utan att göra anspråk på att känna igen dem undviker frågan helt, och de öppna vikterna gör att vem som helst kan kontrollera saken själv.