Fermion Research släppte Phonon-2 den 30 september, en taligenkänningsmodell för engelska med öppna vikter som laddas ner på 164 megabyte och som enligt bolaget skriver ut en timmes ljud på ungefär tjugo sekunder på en MacBook Air.

Det är träffsäkerheten som gör storleken intressant. Fermion uppger en genomsnittlig ordfelfrekvens på 5,21 procent över de sju offentliga engelska testmängder som Open ASR Leaderboard använder, och säger att varje öppen modell som får bättre resultat är minst 5,8 gånger så stor. Bolaget har öppnat en begäran om att lägga in modellen i den listan, så siffran blir inom kort möjlig att kontrollera för någon annan än upphovsmannen.

Så blev den liten

Phonon-2 är destillerad ur Nvidias Parakeet TDT 0.6B v3, en modell på 2,5 gigabyte, och håller varje vikt i kodaren på en av fem inlärda nivåer med omkring 2,1 bitar. Det är en minskning av filstorleken med 93 procent jämfört med läraren.

En person med hörlurar vid en bärbar dator
Modellen körs på Apple silicon, Linux, Windows och Nvidia-grafikkort från en enda fil. Illustrationsbild. Anna Shvets · pexels · Pexels License

Att kvantisera till ungefär två bitar per vikt är aggressivt, och det vanliga utfallet är en modell som klarar sig på ren inläsning och faller ihop vid brytning, buller och överlappande talare. Om den här gör det är precis vad listan kommer att visa.

Varför den kör överallt

En enda fil täcker Apple silicon, Linux, Windows och Nvidia-grafikkort. Implementationerna skiljer sig under ytan — Apple-byggena använder MLX för grafikacceleration, och processorvägarna använder AVX-512, AVX2 eller NEON beroende på processor — men den distribuerade filen är densamma.

Den finns via ett kommandoradsverktyg som installeras från PyPI, via Docker och inuti Detta, Fermions egen dikteringsapp för macOS. Vikterna publiceras på Hugging Face under CC-BY-4.0, en licens som tillåter kommersiell användning med källangivelse.

En ljudvågform på en datorskärm
Ordfelfrekvensen mäts över sju offentliga engelska testmängder. Illustrationsbild. Egor Komarov · pexels · Pexels License

Varför en liten modell spelar roll här

Taligenkänning är en av få AI-uppgifter där lokal körning oftare är ett krav än en preferens. Medicinsk diktering, juridiska intervjuer, transkribering på redaktioner och allt som omfattas av en regel om datalagring inom ett land har samma begränsning: ljudet bör inte lämna maskinen.

En modell som ryms i 164 megabyte och går snabbare än realtid på en vanlig bärbar dator förvandlar det från ett ingenjörsprojekt till en nedladdning.

Vad som är värt att följa

Om posten i Open ASR Leaderboard landar och återskapar siffran 5,21 procent, och hur modellen klarar sig på ljud med brytning och buller, som de sju offentliga testmängderna bara delvis täcker.