Vad det är

Meta Superintelligence Labs släppte Muse Voice Transcribe den 1 september, bolagets första realtidsmodell för ljuduppfattning. Den utför tre uppgifter som talkedjor annars brukar fördela på separata komponenter: strömmande automatisk taligenkänning, diarisering av fler än 20 röster och turdetektering — att avgöra när någon faktiskt har talat färdigt.

Modellen, muse-voice-transcribe-1.0, är ett enda autoregressivt multimodalt system som bearbetar ljud i 80 millisekunders block med 12,5 Hz och gör varje block till en mjuk token, enligt MarkTechPosts tekniska genomgång. En adaptiv fördröjningsmekanism, tränad med förstärkningsinlärning, väger träffsäkerhet mot latens ord för ord.

Den tränades på över 70 språk, varav 25 grundligt verifierade vid lanseringen, och klarar språkbyten mitt i en mening och sessioner på över en timme.

Siffrorna

Meta uppger att modellen ligger först på Artificial Analysis både för strömmande tal-till-text och för diarisering. Bolaget redovisar en strömmande ordfelsprocent på 3,1 vid 0,16 sekunder efter att talet upphört, mot 3,4 till 4,0 för de modeller det namnger som konkurrenter, och en genomsnittlig diariseringsfelprocent på 17,5 där rivalerna hamnar mellan 21,1 och 28,6.

Människor som samtalar runt ett konferensbord
Diarisering handlar om att avgöra vem som talade, vilket modellen gör jämsides med igenkänningen. Arkivbild. Vlada Karpovich · pexels · Pexels License

Artificial Analysis är en oberoende utvärderare, vilket placerar de här siffrorna i en annan kategori än en leverantörs interna testbänk. Rankingen är ändå en ögonblicksbild av en tabell som rör sig, och konkurrenturvalet är Metas eget.

Varför en modell i stället för tre

Ingenjörsargumentet är den intressanta delen. En konventionell kedja kör igenkänning, sedan diarisering och därefter en separat turdetektor; varje steg lägger till latens och vart och ett kan vara oense med de andra om var ett ord eller en talargräns går. Att smälta samman dem i en modell tar bort efterbearbetningen och låter en och samma uppsättning representationer svara på alla tre frågorna.

Meta är öppen med varför bolaget vill ha det: det uttalade konstruktionsmålet är samtalshårdvara. Ett citat i tillkännagivandet formulerar kravet som att modellen måste “lyssna som en människa på AI-glasögon i verkliga samtal, inte bara på röstkommandon”, vilket är ett svårare problem än diktering och ett annat än mötestranskribering.

Ett par trådlösa hörlurar av over ear-typ på ett träskrivbord
Meta uppger att konstruktionsmålet är samtalshårdvara snarare än diktering. Arkivbild. Zafer Erdoğan · pexels · Pexels License

Tillgång och de uteblivna vikterna

Modellen finns bara via API. Den serveras genom Meta Model API med en nivå utan datalagring och driver redan diktering i Meta AI för Mac och i Muse Code. Meta uppger att ljudet bearbetas för att ge transkriptet och inte lagras. MarkTechPost anger priset till 3,00 dollar per 1 000 ljudminuter, ungefär 0,18 dollar i timmen; Metas eget tillkännagivande publicerar inget pris.

Inga öppna vikter släpptes, vilket är värt att notera hos ett bolag vars hållning i frågan om öppna modeller varit en bärande del av dess offentliga argument. En realtidsmodell för ljuduppfattning är precis den sorts artefakt som vore mest användbar på enheten och minst kontrollerbar när den väl är ute.

Marknadsläget är att transkribering snabbt håller på att bli en råvara, från flera håll samtidigt, och den intressanta jämförelsen under nästa kvartal är inte ordfelsprocent utan om någon av dessa modeller hamnar i hårdvara som människor faktiskt bär.