En modell med en biljon parametrar under MIT-licens

Xiaomi släppte MiMo-V2.6-serien på måndagen och lade ut vikterna på Hugging Face under MIT-licens. Flaggskeppet MiMo-V2.6-Pro är en gles expertblandningsmodell med 1,02 biljoner parametrar totalt och 42 miljarder aktiva per token. Billigare MiMo-V2.6-Flash har 309 miljarder totalt och 15 miljarder aktiva. Båda tar emot text, bild, ljud och video, och båda har ett kontextfönster på en miljon tokens.

Artificial Analysis, som kör sina egna utvärderingar i stället för att återpublicera leverantörernas tabeller, gav MiMo-V2.6-Pro 46 poäng på sitt Intelligence Index och placerar den först av de 114 modeller med öppna vikter som följs. Medianen i indexet ligger på 18.

Priset är argumentet

I Xiaomis API kostar Pro 0,43 dollar per miljon tokens in och 0,87 dollar per miljon ut, med 99 procents rabatt på cachad indata. Flash kostar 0,14 och 0,28. Artificial Analysis beräknar kostnaden för att köra hela indexet genom Pro till omkring 0,13 dollar per uppgift, vilket sätter modellen på gränslinjen mellan intelligens och kostnad.

En bärbar dator på ett träskrivbord med rader av programkod
Pro-modellen kostar 0,43 dollar per miljon tokens in. Illustrationsbild. Daniil Komov · pexels · Pexels License

Det är ungefär en femtedel av vad den närmaste västerländska jämförelsen tar. SpaceXAI:s Grok 4.7, som Artificial Analysis gav samma 46 poäng när båda kom på måndagen, prissätts till 2 dollar per miljon tokens in och 6 dollar per miljon ut.

Det oberoende indexet visar också de praktiska avvägningarna. Pro genererar 125 tokens i sekunden, tolfte snabbast bland de öppna modellerna, och tar 2,19 sekunder till första token. Den är mångordig: utvärderaren behövde 140 miljoner tokens för att köra hela indexet.

Tränad inför öppen ridå

Xiaomi beskrev lanseringen som byggd offentligt. Sedan den 15 september har en instrumentpanel i realtid sänt förstärkningsinlärningen för båda modellerna — steg, belöningskurvor, tokengenomströmning, testresultat och en löpande kostnadsräknare.

Ingenjörer som diskuterar data på datorskärmar
En instrumentpanel i realtid visade träningens belöningskurvor och kostnad. Illustrationsbild. ThisIsEngineering · pexels · Pexels License

Enligt Xiaomis egen redovisning gjorde de två modellerna 30 steg förstärkningsinlärning vardera över omkring 750 000 banor, till ungefär 2,62 miljoner dollar för Pro och omkring 850 000 för Flash. Bolaget säger att det använde två metoder för att hindra modellerna från att manipulera sin egen belöning: en bygger en bedömningsmall per uppgift genom att jämföra flera försök, en annan flyttar träningsvikt mot de bättre godkända lösningarna i en grupp. Det är företagets egna beskrivningar av sin egen metod; ingen utomstående har upprepat dem.

Vad som är öppet och vad som inte är det

MIT-licensen täcker vikterna, och Xiaomi publicerar dessutom den tekniska rapporten, träningsmiljöerna för förstärkningsinlärning och själva RL-koden. Det är en bredare öppning än Alibabas förra veckan, när Qwen-Image-2.1 kom med öppna vikter men en licens begränsad till forskning.

En tredje variant, MiMo-V2.6-Pro-UltraSpeed, är en värdtjänst och ingen nedladdning: Xiaomi säljer den med påslag för upp till tjugo gånger snabbare utdata.

Vad man ska följa

Det första är om placeringen håller när andra än Artificial Analysis utvärderar modellen. Det andra är spridningen: en MIT-licens på en modell med en biljon parametrar hjälper bara den som har hårdvara att servera 42 miljarder aktiva parametrar, och merparten av efterfrågan hamnar på det värdbaserade API:et och hos routrarna snarare än på egna GPU:er.