En modell i frontlinjen utan full attention i något lager
NaiveAI, ett Pekinglabb som grundades i februari och inte tidigare släppt någon modell, har publicerat Naive-N0.5-Flash under MIT-licens. Det är en mixture-of-experts-modell med 309 miljarder parametrar totalt och 15,5 miljarder aktiva, och den uppges ha ett nativt kontextfönster på en miljon tokens. Det ovanliga är vad som saknas: enligt modellkortet finns inget lager med full attention någonstans i nätverket.
Transformatorer behåller normalt minst några lager som ser hela kontexten. De lagren är det som bevarar information över långa avstånd, och vid miljontokenlängder är de också där merparten av avkodningskostnaden ligger. Naive-N0.5-Flash tar bort dem helt. Dess 48 lager är fördelade på åtta moduler om sex lager: fem lager med glidande fönster följt av ett lager DeepSeek Sparse Attention, där även första lagret i första modulen bytts mot DSA. Det ger 39 lager med glidande fönster och 9 glesa.
Det glidande fönstret är 128 tokens. De glesa lagren kör en lätt indexerare med 16 huvuden över hela historiken och beräknar sedan attention bara över de 2 048 tokens den väljer ut. Hela nyckel-värde-cachen behålls och indexeraren läser fortfarande allt, så besparingen ligger i attentionberäkning och minnestrafik snarare än i lagring.

Byggd på Xiaomis öppna basmodell
Naive-N0.5-Flash är inte tränad från noll. Den utgår från Xiaomis basmodell MiMo-V2.5 med öppna vikter, som NaiveAI tackar i sina acknowledgements tillsammans med DeepSeek för designen av gles attention och SGLang-projektet för inferensinfrastruktur. Att anpassa basmodellen till den nya attentionstrukturen var enligt företaget ett av syftena med den fortsatta förträningen: 3,25 biljoner tokens i tre steg, varav 50 miljarder tokens uppvärmning av indexeraren, 3 biljoner träning med gles attention och 200 miljarder avtagande inlärningstakt.
Den härkomsten spelar roll för hur släppet ska läsas. Det är en omfattande arkitektonisk ombyggnad av någon annans basmodell, publicerad öppet, snarare än en ny förträningskörning — och den erbjuds som bevis för att hybridstackar med gles och glidande attention kan hålla kvaliteten ut till en miljon tokens.
NaiveAI har också publicerat NaiveRT, sitt eget inferenssystem, som enligt företaget kombinerar megakernelfusion, Programmatic Dependent Launch och spekulativ avkodning för 50 tokens per sekund och användare i standardläge och upp till 2 000 i ett “Ultrafast”-läge. Vikter och inferenskod har MIT-licens; det egna API:et kostar 0,10 dollar per miljon inmatade tokens, 0,40 per miljon utmatade och 0,01 per miljon cacheläsningar.
Testsiffrorna är företagets egna
Modellkortet redovisar resultat på kodnings- och agentuppgifter — SWE-Bench Pro, DeepSWE v1.1, Terminal-Bench 2.1, ALE-CLI, ProgramBench — och på en uppsättning tester för AI-forskning och utveckling, bland dem PostTrainBench, MLE-bench-30 och PaperBench. Det är NaiveAI:s egna utvärderingar, inte oberoende resultat, och företaget är tydligt med riggen: om inget annat anges kördes testerna genom Claude Code 2.1.207 med en miljon tokens kontext, temperatur 1,0 och top-p 0,95, med bara enkel filhantering och Bash-verktyg tillgängliga. Konkurrenternas siffror citeras från andra tillverkares bloggar, modellkort och offentliga topplistor i stället för att köras om.

Ett labb som värderades innan det hade en produkt
NaiveAI grundades i februari 2026 av Dai Jifeng, docent vid Tsinghua-universitetet som tidigare arbetat på Microsoft Research Asia och på datorseendeföretaget SenseTime. Med Tencent som finansiär tog labbet in omkring 400 miljoner dollar och nådde en uppgiven värdering på cirka 1,42 miljarder — en siffra som uppmärksammades i förra veckan just därför att företaget inte hade släppt någonting.
Nu har det släppt något, och argumentet i modellkortet är husets slogan snarare än en poäng: “Building Frontier AI with AI.” NaiveAI uppger att NaiveRT självt byggdes och optimerades genom vad företaget kallar AI-centrerad forskning och utveckling, och hänvisar till en fallstudie i sin tekniska blogg för processen.
Det som ska följas är om arkitekturen håller vid kontakt med andras arbetslaster. En modell utan något lager med full attention är ett verkligt test av om ett fönster på 128 tokens plus 2 048 glest utvalda tokens kan ersätta global attention vid en miljon tokens kontext, och MIT-licensen gör att utomstående kan köra det testet själva i stället för att lita på företagets siffror. Vikterna kräver Nvidia-hårdvara med FP8-stöd och tar omkring 315 GB, så testet blir inte billigt.