En modell i front uten full attention i noe lag
NaiveAI, et Beijing-laboratorium som ble stiftet i februar og aldri har sluppet en modell før, har publisert Naive-N0.5-Flash under MIT-lisens. Det er en mixture-of-experts-modell med 309 milliarder parametere totalt og 15,5 milliarder aktive, og den oppgis å ha et nativt kontekstvindu på én million tokens. Det uvanlige er det som mangler: ifølge modellkortet finnes det ikke et eneste lag med full attention i nettverket.
Transformere beholder normalt i det minste noen lag som ser hele konteksten. Disse lagene er det som bevarer informasjon over lange avstander, og ved millionlengder er de også der mesteparten av dekodingskostnaden ligger. Naive-N0.5-Flash fjerner dem helt. De 48 lagene er delt i åtte moduler på seks lag: fem lag med glidende vindu fulgt av ett lag DeepSeek Sparse Attention, der også første lag i første modul er byttet til DSA. Det gir 39 lag med glidende vindu og 9 sparse.
Det glidende vinduet er 128 tokens. De sparse lagene kjører en lett indekserer med 16 hoder over hele historikken, og beregner deretter attention bare over de 2 048 tokens den velger. Hele nøkkel-verdi-cachen beholdes, og indeksereren leser fortsatt alt, så innsparingen ligger i attentionberegning og minnetrafikk, ikke i lagring.

Bygget på Xiaomis åpne basismodell
Naive-N0.5-Flash er ikke trent fra grunnen av. Den bygger på Xiaomis basismodell MiMo-V2.5 med åpne vekter, som NaiveAI krediterer i takkelisten sammen med DeepSeek for utformingen av sparse attention og SGLang-prosjektet for inferensinfrastruktur. Å tilpasse basismodellen til den nye attentionstrukturen var ifølge selskapet ett av formålene med den fortsatte førtreningen: 3,25 billioner tokens i tre trinn, med 50 milliarder tokens oppvarming av indeksereren, 3 billioner trening med sparse attention og 200 milliarder avtakende læringsrate.
Den avstamningen betyr noe for lesningen av slippet. Dette er en betydelig arkitektonisk ombygging av en annens basismodell, publisert åpent, snarere enn en ny førtreningskjøring — og den tilbys som bevis på at hybride stabler med sparse og glidende attention kan holde kvaliteten ut til én million tokens.
NaiveAI har også publisert NaiveRT, sitt eget inferenssystem, som selskapet sier kombinerer megakjernefusjon, Programmatic Dependent Launch og spekulativ dekoding for 50 tokens per sekund per bruker i standardmodus og opptil 2 000 i en “Ultrafast”-modus. Vekter og inferenskode har MIT-lisens; det egne API-et koster 0,10 dollar per million tokens inn, 0,40 per million ut og 0,01 per million cachelesninger.
Testtallene er selskapets egne
Modellkortet oppgir resultater på kode- og agentoppgaver — SWE-Bench Pro, DeepSWE v1.1, Terminal-Bench 2.1, ALE-CLI, ProgramBench — og på en serie tester for KI-forskning og utvikling, blant dem PostTrainBench, MLE-bench-30 og PaperBench. Det er NaiveAIs egne evalueringer, ikke uavhengige resultater, og selskapet er tydelig om riggen: om ikke annet er oppgitt, kjørte det testene gjennom Claude Code 2.1.207 med én million tokens kontekst, temperatur 1,0 og top-p 0,95, med bare enkel filhåndtering og Bash-verktøy tilgjengelig. Konkurrentenes tall er hentet fra andre produsenters blogger, modellkort og offentlige topplister i stedet for å kjøres om.

Et laboratorium verdsatt før det hadde et produkt
NaiveAI ble stiftet i februar 2026 av Dai Jifeng, førsteamanuensis ved Tsinghua-universitetet som tidligere har arbeidet hos Microsoft Research Asia og i datasynselskapet SenseTime. Med Tencent i ryggen hentet laboratoriet rundt 400 millioner dollar og nådde en oppgitt verdsettelse på omkring 1,42 milliarder — et tall som ble lagt merke til i forrige uke nettopp fordi selskapet ikke hadde sluppet noe.
Nå har det sluppet noe, og argumentet i modellkortet er husets slagord snarere enn en poengsum: “Building Frontier AI with AI.” NaiveAI sier at NaiveRT selv ble bygget og optimalisert gjennom det selskapet kaller KI-sentrert forskning og utvikling, og henviser til en casestudie i den tekniske bloggen.
Det som skal følges, er om arkitekturen holder ved møtet med andres arbeidslast. En modell uten et eneste lag med full attention er en reell prøve på om et vindu på 128 tokens pluss 2 048 sparse utvalgte tokens kan erstatte global attention ved én million tokens kontekst, og MIT-lisensen gjør at utenforstående kan kjøre prøven selv i stedet for å stole på selskapets tall. Vektene krever Nvidia-maskinvare med FP8-støtte og tar omkring 315 GB, så prøven blir ikke billig.