En model i front uden full attention i noget lag
NaiveAI, et Beijing-laboratorium stiftet i februar, som aldrig før har udgivet en model, har offentliggjort Naive-N0.5-Flash under MIT-licens. Det er en mixture-of-experts-model med 309 milliarder parametre i alt og 15,5 milliarder aktive, og den angives at have et nativt kontekstvindue på én million tokens. Det usædvanlige er det, der mangler: ifølge modelkortet findes der ikke et enkelt lag med full attention i netværket.
Transformere beholder normalt mindst nogle lag, der ser hele konteksten. De lag er dem, der bevarer information over lange afstande, og ved millionlængder er de også der, hvor størstedelen af afkodningsomkostningen ligger. Naive-N0.5-Flash fjerner dem helt. De 48 lag er fordelt på otte moduler af seks: fem lag med glidende vindue fulgt af ét lag DeepSeek Sparse Attention, hvor også første lag i første modul er erstattet af DSA. Det giver 39 lag med glidende vindue og 9 sparse.
Det glidende vindue er 128 tokens. De sparse lag kører en let indekserer med 16 hoveder over hele historikken og beregner derefter kun attention over de 2.048 tokens, den udvælger. Hele nøgle-værdi-cachen bevares, og indeksereren læser stadig alt, så besparelsen ligger i attentionberegning og hukommelsestrafik, ikke i lagring.

Bygget på Xiaomis åbne basismodel
Naive-N0.5-Flash er ikke trænet fra bunden. Den bygger på Xiaomis basismodel MiMo-V2.5 med åbne vægte, som NaiveAI krediterer i sine tak sammen med DeepSeek for designet af sparse attention og SGLang-projektet for inferensinfrastruktur. At tilpasse basismodellen til den nye attentionstruktur var ifølge selskabet et af formålene med den fortsatte fortræning: 3,25 billioner tokens i tre trin, heraf 50 milliarder tokens opvarmning af indeksereren, 3 billioner træning med sparse attention og 200 milliarder aftagende læringsrate.
Den afstamning betyder noget for læsningen af udgivelsen. Det er en omfattende arkitektonisk ombygning af en andens basismodel, offentliggjort åbent, snarere end en ny fortræningskørsel — og den tilbydes som bevis på, at hybride stakke med sparse og glidende attention kan holde kvaliteten ud til én million tokens.
NaiveAI har også offentliggjort NaiveRT, sit eget inferenssystem, som selskabet siger kombinerer megakernefusion, Programmatic Dependent Launch og spekulativ afkodning for 50 tokens pr. sekund pr. bruger i standardtilstand og op til 2.000 i en “Ultrafast”-tilstand. Vægte og inferenskode har MIT-licens; det hostede API koster 0,10 dollar pr. million tokens ind, 0,40 pr. million ud og 0,01 pr. million cachelæsninger.
Testtallene er selskabets egne
Modelkortet angiver resultater på kode- og agentopgaver — SWE-Bench Pro, DeepSWE v1.1, Terminal-Bench 2.1, ALE-CLI, ProgramBench — og på en række tests for AI-forskning og udvikling, blandt dem PostTrainBench, MLE-bench-30 og PaperBench. Det er NaiveAIs egne evalueringer, ikke uafhængige resultater, og selskabet er tydeligt om riggen: medmindre andet er anført, kørte det testene gennem Claude Code 2.1.207 med én million tokens kontekst, temperatur 1,0 og top-p 0,95, med kun simpel filhåndtering og Bash-værktøjer tilgængelige. Konkurrenternes tal er hentet fra andre producenters blogs, modelkort og offentlige lister i stedet for at blive kørt om.

Et laboratorium værdisat før det havde et produkt
NaiveAI blev stiftet i februar 2026 af Dai Jifeng, lektor ved Tsinghua-universitetet, der tidligere har arbejdet hos Microsoft Research Asia og i computervisionsselskabet SenseTime. Med Tencent i ryggen rejste laboratoriet omkring 400 millioner dollar og nåede en oplyst værdisætning på cirka 1,42 milliarder — et tal, der blev bemærket i sidste uge netop fordi selskabet ikke havde udgivet noget.
Nu har det udgivet noget, og argumentet i modelkortet er husets slogan snarere end en score: “Building Frontier AI with AI.” NaiveAI oplyser, at NaiveRT selv blev bygget og optimeret gennem det, selskabet kalder AI-centreret forskning og udvikling, og henviser til et casestudie i sin tekniske blog.
Det, der skal følges, er om arkitekturen holder ved mødet med andres arbejdsbelastninger. En model uden et enkelt lag med full attention er en reel prøve på, om et vindue på 128 tokens plus 2.048 sparse udvalgte tokens kan erstatte global attention ved én million tokens kontekst, og MIT-licensen gør, at udenforstående kan køre prøven selv i stedet for at stole på selskabets tal. Vægtene kræver Nvidia-hardware med FP8-understøttelse og fylder omkring 315 GB, så prøven bliver ikke billig.