Un modèle de pointe sans aucune couche d’attention complète

NaiveAI, un laboratoire pékinois fondé en février qui n’avait jamais publié de modèle, a mis en ligne Naive-N0.5-Flash sous licence MIT. C’est un modèle à mélange d’experts de 309 milliards de paramètres au total et 15,5 milliards actifs, annoncé avec une fenêtre de contexte native d’un million de jetons. L’inhabituel tient à ce qui manque : selon la fiche du modèle, il n’existe aucune couche d’attention complète dans l’ensemble du réseau.

Les transformeurs conservent d’ordinaire au moins quelques couches qui balaient tout le contexte. Ce sont elles qui préservent l’information à longue portée et, à des longueurs d’un million de jetons, elles concentrent aussi l’essentiel du coût de décodage. Naive-N0.5-Flash les supprime entièrement. Ses 48 couches se répartissent en huit modules de six : cinq couches d’attention à fenêtre glissante suivies d’une couche DeepSeek Sparse Attention, la première couche du premier module étant elle aussi remplacée par une couche DSA. Soit 39 couches à fenêtre glissante et 9 couches parcimonieuses.

La fenêtre glissante fait 128 jetons. Les couches parcimonieuses font tourner un indexeur léger de 16 têtes sur tout l’historique, puis ne calculent l’attention que sur les 2 048 jetons qu’il retient. Le cache clés-valeurs complet est conservé et l’indexeur parcourt toujours l’intégralité de l’historique : l’économie porte donc sur le calcul d’attention et le trafic mémoire, non sur le stockage.

Rangées de baies de serveurs à l'intérieur d'une salle informatique
Le modèle conserve tout son cache clés-valeurs : l'économie porte sur le calcul, non sur le stockage. Image d'archive. ThisIsEngineering · pexels · Pexels License

Construit sur le modèle de base ouvert de Xiaomi

Naive-N0.5-Flash n’a pas été entraîné de zéro. Il part du modèle de base à poids ouverts MiMo-V2.5 de Xiaomi, que NaiveAI remercie dans ses crédits aux côtés de DeepSeek pour la conception de l’attention parcimonieuse et du projet SGLang pour l’infrastructure d’inférence. Adapter le modèle de base à cette nouvelle structure d’attention était, selon l’entreprise, l’un des objectifs du préentraînement prolongé : 3 250 milliards de jetons en trois étapes, dont 50 milliards de mise en route de l’indexeur, 3 000 milliards d’entraînement en attention parcimonieuse et 200 milliards de décroissance du taux d’apprentissage.

Cette filiation compte pour lire l’annonce. Il s’agit d’une refonte architecturale substantielle du modèle de base d’un autre acteur, publiée en ouvert, et non d’un nouveau préentraînement complet — et elle est présentée comme la preuve que des piles hybrides mêlant parcimonie et fenêtre glissante peuvent tenir la qualité jusqu’à un million de jetons.

NaiveAI a également publié NaiveRT, son propre système d’inférence, qui selon l’entreprise combine fusion de méga-noyaux, Programmatic Dependent Launch et décodage spéculatif pour atteindre 50 jetons par seconde et par utilisateur en mode standard, et jusqu’à 2 000 en mode « Ultrafast ». Les poids et le code d’inférence sont sous licence MIT ; l’API hébergée est facturée 0,10 dollar par million de jetons en entrée, 0,40 en sortie et 0,01 par million de lectures de cache.

Les chiffres des tests sont ceux de l’entreprise

La fiche du modèle rapporte des résultats sur des tâches de code et d’agents — SWE-Bench Pro, DeepSWE v1.1, Terminal-Bench 2.1, ALE-CLI, ProgramBench — et sur une série de tests de recherche et développement en IA dont PostTrainBench, MLE-bench-30 et PaperBench. Ce sont les évaluations propres de NaiveAI, pas des résultats indépendants, et l’entreprise détaille son banc d’essai : sauf mention contraire, elle a lancé les tests via Claude Code 2.1.207 avec un contexte d’un million de jetons, une température de 1,0 et un top-p de 0,95, n’exposant que des outils élémentaires de fichiers et Bash. Les scores des concurrents sont repris de leurs blogs, fiches et classements publics plutôt que rejoués.

Des ingénieurs discutent d'un schéma devant un tableau blanc
NaiveAI affirme que son système d'inférence a lui-même été conçu par une recherche centrée sur l'IA. Image d'archive. Godfrey Atima · pexels · Pexels License

Un laboratoire valorisé avant d’avoir un produit

NaiveAI a été fondé en février 2026 par Dai Jifeng, maître de conférences à l’université Tsinghua, passé par Microsoft Research Asia et par l’entreprise de vision par ordinateur SenseTime. Soutenu par Tencent, le laboratoire a levé environ 400 millions de dollars et atteint une valorisation estimée à quelque 1,42 milliard — un chiffre remarqué la semaine dernière précisément parce que l’entreprise n’avait alors rien livré.

C’est désormais fait, et l’argument de la fiche technique est le slogan de la maison plutôt qu’un score : « Building Frontier AI with AI ». NaiveAI affirme que NaiveRT a lui-même été conçu et optimisé par ce qu’elle nomme une recherche et un développement centrés sur l’IA, et renvoie à une étude de cas publiée dans son blog technique.

Reste à voir si l’architecture résiste au contact des charges de travail des autres. Un modèle sans aucune couche d’attention complète constitue un test réel : une fenêtre de 128 jetons plus 2 048 jetons sélectionnés de façon parcimonieuse peuvent-elles remplacer l’attention globale à un million de jetons de contexte ? La licence MIT permet à des équipes extérieures de mener ce test elles-mêmes au lieu de s’en remettre aux chiffres de l’entreprise. Les poids exigent du matériel Nvidia compatible FP8 et occupent environ 315 Go : l’épreuve ne sera pas bon marché.