Le laboratoire allemand choisit le jour de l’Unité pour son premier grand modèle ouvert
Aleph Alpha a publié Kolibri le 3 octobre, jour de l’Unité allemande, et déposé les poids complets sur Hugging Face sous licence Apache 2.0. C’est la première publication en poids ouverts à cette échelle pour l’entreprise de Heidelberg. Un prédécesseur, Kolibri Origin, a terminé son pré-entraînement le 11 juin et n’a jamais été publié.
Kolibri est un transformeur à mélange d’experts doté de 78,1 milliards de paramètres au total et de 3,46 milliards actifs pour chaque token : 384 experts, dont six s’activent simultanément. Aleph Alpha indique avoir entraîné le modèle sur 20 000 milliards de tokens, filtrés à partir de plus de 200 000 milliards de tokens de données brutes, et que 21,3 % du mélange de pré-entraînement était en allemand. Le texte traduit représente 6 % de l’ensemble, une part que l’entreprise dit avoir maintenue basse parce que le texte traduit porte l’empreinte culturelle de sa langue source.
La fenêtre de contexte atteint un million de tokens, même si la plus longue séquence sur laquelle le modèle a réellement été entraîné est de 262 144. Sa date de coupure des connaissances est le 18 juin 2026, pour l’anglais comme pour l’allemand.

La juridiction, pas la frontière
Aleph Alpha ne prétend pas avoir rattrapé les laboratoires de pointe. L’entreprise revendique une juridiction. Elle affirme que Kolibri a été construit par ses propres équipes en Allemagne et entraîné sur des infrastructures situées en Allemagne et en Finlande, sous droit européen et allemand et sans contrôle étranger, et qu’elle a conçu le modèle dès le départ au regard du règlement européen sur l’IA, du code de bonnes pratiques pour l’IA à usage général et du RGPD.
L’offre vise l’administration publique, l’industrie et l’aéronautique : des acheteurs qui ne peuvent pas envoyer leurs documents internes à un service d’inférence tiers. Faire tourner 3,46 milliards de paramètres par token reste assez léger pour une exploitation sur site, ce qui est tout l’objet de l’architecture.
Le modèle est également entraîné à s’abstenir. Aleph Alpha a utilisé des données d’abstention et un protocole qu’elle appelle Merlin-Arthur pour que Kolibri dise qu’il ne sait pas lorsque la réponse n’est pas dans le contexte fourni, un comportement que ses clients réclament, selon elle, et qu’elle suit comme une mesure pendant l’entraînement.
Les chiffres, et qui les a produits
Tous les scores publiés de Kolibri sont ceux d’Aleph Alpha. Selon ses propres relevés, le modèle atteint 96,9 sur AIME 2025, 90,0 sur une traduction allemande d’AIME 2026, 84,3 sur GPQA Diamond et 85,9 sur LiveCodeBench v6. L’entreprise l’a comparé au Qwen3.6-35B-A3B d’Alibaba, au Nemotron 3 Super de Nvidia et à Mistral Small 4, et affirme que Kolibri égale des modèles dotés de jusqu’à quatre fois plus de paramètres actifs. L’avance n’est pas uniforme : sur un test d’agent bancaire, elle annonce 38,1 contre 10,6 pour Qwen3.6-35B-A3B, mais sur BFCL v4 elle annonce 61,4 contre 67,2 pour Qwen.

Le panel de comparaison est lui-même contesté. Trending Topics a relevé que les trois rivaux retenus par Aleph Alpha datent tous du printemps, et que Kolibri n’est mesuré ni contre Qwen3.8, ni contre GLM-5.3, ni contre Kimi K3. Selon sa lecture de l’Artificial Analysis Intelligence Index, Kolibri se placerait derrière au moins vingt autres modèles en poids ouverts. La réponse d’Aleph Alpha est que les tests publics décrivent mal les besoins de ses clients. Aucune évaluation indépendante de Kolibri n’a encore été publiée.
Trois mois pour passer de 30 à 78 milliards
La sortie est aussi un argument sur le rythme. Kolibri Origin comptait 30,6 milliards de paramètres au total, une fenêtre de 65k et 7 510 milliards de tokens d’entraînement. Kolibri a terminé son pré-entraînement le 11 septembre, trois mois plus tard. Entre-temps, Aleph Alpha a triplé le nombre d’experts, remplacé son algorithme de routage, substitué à l’attention complète une fenêtre glissante de 512 tokens avec attention complète une couche sur cinq, et appris au modèle quatre niveaux d’effort de raisonnement.
Le pré-entraînement a duré 21 jours et subi 38 interruptions imprévues dues à des pannes matérielles et à des connexions coupées, soit environ une par 10 000 heures de GPU, toutes traitées, selon l’entreprise, sans intervention humaine.
Ce qu’il faudra surveiller, c’est si un classement indépendant confirme quoi que ce soit de tout cela, et si les administrations allemandes déploient réellement le modèle. Les évaluations internes d’Aleph Alpha sont pour l’instant la seule preuve que sa spécialisation fonctionne.