Tyska labbet väljer enhetsdagen för sin första stora öppna modell

Aleph Alpha släppte Kolibri den 3 oktober, tyska enhetsdagen, och lade upp hela vikterna på Hugging Face under Apache 2.0. Det är Heidelbergföretagets första öppna släpp i den här storleken. En föregångare, Kolibri Origin, blev färdigförtränad den 11 juni och publicerades aldrig.

Kolibri är en mixture-of-experts-transformator med 78,1 miljarder parametrar totalt och 3,46 miljarder aktiva för varje token: 384 experter, varav sex används samtidigt. Aleph Alpha uppger att modellen tränades på 20 biljoner tokens, filtrerade ur mer än 200 biljoner tokens rådata, och att 21,3 procent av förträningsblandningen var tyska. Översatt text utgör 6 procent av helheten, en andel företaget säger att det höll låg eftersom översatt text bär med sig det kulturella avtrycket från sitt källspråk.

Kontextfönstret går upp till en miljon tokens, även om den längsta sekvens modellen faktiskt tränades på är 262 144. Kunskapsgränsen är den 18 juni 2026 för både engelska och tyska.

Nätverkskablar inkopplade i en rackmonterad switch
Aleph Alpha riktar Kolibri mot köpare som inte kan skicka interna dokument till en utomstående inferenstjänst. Illustration. Brett Sayles · pexels · Pexels License

Jurisdiktion, inte frontlinjen

Aleph Alpha hävdar inte att det har hunnit upp frontlabben. Det hävdar jurisdiktion. Företaget säger att Kolibri byggdes av egna team i Tyskland och tränades på infrastruktur i Tyskland och Finland, under europeisk och tysk rätt utan utländsk kontroll, och att modellen utformades mot EU:s AI-förordning, uppförandekoden för AI med allmänt ändamål och GDPR från början.

Erbjudandet riktas till offentlig förvaltning, industri och flygindustri: köpare som inte kan skicka interna dokument till en utomstående inferenstjänst. Att köra 3,46 miljarder parametrar per token är tillräckligt litet för drift i kundens egen miljö, vilket är hela poängen med arkitekturen.

Modellen är också tränad att avstå. Aleph Alpha använde abstentionsdata och ett protokoll det kallar Merlin-Arthur, så att Kolibri säger att den inte vet när svaret inte finns i det underlag den fått, ett beteende företaget säger att kunderna efterfrågar och som det mäter löpande under träningen.

Siffrorna, och vem som tog fram dem

Samtliga publicerade Kolibri-resultat kommer från Aleph Alpha självt. Enligt företagets siffror når modellen 96,9 på AIME 2025, 90,0 på en tysk översättning av AIME 2026, 84,3 på GPQA Diamond och 85,9 på LiveCodeBench v6. Företaget jämförde den med Alibabas Qwen3.6-35B-A3B, Nvidias Nemotron 3 Super och Mistral Small 4, och sade att Kolibri matchar modeller med upp till fyra gånger så många aktiva parametrar. Försprånget är ojämnt: på ett bankagentstest redovisar företaget 38,1 mot 10,6 för Qwen3.6-35B-A3B, men på BFCL v4 redovisar det 61,4 mot Qwens 67,2.

En hand som skriver matematiska ekvationer på en whiteboard
Samtliga Kolibri-resultat som publicerats så här långt kommer från Aleph Alpha självt. Illustration. cottonbro studio · pexels · Pexels License

Själva jämförelsegruppen är omstridd. Trending Topics påpekade att alla tre konkurrenter Aleph Alpha valt är från våren, och att Kolibri inte mäts mot Qwen3.8, GLM-5.3 eller Kimi K3. Enligt sajtens läsning av Artificial Analysis Intelligence Index skulle Kolibri hamna bakom minst tjugo andra öppna modeller. Aleph Alphas svar är att offentliga tester beskriver kundernas behov dåligt. Någon oberoende utvärdering av Kolibri har ännu inte publicerats.

Tre månader från 30 till 78 miljarder

Släppet är också ett argument om tempo. Kolibri Origin hade 30,6 miljarder parametrar totalt, ett 65k-fönster och 7,51 biljoner träningstokens. Kolibri blev färdigförtränad den 11 september, tre månader senare. Däremellan tredubblade Aleph Alpha antalet experter, bytte routningsalgoritm, ersatte full uppmärksamhet med ett glidande fönster på 512 tokens plus full uppmärksamhet var femte lager, och lärde modellen fyra nivåer av resonemangsansträngning.

Förträningen pågick i 21 dagar och drabbades av 38 oplanerade avbrott från hårdvarufel och tappade anslutningar, ungefär ett per 10 000 GPU-timmar, som enligt företaget alla hanterades utan att en människa behövde gripa in.

Det som är värt att följa är om en oberoende rangordning bekräftar något av detta, och om tyska myndigheter faktiskt tar modellen i drift. Aleph Alphas interna kundnära utvärderingar är så här långt det enda belägget för att specialiseringen fungerar.