Det tyske laboratorium vælger enhedsdagen til sin første store åbne model
Aleph Alpha udgav Kolibri den 3. oktober, den tyske enhedsdag, og lagde hele vægtene op på Hugging Face under Apache 2.0. Det er Heidelberg-virksomhedens første åbne udgivelse i denne størrelse. En forgænger, Kolibri Origin, blev færdigtrænet den 11. juni og blev aldrig offentliggjort.
Kolibri er en mixture-of-experts-transformer med 78,1 milliarder parametre i alt og 3,46 milliarder aktive for hvert token: 384 eksperter, hvoraf seks er i brug samtidig. Aleph Alpha oplyser, at modellen blev trænet på 20 billioner tokens, filtreret ud af mere end 200 billioner tokens rådata, og at 21,3 procent af fortræningsblandingen var tysk. Oversat tekst udgør 6 procent af helheden, en andel virksomheden siger, den holdt lav, fordi oversat tekst bærer det kulturelle aftryk fra sit kildesprog.
Kontekstvinduet går op til én million tokens, selv om den længste sekvens, modellen faktisk blev trænet på, er 262 144. Videnskæringsdatoen er den 18. juni 2026 for både engelsk og tysk.

Jurisdiktion, ikke fronten
Aleph Alpha hævder ikke at have indhentet frontlaboratorierne. Virksomheden hævder jurisdiktion. Den siger, at Kolibri blev bygget af egne hold i Tyskland og trænet på infrastruktur i Tyskland og Finland, under europæisk og tysk ret uden udenlandsk kontrol, og at modellen fra starten blev udformet efter EU’s AI-forordning, adfærdskodeksen for AI til almene formål og GDPR.
Tilbuddet er rettet mod offentlig forvaltning, industri og luftfart: købere, der ikke kan sende interne dokumenter til en udenforstående inferenstjeneste. At køre 3,46 milliarder parametre per token er lille nok til drift hos kunden selv, hvilket er hele pointen med arkitekturen.
Modellen er også trænet til at afstå. Aleph Alpha brugte afståelsesdata og en protokol, virksomheden kalder Merlin-Arthur, så Kolibri siger, at den ikke ved det, når svaret ikke findes i det materiale, den har fået, en adfærd virksomheden siger, kunderne beder om, og som den måler gennem træningen.
Tallene, og hvem der lavede dem
Alle offentliggjorte Kolibri-resultater kommer fra Aleph Alpha selv. Efter virksomhedens tal når modellen 96,9 på AIME 2025, 90,0 på en tysk oversættelse af AIME 2026, 84,3 på GPQA Diamond og 85,9 på LiveCodeBench v6. Virksomheden sammenlignede den med Alibabas Qwen3.6-35B-A3B, Nvidias Nemotron 3 Super og Mistral Small 4 og sagde, at Kolibri matcher modeller med op til fire gange så mange aktive parametre. Forspringet er ujævnt: på en test for bankagenter oplyser virksomheden 38,1 mod 10,6 for Qwen3.6-35B-A3B, men på BFCL v4 oplyser den 61,4 mod Qwens 67,2.

Selve sammenligningsgruppen er omstridt. Trending Topics bemærkede, at alle tre konkurrenter, Aleph Alpha valgte, er fra foråret, og at Kolibri ikke måles mod Qwen3.8, GLM-5.3 eller Kimi K3. Efter mediets læsning af Artificial Analysis Intelligence Index ville Kolibri havne bag mindst tyve andre åbne modeller. Aleph Alphas svar er, at offentlige test beskriver kundernes behov dårligt. Nogen uafhængig evaluering af Kolibri er endnu ikke offentliggjort.
Tre måneder fra 30 til 78 milliarder
Udgivelsen er også et argument om tempo. Kolibri Origin havde 30,6 milliarder parametre i alt, et 65k-vindue og 7,51 billioner træningstokens. Kolibri blev færdigtrænet den 11. september, tre måneder senere. I mellemtiden tredoblede Aleph Alpha antallet af eksperter, skiftede rutingalgoritme, erstattede fuld opmærksomhed med et glidende vindue på 512 tokens plus fuld opmærksomhed hvert femte lag, og lærte modellen fire niveauer af ræsonneringsindsats.
Fortræningen løb i 21 dage og blev ramt af 38 uplanlagte afbrydelser fra hardwarefejl og tabte forbindelser, omtrent én per 10 000 GPU-timer, som virksomheden siger alle blev håndteret, uden at et menneske greb ind.
Det, der er værd at følge, er om en uafhængig rangliste bekræfter noget af dette, og om tyske offentlige myndigheder faktisk sætter modellen i drift. Aleph Alphas interne kundenære evalueringer er indtil nu det eneste bevis på, at specialiseringen virker.