Det tyske laboratoriet velger enhetsdagen for sin første store åpne modell

Aleph Alpha slapp Kolibri 3. oktober, den tyske enhetsdagen, og la hele vektene ut på Hugging Face under Apache 2.0. Det er Heidelberg-selskapets første åpne slipp i denne størrelsen. En forgjenger, Kolibri Origin, ble ferdig forhåndstrent 11. juni og ble aldri publisert.

Kolibri er en mixture-of-experts-transformer med 78,1 milliarder parametre totalt og 3,46 milliarder aktive for hver token: 384 eksperter, der seks er i bruk samtidig. Aleph Alpha opplyser at modellen ble trent på 20 billioner tokens, filtrert ut av mer enn 200 billioner tokens rådata, og at 21,3 prosent av forhåndstreningsblandingen var tysk. Oversatt tekst utgjør 6 prosent av helheten, en andel selskapet sier det holdt lav fordi oversatt tekst bærer med seg det kulturelle avtrykket fra kildespråket.

Kontekstvinduet går opp til én million tokens, selv om den lengste sekvensen modellen faktisk ble trent på er 262 144. Kunnskapsgrensen er 18. juni 2026 for både engelsk og tysk.

Nettverkskabler koblet til en rackmontert svitsj
Aleph Alpha retter Kolibri mot kjøpere som ikke kan sende interne dokumenter til en utenforstående inferenstjeneste. Illustrasjon. Brett Sayles · pexels · Pexels License

Jurisdiksjon, ikke fronten

Aleph Alpha hevder ikke å ha tatt igjen frontlaboratoriene. Selskapet hevder jurisdiksjon. Det sier at Kolibri ble bygget av egne team i Tyskland og trent på infrastruktur i Tyskland og Finland, under europeisk og tysk rett uten utenlandsk kontroll, og at modellen ble utformet mot EUs AI-forordning, atferdskoden for AI med generelt formål og GDPR fra starten.

Tilbudet er rettet mot offentlig forvaltning, industri og luftfart: kjøpere som ikke kan sende interne dokumenter til en utenforstående inferenstjeneste. Å kjøre 3,46 milliarder parametre per token er lite nok til drift hos kunden selv, som er hele poenget med arkitekturen.

Modellen er også trent til å avstå. Aleph Alpha brukte avståelsesdata og en protokoll selskapet kaller Merlin-Arthur, slik at Kolibri sier at den ikke vet når svaret ikke finnes i det materialet den har fått, en atferd selskapet sier kundene etterspør og som det måler gjennom treningen.

Tallene, og hvem som laget dem

Alle publiserte Kolibri-resultater kommer fra Aleph Alpha selv. Etter selskapets tall når modellen 96,9 på AIME 2025, 90,0 på en tysk oversettelse av AIME 2026, 84,3 på GPQA Diamond og 85,9 på LiveCodeBench v6. Selskapet sammenlignet den med Alibabas Qwen3.6-35B-A3B, Nvidias Nemotron 3 Super og Mistral Small 4, og sa at Kolibri matcher modeller med opptil fire ganger så mange aktive parametre. Forspranget er ujevnt: på en test for bankagenter oppgir selskapet 38,1 mot 10,6 for Qwen3.6-35B-A3B, men på BFCL v4 oppgir det 61,4 mot Qwens 67,2.

En hånd som skriver matematiske likninger på en whiteboard
Alle Kolibri-resultater som er publisert så langt, kommer fra Aleph Alpha selv. Illustrasjon. cottonbro studio · pexels · Pexels License

Selve sammenligningsgruppen er omstridt. Trending Topics påpekte at alle de tre konkurrentene Aleph Alpha valgte er fra våren, og at Kolibri ikke måles mot Qwen3.8, GLM-5.3 eller Kimi K3. Etter nettstedets lesning av Artificial Analysis Intelligence Index ville Kolibri havne bak minst tjue andre åpne modeller. Aleph Alphas svar er at offentlige tester beskriver kundenes behov dårlig. Noen uavhengig evaluering av Kolibri er ennå ikke publisert.

Tre måneder fra 30 til 78 milliarder

Slippet er også et argument om tempo. Kolibri Origin hadde 30,6 milliarder parametre totalt, et 65k-vindu og 7,51 billioner treningstokens. Kolibri ble ferdig forhåndstrent 11. september, tre måneder senere. I mellomtiden tredoblet Aleph Alpha antallet eksperter, byttet rutingalgoritme, erstattet full oppmerksomhet med et glidende vindu på 512 tokens pluss full oppmerksomhet hvert femte lag, og lærte modellen fire nivåer av resonneringsinnsats.

Forhåndstreningen varte i 21 dager og ble rammet av 38 uplanlagte avbrudd fra maskinvarefeil og tapte forbindelser, omtrent ett per 10 000 GPU-timer, som selskapet sier alle ble håndtert uten at et menneske måtte gripe inn.

Det som er verdt å følge, er om en uavhengig rangering bekrefter noe av dette, og om tyske offentlige organer faktisk setter modellen i drift. Aleph Alphas interne kundenære evalueringer er så langt det eneste beviset på at spesialiseringen virker.