O laboratório alemão escolhe o Dia da Unidade para o seu primeiro grande modelo aberto
A Aleph Alpha publicou o Kolibri a 3 de outubro, Dia da Unidade Alemã, e colocou os pesos completos no Hugging Face sob licença Apache 2.0. É o primeiro lançamento de pesos abertos desta escala da empresa de Heidelberg. Um antecessor, o Kolibri Origin, concluiu o pré-treino a 11 de junho e nunca chegou a ser publicado.
O Kolibri é um transformador de mistura de especialistas com 78,1 mil milhões de parâmetros no total e 3,46 mil milhões activos para cada token: 384 especialistas, dos quais seis são activados ao mesmo tempo. A Aleph Alpha afirmou ter treinado o modelo com 20 bilhões de tokens, filtrados a partir de mais de 200 bilhões de tokens de dados brutos, e que 21,3% da mistura de pré-treino era alemão. O texto traduzido representa 6% do conjunto, uma proporção que a empresa diz ter mantido baixa porque o texto traduzido transporta a impressão cultural da sua língua de origem.
A janela de contexto chega a um milhão de tokens, embora a sequência mais longa com que o modelo foi efectivamente treinado seja de 262 144. O corte de conhecimento é 18 de junho de 2026, tanto para inglês como para alemão.

Jurisdição, não a fronteira
A Aleph Alpha não afirma ter alcançado os laboratórios de fronteira. Afirma ter jurisdição. A empresa disse que o Kolibri foi construído pelas suas próprias equipas na Alemanha e treinado em infraestrutura situada na Alemanha e na Finlândia, sob direito europeu e alemão e sem controlo estrangeiro, e que desenhou o modelo desde o início em função do Regulamento de IA da UE, do Código de Conduta para IA de uso geral e do RGPD.
A proposta aponta à administração pública, à indústria e à aeronáutica: compradores que não podem enviar documentos internos para um serviço de inferência de terceiros. Correr 3,46 mil milhões de parâmetros por token é suficientemente leve para servir nas instalações do cliente, que é o objectivo da arquitectura.
O modelo também está treinado para se abster. A Aleph Alpha usou dados de abstenção e um protocolo a que chama Merlin-Arthur para que o Kolibri diga que não sabe quando a resposta não está no contexto fornecido, um comportamento que, segundo a empresa, os clientes pedem e que acompanha como métrica durante o treino.
Os números, e quem os produziu
Todas as pontuações publicadas do Kolibri são da própria Aleph Alpha. Pelos seus dados, o modelo atinge 96,9 no AIME 2025, 90,0 numa tradução alemã do AIME 2026, 84,3 no GPQA Diamond e 85,9 no LiveCodeBench v6. A empresa comparou-o com o Qwen3.6-35B-A3B da Alibaba, o Nemotron 3 Super da Nvidia e o Mistral Small 4, e disse que o Kolibri iguala modelos com até quatro vezes os seus parâmetros activos. A vantagem não é uniforme: num teste de agente bancário declara 38,1 contra 10,6 do Qwen3.6-35B-A3B, mas no BFCL v4 declara 61,4 contra 67,2 do Qwen.

O próprio conjunto de comparação é contestado. A Trending Topics notou que os três rivais escolhidos pela Aleph Alpha datam todos da primavera, e que o Kolibri não é medido contra o Qwen3.8, o GLM-5.3 ou o Kimi K3. Na sua leitura do Artificial Analysis Intelligence Index, o Kolibri ficaria atrás de pelo menos vinte outros modelos de pesos abertos. A resposta da Aleph Alpha é que os testes públicos descrevem mal o que os seus clientes precisam. Ainda não foi publicada qualquer avaliação independente do Kolibri.
Três meses para passar de 30 a 78 mil milhões
O lançamento é também um argumento sobre ritmo. O Kolibri Origin tinha 30,6 mil milhões de parâmetros no total, uma janela de 65k e 7,51 bilhões de tokens de treino. O Kolibri concluiu o pré-treino a 11 de setembro, três meses depois. Pelo meio, a Aleph Alpha triplicou o número de especialistas, substituiu o algoritmo de encaminhamento, trocou a atenção completa por uma janela deslizante de 512 tokens com atenção completa a cada cinco camadas, e ensinou ao modelo quatro níveis de esforço de raciocínio.
O pré-treino durou 21 dias e sofreu 38 interrupções imprevistas por falhas de hardware e quedas de ligação, cerca de uma por cada 10 000 horas de GPU, todas tratadas, segundo a empresa, sem intervenção humana.
O que há para seguir é se alguma classificação independente confirma algo disto, e se os organismos públicos alemães chegam a pôr o modelo em produção. As avaliações internas da Aleph Alpha são, até agora, a única prova de que a especialização funciona.