El laboratorio alemán elige el Día de la Unidad para su primer modelo abierto grande

Aleph Alpha publicó Kolibri el 3 de octubre, Día de la Unidad Alemana, y colocó los pesos completos en Hugging Face con licencia Apache 2.0. Es el primer lanzamiento de pesos abiertos de esta escala de la empresa de Heidelberg. Un modelo anterior, Kolibri Origin, terminó su preentrenamiento el 11 de junio y nunca se publicó.

Kolibri es un transformador de mezcla de expertos con 78.100 millones de parámetros en total y 3.460 millones activos para cada token: 384 expertos, de los que se activan seis a la vez. Aleph Alpha afirmó que entrenó el modelo con 20 billones de tokens, filtrados a partir de más de 200 billones de tokens de datos brutos, y que el 21,3% de la mezcla de preentrenamiento era alemán. El texto traducido supone el 6% del conjunto, una proporción que la empresa dijo haber mantenido baja porque el texto traducido arrastra la huella cultural de su idioma de origen.

La ventana de contexto llega a un millón de tokens, aunque la secuencia más larga con la que se entrenó realmente el modelo es de 262.144. Su corte de conocimiento es el 18 de junio de 2026 tanto para inglés como para alemán.

Cables de red conectados a un conmutador montado en bastidor
Aleph Alpha dirige Kolibri a compradores que no pueden enviar documentos internos a un servicio de inferencia ajeno. Ilustración. Brett Sayles · pexels · Pexels License

Jurisdicción, no la frontera

Aleph Alpha no afirma haber alcanzado a los laboratorios de frontera. Afirma tener jurisdicción. La empresa dijo que Kolibri lo construyeron sus propios equipos en Alemania y que se entrenó en infraestructura situada en Alemania y Finlandia, bajo derecho europeo y alemán y sin control extranjero, y que diseñó el modelo desde el principio conforme al Reglamento de IA de la UE, al Código de Buenas Prácticas para IA de uso general y al RGPD.

La propuesta apunta a la administración pública, la industria y la aeronáutica: compradores que no pueden enviar documentos internos a un servicio de inferencia ajeno. Ejecutar 3.460 millones de parámetros por token es lo bastante pequeño para servirse en las instalaciones del cliente, que es el sentido de la arquitectura.

El modelo también está entrenado para negarse a responder. Aleph Alpha usó datos de abstención y un protocolo que llama Merlin-Arthur para que Kolibri diga que no sabe cuando la respuesta no está en el contexto facilitado, un comportamiento que, según la empresa, los clientes piden y que mide como métrica durante el entrenamiento.

Las cifras, y quién las produjo

Todas las puntuaciones publicadas de Kolibri son de Aleph Alpha. Según sus datos, el modelo alcanza 96,9 en AIME 2025, 90,0 en una traducción al alemán de AIME 2026, 84,3 en GPQA Diamond y 85,9 en LiveCodeBench v6. La empresa lo comparó con Qwen3.6-35B-A3B de Alibaba, Nemotron 3 Super de Nvidia y Mistral Small 4, y dijo que Kolibri iguala a modelos con hasta cuatro veces sus parámetros activos. La ventaja no es uniforme: en una prueba de agentes bancarios declara 38,1 frente a 10,6 de Qwen3.6-35B-A3B, pero en BFCL v4 declara 61,4 frente a 67,2 de Qwen.

Una mano escribiendo ecuaciones matemáticas en una pizarra blanca
Todas las cifras de referencia de Kolibri publicadas hasta ahora proceden de Aleph Alpha. Ilustración. cottonbro studio · pexels · Pexels License

El propio conjunto de comparación está en discusión. Trending Topics señaló que los tres rivales elegidos por Aleph Alpha son de la primavera, y que Kolibri no se mide contra Qwen3.8, GLM-5.3 ni Kimi K3. Según su lectura del Artificial Analysis Intelligence Index, Kolibri quedaría por detrás de al menos veinte modelos de pesos abiertos. La respuesta de Aleph Alpha es que las pruebas públicas describen mal lo que necesitan sus clientes. Todavía no se ha publicado ninguna evaluación independiente de Kolibri.

Tres meses para pasar de 30.000 a 78.000 millones

El lanzamiento es también un argumento sobre velocidad. Kolibri Origin tenía 30.600 millones de parámetros totales, una ventana de 65k y 7,51 billones de tokens de entrenamiento. Kolibri terminó su preentrenamiento el 11 de septiembre, tres meses después. Entre ambas fechas, Aleph Alpha triplicó el número de expertos, cambió su algoritmo de enrutamiento, sustituyó la atención completa por una ventana deslizante de 512 tokens con atención completa cada cinco capas, y enseñó al modelo cuatro niveles de esfuerzo de razonamiento.

El preentrenamiento duró 21 días y sufrió 38 interrupciones imprevistas por fallos de hardware y conexiones caídas, aproximadamente una por cada 10.000 horas de GPU, todas gestionadas, según la empresa, sin intervención humana.

Lo que hay que seguir es si alguna clasificación independiente confirma algo de esto, y si los organismos públicos alemanes despliegan el modelo. Las evaluaciones internas de Aleph Alpha son por ahora la única prueba de que su especialización funciona.