Qué se ha publicado

El Allen Institute for AI publicó el jueves Olmo-core 3, un marco de entrenamiento abierto para grandes modelos de lenguaje de mezcla de expertos, junto con un informe técnico y una demo interactiva.

Un modelo de mezcla de expertos enruta cada token hacia un pequeño subconjunto de sus parámetros, de modo que la capacidad total puede crecer sin que crezca con ella el coste de cada pasada hacia adelante. Por eso casi todos los modelos de frontera son hoy dispersos. También por eso entrenar uno es más difícil que entrenar uno denso: el enrutado debe equilibrarse entre dispositivos, y el patrón de comunicación que genera es lo que decide si el hardware está ocupado o parado.

Las cifras

En una prueba preliminar con ocho GPU Nvidia B300, Ai2 dice que un modelo de mezcla de expertos de 47.000 millones de parámetros procesó 52.000 tokens por segundo y GPU con la nueva pila, frente a 19.400 con su implementación anterior construida sobre FSDP de PyTorch: unas 2,7 veces el rendimiento.

Ventiladores de refrigeración dentro de una caja de ordenador
El instituto reporta 2,7 veces el rendimiento de su implementación anterior. Foto ilustrativa. Andrey Matveev · pexels · Pexels License

Las cifras de capacidad son la otra mitad. Ai2 amplió el conjunto de expertos de 8 a 128 manteniendo cuatro expertos activos por token, lo que llevó los parámetros totales de 4.600 millones a 47.000 millones con unos 3.200 millones activos por token, y costó menos de un 5 por ciento del rendimiento de entrenamiento.

A escala, el instituto reporta haber medido una configuración de 1,2 billones de parámetros con 58.360 millones activos por token repartidos en 512 GPU B300, con un rendimiento máximo observado de 858 TFLOP/s por GPU, y una prueba adicional a 2,38 billones de parámetros usando DeepEP v2. Activar el formato numérico MXFP8 donde más ayudaba dio alrededor de un 21 por ciento más de rendimiento que la referencia BF16, y bajó la memoria activa máxima de 103 GiB a 95 GiB.

Son las mediciones propias del instituto sobre su propio marco, publicadas junto con la versión.

Por qué la infraestructura importa más que los pesos

Los modelos de pesos abiertos son hoy comunes. La infraestructura de entrenamiento abierta capaz de una ejecución dispersa de un billón de parámetros no lo es, y es la parte que determina si un grupo universitario o un laboratorio pequeño puede hacer algo más que ajustar el punto de control de otro.

Un técnico instalando hardware en un bastidor de servidores
La configuración mayor probada abarcó 512 GPU. Foto ilustrativa. panumas nikhomkhai · pexels · Pexels License

Ai2 ha sido consistente en esto: su línea Olmo ha publicado datos, código y puntos de control intermedios, no solo pesos. Olmo-core 3 extiende eso a la capa que suele guardarse con más celo, porque el rendimiento del entrenamiento distribuido es donde reside buena parte de la ventaja práctica de un laboratorio de frontera.

La salvedad es el hardware. Estas cifras vienen de B300, y una pila afinada para las piezas más nuevas de Nvidia es menos útil para un grupo que usa aceleradores antiguos, que son la mayoría fuera de los bien financiados.

Lo que hay que vigilar es si alguien fuera de Ai2 reproduce las cifras de rendimiento en su propio clúster. Un marco abierto vale lo que vale su segundo usuario.