Más rápido que el tiempo real

NVIDIA Research ha publicado Sol-H3, una pila de inferencia para MiniMax-H3, el modelo de generación de vídeo de pesos abiertos. En un sistema Blackwell de 8 NVIDIA B300, la página del proyecto indica que genera cinco segundos de vídeo de 1344×768 a 24 fotogramas por segundo, con audio estéreo, en 1,653 segundos.

Eso es más rápido de lo que tarda en reproducirse el clip. La comparación que publica el equipo es frente a H3 base en el mismo hardware: 18,25 segundos para la misma salida de cinco segundos, una reducción de 11,04 veces.

La brecha se amplía con la duración. Diez segundos de vídeo tardan 3,732 segundos frente a 50,66 de la referencia, una reducción de 13,57 veces. Quince segundos tardan 6,612 frente a 99,51, una reducción de 15,05 veces. Todas esas cifras son de NVIDIA, medidas en su propio hardware.

De dónde sale la aceleración

Sol-H3 combina dos trabajos de NVIDIA, Sol-Engine y Sol-Attn, en un solo entorno de ejecución. Las técnicas enumeradas son atención dispersa dinámica que no requiere reentrenamiento, fusión de norm, RoPE, MLP y la configuración de atención dispersa, comunicación fusionada INT8 QKV y salida FP8 entre ocho GPU, decodificación VAE por lotes en paralelo y caché precalculada de AdaLN.

Una tarjeta gráfica sobre un escritorio de madera junto a un teclado
Las cifras publicadas se midieron en un sistema NVIDIA B300 de ocho GPU. Imagen ilustrativa. Trần Chính · pexels · Pexels License

La configuración varía según la escala: atención densa en una sola B300, y la ruta dispersa con INT8 QKV y transporte de salida FP8 en cuatro y ocho. Las cifras principales usan además un perfil de generación de cuatro pasos frente a una referencia de 49 pasos, lo que explica una parte sustancial de la diferencia y así se indica en la página del proyecto.

Por qué la noticia es una pila de inferencia

Aquí el modelo no ha cambiado. MiniMax-H3 es el mismo sistema de pesos abiertos sobre cuyo despliegue en producción escribió vLLM una semana antes. Lo que ha cambiado es todo lo que hay entre los pesos y la salida.

Una persona editando material de vídeo en la pantalla de un ordenador
El coste de servicio, más que los pesos del modelo, es hoy gran parte del gasto en generación de vídeo. Imagen ilustrativa. André Eusébio · pexels · Pexels License

Ahí es donde vive cada vez más la economía de la generación de vídeo. Un modelo de vídeo por difusión es caro por segundo de salida de un modo en que un modelo de lenguaje no lo es, y la diferencia entre una demo de investigación y un producto suele estar en la pila de servicio, no en el punto de control. El código de Sol-H3 se publica bajo Apache 2.0; los pesos del modelo y los componentes de terceros conservan sus propios términos.

Qué vigilar a continuación

Las cifras que hay que buscar son las independientes. NVIDIA midió sus propias optimizaciones en sus propios aceleradores, lo que es normal en este tipo de publicación y también una razón para esperar reproducciones de terceros antes de tratar el 15× como una cifra general.

Lo otro que merece atención es si las técnicas se transfieren. Sol-H3 admite en el mismo motor cualquier LoRA de pocos pasos de MiniMax-H3, lo que sugiere que el motor no está ajustado de forma estrecha a un solo punto de control, pero esa afirmación es más fácil de comprobar en un modelo que NVIDIA no haya elegido.