Más rápido que el tiempo real
NVIDIA Research ha publicado Sol-H3, una pila de inferencia para MiniMax-H3, el modelo de generación de vídeo de pesos abiertos. En un sistema Blackwell de 8 NVIDIA B300, la página del proyecto indica que genera cinco segundos de vídeo de 1344×768 a 24 fotogramas por segundo, con audio estéreo, en 1,653 segundos.
Eso es más rápido de lo que tarda en reproducirse el clip. La comparación que publica el equipo es frente a H3 base en el mismo hardware: 18,25 segundos para la misma salida de cinco segundos, una reducción de 11,04 veces.
La brecha se amplía con la duración. Diez segundos de vídeo tardan 3,732 segundos frente a 50,66 de la referencia, una reducción de 13,57 veces. Quince segundos tardan 6,612 frente a 99,51, una reducción de 15,05 veces. Todas esas cifras son de NVIDIA, medidas en su propio hardware.
De dónde sale la aceleración
Sol-H3 combina dos trabajos de NVIDIA, Sol-Engine y Sol-Attn, en un solo entorno de ejecución. Las técnicas enumeradas son atención dispersa dinámica que no requiere reentrenamiento, fusión de norm, RoPE, MLP y la configuración de atención dispersa, comunicación fusionada INT8 QKV y salida FP8 entre ocho GPU, decodificación VAE por lotes en paralelo y caché precalculada de AdaLN.

La configuración varía según la escala: atención densa en una sola B300, y la ruta dispersa con INT8 QKV y transporte de salida FP8 en cuatro y ocho. Las cifras principales usan además un perfil de generación de cuatro pasos frente a una referencia de 49 pasos, lo que explica una parte sustancial de la diferencia y así se indica en la página del proyecto.
Por qué la noticia es una pila de inferencia
Aquí el modelo no ha cambiado. MiniMax-H3 es el mismo sistema de pesos abiertos sobre cuyo despliegue en producción escribió vLLM una semana antes. Lo que ha cambiado es todo lo que hay entre los pesos y la salida.

Ahí es donde vive cada vez más la economía de la generación de vídeo. Un modelo de vídeo por difusión es caro por segundo de salida de un modo en que un modelo de lenguaje no lo es, y la diferencia entre una demo de investigación y un producto suele estar en la pila de servicio, no en el punto de control. El código de Sol-H3 se publica bajo Apache 2.0; los pesos del modelo y los componentes de terceros conservan sus propios términos.
Qué vigilar a continuación
Las cifras que hay que buscar son las independientes. NVIDIA midió sus propias optimizaciones en sus propios aceleradores, lo que es normal en este tipo de publicación y también una razón para esperar reproducciones de terceros antes de tratar el 15× como una cifra general.
Lo otro que merece atención es si las técnicas se transfieren. Sol-H3 admite en el mismo motor cualquier LoRA de pocos pasos de MiniMax-H3, lo que sugiere que el motor no está ajustado de forma estrecha a un solo punto de control, pero esa afirmación es más fácil de comprobar en un modelo que NVIDIA no haya elegido.