Snabbare än realtid
NVIDIA Research har släppt Sol-H3, en inferensstack för MiniMax-H3, videogenereringsmodellen med öppna vikter. På ett system med 8 NVIDIA B300 Blackwell uppger projektsidan att den genererar fem sekunder video i 1344×768 vid 24 bilder per sekund, med stereoljud, på 1,653 sekunder.
Det är snabbare än klippet tar att spela upp. Jämförelsen teamet publicerar är mot bas-H3 på samma hårdvara: 18,25 sekunder för samma femsekundersresultat, en minskning med 11,04 gånger.
Gapet växer med längden. Tio sekunder video tar 3,732 sekunder mot 50,66 för referensen, en minskning med 13,57 gånger. Femton sekunder tar 6,612 mot 99,51, en minskning med 15,05 gånger. Samtliga siffror är NVIDIA:s egna, mätta på bolagets egen hårdvara.
Var accelerationen kommer ifrån
Sol-H3 kombinerar två NVIDIA-arbeten, Sol-Engine och Sol-Attn, till en körmiljö. De uppräknade teknikerna är dynamisk gles attention som inte kräver omträning, sammanslagen norm, RoPE, MLP och uppsättning av gles attention, sammanslagen INT8 QKV- och FP8-utdatakommunikation över åtta GPU:er, parallell satsvis VAE-avkodning och förberäknad AdaLN-cachning.

Konfigurationen skiljer sig åt med skalan: tät attention på en enda B300, och den glesa vägen med INT8 QKV och FP8-utdatatransport på fyra och åtta. Huvudsiffrorna använder dessutom en genereringsprofil på fyra steg mot en referens på 49 steg, vilket förklarar en väsentlig del av skillnaden och anges så på projektsidan.
Varför en inferensstack är nyheten
Modellen har inte ändrats här. MiniMax-H3 är samma system med öppna vikter som vLLM skrev om att köra i produktion en vecka tidigare. Det som ändrats är allt mellan vikterna och utdata.

Det är alltmer där ekonomin i videogenerering bor. En diffusionsbaserad videomodell är dyr per sekund utdata på ett sätt en språkmodell inte är, och skillnaden mellan en forskningsdemo och en produkt sitter oftast i serveringsstacken snarare än i checkpointen. Sol-H3:s kod släpps under Apache 2.0; modellvikter och tredjepartskomponenter behåller sina egna villkor.
Vad som händer härnäst
Siffrorna att leta efter är de oberoende. NVIDIA mätte sina egna optimeringar på sina egna acceleratorer, vilket är normalt för den här typen av släpp och också ett skäl att vänta på reproduktioner från tredje part innan 15× behandlas som ett allmängiltigt tal.
Det andra värt att bevaka är om teknikerna går att flytta. Sol-H3 tar emot vilken fåstegs-LoRA för MiniMax-H3 som helst i samma motor, vilket antyder att motorn inte är snävt anpassad till en enda checkpoint — men det påståendet är lättast att pröva på en modell NVIDIA inte valt.