Flaskhalsen
Agentbaserad förstärkningsinlärning skiljer träning från utrullning: modellen tränas på ett kluster och agerar på ett annat, och varje policyuppdatering måste nå utrullningsklustret innan nästa omgång kan börja. Den överföringen är dödtid.
En artikel publicerad den 7 oktober av forskare vid Nvidia och Aalto-universitetet sätter en siffra på det. Att skicka en fullständig kontrollpunkt för en modell med en biljon parametrar mellan två AWS-regioner tar 87,5 minuter. Ingenting tränas under tiden.
Observationen metoden vilar på
Författarna mätte hur mycket av modellen som faktiskt ändras, och anger att bara omkring 1% av vikterna i BF16 skiljer sig från ett träningssteg till nästa. De övriga 99% kopieras tvärs över en kontinent utan anledning.
Deras system, NeMo-DCR, skickar bara de värden som ändrats, och gör det bitexakt: det mottagande klustret får samma parameter- och buffertbitar som en fullständig tät omladdning skulle ha gett. Det betyder mer än det låter, eftersom en ungefärlig omladdning inför drift mellan den policy som tränas och den som samplas, vilket är just det förstärkningsinlärning är känsligt för.

Maskineriet omfattar fasta indexavbildningar som placerar varje ändring på en kanonisk koordinat i kontrollpunkten, ett val mellan XOR- och överskrivningskodning, tillämpning på plats med omförsök efter fel, och en gemensam incheckning som binder varje policyversion till den utgångspunkt den byggts från. Överföringar går via objektlagring eller ett relästräd, utan kollektiv operation mellan kluster.
Siffrorna
Samtliga är författarnas egna mätningar och har inte återskapats oberoende.
Vid förändringstakter på 3% och 5% går omladdningar av modeller från 30 miljarder till en biljon parametrar 12 till 40 gånger snabbare än en referens med fullständig kontrollpunkt begränsad till transport. Vid 120 miljarder parametrar tar en omladdning 22,6 till 49,7 sekunder mot en referens på 750 sekunder för en kontrollpunkt på 247,2 GB. Vid en biljon parametrar och 3% förändringstakt tar relästrädet omkring 150 sekunder i stället för 87,5 minuter.
Kodningsvalen bär egna siffror: XOR-masker komprimeras 1,7 till 2,2 gånger mindre än överskrivningsvärden, och ett blandat schema med XOR och överskrivning minskar nyttolasten i byte för Qwen3 med 38 till 40% jämfört med enbart överskrivning.

Vad det säger om vart tiden tar vägen
En siffra i artikeln är värd mer än snabbhetsvinsterna. I belastningsfallen står transporten för 77 till 94% av omladdningstiden med relästräd — alltså, när komprimeringsarbetet är gjort är nästan all återstående tid bara förflyttning av byte.
Det säger att metoden ligger nära det golv nätet sätter snarare än kodningen, och att ytterligare vinster måste komma från att skicka mindre eller skicka annorlunda, inte från att komprimera hårdare.
Vad man ska följa
Om förändringstakten på 1% håller i andra träningsregimer, om någon återskapar siffrorna utanför Nvidias egen stack, och om metoden hamnar i en släppt version av NeMo. En teknik som bara fungerar på hårdvaran och ramverket hos det företag som skrivit artikeln är en produktegenskap snarare än ett resultat.