Ett nätverk, två sorters token

Reka AI släppte Rho-1 den 5 oktober som en forskningsförhandsvisning. Det är en modell med 19 miljarder parametrar som tar emot och producerar text, bilder, video och robothandlingar inuti ett enda nätverk, i stället för att skicka varje uppgift vidare till ett specialiserat system bakom ett gemensamt gränssnitt.

Konstruktionen Reka beskriver är medvetet symmetrisk: allt som går in i eller ut ur nätverket har ett av två format. Text och resonemang är diskreta token. Bilder, video, robothandlingar och proprioception — robotens egen känsla för var lederna befinner sig — är kontinuerliga token. Samma vikter som förutsäger nästa videobildruta producerar också nästa rörelse för en robotarm.

Träningsdata för robotar är den vanliga flaskhalsen här, eftersom teleopererat material är dyrt att samla in. Rekas svar är en invers dynamikmodell som återskapar styrsignaler ur vanlig internetvideo, vilket gör ett stort och billigt korpus till något en handlingsmodell kan lära sig av.

En professionell videokamera på stativ i en studio
Reka uppger att den återskapar styrsignaler för robotar ur vanlig internetvideo. Illustration. Caleb Oquendo · pexels · Pexels License

Vad den gör, och vad den ännu inte gör

Reka publicerade prestandasiffror snarare än testresultat. Basmodellen genererar video i median 0,79 gånger realtid, med ungefär sex sekunder till första bildrutan. En destillerad variant minskar brusreduceringen från 99 steg till åtta. Begärda redigeringar i en pågående video landar på mellan 1,11 och 2,01 sekunder. Den nativa upplösningen är 672 gånger 384.

Bolaget är ovanligt rakt om begränsningarna. Strukturen driver i sekvenser längre än omkring 30 sekunder. Den tidsmässiga förankringen är svag, så modellen tappar bort objekt genom en video. Riktad bildredigering är skör. Den nativa upplösningen ligger under vad specialiserade videosystem levererar. Ingen av siffrorna har kontrollerats utanför Reka.

En tom fotostudio med ljusstativ
Nativ videoupplösning är 672 gånger 384, under vad specialiserade videosystem levererar. Illustration. Hc Digital · pexels · Pexels License

Beräkningssiffran är argumentet

Rho-1 tränades på 320 Nvidia H100-GPU:er under ungefär tre månader. Det är en liten bråkdel av vad en textmodell i frontlinjen förbrukar, och det är den del av beskedet som riktar sig till den som ska avgöra om enhetliga multimodala arkitekturer är en forskningskuriositet eller ett praktiskt alternativ.

Reka släpper inga vikter. Åtkomsten är en forskningsförhandsvisning, och bolaget har bett den som arbetar med förkroppsligad robotik, interaktiv simulering eller system för syn och handling att höra av sig direkt.

Det användbara provet blir om påståendet om ett enda nätverk överlever kontakt med en riktig robot. En modell som styr en arm med samma vikter som den renderar video med är en ren idé; om den är bättre än en hög med sammankopplade specialmodeller är en fråga förhandsvisningen inte besvarar.