Ingen innlært styringslag mellom modellen og roboten

Forskere ved Stanford og Caltech har fått en Unitree G1-humanoid til å utføre husholdningsoppgaver i flere trinn i rom den aldri hadde sett, med en generell syns- og språkmodell som gir kommandoene direkte. Systemet, kalt HomeBody, rydder rom, henter gjenstander og åpner skuffer for å ta ut det som ligger i dem.

Det bemerkelsesverdige er hva forskerne utelot. Nesten alt humanoidarbeid de siste to årene fører persepsjon og språk gjennom et trent syn-språk-handlingslag — en modell lært opp på robotdemonstrasjoner til å gjøre instruksjoner om til bevegelse. HomeBody har ikke et slikt lag. OpenAIs GPT-6 Astra kobles inn som det teamet kaller en plugg-og-spill-VLM, og kaller et bibliotek av sammensettbare ferdigheter uten noen gang å ha blitt trent på hverken roboten eller rommet.

Ferdighetsbiblioteket er lite: navigere, plukke opp, plassere, åpne en skuff og plukke fra en skuff. Hver er en konvensjonell regulator. Astras oppgave er å se på gjeldende bilde og avgjøre hvilken som skal kalles, og på hva.

En industrirobotarm i et verksted
HomeBodys ferdighetsbibliotek rommer fem konvensjonelle regulatorer. Arkivbilde. Freek Wolsink · pexels · Pexels License

Hvordan den vet hvor ting er

Et ukjent rom er det vanskelige, og teamet løser det før oppgaven snarere enn under den. Roboten utforsker, og runden rekonstrueres til en digital tvilling i Nvidias Isaac Sim. Det gir systemet et varig romlig minne, slik at det kan bes om en gjenstand som ikke er i synsfeltet og gå dit det har sett en.

Rundt dette sitter konvensjonelle komponenter: SAM 2.1 for sporing, Fast-FoundationStereo for dybde, Super Odometry med ICP-registrering for lokalisering, og en AMO-policy for å samordne underkroppen med det armene gjør. For hvert steg velger modellen en ferdighet og et mål ut fra førstepersonsbildet, kartet, griperens tilstand og hva den husker å ha sett. Når et grep bommer, forsøkes det lokalt på nytt med visuell servostyring i stedet for å starte oppgaven om.

Den lokale delen kjører på ett enkelt RTX 4090-laptopgrafikkort. Astra kjører eksternt.

Hva teamet sier ikke virker ennå

Arbeidet er uvanlig direkte om kostnadene sine, og det er den interessante delen.

Rekonstruksjonen må skje før et nytt rom kan brukes, noe som koster tid og API-bruk. Oppgavens lengde begrenses av maskinvaren snarere enn programvaren: robotens utholdenhet tar slutt først, og the-decoder merker seg servoer som overopphetes under kjøringene. Og fordi Astra kalles eksternt for hver beslutning, viser latensen seg som synlige pauser mellom handlingene.

En åpen kjøkkenskuff med bestikk i
Å åpne en skuff og plukke fra den er to av de fem ferdighetene. Arkivbilde. Bilguun Gantumur · pexels · Pexels License

Hvorfor det betyr noe

Hvis en frontmodell kan styre en humanoid gjennom ukjente rom med bare håndskrevne ferdigheter, er det trente handlingslaget en bekvemmelighet og ikke et krav, og robotspesifikke demonstrasjonsdata blir en svakere vollgrav enn feltet har antatt. Det er en påstand om arkitektur, fremmet på en prosjektside fra to universitetslaboratorier, ikke et målt resultat mot konkurrerende systemer — og bør leses slik til noen gjentar det.

Kostnadene peker også på hva som ville endre saken. Latens og rekonstruksjon er begge ingeniørproblemer med åpenbare retninger: en mindre modell på roboten for den raske sløyfen, en raskere rekonstruksjon, eller en modell i Astras klasse servert nærmere maskinvaren. Ingen av dem krever en ny idé, og derfor er resultatet verdt å følge heller enn å legge bort.