Intet indlært styringslag mellem modellen og robotten

Forskere ved Stanford og Caltech har fået en Unitree G1-humanoid til at løse husholdningsopgaver i flere trin i rum, den aldrig havde set, med en generel syns- og sprogmodel, der giver kommandoerne direkte. Systemet, kaldet HomeBody, rydder op, henter genstande og åbner skuffer for at tage ud, hvad der ligger i dem.

Det bemærkelsesværdige er, hvad forskerne udelod. Næsten alt humanoidarbejde de seneste to år fører perception og sprog gennem et trænet syn-sprog-handlingslag — en model lært op på robotdemonstrationer til at omsætte instruktioner til bevægelse. HomeBody har ikke et sådant lag. OpenAIs GPT-6 Astra kobles ind som det, holdet kalder en plug-and-play-VLM, og kalder et bibliotek af sammensættelige færdigheder uden nogensinde at være trænet på hverken robotten eller rummet.

Færdighedsbiblioteket er lille: navigere, samle op, placere, åbne en skuffe og tage fra en skuffe. Hver er en konventionel regulator. Astras opgave er at se på det aktuelle billede og afgøre, hvilken der skal kaldes, og på hvad.

En industrirobotarm i et værksted
HomeBodys færdighedsbibliotek rummer fem konventionelle regulatorer. Arkivfoto. Freek Wolsink · pexels · Pexels License

Hvordan den ved, hvor tingene er

Et ukendt rum er det svære, og holdet løser det før opgaven snarere end undervejs. Robotten udforsker, og turen rekonstrueres til en digital tvilling i Nvidias Isaac Sim. Det giver systemet en vedvarende rumlig hukommelse, så den kan bedes om en genstand, der ikke er i synsfeltet, og gå hen, hvor den har set en.

Omkring det sidder konventionelle komponenter: SAM 2.1 til sporing, Fast-FoundationStereo til dybde, Super Odometry med ICP-registrering til lokalisering og en AMO-politik til at koordinere underkroppen med det, armene laver. For hvert skridt vælger modellen en færdighed og et mål ud fra førstepersonsbilledet, kortet, griberens tilstand og det, den husker at have set. Når et greb rammer forbi, prøves lokalt igen med visuel servostyring frem for at starte opgaven forfra.

Den lokale del kører på ét enkelt RTX 4090-laptopgrafikkort. Astra kører eksternt.

Hvad holdet siger ikke virker endnu

Arbejdet er usædvanligt direkte om sine omkostninger, og det er den interessante del.

Rekonstruktionen skal ske, før et nyt rum kan bruges, hvilket koster tid og API-forbrug. Opgavens længde begrænses af hardwaren snarere end softwaren: robottens udholdenhed slipper op først, og the-decoder bemærker servoer, der overopheder under kørslerne. Og fordi Astra kaldes eksternt ved hver beslutning, viser latensen sig som synlige pauser mellem handlingerne.

En åben køkkenskuffe med bestik i
At åbne en skuffe og tage fra den er to af de fem færdigheder. Arkivfoto. Bilguun Gantumur · pexels · Pexels License

Hvorfor det betyder noget

Hvis en frontmodel kan styre en humanoid gennem ukendte rum med kun håndskrevne færdigheder, er det trænede handlingslag en bekvemmelighed og ikke et krav, og robotspecifikke demonstrationsdata bliver en svagere voldgrav, end feltet har antaget. Det er en påstand om arkitektur, fremsat på en projektside fra to universitetslaboratorier, ikke et målt resultat mod konkurrerende systemer — og bør læses sådan, indtil nogen gentager det.

Omkostningerne peger også på, hvad der ville ændre sagen. Latens og rekonstruktion er begge ingeniørproblemer med åbenlyse retninger: en mindre model på robotten til den hurtige sløjfe, en hurtigere rekonstruktion, eller en model i Astras klasse serveret tættere på hardwaren. Ingen af dem kræver en ny idé, og derfor er resultatet værd at følge frem for at lægge væk.