Inget inlärt styrlager mellan modellen och roboten
Forskare vid Stanford och Caltech har låtit en Unitree G1-humanoid utföra hushållsuppgifter i flera steg i rum den aldrig sett, med en allmän vision- och språkmodell som ger kommandona direkt. Systemet, som heter HomeBody, städar undan, hämtar föremål och öppnar lådor för att ta ut det som ligger i dem.
Det anmärkningsvärda är vad forskarna utelämnat. Nästan allt humanoidarbete de senaste två åren leder perception och språk genom ett tränat vision-språk-handlingslager — en modell som lärt sig av robotdemonstrationer att omvandla instruktioner till rörelse. HomeBody har inget sådant lager. OpenAI:s GPT-6 Astra kopplas in som vad gruppen kallar en instickbar VLM, och anropar ett bibliotek av kombinerbara färdigheter utan att någonsin ha tränats på vare sig roboten eller rummet.
Färdighetsbiblioteket är litet: navigera, plocka upp, placera, öppna en låda och plocka ur en låda. Var och en är en konventionell regulator. Astras uppgift är att titta på den aktuella vyn och avgöra vilken som ska anropas och på vad.

Hur den vet var saker finns
Ett okänt rum är det svåra, och gruppen löser det före uppgiften snarare än under den. Roboten utforskar, och rundan rekonstrueras till en digital tvilling i Nvidias Isaac Sim. Det ger systemet ett bestående rumsligt minne, så att det kan ombes hämta ett föremål som inte syns just nu och gå dit det sett ett.
Runt detta sitter konventionella delar: SAM 2.1 för spårning, Fast-FoundationStereo för djup, Super Odometry med ICP-registrering för lokalisering och en AMO-policy för att samordna underkroppen med det armarna gör. Vid varje steg väljer modellen en färdighet och ett mål utifrån förstapersonsvyn, kartan, gripdonets läge och vad den minns att den sett. När ett grepp missar görs ett lokalt omförsök med visuell servostyrning i stället för att uppgiften startas om.
Den lokala delen körs på ett enda RTX 4090-laptopgrafikkort. Astra körs på distans.
Vad gruppen säger inte fungerar ännu
Arbetet är ovanligt rättframt om sina kostnader, och det är den intressanta delen.
Rekonstruktionen måste göras innan ett nytt rum kan användas, vilket kostar tid och API-pengar. Uppgiftens längd begränsas av hårdvaran snarare än mjukvaran: robotens uthållighet tar slut först, och the-decoder noterar att servon överhettas under körningarna. Och eftersom Astra anropas på distans för varje beslut syns dess latens som pauser mellan handlingarna.

Varför det spelar roll
Om en frontlinjemodell kan styra en humanoid genom okända rum med enbart handskrivna färdigheter är det tränade handlingslagret en bekvämlighet och inte ett krav, och robotspecifika demonstrationsdata blir en mindre vallgrav än fältet antagit. Det är ett påstående om arkitektur, gjort på en projektsida från två universitetslabb, inte ett mätt resultat mot konkurrerande system — och bör läsas så tills någon upprepar det.
Kostnaderna pekar också på vad som skulle ändra saken. Latens och rekonstruktion är båda ingenjörsproblem med uppenbara riktningar: en mindre modell på roboten för den snabba slingan, en snabbare rekonstruktion, eller en modell i Astras klass som körs närmare hårdvaran. Inget av det kräver en ny idé, och därför är resultatet värt att följa snarare än att lägga undan.