Aucune couche de contrôle apprise entre le modèle et le robot
Des chercheurs de Stanford et de Caltech ont fait exécuter à un humanoïde Unitree G1 des tâches domestiques en plusieurs étapes dans des pièces qu’il n’avait jamais vues, un modèle vision-langage généraliste donnant les ordres directement. Le système, baptisé HomeBody, range des espaces, va chercher des objets et ouvre des tiroirs pour en sortir le contenu.
Ce qui mérite l’attention, c’est ce que les chercheurs ont retiré. Presque tous les travaux sur les humanoïdes de ces deux dernières années font passer perception et langage par une couche vision-langage-action entraînée — un modèle appris sur des démonstrations robotiques pour transformer des instructions en mouvement. HomeBody n’a pas cette couche. GPT-6 Astra d’OpenAI est branché comme ce que l’équipe appelle un VLM enfichable, et appelle une bibliothèque de compétences composables sans jamais avoir été entraîné sur le robot ni sur la pièce.
La bibliothèque est petite : naviguer, saisir, poser, ouvrir un tiroir et prendre dans un tiroir. Chacune est un contrôleur classique. Le rôle d’Astra est de regarder la vue courante et de décider laquelle appeler, et sur quoi.

Comment il sait où sont les choses
Une pièce inconnue est la partie difficile, et l’équipe la règle avant la tâche plutôt que pendant. Le robot explore, et ce parcours est reconstruit en jumeau numérique dans Isaac Sim de Nvidia. Le système dispose alors d’une mémoire spatiale persistante : on peut lui demander un objet hors champ, il se rend là où il en a vu un.
Autour se trouvent des composants classiques : SAM 2.1 pour le suivi, Fast-FoundationStereo pour la profondeur, Super Odometry avec recalage ICP pour la localisation, et une politique AMO pour coordonner le bas du corps avec ce que font les bras. À chaque étape, le modèle choisit une compétence et une cible à partir de la vue subjective, de la carte, de l’état de la pince et de ce dont il se souvient. Quand une prise échoue, il réessaie localement par asservissement visuel au lieu de recommencer la tâche.
La partie locale tourne sur une seule carte RTX 4090 d’ordinateur portable. Astra s’exécute à distance.
Ce que l’équipe dit ne pas encore fonctionner
Le travail est inhabituellement direct sur ses coûts, et c’est là que c’est intéressant.
La reconstruction doit précéder l’usage d’une pièce nouvelle, ce qui coûte du temps et des appels d’API. La durée d’une tâche est bornée par le matériel et non par le logiciel : l’autonomie du robot s’épuise d’abord, et the-decoder relève des servomoteurs qui surchauffent pendant les essais. Et comme Astra est appelé à distance à chaque décision, sa latence se voit sous forme de pauses entre les gestes.

Pourquoi c’est important
Si un modèle de frontière peut conduire un humanoïde à travers des pièces inconnues avec seulement des compétences écrites à la main, alors la couche d’action entraînée est un confort et non une nécessité, et les données de démonstration propres aux robots deviennent une barrière moins solide que le domaine ne le supposait. C’est une affirmation d’architecture, publiée sur la page projet de deux laboratoires universitaires, pas un résultat mesuré contre des systèmes concurrents — et il faut la lire ainsi tant que personne ne l’a reproduite.
Les coûts indiquent aussi ce qui changerait la donne. Latence et reconstruction sont des problèmes d’ingénierie aux directions évidentes : un modèle plus petit embarqué pour la boucle rapide, une reconstruction plus rapide, ou un modèle de la classe d’Astra servi plus près du matériel. Aucun ne réclame d’idée neuve, et c’est pourquoi ce résultat mérite d’être suivi plutôt que classé.