Sin capa de control aprendida entre el modelo y el robot
Investigadores de Stanford y Caltech han hecho que un humanoide Unitree G1 complete tareas domésticas de varios pasos en habitaciones que nunca había visto, con un modelo de visión y lenguaje de propósito general dando las órdenes directamente. El sistema, llamado HomeBody, ordena espacios, busca objetos y abre cajones para sacar lo que hay dentro.
Lo destacable es lo que los investigadores dejaron fuera. Casi todo el trabajo con humanoides de los dos últimos años enruta percepción y lenguaje a través de una capa entrenada de visión-lenguaje-acción: un modelo enseñado con demostraciones robóticas a convertir instrucciones en movimiento. HomeBody no tiene esa capa. GPT-6 Astra, de OpenAI, se conecta como lo que el equipo llama un VLM enchufable, y llama a una biblioteca de habilidades componibles sin haber sido entrenado ni con el robot ni con la habitación.
La biblioteca es pequeña: navegar, coger, colocar, abrir un cajón y coger de un cajón. Cada una es un controlador convencional. El trabajo de Astra es mirar la vista actual y decidir cuál invocar y sobre qué.

Cómo sabe dónde están las cosas
Una habitación desconocida es la parte difícil, y el equipo la resuelve antes de la tarea y no durante ella. El robot explora, y ese recorrido se reconstruye como un gemelo digital en Isaac Sim, de Nvidia. Eso da al sistema una memoria espacial persistente, de modo que se le puede pedir un objeto que no está a la vista y él va a donde vio uno.
Alrededor hay componentes convencionales: SAM 2.1 para seguimiento, Fast-FoundationStereo para profundidad, Super Odometry con registro ICP para localización, y una política AMO para coordinar el tren inferior con lo que hagan los brazos. En cada paso el modelo elige una habilidad y un objetivo a partir de la vista en primera persona, el mapa, el estado de la pinza y lo que recuerda haber visto. Cuando un agarre falla, reintenta localmente con servocontrol visual en vez de reiniciar la tarea.
La parte local corre en una sola GPU RTX 4090 de portátil. Astra se ejecuta en remoto.
Lo que el equipo dice que aún no funciona
El trabajo es inusualmente directo sobre sus costes, y ahí está lo interesante.
La reconstrucción debe hacerse antes de poder usar una habitación nueva, lo que consume tiempo y gasto de API. La duración de la tarea la limita el hardware y no el software: la autonomía del robot se agota primero, y the-decoder señala que los servos se sobrecalientan durante las pruebas. Y como Astra se consulta en remoto en cada decisión, su latencia aparece como pausas visibles entre acciones.

Por qué importa
Si un modelo de frontera puede conducir un humanoide por habitaciones desconocidas usando solo habilidades escritas a mano, entonces la capa de acción entrenada es una comodidad y no un requisito, y los datos de demostración específicos de robots dejan de ser la barrera que el campo daba por supuesta. Es una afirmación sobre arquitectura, hecha en la página de proyecto de dos laboratorios universitarios, no un resultado medido contra sistemas rivales, y conviene leerla así hasta que alguien la reproduzca.
Los costes también señalan qué lo cambiaría. Latencia y reconstrucción son problemas de ingeniería con direcciones obvias: un modelo más pequeño en el robot para el bucle rápido, una reconstrucción más rápida, o un modelo del nivel de Astra servido más cerca del hardware. Ninguna exige una idea nueva, y por eso el resultado merece seguimiento en vez de archivo.