Sem camada de controlo aprendida entre o modelo e o robô

Investigadores de Stanford e do Caltech puseram um humanoide Unitree G1 a cumprir tarefas domésticas de vários passos em divisões que nunca vira, com um modelo de visão e linguagem de uso geral a dar as ordens diretamente. O sistema, chamado HomeBody, arruma espaços, vai buscar objetos e abre gavetas para retirar o que está lá dentro.

O que merece atenção é o que os investigadores deixaram de fora. Quase todo o trabalho com humanoides dos últimos dois anos encaminha perceção e linguagem por uma camada treinada de visão-linguagem-ação — um modelo ensinado com demonstrações robóticas a converter instruções em movimento. O HomeBody não tem essa camada. O GPT-6 Astra, da OpenAI, é ligado como aquilo a que a equipa chama um VLM de encaixe, e chama uma biblioteca de competências componíveis sem nunca ter sido treinado no robô nem na divisão.

A biblioteca é pequena: navegar, agarrar, pousar, abrir uma gaveta e tirar de uma gaveta. Cada uma é um controlador convencional. O papel do Astra é olhar para a vista atual e decidir qual chamar e sobre o quê.

Um braço robótico industrial numa oficina
A biblioteca do HomeBody tem cinco controladores convencionais. Imagem de arquivo. Freek Wolsink · pexels · Pexels License

Como sabe onde estão as coisas

Uma divisão desconhecida é a parte difícil, e a equipa resolve-a antes da tarefa e não durante. O robô explora, e esse percurso é reconstruído como gémeo digital no Isaac Sim da Nvidia. Isso dá ao sistema uma memória espacial persistente, pelo que se lhe pode pedir um objeto fora do campo de visão e ele vai onde viu um.

À volta estão componentes convencionais: SAM 2.1 para seguimento, Fast-FoundationStereo para profundidade, Super Odometry com registo ICP para localização e uma política AMO para coordenar a parte inferior do corpo com o que os braços fazem. Em cada passo o modelo escolhe uma competência e um alvo a partir da vista na primeira pessoa, do mapa, do estado da garra e do que recorda ter visto. Quando uma pega falha, repete localmente com servocontrolo visual em vez de reiniciar a tarefa.

A parte local corre numa única GPU RTX 4090 de portátil. O Astra corre remotamente.

O que a equipa diz que ainda não funciona

O trabalho é invulgarmente direto quanto aos seus custos, e é aí que está o interesse.

A reconstrução tem de acontecer antes de uma divisão nova ser utilizável, o que custa tempo e despesa de API. A duração da tarefa é limitada pelo hardware e não pelo software: a autonomia do robô esgota-se primeiro, e o the-decoder nota servos a sobreaquecer durante os ensaios. E como o Astra é chamado remotamente a cada decisão, a sua latência aparece como pausas visíveis entre ações.

Uma gaveta de cozinha aberta com utensílios
Abrir uma gaveta e tirar dela são duas das cinco competências. Imagem de arquivo. Bilguun Gantumur · pexels · Pexels License

Porque importa

Se um modelo de fronteira consegue conduzir um humanoide por divisões desconhecidas usando apenas competências escritas à mão, então a camada de ação treinada é uma comodidade e não um requisito, e os dados de demonstração específicos de robôs passam a ser menos fosso do que o campo assumia. É uma afirmação sobre arquitetura, feita numa página de projeto de dois laboratórios universitários, não um resultado medido contra sistemas concorrentes — e deve ler-se assim até alguém a reproduzir.

Os custos apontam também o que mudaria isto. Latência e reconstrução são problemas de engenharia com direções óbvias: um modelo mais pequeno no robô para o ciclo rápido, uma reconstrução mais rápida, ou um modelo da classe do Astra servido mais perto do hardware. Nenhum exige uma ideia nova, e é por isso que o resultado merece acompanhamento em vez de arquivo.