मॉडल और रोबोट के बीच कोई सीखा हुआ नियंत्रण-स्तर नहीं
स्टैनफ़ोर्ड और कैलटेक के शोधकर्ताओं ने एक यूनिट्री G1 ह्यूमनॉइड से उन कमरों में कई चरणों वाले घरेलू काम कराए जिन्हें उसने पहले कभी नहीं देखा था, और आदेश सीधे एक सामान्य-प्रयोजन दृष्टि-भाषा मॉडल से आ रहे थे। यह प्रणाली, जिसका नाम होमबॉडी है, जगह समेटती है, चीज़ें लाकर देती है और दराज़ खोलकर उनमें रखी वस्तु निकालती है।
ध्यान देने योग्य बात यह है कि शोधकर्ताओं ने क्या हटाया। पिछले दो वर्षों का लगभग सारा ह्यूमनॉइड काम धारणा और भाषा को एक प्रशिक्षित दृष्टि-भाषा-क्रिया स्तर से गुज़ारता है — ऐसा मॉडल जिसे रोबोट प्रदर्शनों पर निर्देशों को गति में बदलना सिखाया जाता है। होमबॉडी में वह स्तर है ही नहीं। ओपनएआई का GPT-6 ऐस्ट्रा उसमें वह चीज़ बनकर जुड़ता है जिसे टीम प्लग-एंड-प्ले वीएलएम कहती है, और वह संयोजनीय कौशलों की एक लाइब्रेरी को बुलाता है, बिना कभी रोबोट या कमरे पर प्रशिक्षित हुए।
कौशल-लाइब्रेरी छोटी है: नेविगेट करना, उठाना, रखना, दराज़ खोलना और दराज़ से उठाना। हर एक पारंपरिक नियंत्रक है। ऐस्ट्रा का काम मौजूदा दृश्य देखकर यह तय करना है कि किसे बुलाना है और किस पर।

उसे कैसे पता चलता है कि चीज़ें कहाँ हैं
अनजान कमरा ही कठिन हिस्सा है, और टीम इसे काम के दौरान नहीं, उससे पहले सुलझाती है। रोबोट पहले घूमता है, और उस चक्कर को एनविडिया के आइज़ैक सिम में एक डिजिटल जुड़वाँ के रूप में पुनर्निर्मित किया जाता है। इससे प्रणाली को स्थायी स्थानिक स्मृति मिलती है, ताकि उससे ऐसी वस्तु माँगी जा सके जो अभी दिखाई नहीं दे रही, और वह वहीं जाए जहाँ उसने एक देखी थी।
इसके इर्द-गिर्द पारंपरिक घटक हैं: ट्रैकिंग के लिए SAM 2.1, गहराई के लिए Fast-FoundationStereo, स्थान-निर्धारण के लिए ICP पंजीकरण सहित सुपर ओडोमेट्री, और भुजाओं के काम के साथ निचले शरीर का तालमेल बिठाने के लिए AMO नीति। हर चरण पर मॉडल मौजूदा प्रथम-पुरुष दृश्य, नक्शे, ग्रिपर की स्थिति और याद की गई चीज़ों से एक कौशल और एक लक्ष्य चुनता है। पकड़ चूक जाए तो वह पूरा काम दोबारा शुरू करने के बजाय दृश्य-सर्वो से स्थानीय रूप से फिर कोशिश करता है।
स्थानीय हिस्सा एक अकेले RTX 4090 लैपटॉप जीपीयू पर चलता है। ऐस्ट्रा दूर से चलता है।
टीम के अनुसार अभी क्या काम नहीं करता
यह काम अपनी लागतों को लेकर असामान्य रूप से सीधा है, और यही दिलचस्प हिस्सा है।
नया कमरा इस्तेमाल के लायक बनने से पहले पुनर्निर्माण करना पड़ता है, जिसमें समय और एपीआई खर्च लगता है। काम की अवधि सॉफ़्टवेयर नहीं, हार्डवेयर तय करता है: रोबोट की बैटरी पहले जवाब देती है, और द-डिकोडर बताता है कि परीक्षणों के दौरान सर्वो गरम हो जाते हैं। और चूँकि हर निर्णय के लिए ऐस्ट्रा को दूर से बुलाया जाता है, उसकी देरी क्रियाओं के बीच दिखने वाले ठहराव के रूप में सामने आती है।

यह क्यों मायने रखता है
अगर कोई अग्रणी मॉडल सिर्फ़ हाथ से लिखे कौशलों के सहारे अनजान कमरों में ह्यूमनॉइड चला सकता है, तो प्रशिक्षित क्रिया-स्तर एक सुविधा है, अनिवार्यता नहीं, और रोबोट-विशिष्ट प्रदर्शन डेटा उतनी बड़ी बाधा नहीं रह जाता जितनी यह क्षेत्र मानता रहा है। यह वास्तुकला के बारे में किया गया दावा है, जो दो विश्वविद्यालय प्रयोगशालाओं के प्रोजेक्ट पन्ने पर है, प्रतिस्पर्धी प्रणालियों के मुक़ाबले मापा गया परिणाम नहीं — और जब तक कोई इसे दोहरा न ले, इसे इसी तरह पढ़ा जाना चाहिए।
लागतें यह भी बताती हैं कि इसे क्या बदलेगा। देरी और पुनर्निर्माण, दोनों अभियांत्रिकी की समस्याएँ हैं जिनकी दिशा स्पष्ट है: तेज़ चक्र के लिए रोबोट पर कोई छोटा मॉडल, तेज़ पुनर्निर्माण, या ऐस्ट्रा-श्रेणी का मॉडल हार्डवेयर के नज़दीक चलाना। इनमें से किसी के लिए नई अवधारणा नहीं चाहिए, और इसीलिए यह परिणाम फ़ाइल में रखने के बजाय नज़र रखने लायक है।