मॉडल और रोबोट के बीच कोई सीखा हुआ नियंत्रण-स्तर नहीं

स्टैनफ़ोर्ड और कैलटेक के शोधकर्ताओं ने एक यूनिट्री G1 ह्यूमनॉइड से उन कमरों में कई चरणों वाले घरेलू काम कराए जिन्हें उसने पहले कभी नहीं देखा था, और आदेश सीधे एक सामान्य-प्रयोजन दृष्टि-भाषा मॉडल से आ रहे थे। यह प्रणाली, जिसका नाम होमबॉडी है, जगह समेटती है, चीज़ें लाकर देती है और दराज़ खोलकर उनमें रखी वस्तु निकालती है।

ध्यान देने योग्य बात यह है कि शोधकर्ताओं ने क्या हटाया। पिछले दो वर्षों का लगभग सारा ह्यूमनॉइड काम धारणा और भाषा को एक प्रशिक्षित दृष्टि-भाषा-क्रिया स्तर से गुज़ारता है — ऐसा मॉडल जिसे रोबोट प्रदर्शनों पर निर्देशों को गति में बदलना सिखाया जाता है। होमबॉडी में वह स्तर है ही नहीं। ओपनएआई का GPT-6 ऐस्ट्रा उसमें वह चीज़ बनकर जुड़ता है जिसे टीम प्लग-एंड-प्ले वीएलएम कहती है, और वह संयोजनीय कौशलों की एक लाइब्रेरी को बुलाता है, बिना कभी रोबोट या कमरे पर प्रशिक्षित हुए।

कौशल-लाइब्रेरी छोटी है: नेविगेट करना, उठाना, रखना, दराज़ खोलना और दराज़ से उठाना। हर एक पारंपरिक नियंत्रक है। ऐस्ट्रा का काम मौजूदा दृश्य देखकर यह तय करना है कि किसे बुलाना है और किस पर।

कार्यशाला में एक औद्योगिक रोबोटिक भुजा
होमबॉडी की कौशल-लाइब्रेरी में पाँच पारंपरिक नियंत्रक हैं। प्रतीकात्मक तस्वीर। Freek Wolsink · pexels · Pexels License

उसे कैसे पता चलता है कि चीज़ें कहाँ हैं

अनजान कमरा ही कठिन हिस्सा है, और टीम इसे काम के दौरान नहीं, उससे पहले सुलझाती है। रोबोट पहले घूमता है, और उस चक्कर को एनविडिया के आइज़ैक सिम में एक डिजिटल जुड़वाँ के रूप में पुनर्निर्मित किया जाता है। इससे प्रणाली को स्थायी स्थानिक स्मृति मिलती है, ताकि उससे ऐसी वस्तु माँगी जा सके जो अभी दिखाई नहीं दे रही, और वह वहीं जाए जहाँ उसने एक देखी थी।

इसके इर्द-गिर्द पारंपरिक घटक हैं: ट्रैकिंग के लिए SAM 2.1, गहराई के लिए Fast-FoundationStereo, स्थान-निर्धारण के लिए ICP पंजीकरण सहित सुपर ओडोमेट्री, और भुजाओं के काम के साथ निचले शरीर का तालमेल बिठाने के लिए AMO नीति। हर चरण पर मॉडल मौजूदा प्रथम-पुरुष दृश्य, नक्शे, ग्रिपर की स्थिति और याद की गई चीज़ों से एक कौशल और एक लक्ष्य चुनता है। पकड़ चूक जाए तो वह पूरा काम दोबारा शुरू करने के बजाय दृश्य-सर्वो से स्थानीय रूप से फिर कोशिश करता है।

स्थानीय हिस्सा एक अकेले RTX 4090 लैपटॉप जीपीयू पर चलता है। ऐस्ट्रा दूर से चलता है।

टीम के अनुसार अभी क्या काम नहीं करता

यह काम अपनी लागतों को लेकर असामान्य रूप से सीधा है, और यही दिलचस्प हिस्सा है।

नया कमरा इस्तेमाल के लायक बनने से पहले पुनर्निर्माण करना पड़ता है, जिसमें समय और एपीआई खर्च लगता है। काम की अवधि सॉफ़्टवेयर नहीं, हार्डवेयर तय करता है: रोबोट की बैटरी पहले जवाब देती है, और द-डिकोडर बताता है कि परीक्षणों के दौरान सर्वो गरम हो जाते हैं। और चूँकि हर निर्णय के लिए ऐस्ट्रा को दूर से बुलाया जाता है, उसकी देरी क्रियाओं के बीच दिखने वाले ठहराव के रूप में सामने आती है।

बरतनों से भरी एक खुली रसोई दराज़
दराज़ खोलना और उसमें से उठाना पाँच में से दो कौशल हैं। प्रतीकात्मक तस्वीर। Bilguun Gantumur · pexels · Pexels License

यह क्यों मायने रखता है

अगर कोई अग्रणी मॉडल सिर्फ़ हाथ से लिखे कौशलों के सहारे अनजान कमरों में ह्यूमनॉइड चला सकता है, तो प्रशिक्षित क्रिया-स्तर एक सुविधा है, अनिवार्यता नहीं, और रोबोट-विशिष्ट प्रदर्शन डेटा उतनी बड़ी बाधा नहीं रह जाता जितनी यह क्षेत्र मानता रहा है। यह वास्तुकला के बारे में किया गया दावा है, जो दो विश्वविद्यालय प्रयोगशालाओं के प्रोजेक्ट पन्ने पर है, प्रतिस्पर्धी प्रणालियों के मुक़ाबले मापा गया परिणाम नहीं — और जब तक कोई इसे दोहरा न ले, इसे इसी तरह पढ़ा जाना चाहिए।

लागतें यह भी बताती हैं कि इसे क्या बदलेगा। देरी और पुनर्निर्माण, दोनों अभियांत्रिकी की समस्याएँ हैं जिनकी दिशा स्पष्ट है: तेज़ चक्र के लिए रोबोट पर कोई छोटा मॉडल, तेज़ पुनर्निर्माण, या ऐस्ट्रा-श्रेणी का मॉडल हार्डवेयर के नज़दीक चलाना। इनमें से किसी के लिए नई अवधारणा नहीं चाहिए, और इसीलिए यह परिणाम फ़ाइल में रखने के बजाय नज़र रखने लायक है।