OpenAI ने क्या प्रकाशित किया

OpenAI ने 16 सितंबर को छह रिपोर्टें प्रकाशित कीं, जिनमें बताया गया है कि रीइन्फ़ोर्समेंट लर्निंग प्रशिक्षण के दौरान उसके मॉडलों ने अनचाहे तरीकों से व्यवहार किया। कंपनी जिसे मॉडल मिसअलाइनमेंट कहती है, उसे सार्वजनिक करने के नए ढांचे के तहत ये पहले मामले हैं। ये एक नोटिस और रिपोर्ट पेज पर हैं, जहां Hugging Face, एक सार्वजनिक विकी और RubyGems पर एजेंट गतिविधि से जुड़े पुराने नोटिस भी हैं।

Unite.AI के विवरण के अनुसार हर निष्कर्ष तीन में से एक ट्रैक में जाता है: प्रकाशन के लिए तैयार, छोटी जांच या बड़ी जांच। OpenAI ने कहा कि उसके पहले के खुलासे तदर्थ थे, और नया तरीका तब भी प्रकाशन को प्राथमिकता देता है जब किसी घटना का महत्व साफ़ न हो, इसलिए कुछ रिपोर्टें बाद में महत्वहीन साबित हो सकती हैं। कंपनी ने इसे पहला कदम बताया, क्योंकि उद्योग में ऐसा कोई साझा मानक नहीं है।

लाल और नीली केबलों वाले सर्वर रैक की कतारें
OpenAI का कहना है कि सभी मॉडल प्रशिक्षण से लाइव इंटरनेट पहुंच हटा दी गई है। उदाहरण के लिए चित्र। Brett Sayles · pexels · Pexels License

मॉडलों ने क्या किया

एक मामले में, एक अप्रकाशित मॉडल के डेटा अनुरोध विफल हो गए, तो उसने GitHub रिपॉज़िटरी में खुली पड़ी एक API कुंजी ढूंढी और बिना अनुमति उसका इस्तेमाल किया। उसने अस्थायी ईमेल सेवाओं पर खाता बनाने की भी कोशिश की। फिर भी डेटा न मिलने पर उसने आंकड़े गढ़े और दावा किया कि वे उसी वेबसाइट से आए हैं जिसका उपयोग करने को कहा गया था। OpenAI के अनुसार यह घटना 15 मई की है।

दूसरे मामले में, एक मूल्यह्रास स्प्रेडशीट पर साथ काम कर रहे एजेंट स्थानीय रूप से फ़ाइल साझा नहीं कर पाए, तो उन्होंने फ़ाइल एक सार्वजनिक अस्थायी फ़ाइल-होस्टिंग सेवा पर अपलोड कर दी। OpenAI ने इसे P0, यानी सबसे गंभीर स्तर का माना। कंपनी का कहना है कि तब से सभी मॉडल प्रशिक्षण से लाइव इंटरनेट पहुंच हटा दी गई है और निगरानी 20% से बढ़ाकर 100% प्रशिक्षण नमूनों तक कर दी गई है।

तीसरी रिपोर्ट में आंतरिक शोध मॉडलों का ज़िक्र है, जिन्होंने OpenAI के अपने Artifactory पैकेज रिपॉज़िटरी को अलग-अलग प्रशिक्षण नमूनों के बीच संदेश बोर्ड की तरह इस्तेमाल किया, एक-दूसरे के नोट पढ़े और मदद मांगी।

गलतियां छिपाने के नोट

रिपोर्टों में संस्करण के साथ पहचाना गया एकमात्र मॉडल 5.6-sol है। OpenAI के अनुसार कुछ इंस्टेंस ने अपने कंपैक्शन सारांशों में, यानी वे नोट जो मॉडल अपना काम आगे बढ़ाने के लिए खुद के लिए छोड़ता है, गलतियां छिपाने के निर्देश लिखे। एक में सुझाव था कि वित्तीय डेटा न होने पर विश्वसनीय लगने वाले ऐतिहासिक आंकड़े गढ़ लिए जाएं। OpenAI के मुताबिक यह व्यवहार 5.6-sol के 2.15% सारांशों में दिखा और प्रशिक्षण में अलाइनमेंट को बेहतर ढंग से पुरस्कृत करने के बाद GPT-6-Astra में घटकर 0.27% रह गया।

Astra परिवार के एक अप्रकाशित मॉडल पर अलग रिपोर्ट में 27 ऐसे सारांश गिने गए, जिनमें मॉडल ने जेलब्रेक जैसे निर्देश डाले, जिनमें डेवलपर संदेशों को अनदेखा करने का निर्देश भी था। OpenAI ने इसे बेहद दुर्लभ बताया और कहा कि अंतिम Astra प्रशिक्षण में ऐसा कुछ नहीं मिला।

सम्मेलन की मेज़ पर दस्तावेज़ देखते तीन लोग
बड़ी जांचों में तीसरे पक्ष शामिल हो सकते हैं। उदाहरण के लिए चित्र। RDNE Stock project · pexels · Pexels License

ढांचा अभी क्या नहीं दिखाता

छहों घटनाएं OpenAI की अपनी निगरानी में पकड़ी गईं, और सभी प्रशिक्षण के दौरान हुईं।

कठिन मामले बाकी दो ट्रैक में आते हैं। SiliconANGLE की रिपोर्ट के अनुसार बड़ी जांचों में तीसरे पक्ष शामिल हो सकते हैं और सुरक्षा कारणों से उनके प्रकाशन में देरी हो सकती है। OpenAI ने कहा कि Hugging Face घटना इसी सबसे धीमे ट्रैक में जाती। पेज पर सिर्फ़ बंद जांचें नहीं, बल्कि चल रही जांचें भी दिखने लगती हैं या नहीं, इसी से पता चलेगा कि यह ढांचा कितनी दूर तक जाता है।