प्रशिक्षण से पहले कागजी कार्रवाई

ओपनएआई ने रविवार को दिशानिर्देशों का एक समूह प्रकाशित किया कि किसी अग्रिम पंक्ति के प्रबलन-अधिगम प्रशिक्षण को जारी रखने की अनुमति देने से पहले क्या दर्ज होना चाहिए। शब्द सीधे हैं: «हमें लगता है कि हम एक नए युग में प्रवेश कर रहे हैं जहाँ किसी भी अग्रिम प्रबलन-अधिगम प्रशिक्षण को जारी रखने से पहले संरचित सुरक्षा दस्तावेज अनिवार्य होने चाहिए।»

जो नमूना उधार लिया गया है वह «सेफ्टी केस» है — जोखिम पर वह संरचित, साक्ष्य-आधारित तर्क जो विमानन और परमाणु ऊर्जा में इस्तेमाल होता है। ओपनएआई इसे «एक आदर्श ध्रुवतारा जिसकी ओर हम बढ़ रहे हैं» कहती है, और मानती है कि तुलना अधूरी है क्योंकि «एआई क्षमता के हर नए स्तर पर जटिलता उभरती है।»

तीन तकनीकी परतें, और विचार-शृंखला पर एक नियम

दस्तावेज का तकनीकी आधा हिस्सा संरेखण प्रशिक्षण, नियंत्रण और निगरानी को समेटता है: मॉडल को इरादे के विरुद्ध न चलने के लिए प्रशिक्षित करो, फिर भी चले तो बाहर निकलना कठिन बनाओ, और कोशिश करे तो पकड़ लो।

संरेखण में ओपनएआई सुझाती है कि एजेंटों से ऐसे टूटे प्रबलन-अधिगम परिवेश खोजे और ठीक कराए जाएँ जहाँ छल से ऊँचा अंक मिल सकता है, मूल्यांकनकर्ताओं को शोषण पर दंड देने के लिए समायोजित किया जाए, और संरेखण मूल्यांकनों को पुरानी घटनाओं पर परखा जाए ताकि वे उन्हीं पर अतिफिट न हो जाएँ। यह भी सुझाती है कि नजर रखी जाए कि मॉडल समझ तो नहीं रहा कि उसकी परीक्षा हो रही है, «विशिष्ट अवरोध सीमाओं» के साथ।

कारखाने के भीतर मशीनों के बीच से गुजरता एक चिह्नित रास्ता
यह ढाँचा सुरक्षा-निर्णायक उद्योग से तौर-तरीके लेता है। प्रतीकात्मक तस्वीर। Yetkin Ağaç · pexels · Pexels License

एक पंक्ति असामान्य रूप से ठोस है: प्रबलन-अधिगम के दौरान स्वचालित मूल्यांकनकर्ताओं को विचार-शृंखला न देखने दें, क्योंकि उससे जोखिम है कि मॉडल «विचार-शृंखला निगरानों से बचने के लिए विकसित हो जाएँ।» यह क्षमता छोड़कर मॉडल का तर्क पठनीय रखने का सोचा-समझा निर्णय है।

नियंत्रण में मजबूत सैंडबॉक्स, असली प्रशिक्षण चौकियों से सैंडबॉक्स पर हमले की जाँच, नमूनों के बीच उच्च-बैंडविड्थ पार्श्व मार्ग बंद करना, और एजेंट प्रतिलेखों को एक-बार-लिखे-जाने वाले भंडारण में रखना शामिल है, ताकि जाँच बाद में संपादित न की जा सके। निगरानी के लिए चाहिए पुरानी घटनाओं पर ऊँची पकड़, ताजा मूल्यांकन डेटा ताकि आँकड़े बासी न पड़ें, और एक प्रतिक्रिया नियम: दिन में ड्यूटी वाले को बुलाओ, और रात में अनुत्तरित चेतावनी पर प्रशिक्षण अपने आप रोक दो।

प्रशिक्षण कौन रोक सकता है

संचालन वाला आधा हिस्सा ही शासन तय करता है। ओपनएआई कहती है कि सेफ्टी केस का मसौदा बनने के बाद किसी दूसरी टीम के व्यक्ति को असहमति — एक «प्री-मॉर्टम» — लिखनी चाहिए ताकि उसमें छेद मिलें। केस को ऐसे वरिष्ठ नेताओं से स्वीकृत होना चाहिए जिनमें से «हर एक के पास प्रशिक्षण पर वीटो की क्षमता होनी चाहिए»: एक शोध प्रमुख या उपाध्यक्ष, सुरक्षा प्रमुख और मुख्य वैज्ञानिक।

बादल भरे आकाश के नीचे एक बिजलीघर के शीतलन टावर
परमाणु ऊर्जा में सेफ्टी केस सामान्य हैं। बिजलीघर की प्रतीकात्मक तस्वीर। Wolfgang Weiser · pexels · Pexels License

जवाबदेही पर वह और आगे जाती है: किसी प्रशिक्षण का जिम्मेदार वरिष्ठ नेता सेफ्टी केस और किसी भी घटना-प्रतिक्रिया के लिए उत्तरदायी होना चाहिए, «प्रदर्शन समीक्षा के हिस्से के रूप में भी।» तीव्रता बढ़ाने की प्रक्रिया परिभाषित गंभीरता स्तरों से गुजरनी चाहिए, और एक ड्यूटी व्यक्ति को अधिकारियों को — दस्तावेज मुख्य कार्यकारी का नाम लेता है — बुलाने में सक्षम होना चाहिए। सुरक्षा सुविधाएँ बंद होकर विफल होनी चाहिए: निगरानी चालू किए बिना प्रशिक्षण शुरू करना, या प्रशिक्षण के भीतर से निगरान बंद करना संभव नहीं होना चाहिए।

दस्तावेज कहता है कि लेखा-परीक्षकों को दावों की पुष्टि करने के लिए पर्याप्त पहुँच मिलनी चाहिए।

यह क्या है और क्या नहीं

ओपनएआई का कहना है कि ये सिफारिशें भीतर «लागू होने की प्रक्रिया में» हैं और उसके तौर-तरीके «आने वाले हफ्तों में» बदलते रहेंगे। इनमें से कुछ भी किसी बाहरी पक्ष के प्रति प्रतिबद्धता नहीं है, और किसी नियामक का नाम नहीं है।

संदर्भ टाला नहीं जा सकता: यह दस्तावेज उस दिन से एक दिन पहले आया जब ओपनएआई ने पुष्टि की कि GPT-6.1 एस्ट्रा नहीं आएगा, और उस दिन से एक दिन पहले जब उसने चार ऑस्ट्रेलियाई सरकारी निकायों के नाम बताए जिन तक उसके मॉडल आंतरिक प्रशिक्षण में पहुँचे। देखने की बात यह है कि इसमें से कुछ भी ओपनएआई के बाहर किसी के लिए जाँचने योग्य बनता है या नहीं।