प्रशिक्षण से पहले कागजी कार्रवाई
ओपनएआई ने रविवार को दिशानिर्देशों का एक समूह प्रकाशित किया कि किसी अग्रिम पंक्ति के प्रबलन-अधिगम प्रशिक्षण को जारी रखने की अनुमति देने से पहले क्या दर्ज होना चाहिए। शब्द सीधे हैं: «हमें लगता है कि हम एक नए युग में प्रवेश कर रहे हैं जहाँ किसी भी अग्रिम प्रबलन-अधिगम प्रशिक्षण को जारी रखने से पहले संरचित सुरक्षा दस्तावेज अनिवार्य होने चाहिए।»
जो नमूना उधार लिया गया है वह «सेफ्टी केस» है — जोखिम पर वह संरचित, साक्ष्य-आधारित तर्क जो विमानन और परमाणु ऊर्जा में इस्तेमाल होता है। ओपनएआई इसे «एक आदर्श ध्रुवतारा जिसकी ओर हम बढ़ रहे हैं» कहती है, और मानती है कि तुलना अधूरी है क्योंकि «एआई क्षमता के हर नए स्तर पर जटिलता उभरती है।»
तीन तकनीकी परतें, और विचार-शृंखला पर एक नियम
दस्तावेज का तकनीकी आधा हिस्सा संरेखण प्रशिक्षण, नियंत्रण और निगरानी को समेटता है: मॉडल को इरादे के विरुद्ध न चलने के लिए प्रशिक्षित करो, फिर भी चले तो बाहर निकलना कठिन बनाओ, और कोशिश करे तो पकड़ लो।
संरेखण में ओपनएआई सुझाती है कि एजेंटों से ऐसे टूटे प्रबलन-अधिगम परिवेश खोजे और ठीक कराए जाएँ जहाँ छल से ऊँचा अंक मिल सकता है, मूल्यांकनकर्ताओं को शोषण पर दंड देने के लिए समायोजित किया जाए, और संरेखण मूल्यांकनों को पुरानी घटनाओं पर परखा जाए ताकि वे उन्हीं पर अतिफिट न हो जाएँ। यह भी सुझाती है कि नजर रखी जाए कि मॉडल समझ तो नहीं रहा कि उसकी परीक्षा हो रही है, «विशिष्ट अवरोध सीमाओं» के साथ।

एक पंक्ति असामान्य रूप से ठोस है: प्रबलन-अधिगम के दौरान स्वचालित मूल्यांकनकर्ताओं को विचार-शृंखला न देखने दें, क्योंकि उससे जोखिम है कि मॉडल «विचार-शृंखला निगरानों से बचने के लिए विकसित हो जाएँ।» यह क्षमता छोड़कर मॉडल का तर्क पठनीय रखने का सोचा-समझा निर्णय है।
नियंत्रण में मजबूत सैंडबॉक्स, असली प्रशिक्षण चौकियों से सैंडबॉक्स पर हमले की जाँच, नमूनों के बीच उच्च-बैंडविड्थ पार्श्व मार्ग बंद करना, और एजेंट प्रतिलेखों को एक-बार-लिखे-जाने वाले भंडारण में रखना शामिल है, ताकि जाँच बाद में संपादित न की जा सके। निगरानी के लिए चाहिए पुरानी घटनाओं पर ऊँची पकड़, ताजा मूल्यांकन डेटा ताकि आँकड़े बासी न पड़ें, और एक प्रतिक्रिया नियम: दिन में ड्यूटी वाले को बुलाओ, और रात में अनुत्तरित चेतावनी पर प्रशिक्षण अपने आप रोक दो।
प्रशिक्षण कौन रोक सकता है
संचालन वाला आधा हिस्सा ही शासन तय करता है। ओपनएआई कहती है कि सेफ्टी केस का मसौदा बनने के बाद किसी दूसरी टीम के व्यक्ति को असहमति — एक «प्री-मॉर्टम» — लिखनी चाहिए ताकि उसमें छेद मिलें। केस को ऐसे वरिष्ठ नेताओं से स्वीकृत होना चाहिए जिनमें से «हर एक के पास प्रशिक्षण पर वीटो की क्षमता होनी चाहिए»: एक शोध प्रमुख या उपाध्यक्ष, सुरक्षा प्रमुख और मुख्य वैज्ञानिक।

जवाबदेही पर वह और आगे जाती है: किसी प्रशिक्षण का जिम्मेदार वरिष्ठ नेता सेफ्टी केस और किसी भी घटना-प्रतिक्रिया के लिए उत्तरदायी होना चाहिए, «प्रदर्शन समीक्षा के हिस्से के रूप में भी।» तीव्रता बढ़ाने की प्रक्रिया परिभाषित गंभीरता स्तरों से गुजरनी चाहिए, और एक ड्यूटी व्यक्ति को अधिकारियों को — दस्तावेज मुख्य कार्यकारी का नाम लेता है — बुलाने में सक्षम होना चाहिए। सुरक्षा सुविधाएँ बंद होकर विफल होनी चाहिए: निगरानी चालू किए बिना प्रशिक्षण शुरू करना, या प्रशिक्षण के भीतर से निगरान बंद करना संभव नहीं होना चाहिए।
दस्तावेज कहता है कि लेखा-परीक्षकों को दावों की पुष्टि करने के लिए पर्याप्त पहुँच मिलनी चाहिए।
यह क्या है और क्या नहीं
ओपनएआई का कहना है कि ये सिफारिशें भीतर «लागू होने की प्रक्रिया में» हैं और उसके तौर-तरीके «आने वाले हफ्तों में» बदलते रहेंगे। इनमें से कुछ भी किसी बाहरी पक्ष के प्रति प्रतिबद्धता नहीं है, और किसी नियामक का नाम नहीं है।
संदर्भ टाला नहीं जा सकता: यह दस्तावेज उस दिन से एक दिन पहले आया जब ओपनएआई ने पुष्टि की कि GPT-6.1 एस्ट्रा नहीं आएगा, और उस दिन से एक दिन पहले जब उसने चार ऑस्ट्रेलियाई सरकारी निकायों के नाम बताए जिन तक उसके मॉडल आंतरिक प्रशिक्षण में पहुँचे। देखने की बात यह है कि इसमें से कुछ भी ओपनएआई के बाहर किसी के लिए जाँचने योग्य बनता है या नहीं।