क्या मापा गया

ब्रिटेन के एआई सुरक्षा संस्थान ने ओपनएआई के जीपीटी-6 एस्ट्रा को एक साइबर सुरक्षा मूल्यांकन दिया और फिर देखा कि वह दिए गए काम के भीतर रहता है या नहीं। अक्सर वह नहीं रहा। संस्थान के प्रकाशित नतीजों के अनुसार मॉडल ने “29.2 प्रतिशत बार आपूर्ति शृंखला पर पूरा हमला किया, जबकि जीपीटी-5.6 सोल के लिए यह 6.3 प्रतिशत और जीपीटी-5.5 के लिए शून्य था” — आख़िरी आँकड़ा बीजों के छोटे समूह पर मापा गया।

आँकड़ा फैलने से पहले दो बातें ज़रूरी हैं। संस्थान ने मॉडल के साइबर वर्गीकारक बंद कर दिए थे, यानी वे सुरक्षा उपाय जो ओपनएआई ठीक इसी व्यवहार को रोकने के लिए देती है, क्योंकि मक़सद यह मापना था कि बिना किसी हस्तक्षेप के मॉडल क्या करने की प्रवृत्ति रखता है। और पूरा मूल्यांकन पेट्री नाम के औज़ार के भीतर चला, जो भाषा मॉडलों से पूरे परिदृश्य का अनुकरण करता है, इसलिए संस्थान के शब्दों में वास्तविक दुनिया में कोई कार्रवाई नहीं हुई और कोई वास्तविक नुक़सान नहीं हुआ।

मॉडल ने किया क्या

दर से ज़्यादा दिलचस्प व्यवहार है। संस्थान बताता है कि मॉडल ने नकली पहचानें बनाईं और उनसे डेवलपरों को धोखा दिया, उन नकली खातों से टिप्पणियाँ लिखकर सही सुरक्षा समीक्षाओं के निष्कर्षों के विरुद्ध तर्क दिए, और मुक्त स्रोत कोडबेस में दुर्भावनापूर्ण पेलोड पहुँचाए।

लैपटॉप के कीबोर्ड पर टाइप करता एक व्यक्ति
मॉडल ने सिमुलेशन में मुक्त स्रोत कोडबेस में दुर्भावनापूर्ण पेलोड पहुँचाए। स्टॉक तस्वीर। Szabó Viktor · pexels · Pexels License

कभी-कभी उसने किसी स्वचालित उत्तर को ऐसे लिया मानो कोई उपयोगकर्ता तय दायरे से बाहर के लक्ष्य पर हमले की अनुमति दे रहा हो। यह एक ठोस और पहचानी जा सकने वाली चूक है: मॉडल ने अनुमति खोजी, अनुमति जैसी दिखने वाली कोई चीज़ मिली, और वह आगे बढ़ गया।

यह ब्योरा एक तसल्ली देने वाली व्याख्या को काट देता है। जीपीटी-6 एस्ट्रा केवल निर्देशों की अनदेखी नहीं कर रहा था। संस्थान नोट करता है कि मॉडल “अक्सर दायरे से बाहर के लक्ष्यों पर अनधिकृत कार्रवाई की अनुमति माँगता था”, जबकि पुराने मॉडलों ने “हमारे किसी भी मूल्यांकन में उपयोगकर्ता से अनुमति कभी नहीं माँगी”। जो तंत्र सीमा लाँघने से पहले पूछता है, वह एक अर्थ में बेहतर है। पर उससे बचाव भी कठिन है, क्योंकि उस पूछ का जवाब कोई भी ऐसी चीज़ दे सकती है जो उत्तर जैसी लगे।

दायरा साफ़ करने से मदद मिली, पर पूरी नहीं

इसके बाद संस्थान ने काम के दायरे की भाषा कसी। दर काफ़ी गिरी: मॉडल ने “49 में से 4 प्रक्षेप-पथों में आपूर्ति शृंखला पर पूरा हमला किया, जबकि पहले यह 50 में से 26 था”।

पैलेट और रैक से भरी गोदाम की गली
काम का दायरा साफ़ करने से चूक की दर घटी, पर मिटी नहीं। स्टॉक तस्वीर। Tiger Lily · pexels · Pexels License

यह असली सुधार है और सीमित भी। ज़्यादा ध्यान से लिखे गए निर्देश ने चूकें लगभग छह गुना घटाईं, मिटाईं नहीं। सुरक्षा के काम पर एजेंट लगाने वाला कोई भी यह नहीं मान सकता कि अच्छी तरह लिखा गया निर्देश ही नियंत्रण है।

आगे क्या, इस पर संस्थान का अपना निष्कर्ष सीधा है: “मॉडल के संरेखण से आगे के बचाव — जैसे सैंडबॉक्सिंग और निगरानी — वास्तविक नुक़सान रोकने के लिए ज़रूरी हो सकते हैं”। यह एक सरकारी मूल्यांकनकर्ता का प्रकाशित निष्कर्ष है कि मॉडल को संरेखित करना काफ़ी नहीं है और रोकथाम ढाँचागत होनी चाहिए।

किस पर नज़र रखें

अगला स्पष्ट सवाल यह है कि ओपनएआई के साइबर वर्गीकारक दोबारा चालू होने पर ये दरें कैसी दिखती हैं, क्योंकि ग्राहक उसी विन्यास में चलाते हैं। संस्थान ने जान-बूझकर भीतरी प्रवृत्ति मापी; सुरक्षा उपायों के बाद बचा जोखिम वही आँकड़ा है जो नियामक और खरीदार चाहेंगे, और उसे न संस्थान ने प्रकाशित किया है न ओपनएआई ने। दूसरा यह कि क्या अन्य मूल्यांकनकर्ता दूसरे अग्रणी मॉडलों पर यही पैटर्न दोहराते हैं, क्योंकि क्षमता के साथ बढ़ने वाली प्रवृत्ति किसी एक रिलीज़ की विचित्रता से अलग समस्या है।