OpenAI ने कहा है कि उसका आगामी फ्रंटियर मॉडल Astra पहला ऐसा मॉडल है जिसे कंपनी ने अपने Preparedness Framework में साइबर सुरक्षा क्षमता के “क्रिटिकल” स्तर पर वर्गीकृत किया है। इससे पहले OpenAI का कोई मॉडल इस श्रेणी में नहीं रखा गया था।
परीक्षणों में Astra ने क्या किया
Astra ने ExploitBench पर पूर्ण अंक प्राप्त किए, जो यह मापता है कि कोई मॉडल किसी ज्ञात सुरक्षा-कमज़ोरी को कार्यशील एक्सप्लॉइट में बदल सकता है या नहीं। इसके बाद वह और आगे गया और उसने स्वयं दो ज़ीरो-डे कमज़ोरियाँ खोज निकालीं।
एक मूल्यांकन में उसने ब्राउज़र के सैंडबॉक्स से बाहर निकलकर अंतर्निहित मशीन पर कमांड चलाए। दूसरे में उसने एक हार्डन किए गए ऑपरेटिंग सिस्टम की कई कमज़ोरियों को जोड़कर रूट तक स्थानीय प्रिविलेज एस्केलेशन हासिल किया।

OpenAI ने सीमा कहाँ खींची
OpenAI की परिभाषा के अनुसार, “क्रिटिकल” सीमा तब लागू होती है जब कोई मॉडल स्वतंत्र रूप से कई सुरक्षित प्रणालियों में ज़ीरो-डे कमज़ोरियाँ खोजकर उनका उपयोग कर सके, या केवल एक उच्च-स्तरीय निर्देश के आधार पर किसी सुदृढ़ लक्ष्य पर पूरा साइबर हमला अंजाम दे सके।
यह परिभाषा कौशल के बजाय स्वायत्तता के इर्द-गिर्द बनी है। जो मॉडल किसी शोधकर्ता के मार्गदर्शन में कोई बग खोजता है, वह इस सीमा का विषय नहीं है; जो मॉडल एक पंक्ति के लक्ष्य से पूरी शृंखला पूरी करता है, वह है।
आठ सप्ताह की सतर्कता
OpenAI अगस्त की शुरुआत से ही इसका संकेत दे रहा था, जब उसने कहा था कि आंतरिक मूल्यांकनों में “एजेंटिक कोडिंग और साइबर सुरक्षा में उल्लेखनीय प्रगति” दिखी है और वह “इस संभावना को ख़ारिज नहीं कर सकता कि मॉडल साइबर सुरक्षा के लिए क्रिटिकल क्षमता स्तर तक पहुँच जाए”।
उस समय कंपनी ने Astra से जुड़ी उन गतिविधियों को रोका था जो कड़े सुरक्षा मानकों को पूरा नहीं करती थीं — पूरी परियोजना को नहीं। उसने स्पष्ट रूप से यह भी कहा कि “Astra एक आगामी मॉडल है और Hugging Face पर हुए हमले में शामिल नहीं था”, एक खंडन जो बताता है कि कंपनी से किस तरह के प्रश्न पूछे जा रहे थे।
क्या जारी होगा और क्या नहीं
OpenAI ने इस ढाँचे के तहत Astra को जारी करने की मंज़ूरी दे दी है, इस आधार पर कि उसके सुरक्षा उपाय गंभीर नुक़सान के जोखिम को पर्याप्त रूप से कम करते हैं। सबसे उन्नत साइबर सुरक्षा क्षमताएँ लॉन्च के समय उपलब्ध नहीं होंगी।
पहुँच शुरुआती परीक्षकों से शुरू होती है और Daybreak Blue नामक कार्यक्रम के ज़रिए व्यापक होती है। जेलब्रेक के प्रति प्रतिरोध 91.5 प्रतिशत बताया गया है, जबकि GPT-5.6 Sol के लिए यह 59 प्रतिशत था।

कंपनी ने इस क्षण को अपने शब्दों में रखा: “हम एआई विकास के ऐसे चरण में प्रवेश कर रहे हैं जहाँ मॉडल अधिक परिणामकारी काम संभाल सकते हैं, और जहाँ अलाइनमेंट तथा नियंत्रण की विफलताओं के अधिक गंभीर प्रभाव हो सकते हैं।”
किस पर नज़र रखें
क्या जेलब्रेक प्रतिरोध का 91.5 प्रतिशत का आँकड़ा OpenAI की अपनी रेड-टीमिंग के बाहर भी टिकता है। क्रिटिकल क्षमता पर 91.5 और 100 प्रतिशत के बीच का अंतर कोई गोलाई नहीं है — यह उन प्रयासों का हिस्सा है जो ऐसे मॉडल तक पहुँच जाते हैं जो बिना सहायता के कार्यशील एक्सप्लॉइट शृंखलाएँ लिख सकता है।