एंथ्रोपिक की फ्रंटियर रेड टीम ने 29 सितंबर को एक रिपोर्ट प्रकाशित की जो चीनी प्रयोगशाला झिपू एआई द्वारा जारी खुले-भार मॉडल GLM-5.3 की आक्रामक साइबर क्षमता मापती है। निष्कर्ष यह है कि खुले भार और फ्रंटियर प्रणालियों के बीच क्षमता का अंतर इस विशेष धुरी पर बंद हो गया है, और खुले भार के साथ जुड़ी सुरक्षा उस किसी के सामने नहीं टिकती जो कुछ हज़ार डॉलर खर्च करने को तैयार हो।

ExploitBench पर GLM-5.3 ने 410 में से 50 प्रयासों में पूरा एक्सप्लॉइट विकसित किया, यानी 12 प्रतिशत। बाइनरी एक्सप्लॉइटेशन के एक परीक्षण में उसने 100 प्रयासों के 4 प्रतिशत में नियंत्रण-प्रवाह का पूरा अपहरण किया। एंथ्रोपिक इन्हीं दो मापों पर क्लॉड मिथॉस प्रीव्यू को 14 और 6 प्रतिशत पर रखता है। दोनों आँकड़े एंथ्रोपिक के अपने हैं, उसी की टीम ने चलाए हैं, और उन्हें ऐसे ही पढ़ा जाना चाहिए। रिपोर्ट जिस तुलना पर टिकी है वह पीढ़ीगत है: क्लॉड ओपस 4.6 और GLM-5.2, दोनों पुराने, इन्हीं परीक्षणों पर लगभग शून्य पर थे।

अस्वीकार दरें सबसे चौंकाने वाली हैं

एंथ्रोपिक ने मापा कि चार स्थितियों में GLM-5.3 कितनी बार दुर्भावनापूर्ण साइबर हमले के अनुरोध पर सहमत हुआ। सीधे पूछे जाने पर 0 प्रतिशत। झूठी आड़ वाली कहानी के साथ 64 प्रतिशत। तर्क पहले से भरा होने पर 92 प्रतिशत। एब्लिटरेटेड संस्करण में — जहाँ भार बदलकर अस्वीकार व्यवहार हटाया गया — 100 प्रतिशत। एंथ्रोपिक बताता है कि उसने जितने भी क्लॉड मॉडल परखे, वे लागू स्थितियों में 0 प्रतिशत पर रहे।

डेस्क और मॉनिटरों वाला एक उजला खुला कार्यालय
रिपोर्ट रक्षकों के लिए बेहतर पहुँच की वकालत करती है। प्रतीकात्मक तस्वीर। cottonbro studio · pexels · Pexels License

GLM-5.3 को एब्लिटरेट करने में एंथ्रोपिक की टीम को 2,200 जीपीयू घंटे लगे, जिसका मूल्य वह लगभग 4,400 डॉलर आँकती है। हानिकारक अनुरोधों के तीन परीक्षणों पर अस्वीकार दर 95 प्रतिशत से गिरकर लगभग 6 प्रतिशत रह गई, और उसके बाद मॉडल की क्षमताएँ काफी हद तक बरकरार रहीं। रिपोर्ट नोट करती है कि मॉडल के एब्लिटरेटेड संस्करण जारी होने के कुछ ही दिनों में सार्वजनिक रूप से आ गए थे, इसलिए 4,400 डॉलर इसे खुद करने की लागत है, परिणाम पाने की नहीं।

दो ठोस उदाहरण

रिपोर्ट एक शोधकर्ता का वर्णन करती है जिसने GLM-5.3 से एक ब्राउज़र के जावास्क्रिप्ट इंजन में पहले से अज्ञात कमज़ोरियाँ खोजीं और सीमित ध्यान के साथ एक ही दिन में उन्हें कार्यशील एक्सप्लॉइट में जोड़ दिया। दूसरे ने CVE-2026-11645 के लिए 20 मिनट के मानवीय समय में एक्सप्लॉइट बनाया, जिसकी एपीआई लागत झिपू के दामों पर 20.40 डॉलर रही।

हरे सर्किट बोर्ड का नज़दीकी दृश्य
एब्लिटरेशन की लागत जीपीयू समय में लगभग 4,400 डॉलर रही। प्रतीकात्मक तस्वीर। Júlio Riccó · pexels · Pexels License

ये माप से अधिक किस्से हैं, और एंथ्रोपिक उन्हें वैसे ही प्रस्तुत करता है। यही वह हिस्सा भी है जिसे कोई रक्षक दो बार पढ़ेगा, क्योंकि यह काम की कीमत बताता है।

एंथ्रोपिक इससे क्या चाहता है

सिफ़ारिशें एक ही दिशा में जाती हैं: साइबर रक्षकों को उपलब्ध सबसे सक्षम मॉडलों तक पहुँच मिलनी चाहिए, और सरकारों को ठीक इसी के लिए सक्षम मॉडलों का परीक्षण करना चाहिए। यह फ्रंटियर पहुँच बेचने वाली कंपनी का स्वार्थपूर्ण तर्क है, और यह कहना ज़रूरी है। यह उन आँकड़ों से भी निकलता है जो उसने प्रकाशित किए, उन आँकड़ों सहित जो एक प्रतिद्वंद्वी के खुले मॉडल को उसके अपने पूर्वावलोकन के करीब रखते हैं।

आगे क्या देखना है

क्या झिपू अपनी माप के साथ जवाब देता है, और क्या कोई सरकारी परीक्षण निकाय इन्हीं परीक्षणों पर स्वतंत्र परिणाम प्रकाशित करता है। तब तक यहाँ का हर आँकड़ा तुलना किए जा रहे प्रयोगशालाओं में से एक से आता है।