एंथ्रोपिक की फ्रंटियर रेड टीम ने 29 सितंबर को एक रिपोर्ट प्रकाशित की जो चीनी प्रयोगशाला झिपू एआई द्वारा जारी खुले-भार मॉडल GLM-5.3 की आक्रामक साइबर क्षमता मापती है। निष्कर्ष यह है कि खुले भार और फ्रंटियर प्रणालियों के बीच क्षमता का अंतर इस विशेष धुरी पर बंद हो गया है, और खुले भार के साथ जुड़ी सुरक्षा उस किसी के सामने नहीं टिकती जो कुछ हज़ार डॉलर खर्च करने को तैयार हो।
ExploitBench पर GLM-5.3 ने 410 में से 50 प्रयासों में पूरा एक्सप्लॉइट विकसित किया, यानी 12 प्रतिशत। बाइनरी एक्सप्लॉइटेशन के एक परीक्षण में उसने 100 प्रयासों के 4 प्रतिशत में नियंत्रण-प्रवाह का पूरा अपहरण किया। एंथ्रोपिक इन्हीं दो मापों पर क्लॉड मिथॉस प्रीव्यू को 14 और 6 प्रतिशत पर रखता है। दोनों आँकड़े एंथ्रोपिक के अपने हैं, उसी की टीम ने चलाए हैं, और उन्हें ऐसे ही पढ़ा जाना चाहिए। रिपोर्ट जिस तुलना पर टिकी है वह पीढ़ीगत है: क्लॉड ओपस 4.6 और GLM-5.2, दोनों पुराने, इन्हीं परीक्षणों पर लगभग शून्य पर थे।
अस्वीकार दरें सबसे चौंकाने वाली हैं
एंथ्रोपिक ने मापा कि चार स्थितियों में GLM-5.3 कितनी बार दुर्भावनापूर्ण साइबर हमले के अनुरोध पर सहमत हुआ। सीधे पूछे जाने पर 0 प्रतिशत। झूठी आड़ वाली कहानी के साथ 64 प्रतिशत। तर्क पहले से भरा होने पर 92 प्रतिशत। एब्लिटरेटेड संस्करण में — जहाँ भार बदलकर अस्वीकार व्यवहार हटाया गया — 100 प्रतिशत। एंथ्रोपिक बताता है कि उसने जितने भी क्लॉड मॉडल परखे, वे लागू स्थितियों में 0 प्रतिशत पर रहे।

GLM-5.3 को एब्लिटरेट करने में एंथ्रोपिक की टीम को 2,200 जीपीयू घंटे लगे, जिसका मूल्य वह लगभग 4,400 डॉलर आँकती है। हानिकारक अनुरोधों के तीन परीक्षणों पर अस्वीकार दर 95 प्रतिशत से गिरकर लगभग 6 प्रतिशत रह गई, और उसके बाद मॉडल की क्षमताएँ काफी हद तक बरकरार रहीं। रिपोर्ट नोट करती है कि मॉडल के एब्लिटरेटेड संस्करण जारी होने के कुछ ही दिनों में सार्वजनिक रूप से आ गए थे, इसलिए 4,400 डॉलर इसे खुद करने की लागत है, परिणाम पाने की नहीं।
दो ठोस उदाहरण
रिपोर्ट एक शोधकर्ता का वर्णन करती है जिसने GLM-5.3 से एक ब्राउज़र के जावास्क्रिप्ट इंजन में पहले से अज्ञात कमज़ोरियाँ खोजीं और सीमित ध्यान के साथ एक ही दिन में उन्हें कार्यशील एक्सप्लॉइट में जोड़ दिया। दूसरे ने CVE-2026-11645 के लिए 20 मिनट के मानवीय समय में एक्सप्लॉइट बनाया, जिसकी एपीआई लागत झिपू के दामों पर 20.40 डॉलर रही।

ये माप से अधिक किस्से हैं, और एंथ्रोपिक उन्हें वैसे ही प्रस्तुत करता है। यही वह हिस्सा भी है जिसे कोई रक्षक दो बार पढ़ेगा, क्योंकि यह काम की कीमत बताता है।
एंथ्रोपिक इससे क्या चाहता है
सिफ़ारिशें एक ही दिशा में जाती हैं: साइबर रक्षकों को उपलब्ध सबसे सक्षम मॉडलों तक पहुँच मिलनी चाहिए, और सरकारों को ठीक इसी के लिए सक्षम मॉडलों का परीक्षण करना चाहिए। यह फ्रंटियर पहुँच बेचने वाली कंपनी का स्वार्थपूर्ण तर्क है, और यह कहना ज़रूरी है। यह उन आँकड़ों से भी निकलता है जो उसने प्रकाशित किए, उन आँकड़ों सहित जो एक प्रतिद्वंद्वी के खुले मॉडल को उसके अपने पूर्वावलोकन के करीब रखते हैं।
आगे क्या देखना है
क्या झिपू अपनी माप के साथ जवाब देता है, और क्या कोई सरकारी परीक्षण निकाय इन्हीं परीक्षणों पर स्वतंत्र परिणाम प्रकाशित करता है। तब तक यहाँ का हर आँकड़ा तुलना किए जा रहे प्रयोगशालाओं में से एक से आता है।