نشر فريق Frontier Red Team التابع لشركة Anthropic في 29 سبتمبر تقريراً يقيس القدرة السيبرانية الهجومية لنموذج GLM-5.3، وهو النموذج مفتوح الأوزان الذي أصدره المختبر الصيني Zhipu AI. وخلاصته أن الفجوة في القدرات بين الأوزان المفتوحة وأنظمة الحدود قد أُغلقت على هذا المحور تحديداً، وأن الضوابط المرفقة بالأوزان المفتوحة لا تصمد أمام من يستعد لإنفاق بضعة آلاف من الدولارات.
على اختبار ExploitBench، طوّر GLM-5.3 برمجيات استغلال كاملة في 50 محاولة من أصل 410، أي 12 بالمئة. وفي اختبار لاستغلال الملفات الثنائية حقق اختطافاً كاملاً لمسار التنفيذ في 4 بالمئة من 100 تجربة. وتضع Anthropic نموذج Claude Mythos Preview عند 14 و6 بالمئة على المقياسين نفسيهما. والرقمان من Anthropic نفسها وأجراهما فريقها، وينبغي قراءتهما على هذا الأساس. أما المقارنة التي يستند إليها التقرير فهي جيلية: Claude Opus 4.6 وGLM-5.2، وكلاهما أقدم، سجّلا قرب الصفر على الاختبارات نفسها.
نسب الرفض هي الجزء اللافت
قاست Anthropic عدد المرات التي استجاب فيها GLM-5.3 لطلب هجوم سيبراني خبيث في أربع حالات. عند السؤال المباشر استجاب صفر بالمئة. ومع قصة تغطية كاذبة 64 بالمئة. ومع تعبئة مسار استدلاله مسبقاً 92 بالمئة. وفي نسخة منزوعة الرفض، أي بأوزان عُدّلت لإزالة سلوك الرفض، 100 بالمئة. وتفيد Anthropic بأن كل نماذج Claude التي اختبرتها بقيت عند صفر بالمئة في الحالات المنطبقة.

استغرق نزع الرفض من GLM-5.3 نحو 2200 ساعة معالجة رسومية من فريق Anthropic، وتقدّر كلفتها بنحو 4400 دولار. وهبطت نسب الرفض في ثلاثة اختبارات للطلبات الضارة من 95 بالمئة إلى نحو 6 بالمئة، وظلت قدرات النموذج سليمة إلى حد بعيد بعد ذلك. ويشير التقرير إلى أن نسخاً منزوعة الرفض من النموذج ظهرت علناً خلال أيام من إصداره، فالمبلغ إذن هو كلفة فعل ذلك بنفسك، لا كلفة الحصول على النتيجة.
مثالان عمليان
يصف التقرير باحثاً استخدم GLM-5.3 للعثور على ثغرات غير معروفة سابقاً في محرك جافاسكربت لمتصفح، وربطها في برمجيات استغلال عاملة خلال يوم واحد وبانتباه محدود. وبنى آخر برمجية استغلال للثغرة CVE-2026-11645 في 20 دقيقة من الوقت البشري، بكلفة واجهة برمجية بلغت 20.40 دولاراً وفق أسعار Zhipu.

هذه حكايات لا قياسات، وتعرضها Anthropic بهذه الصفة. وهي أيضاً الجزء الذي سيقرأه المدافع مرتين، لأنه يضع سعراً للعمل.
ما تريده Anthropic من ذلك
تشير التوصيات في اتجاه واحد: أن يحصل المدافعون السيبرانيون على أقوى النماذج المتاحة، وأن تختبر الحكومات النماذج القادرة لهذا الغرض بالذات. وهي حجة ذات مصلحة من شركة تبيع الوصول إلى نماذج الحدود، ويجب قول ذلك. وهي أيضاً حجة تنبع من الأرقام التي نشرتها، بما فيها تلك التي تضع نموذج منافس مفتوحاً قريباً من نسخة المعاينة الخاصة بها.
ما ينبغي متابعته
هل ترد Zhipu بقياسات خاصة بها، وهل ينشر أي جهاز اختبار حكومي تشغيلاً مستقلاً على الاختبارات نفسها. وحتى ذلك الحين، كل رقم هنا مصدره أحد المختبرين محل المقارنة.