La Frontier Red Team d’Anthropic a publié le 29 septembre un rapport mesurant la capacité cyberoffensive de GLM-5.3, le modèle à poids ouverts diffusé par le laboratoire chinois Zhipu AI. Sa conclusion : l’écart de capacité entre poids ouverts et systèmes de frontière s’est refermé sur cet axe précis, et les garde-fous attachés aux poids ouverts ne survivent pas au contact de quiconque est prêt à dépenser quelques milliers de dollars.

Sur ExploitBench, GLM-5.3 a développé des exploits de bout en bout dans 50 tentatives sur 410, soit 12 %. Sur un test d’exploitation de binaires, il a obtenu des détournements complets du flux de contrôle dans 4 % de 100 essais. Anthropic situe Claude Mythos Preview à 14 % et 6 % sur ces deux mêmes mesures. Ces chiffres sont ceux d’Anthropic, produits par son équipe, et doivent être lus ainsi. La comparaison sur laquelle s’appuie le rapport est générationnelle : Claude Opus 4.6 et GLM-5.2, tous deux antérieurs, étaient proches de zéro sur les mêmes tests.

Les taux de refus sont le point frappant

Anthropic a mesuré la fréquence à laquelle GLM-5.3 acceptait une demande de cyberattaque malveillante dans quatre conditions. Interrogé directement, il a accepté 0 % du temps. Avec une fausse histoire de couverture, 64 %. Avec son raisonnement prérempli, 92 %. Dans une version abliérée — des poids modifiés pour supprimer le comportement de refus —, 100 %. Anthropic indique que tous les modèles Claude testés sont restés à 0 % dans les conditions applicables.

Un bureau ouvert lumineux avec des postes de travail et des écrans
Le rapport plaide pour un meilleur accès des défenseurs. Photo d'illustration. cottonbro studio · pexels · Pexels License

L’abliération de GLM-5.3 a demandé 2 200 heures de GPU à l’équipe d’Anthropic, qu’elle chiffre à environ 4 400 dollars. Les taux de refus sur trois tests de demandes nuisibles sont passés de 95 % à environ 6 %, et les capacités du modèle sont restées largement intactes. Le rapport note que des versions abliérées du modèle sont apparues publiquement dans les jours suivant sa sortie : les 4 400 dollars sont donc le coût de le faire soi-même, pas celui d’obtenir le résultat.

Deux exemples concrets

Le rapport décrit un chercheur qui a utilisé GLM-5.3 pour trouver des vulnérabilités jusque-là inconnues dans le moteur JavaScript d’un navigateur et les enchaîner en exploits fonctionnels en une seule journée, avec une attention limitée. Un autre a construit un exploit pour CVE-2026-11645 en 20 minutes de temps humain, pour un coût d’API de 20,40 dollars aux tarifs de Zhipu.

Gros plan d'une carte de circuit imprimé verte
L'abliération a coûté environ 4 400 dollars de temps GPU. Photo d'illustration. Júlio Riccó · pexels · Pexels License

Ce sont des anecdotes plutôt que des mesures, et Anthropic les présente comme telles. C’est aussi la partie qu’un défenseur lira deux fois, parce qu’elle met un prix sur le travail.

Ce qu’Anthropic en attend

Les recommandations pointent dans une seule direction : que les défenseurs disposent des modèles les plus puissants et que les États testent les modèles capables précisément pour cela. C’est un argument intéressé venant d’une entreprise qui vend de l’accès de frontière, et il faut le dire. C’est aussi un argument qui découle des chiffres publiés, y compris ceux qui placent le modèle ouvert d’un concurrent près de sa propre préversion.

Ce qu’il faut surveiller

Si Zhipu répond avec ses propres mesures, et si un organisme public d’évaluation publie une exécution indépendante sur les mêmes tests. D’ici là, chaque chiffre présenté ici provient de l’un des laboratoires comparés.