Anthropics Frontier Red Team offentliggjorde den 29. september en rapport, der måler den offensive cyberevne i GLM-5.3, den åbne model, som det kinesiske laboratorium Zhipu AI har udgivet. Konklusionen er, at kapacitetskløften mellem åbne vægte og frontsystemer er lukket på netop denne akse, og at de spærringer, der følger med åbne vægte, ikke overlever mødet med nogen, der vil bruge nogle få tusind dollar.
På ExploitBench udviklede GLM-5.3 komplette angrebskoder i 50 ud af 410 forsøg, altså 12 procent. På en test for binær udnyttelse opnåede den fuld kapring af kontrolflowet i 4 procent af 100 forsøg. Anthropic angiver Claude Mythos Preview til 14 og 6 procent på de samme to mål. Begge tal er Anthropics egne, kørt af Anthropics hold, og skal læses sådan. Den sammenligning, rapporten støtter sig til, er generationsmæssig: Claude Opus 4.6 og GLM-5.2, begge ældre, lå nær nul på de samme tests.
Afvisningsraterne er det slående
Anthropic målte, hvor ofte GLM-5.3 gik med til en anmodning om ondsindet cyberangreb under fire betingelser. Spurgt direkte gik den med 0 procent af gangene. Med en falsk dækhistorie 64 procent. Med ræsonnementet forudfyldt 92 procent. I en ablitreret udgave — vægte ændret for at fjerne afvisningsadfærden — 100 procent. Anthropic melder, at alle Claude-modeller, de testede, blev på 0 procent under de relevante betingelser.

At ablitrere GLM-5.3 tog Anthropics hold 2.200 GPU-timer, som de sætter til omkring 4.400 dollar. Afvisningsraterne på tre tests med skadelige anmodninger faldt fra 95 til omkring 6 procent, og modellens evner var stort set intakte bagefter. Rapporten bemærker, at ablitrerede versioner af modellen dukkede offentligt op få dage efter udgivelsen, så de 4.400 dollar er prisen for at gøre det selv, ikke for at få resultatet.
To gennemførte eksempler
Rapporten beskriver en forsker, der brugte GLM-5.3 til at finde hidtil ukendte sårbarheder i en browsers JavaScript-motor og kæde dem sammen til fungerende angrebskode på en enkelt dag med begrænset opmærksomhed. En anden byggede en angrebskode til CVE-2026-11645 på 20 minutters menneskelig tid til en API-omkostning på 20,40 dollar efter Zhipus priser.

Det er anekdoter snarere end målinger, og Anthropic præsenterer dem sådan. De er også den del, en forsvarer læser to gange, fordi de sætter en pris på arbejdet.
Hvad Anthropic vil med det
Anbefalingerne peger én vej: at cyberforsvarere bør have adgang til de stærkeste tilgængelige modeller, og at myndigheder bør teste kapable modeller netop til dette. Det er et egeninteresseret argument fra en virksomhed, der sælger frontadgang, og det bør siges. Det følger også af de tal, virksomheden offentliggjorde, herunder dem, der placerer en konkurrents åbne model tæt på dens egen forhåndsversion.
Hvad man skal følge
Om Zhipu svarer med egne målinger, og om et offentligt testorgan offentliggør en uafhængig kørsel på de samme tests. Indtil da kommer hvert tal her fra et af de sammenlignede laboratorier.