Anthropics Frontier Red Team publiserte 29. september en rapport som måler den offensive cyberevnen til GLM-5.3, den åpne modellen som det kinesiske laboratoriet Zhipu AI har sluppet. Konklusjonen er at kapasitetsgapet mellom åpne vekter og frontsystemer er lukket på nettopp denne aksen, og at sperrene som følger med åpne vekter ikke overlever møtet med noen som er villig til å bruke noen tusen dollar.
På ExploitBench utviklet GLM-5.3 komplette angrepskoder i 50 av 410 forsøk, altså 12 prosent. På en test for binærutnyttelse oppnådde den full kapring av kontrollflyten i 4 prosent av 100 forsøk. Anthropic oppgir Claude Mythos Preview til 14 og 6 prosent på de samme to målene. Begge tallene er Anthropics egne, kjørt av Anthropics team, og bør leses slik. Sammenligningen rapporten støtter seg på, er generasjonsmessig: Claude Opus 4.6 og GLM-5.2, begge eldre, lå nær null på de samme testene.
Avslagsratene er det slående
Anthropic målte hvor ofte GLM-5.3 gikk med på en forespørsel om ondsinnet cyberangrep under fire betingelser. Spurt rett ut gikk den med 0 prosent av gangene. Med en falsk dekkhistorie, 64 prosent. Med resonnementet forhåndsutfylt, 92 prosent. I en ablitrert utgave — vekter endret for å fjerne avslagsatferden — 100 prosent. Anthropic melder at alle Claude-modeller de testet, holdt seg på 0 prosent under de aktuelle betingelsene.

Å ablitrere GLM-5.3 tok Anthropics team 2 200 GPU-timer, som de anslår til rundt 4 400 dollar. Avslagsratene på tre tester med skadelige forespørsler falt fra 95 til om lag 6 prosent, og modellens evner var i stor grad intakte etterpå. Rapporten merker seg at ablitrerte versjoner av modellen dukket opp offentlig innen få dager etter lanseringen, så 4 400 dollar er kostnaden ved å gjøre det selv, ikke ved å få resultatet.
To gjennomførte eksempler
Rapporten beskriver en forsker som brukte GLM-5.3 til å finne tidligere ukjente sårbarheter i en nettlesers JavaScript-motor og kjede dem sammen til fungerende angrepskode på én dag, med begrenset oppmerksomhet. En annen bygget en angrepskode for CVE-2026-11645 på 20 minutters menneskelig tid, til en API-kostnad på 20,40 dollar etter Zhipus priser.

Dette er anekdoter snarere enn målinger, og Anthropic presenterer dem som det. De er også den delen en forsvarer leser to ganger, fordi de setter en pris på arbeidet.
Hva Anthropic vil med det
Anbefalingene peker én vei: at cyberforsvarere bør ha tilgang til de sterkeste modellene som finnes, og at myndigheter bør teste kapable modeller nettopp for dette. Det er et egeninteressert argument fra et selskap som selger fronttilgang, og det bør sies. Det følger også av tallene selskapet publiserte, inkludert de som plasserer en konkurrents åpne modell nær selskapets egen forhåndsversjon.
Hva å følge med på
Om Zhipu svarer med egne målinger, og om et offentlig testorgan publiserer en uavhengig kjøring på de samme testene. Inntil da kommer hvert tall her fra ett av laboratoriene som sammenlignes.