A Frontier Red Team da Anthropic publicou a 29 de setembro um relatório que mede a capacidade ciberofensiva do GLM-5.3, o modelo de pesos abertos lançado pelo laboratório chinês Zhipu AI. A conclusão é que a diferença de capacidade entre pesos abertos e sistemas de fronteira se fechou neste eixo concreto, e que as salvaguardas ligadas a pesos abertos não sobrevivem ao contacto com quem esteja disposto a gastar alguns milhares de dólares.
No ExploitBench, o GLM-5.3 desenvolveu exploits completos em 50 de 410 tentativas, ou seja, 12%. Num teste de exploração de binários alcançou desvios completos do fluxo de controlo em 4% de 100 ensaios. A Anthropic coloca o Claude Mythos Preview em 14% e 6% nessas mesmas duas medidas. Ambos os números são da Anthropic, executados pela sua equipa, e devem ser lidos assim. A comparação em que o relatório se apoia é geracional: o Claude Opus 4.6 e o GLM-5.2, ambos anteriores, pontuaram perto de zero nos mesmos testes.
As taxas de recusa são o mais impressionante
A Anthropic mediu com que frequência o GLM-5.3 aceitava um pedido de ciberataque malicioso em quatro condições. Perguntado directamente, aceitou 0% das vezes. Com uma história de cobertura falsa, 64%. Com o raciocínio pré-preenchido, 92%. Numa versão ablitrada — pesos alterados para remover o comportamento de recusa —, 100%. A Anthropic relata que todos os modelos Claude testados se mantiveram em 0% nas condições aplicáveis.

Ablitrar o GLM-5.3 exigiu 2200 horas de GPU à equipa da Anthropic, que avalia em cerca de 4400 dólares. As taxas de recusa em três testes de pedidos nocivos caíram de 95% para cerca de 6%, e as capacidades do modelo ficaram largamente intactas. O relatório nota que surgiram publicamente versões ablitradas do modelo poucos dias após o lançamento, pelo que os 4400 dólares são o custo de o fazer por conta própria, não o de obter o resultado.
Dois exemplos concretos
O relatório descreve um investigador que usou o GLM-5.3 para encontrar vulnerabilidades desconhecidas no motor de JavaScript de um navegador e encadeá-las em exploits funcionais num único dia, com atenção limitada. Outro construiu um exploit para a CVE-2026-11645 em 20 minutos de tempo humano, a um custo de API de 20,40 dólares aos preços da Zhipu.

São anedotas mais do que medições, e a Anthropic apresenta-as como tal. São também a parte que um defensor lerá duas vezes, porque põe um preço no trabalho.
O que a Anthropic pretende com isto
As recomendações apontam numa direcção: que os defensores tenham acesso aos modelos mais fortes disponíveis e que os governos testem modelos capazes precisamente para isto. É um argumento interessado de uma empresa que vende acesso de fronteira, e convém dizê-lo. É também um argumento que decorre dos números que publicou, incluindo os que colocam o modelo aberto de um concorrente perto da sua própria pré-versão.
O que observar
Se a Zhipu responder com medições próprias e se algum organismo público de testes publicar uma execução independente nos mesmos testes. Até lá, todos os números aqui vêm de um dos laboratórios comparados.