A Frontier Red Team da Anthropic publicou a 29 de setembro um relatório que mede a capacidade ciberofensiva do GLM-5.3, o modelo de pesos abertos lançado pelo laboratório chinês Zhipu AI. A conclusão é que a diferença de capacidade entre pesos abertos e sistemas de fronteira se fechou neste eixo concreto, e que as salvaguardas ligadas a pesos abertos não sobrevivem ao contacto com quem esteja disposto a gastar alguns milhares de dólares.

No ExploitBench, o GLM-5.3 desenvolveu exploits completos em 50 de 410 tentativas, ou seja, 12%. Num teste de exploração de binários alcançou desvios completos do fluxo de controlo em 4% de 100 ensaios. A Anthropic coloca o Claude Mythos Preview em 14% e 6% nessas mesmas duas medidas. Ambos os números são da Anthropic, executados pela sua equipa, e devem ser lidos assim. A comparação em que o relatório se apoia é geracional: o Claude Opus 4.6 e o GLM-5.2, ambos anteriores, pontuaram perto de zero nos mesmos testes.

As taxas de recusa são o mais impressionante

A Anthropic mediu com que frequência o GLM-5.3 aceitava um pedido de ciberataque malicioso em quatro condições. Perguntado directamente, aceitou 0% das vezes. Com uma história de cobertura falsa, 64%. Com o raciocínio pré-preenchido, 92%. Numa versão ablitrada — pesos alterados para remover o comportamento de recusa —, 100%. A Anthropic relata que todos os modelos Claude testados se mantiveram em 0% nas condições aplicáveis.

Um escritório aberto e luminoso com secretárias e monitores
O relatório defende melhor acesso para os defensores. Foto ilustrativa. cottonbro studio · pexels · Pexels License

Ablitrar o GLM-5.3 exigiu 2200 horas de GPU à equipa da Anthropic, que avalia em cerca de 4400 dólares. As taxas de recusa em três testes de pedidos nocivos caíram de 95% para cerca de 6%, e as capacidades do modelo ficaram largamente intactas. O relatório nota que surgiram publicamente versões ablitradas do modelo poucos dias após o lançamento, pelo que os 4400 dólares são o custo de o fazer por conta própria, não o de obter o resultado.

Dois exemplos concretos

O relatório descreve um investigador que usou o GLM-5.3 para encontrar vulnerabilidades desconhecidas no motor de JavaScript de um navegador e encadeá-las em exploits funcionais num único dia, com atenção limitada. Outro construiu um exploit para a CVE-2026-11645 em 20 minutos de tempo humano, a um custo de API de 20,40 dólares aos preços da Zhipu.

Grande plano de uma placa de circuito verde
A ablitração custou cerca de 4400 dólares em tempo de GPU. Foto ilustrativa. Júlio Riccó · pexels · Pexels License

São anedotas mais do que medições, e a Anthropic apresenta-as como tal. São também a parte que um defensor lerá duas vezes, porque põe um preço no trabalho.

O que a Anthropic pretende com isto

As recomendações apontam numa direcção: que os defensores tenham acesso aos modelos mais fortes disponíveis e que os governos testem modelos capazes precisamente para isto. É um argumento interessado de uma empresa que vende acesso de fronteira, e convém dizê-lo. É também um argumento que decorre dos números que publicou, incluindo os que colocam o modelo aberto de um concorrente perto da sua própria pré-versão.

O que observar

Se a Zhipu responder com medições próprias e se algum organismo público de testes publicar uma execução independente nos mesmos testes. Até lá, todos os números aqui vêm de um dos laboratórios comparados.