El Frontier Red Team de Anthropic publicó el 29 de septiembre un informe que mide la capacidad ciberofensiva de GLM-5.3, el modelo de pesos abiertos lanzado por el laboratorio chino Zhipu AI. Su conclusión es que la brecha de capacidad entre los pesos abiertos y los sistemas de frontera se ha cerrado en este eje concreto, y que las salvaguardas adheridas a los pesos abiertos no sobreviven al contacto con quien esté dispuesto a gastar unos pocos miles de dólares.
En ExploitBench, GLM-5.3 desarrolló exploits completos en 50 de 410 intentos, es decir, el 12%. En una prueba de explotación de binarios logró secuestros completos del flujo de control en el 4% de 100 ensayos. Anthropic sitúa a Claude Mythos Preview en el 14% y el 6% en esas dos mismas medidas. Ambas cifras son de Anthropic, ejecutadas por su equipo, y deben leerse así. La comparación en la que se apoya el informe es generacional: Claude Opus 4.6 y GLM-5.2, ambos anteriores, puntuaron casi cero en los mismos bancos de pruebas.
Las tasas de rechazo son lo llamativo
Anthropic midió con qué frecuencia GLM-5.3 aceptaba una petición de ciberataque malicioso en cuatro condiciones. Preguntado sin más, aceptó el 0% de las veces. Con una historia de tapadera falsa, el 64%. Con su razonamiento precargado, el 92%. En una versión abliterada —pesos modificados para eliminar el comportamiento de rechazo—, el 100%. Anthropic informa de que todos los modelos Claude que probó se mantuvieron en el 0% en las condiciones aplicables.

Abliterar GLM-5.3 le costó al equipo de Anthropic 2.200 horas de GPU, que valora en unos 4.400 dólares. Las tasas de rechazo en tres bancos de peticiones dañinas cayeron del 95% a cerca del 6%, y las capacidades del modelo quedaron en gran medida intactas. El informe señala que aparecieron versiones abliteradas del modelo en público a los pocos días de su lanzamiento, de modo que los 4.400 dólares son el coste de hacerlo uno mismo, no el de obtener el resultado.
Dos ejemplos concretos
El informe describe a un investigador que usó GLM-5.3 para encontrar vulnerabilidades desconocidas en el motor de JavaScript de un navegador y encadenarlas en exploits funcionales en un solo día, con atención limitada. Otro construyó un exploit para CVE-2026-11645 en 20 minutos de tiempo humano, con un coste de API de 20,40 dólares a los precios de Zhipu.

Son anécdotas más que mediciones, y Anthropic las presenta como tales. También son la parte que un defensor leerá dos veces, porque ponen precio al trabajo.
Qué busca Anthropic con esto
Las recomendaciones apuntan en una dirección: que los defensores dispongan de acceso a los modelos más potentes y que los gobiernos prueben los modelos capaces precisamente para esto. Es un argumento interesado de una empresa que vende acceso de frontera, y conviene decirlo. También es un argumento que se desprende de las cifras que publicó, incluidas las que sitúan el modelo abierto de un competidor cerca de su propia vista previa.
Qué vigilar
Si Zhipu responde con mediciones propias y si algún organismo público de pruebas publica una ejecución independiente sobre los mismos bancos. Hasta entonces, todas las cifras aquí proceden de uno de los laboratorios comparados.