OpenAI ha declarado que Astra, su próximo modelo de frontera, es el primero que clasifica en el nivel Crítico de capacidad en ciberseguridad dentro de su Marco de Preparación. Ningún modelo de OpenAI había sido situado antes en esa categoría.

Qué hizo Astra en las pruebas

Astra obtuvo una puntuación perfecta en ExploitBench, que mide si un modelo es capaz de convertir una vulnerabilidad conocida en un exploit funcional. Después fue más allá y encontró por su cuenta dos vulnerabilidades de día cero.

En una evaluación escapó del entorno aislado de un navegador y ejecutó comandos en la máquina subyacente. En otra encadenó varios fallos de un sistema operativo reforzado hasta lograr una escalada local de privilegios a root.

Gráfico abstracto de Aivio News que acompaña a la noticia sobre OpenAI dice que Astra es su primer modelo con capacidad cibernética Crítica.
Ilustración de Aivio News. No es una fotografía de los hechos descritos. Aivio News · owned · © Aivio News / GrowQ AB

Dónde trazó OpenAI la línea

El umbral Crítico, tal como lo define OpenAI, se aplica cuando un modelo puede encontrar y explotar de forma autónoma vulnerabilidades de día cero en numerosos sistemas bien protegidos, o llevar a cabo un ciberataque completo contra un objetivo reforzado a partir únicamente de una instrucción de alto nivel.

Es una definición construida en torno a la autonomía, no a la destreza. Un modelo que encuentra un fallo con una persona investigadora guiándolo no es lo que describe el umbral; sí lo es uno que completa toda la cadena a partir de un objetivo de una sola línea.

Ocho semanas de cautela

OpenAI llevaba avisando desde principios de agosto, cuando afirmó que sus evaluaciones internas mostraban «avances significativos en programación agéntica y ciberseguridad» y que «no puede descartar que el modelo alcance el nivel de capacidad crítica en ciberseguridad».

Entonces la compañía detuvo las actividades relacionadas con Astra que no cumplían requisitos reforzados de seguridad, no el proyecto en sí. También afirmó de forma tajante que «Astra es un modelo próximo y no participó en la explotación de Hugging Face», un desmentido que dice algo sobre las preguntas que estaba recibiendo.

Qué se lanza y qué no

OpenAI ha autorizado el lanzamiento de Astra conforme al marco, sobre la base de que sus salvaguardas reducen suficientemente el riesgo de daño grave. Las capacidades de ciberseguridad más avanzadas no estarán disponibles en el lanzamiento.

El acceso comienza con personas evaluadoras y se amplía mediante un programa que OpenAI llama Daybreak Blue. La resistencia a los jailbreaks se sitúa en el 91,5%, frente al 59% de GPT-5.6 Sol.

Gráfico abstracto de Aivio News que acompaña a la noticia sobre OpenAI dice que Astra es su primer modelo con capacidad cibernética Crítica.
Ilustración de Aivio News. No es una fotografía de los hechos descritos. Aivio News · owned · © Aivio News / GrowQ AB

La compañía enmarcó el momento con sus propias palabras: «Estamos entrando en una etapa del desarrollo de la IA en la que los modelos pueden asumir trabajos de mayor trascendencia, y los fallos de alineamiento y control pueden tener efectos más graves».

Qué vigilar

Si una cifra del 91,5% de resistencia a los jailbreaks se sostiene fuera del propio equipo rojo de OpenAI. Con capacidad Crítica, la distancia entre el 91,5% y el 100% no es un redondeo: es la proporción de intentos que llegan a un modelo capaz de escribir cadenas de exploits funcionales sin ayuda.