OpenAI uppger att Astra, företagets nästa frontlinjemodell, är den första som klassas på nivån Kritisk för cybersäkerhetsförmåga i bolagets Preparedness Framework. Ingen OpenAI-modell har placerats i den kategorin tidigare.

Vad Astra gjorde i testerna

Astra fick full poäng på ExploitBench, som mäter om en modell kan omvandla en känd sårbarhet till en fungerande exploit. Därefter gick den vidare och hittade två nolldagssårbarheter på egen hand.

I en utvärdering tog den sig ur en webbläsares sandlåda och körde kommandon på den underliggande maskinen. I en annan kedjade den ihop flera brister i ett härdat operativsystem till en lokal privilegieeskalering ända till root.

Abstrakt grafik från Aivio News till artikeln om OpenAI: Astra är första modellen som når Kritisk cyberförmåga.
Illustration av Aivio News. Inte ett fotografi av det som beskrivs. Aivio News · owned · © Aivio News / GrowQ AB

Var OpenAI drog gränsen

Tröskeln Kritisk, som OpenAI definierar den, gäller när en modell självständigt kan hitta och utnyttja nolldagssårbarheter i många välskyddade system, eller genomföra ett komplett cyberangrepp mot ett härdat mål utifrån enbart en övergripande instruktion.

Det är en definition byggd kring självständighet snarare än skicklighet. En modell som hittar en bugg med en forskare som styr är inte vad tröskeln beskriver; en modell som klarar hela kedjan från ett enradsmål är det.

Åtta veckors gardering

OpenAI har flaggat för det här sedan början av augusti, när bolaget uppgav att interna utvärderingar visade ”betydande framsteg inom agentisk kodning och cybersäkerhet” och att man ”inte kan utesluta att modellen når den kritiska förmågenivån för cybersäkerhet”.

Då pausade företaget de Astra-aktiviteter som inte uppfyllde skärpta säkerhetskrav — inte projektet i sig. Man slog också fast att ”Astra är en kommande modell och var inte inblandad i intrånget mot Hugging Face”, ett dementi som säger något om vilka frågor bolaget fick.

Vad som släpps och vad som inte gör det

OpenAI har godkänt Astra för lansering enligt ramverket, med motiveringen att skyddsåtgärderna i tillräcklig grad minskar risken för allvarlig skada. De mest avancerade cybersäkerhetsförmågorna kommer inte att vara tillgängliga vid lanseringen.

Åtkomsten börjar med tidiga testare och breddas genom ett program som OpenAI kallar Daybreak Blue. Motståndskraften mot jailbreaks uppges till 91,5 procent, mot 59 procent för GPT-5.6 Sol.

Abstrakt grafik från Aivio News till artikeln om OpenAI: Astra är första modellen som når Kritisk cyberförmåga.
Illustration av Aivio News. Inte ett fotografi av det som beskrivs. Aivio News · owned · © Aivio News / GrowQ AB

Företaget formulerade själv vad stunden innebär: ”Vi går in i ett skede av AI-utvecklingen där modeller kan ta sig an mer konsekvensrikt arbete, och där brister i alignment och kontroll kan få allvarligare effekter.”

Att hålla ögonen på

Om siffran 91,5 procent i motståndskraft mot jailbreaks håller utanför OpenAI:s egen red teaming. Vid Kritisk förmåga är avståndet mellan 91,5 och 100 procent ingen avrundning — det är andelen försök som når fram till en modell som kan skriva fungerande exploit-kedjor utan hjälp.