OpenAI oplyser, at Astra, selskabets næste frontlinjemodel, er den første, der klassificeres på niveauet Kritisk for cybersikkerhedsevne i selskabets Preparedness Framework. Ingen OpenAI-model har tidligere været placeret i den kategori.

Hvad Astra gjorde i testene

Astra fik fuld score på ExploitBench, som måler, om en model kan omsætte en kendt sårbarhed til en fungerende exploit. Derefter gik den videre og fandt to nuldagssårbarheder på egen hånd.

I én evaluering slap den ud af en browsers sandkasse og kørte kommandoer på den underliggende maskine. I en anden kædede den flere svagheder i et hærdet styresystem sammen til en lokal privilegieeskalering helt til root.

Abstrakt grafik fra Aivio News til artiklen om OpenAI: Astra er første model, der når Kritisk cyberevne.
Illustration af Aivio News. Ikke et fotografi af det beskrevne. Aivio News · owned · © Aivio News / GrowQ AB

Hvor OpenAI trak grænsen

Tærsklen Kritisk gælder, som OpenAI definerer den, når en model selvstændigt kan finde og udnytte nuldagssårbarheder i mange velbeskyttede systemer, eller gennemføre et komplet cyberangreb mod et hærdet mål ud fra blot en overordnet instruks.

Det er en definition bygget om selvstændighed frem for dygtighed. En model, der finder en fejl med en forsker ved roret, er ikke det, tærsklen beskriver; en model, der klarer hele kæden ud fra et mål på én linje, er.

Otte ugers forbehold

OpenAI har varslet det siden begyndelsen af august, da selskabet oplyste, at interne evalueringer viste “betydelige fremskridt inden for agentisk kodning og cybersikkerhed”, og at det “ikke kan udelukke, at modellen når det kritiske evneniveau for cybersikkerhed”.

Dengang satte selskabet de Astra-aktiviteter på pause, der ikke opfyldte skærpede sikkerhedskrav — ikke selve projektet. Det slog også fast, at “Astra er en kommende model og var ikke involveret i udnyttelsen af Hugging Face”, et dementi, der siger noget om de spørgsmål, selskabet fik.

Hvad der udkommer, og hvad der ikke gør

OpenAI har godkendt Astra til udgivelse under rammeværket med den begrundelse, at sikkerhedsforanstaltningerne i tilstrækkelig grad reducerer risikoen for alvorlig skade. De mest avancerede cybersikkerhedsevner vil ikke være tilgængelige ved lanceringen.

Adgangen begynder med tidlige testere og udvides gennem et program, OpenAI kalder Daybreak Blue. Modstandsdygtigheden over for jailbreaks opgives til 91,5 procent mod 59 procent for GPT-5.6 Sol.

Abstrakt grafik fra Aivio News til artiklen om OpenAI: Astra er første model, der når Kritisk cyberevne.
Illustration af Aivio News. Ikke et fotografi af det beskrevne. Aivio News · owned · © Aivio News / GrowQ AB

Selskabet formulerede selv, hvad øjeblikket indebærer: “Vi træder ind i en fase af AI-udviklingen, hvor modeller kan påtage sig mere konsekvensfyldt arbejde, og hvor svigt i alignment og kontrol kan få alvorligere følger.”

Hvad man skal holde øje med

Om tallet på 91,5 procents modstandsdygtighed over for jailbreaks holder uden for OpenAIs egen red teaming. Ved Kritisk evne er afstanden mellem 91,5 og 100 procent ingen afrunding — det er den andel af forsøg, der når frem til en model, som kan skrive fungerende exploit-kæder uden hjælp.