OpenAI opplyser at Astra, selskapets neste frontlinjemodell, er den første som klassifiseres på nivået Kritisk for cybersikkerhetsevne i selskapets Preparedness Framework. Ingen OpenAI-modell har vært plassert i den kategorien tidligere.
Hva Astra gjorde i testene
Astra fikk full score på ExploitBench, som måler om en modell kan gjøre en kjent sårbarhet om til en fungerende exploit. Deretter gikk den videre og fant to nulldagssårbarheter på egen hånd.
I én evaluering slapp den ut av en nettlesers sandkasse og kjørte kommandoer på den underliggende maskinen. I en annen kjedet den sammen flere svakheter i et herdet operativsystem til en lokal privilegieeskalering helt til root.

Hvor OpenAI satte grensen
Terskelen Kritisk, slik OpenAI definerer den, gjelder når en modell selvstendig kan finne og utnytte nulldagssårbarheter i mange godt beskyttede systemer, eller gjennomføre et komplett cyberangrep mot et herdet mål ut fra bare en overordnet instruks.
Det er en definisjon bygget rundt selvstendighet framfor dyktighet. En modell som finner en feil med en forsker som styrer, er ikke det terskelen beskriver; en modell som klarer hele kjeden fra et mål på én linje, er det.
Åtte uker med forbehold
OpenAI har varslet dette siden begynnelsen av august, da selskapet sa at interne evalueringer viste «betydelige framskritt innen agentisk koding og cybersikkerhet», og at det «ikke kan utelukke at modellen når det kritiske evnenivået for cybersikkerhet».
Da satte selskapet på pause de Astra-aktivitetene som ikke oppfylte skjerpede sikkerhetskrav — ikke prosjektet i seg selv. Det slo også fast at «Astra er en kommende modell og var ikke involvert i utnyttelsen av Hugging Face», en avkreftelse som sier noe om spørsmålene selskapet fikk.
Hva som lanseres og hva som ikke gjør det
OpenAI har klarert Astra for lansering under rammeverket, med den begrunnelse at sikkerhetstiltakene i tilstrekkelig grad reduserer risikoen for alvorlig skade. De mest avanserte cybersikkerhetsevnene vil ikke være tilgjengelige ved lansering.
Tilgangen starter med tidlige testere og utvides gjennom et program OpenAI kaller Daybreak Blue. Motstandsdyktigheten mot jailbreak oppgis til 91,5 prosent, mot 59 prosent for GPT-5.6 Sol.

Selskapet formulerte selv hva øyeblikket innebærer: «Vi går inn i en fase av KI-utviklingen der modeller kan påta seg mer konsekvensrikt arbeid, og der svikt i alignment og kontroll kan få alvorligere følger.»
Å følge med på
Om tallet 91,5 prosent motstandsdyktighet mot jailbreak holder utenfor OpenAIs egen red teaming. Ved Kritisk evne er avstanden mellom 91,5 og 100 prosent ingen avrunding — det er andelen forsøk som når fram til en modell som kan skrive fungerende exploit-kjeder uten hjelp.