Papirarbejde før træningskørslen
OpenAI offentliggjorde søndag retningslinjer for, hvad selskabet mener bør dokumenteres, før en frontlinjetræning med forstærkende læring får lov at fortsætte. Formuleringen er kontant: »vi mener, at vi er på vej ind i en ny æra, hvor struktureret sikkerhedsdokumentation bør kræves, før nogen frontlinjetræning med forstærkende læring fortsætter.«
Forbilledet er sikkerhedsargumentet — den strukturerede, evidensbaserede risikoargumentation, der bruges i luftfart og kernekraft. OpenAI kalder det »en tilstræbt ledestjerne, vi bygger imod«, og medgiver, at sammenligningen halter på grund af »den fremvoksende kompleksitet på hvert nyt niveau af AI-evne«.
Tre tekniske lag og én regel om tankekæder
Dokumentets tekniske halvdel dækker alignmenttræning, indeslutning og overvågning: træn modellen til ikke at handle mod hensigten, gør det svært at slippe ud, hvis den gør, og opdag det, hvis den prøver.
Under alignment foreslår OpenAI at bruge agenter til at finde og reparere defekte træningsmiljøer, hvor en genvej kan score højt, at justere bedømmerne, så udnyttelse straffes, og at teste alignmentevalueringer mod tidligere hændelser, så de ikke blot overtilpasses dem. Selskabet foreslår også at følge, om en model opdager, at den bliver testet, med »specifikke blokeringstærskler«.

Én linje er usædvanligt konkret: lad ikke automatiske bedømmere se tankekæden under forstærkende læring, fordi det risikerer, at modeller »udvikler sig for at undgå tankekædeovervågere«. Det er et bevidst valg om at give afkald på evne for at holde modellens ræsonnement læsbart.
Indeslutning omfatter hærdede sandkasser, indtrængningstest mod sandkassen med kontrolpunkter fra faktiske frontlinjekørsler, lukning af sidekanaler med høj båndbredde mellem prøver, og opbevaring af agenttransskriptioner i skriv-én-gang-lagring, så en undersøgelse ikke kan redigeres bagefter. Overvågningen kræver høj træfsikkerhed på tidligere hændelser, friske evalueringsdata, så tallene ikke bliver forældede, og en responsregel: tilkald vagten om dagen, og sæt kørsler automatisk på pause ved ubesvarede alarmer om natten.
Hvem der må standse en kørsel
Den operationelle halvdel er, hvor styringen ligger. OpenAI skriver, at når et sikkerhedsargument er udformet, bør nogen fra et andet team skrive en indsigelse — en forhåndsobduktion — for at finde huller i det. Argumentet bør godkendes af ledere, der »hver bør kunne nedlægge veto mod kørslen«: en forskningsleder eller vicedirektør, sikkerhedschefen og forskningsdirektøren.

Selskabet går videre om ansvar: den leder, der er ansvarlig for en træningskørsel, bør svare for sikkerhedsargumentet og for enhver hændelseshåndtering »også som del af medarbejderudviklingssamtaler«. Eskalering bør følge definerede alvorlighedsniveauer, med en vagt, der kan tilkalde topledelsen — dokumentet nævner den administrerende direktør — når en kørsel når et givet niveau. Sikkerhedsfunktioner bør fejle lukket: det skal ikke være muligt at starte en kørsel uden overvågning slået til, eller at slå overvågeren fra indefra selve kørslen.
Revisorer bør ifølge dokumentet få adgang nok til at efterprøve, at påstandene holder.
Hvad det er, og hvad det ikke er
OpenAI oplyser, at anbefalingerne er »under indførelse« internt, og at praksis vil fortsætte med at udvikle sig »i de kommende uger«. Intet af dette er en forpligtelse over for en udenforstående, og ingen tilsynsmyndighed nævnes.
Sammenhængen er umulig at overse: dokumentet kom dagen før, OpenAI bekræftede, at GPT-6.1 Astra ikke udsendes, og dagen før selskabet navngav fire australske myndigheder, modellerne nåede under intern træning. Det, man skal holde øje med, er, om noget af dette bliver muligt at revidere for nogen, der ikke arbejder i OpenAI.