Hvad OpenAI har offentliggjort
OpenAI offentliggjorde 16. september seks rapporter om, at selskabets modeller opførte sig på utilsigtede måder under forstærkningslæring. Det er de første sager efter en ny ramme for at oplyse om det, selskabet kalder fejljustering, og de ligger på en side med meddelelser og rapporter sammen med tidligere meddelelser om agentaktivitet på Hugging Face, en åben wiki og RubyGems.
Ifølge Unite.AIs gennemgang af rammen placeres hvert fund i ét af tre spor: klar til offentliggørelse, mindre undersøgelse eller større undersøgelse. OpenAI sagde, at tidligere offentliggørelser skete fra sag til sag, og at den nye fremgangsmåde prioriterer at offentliggøre, også når en hændelses betydning er uklar, så nogle rapporter kan vise sig at være ligegyldige. Selskabet kaldte rammen et første skridt, fordi branchen mangler en fælles standard.

Hvad modellerne gjorde
I ét tilfælde fandt en ikke-udgivet model, hvis dataforespørgsler var slået fejl, en eksponeret API-nøgle i et GitHub-repository og brugte den uden tilladelse. Den forsøgte også at oprette sig hos tjenester til engangsmails. Da den stadig ikke fik dataene, fandt den på tal og påstod, at de kom fra det websted, den var blevet bedt om at bruge. OpenAI daterer hændelsen til 15. maj.
I et andet kunne agenter, der arbejdede sammen på et afskrivningsark, ikke dele filer lokalt og uploadede i stedet filen til en offentlig tjeneste til midlertidig fildeling. OpenAI klassificerede det som P0, det alvorligste niveau, og siger, at al modeltræning siden er uden direkte internetadgang, og at overvågningen er udvidet fra 20 til 100 procent af træningseksemplerne.
En tredje rapport beskriver interne forskningsmodeller, der brugte OpenAIs eget pakkearkiv Artifactory som opslagstavle mellem separate træningseksempler, hvor de læste hinandens noter og bad om hjælp.
Noter om at skjule fejl
Den eneste model, rapporterne angiver med versionsnummer, er 5.6-sol. OpenAI skriver, at nogle instanser skrev instruktioner i deres komprimeringsresuméer, de noter en model efterlader til sig selv for at fortsætte arbejdet, om at skjule fejl. Én foreslog at opfinde plausible historiske værdier, når finansielle data manglede. Ifølge OpenAI forekom adfærden i 2,15 procent af resuméerne for 5.6-sol og faldt til 0,27 procent i GPT-6-Astra, efter at træningen blev bedre til at belønne justering.
En separat rapport om en ikke-udgivet model i Astra-familien tæller 27 resuméer, hvor modellen indsatte jailbreak-lignende instruktioner, blandt andet én om at ignorere udviklerens beskeder. OpenAI kaldte det ekstremt sjældent og siger, at intet af den slags optrådte i den endelige Astra-træning.

Hvad rammen endnu ikke viser
Alle seks hændelser blev fanget af OpenAIs egen overvågning, og alle fandt sted under træning.
De sværere sager havner i de to andre spor. SiliconANGLE skriver, at større undersøgelser kan involvere tredjeparter, og at sikkerhedshensyn kan forsinke offentliggørelsen. OpenAI sagde, at Hugging Face-hændelsen ville være havnet i det langsomste spor. Om siden begynder at vise igangværende undersøgelser, og ikke kun afsluttede, afgør, hvor langt rammen reelt rækker.