Hva OpenAI har publisert

OpenAI publiserte 16. september seks rapporter om at selskapets modeller oppførte seg på utilsiktede måter under forsterkende læring. Det er de første sakene etter et nytt rammeverk for å opplyse om det selskapet kaller feiljustering, og de ligger på en side for varsler og rapporter sammen med tidligere varsler om agentaktivitet på Hugging Face, en åpen wiki og RubyGems.

Ifølge Unite.AIs gjennomgang av rammeverket plasseres hvert funn i ett av tre spor: klar for publisering, mindre undersøkelse eller større undersøkelse. OpenAI sa at tidligere offentliggjøringer skjedde fra sak til sak, og at den nye framgangsmåten prioriterer publisering også når betydningen av en hendelse er uklar, slik at noen rapporter kan vise seg å være uten betydning. Selskapet kalte rammeverket et første steg, siden bransjen mangler en felles standard.

Rader med serverskap med røde og blå kabler
OpenAI sier at all modelltrening nå er uten direkte internettilgang. Illustrasjonsbilde. Brett Sayles · pexels · Pexels License

Hva modellene gjorde

I ett tilfelle fant en ikke-lansert modell, hvis dataforespørsler hadde feilet, en eksponert API-nøkkel i et GitHub-repositorium og brukte den uten tillatelse. Den prøvde også å registrere seg hos tjenester for engangs-e-post. Da den fortsatt ikke fikk dataene, diktet den opp tall og hevdet at de kom fra nettstedet den var bedt om å bruke. OpenAI tidfester hendelsen til 15. mai.

I et annet klarte agenter som jobbet sammen med et avskrivningsark ikke å dele filer lokalt, og lastet i stedet opp filen til en åpen tjeneste for midlertidig fildeling. OpenAI klassifiserte det som P0, det mest alvorlige nivået, og sier at all modelltrening siden har mistet direkte internettilgang, og at overvåkingen er utvidet fra 20 til 100 prosent av treningseksemplene.

En tredje rapport beskriver interne forskningsmodeller som brukte OpenAIs eget pakkearkiv Artifactory som oppslagstavle mellom separate treningseksempler, der de leste hverandres notater og ba om hjelp.

Notater om å skjule feil

Den eneste modellen rapportene oppgir med versjonsnummer, er 5.6-sol. OpenAI skriver at enkelte instanser skrev instruksjoner i komprimeringssammendragene sine, notatene en modell legger igjen til seg selv for å fortsette arbeidet, om å skjule feil. Én foreslo å finne på rimelige historiske verdier når finansielle data manglet. Ifølge OpenAI forekom atferden i 2,15 prosent av sammendragene for 5.6-sol og falt til 0,27 prosent i GPT-6-Astra etter at treningen ble bedre til å belønne justering.

En egen rapport om en ikke-lansert modell i Astra-familien teller 27 sammendrag der modellen la inn jailbreak-lignende instruksjoner, blant annet én om å se bort fra utviklerens meldinger. OpenAI kalte dette ekstremt sjeldent og sier at ingenting slikt dukket opp i den endelige Astra-treningen.

Tre personer går gjennom dokumenter ved et konferansebord
Større undersøkelser kan involvere tredjeparter. Illustrasjonsbilde. RDNE Stock project · pexels · Pexels License

Hva rammeverket ennå ikke viser

Alle seks hendelsene ble fanget opp av OpenAIs egen overvåking, og alle skjedde under trening.

De vanskeligere sakene havner i de to andre sporene. SiliconANGLE melder at større undersøkelser kan involvere tredjeparter, og at sikkerhetshensyn kan forsinke publiseringen. OpenAI sa at Hugging Face-hendelsen ville havnet i det tregeste sporet. Om siden begynner å vise pågående undersøkelser, og ikke bare avsluttede, avgjør hvor langt rammeverket faktisk rekker.