Hva brevet er
Tre sikkerhets- og alignmentforskere som OpenAI sa opp i forrige uke, publiserte et åpent brev torsdag stilet til selskapets sikkerhetskomité, dets rådgivende sikkerhetsgruppe og dets rådgivende misjonsråd. Det er undertegnet av Tomek Korbak, Jasmine Wang og Mikita Balesni, og har tittelen “OpenAI cannot make AI safe on its own”.
OpenAI har sagt at de tre brøt selskapets regler ved å skaffe seg tilgang til og håndtere sensitiv bedriftsinformasjon, og en talsperson sa til TechCrunch at en gransking fant et mønster av kritikkverdig atferd som gikk lenger enn å dele informasjon med en ekstern evalueringsgruppe. Selskapet har ikke sagt hvilke regler.
Hva de avviser
Brevet avviser at de tre var kilden til en lekkasje til The Information om nye, mindre overvåkbare arkitekturer. “Vi vet ikke hvem det var”, heter det. “Vi hadde ingen grunn til å lekke det; tvert imot undergravde artikkelen vårt eget arbeid med grenser på tvers av selskaper for utvikling av ikke-overvåkbare arkitekturer.”
Det avviser at noen av dem hadde kontakt med utenforstående utover mandatet i jobben. Om Korbak heter det at granskingen av Hugging Face-hendelsen var “uten presedens, og interne retningslinjer ble utviklet i sanntid”. Om Balesni at han koordinerte med styremedlemmer og toppledelsen og “var nøye med å fjerne sensitive detaljer fra materialet før han delte det”. Om Wang at tilgangen hennes til en leders e-post var delegert til henne for rekruttering, at hun ba om å få den fjernet, og at IT ikke gjorde det.

Argumentet om alle andre
Kjernen i brevet er ikke de tre oppsigelsene. Det er hva oppsigelsene signaliserte til dem som fortsatt jobber der.
“Hvis atferd som ble regnet som normal i forrige måned nå utgjør grunnlag for plutselig oppsigelse, sitter alle i OpenAI igjen og gjetter på hvor grensen går”, heter det. Brevet hevder at oppsigelser “gjennomført og kommunisert så brått kjøler ned den åpne kulturen OpenAI har satt pris på tidligere”, og at friheten til å arbeide med eksterne eksperter uten frykt “i seg selv er en nødvendig sikkerhetsmekanisme”. Det legger til: “KI er ikke en normal teknologi, og OpenAI er ikke et normalt selskap.”
Tre krav
For det første at OpenAI innfrir forrige måneds offentlige løfte om å innlemme eksterne sikkerhetsrevisorer, og at “oppsigelsen vår ikke skal brukes som påskudd for å trekke seg fra de samarbeidene”. Brevet sier forfatterne frykter at oppsigelsene brukes til å begrunne en slutt på arbeidet med METR eller til å snevre inn eksterne revisorers tilgang.
For det andre at OpenAI bevarer overvåkbarheten til frontmodeller. Brevet sier den svekkes, og siterer offentlige uttalelser fra innsiden om at overvåking av tankerekken er “skjør og dessverre på vei i en negativ retning”. Standpunktet er at så lenge sikkerheten hviler på overvåkbarhet, bør ingen frontlab sende ut arkitekturer som reduserer den.
For det tredje at selskapet holder en åpen kanal mellom sine sikkerhetsforskere og det bredere sikkerhetsmiljøet. Brevet ber om å bli spredt internt.

OpenAIs posisjon
OpenAI har ikke svart formelt på brevet. Selskapet delte et internt notat fra en forskningsleder som roser de tre og slår fast: “Jeg vil være veldig tydelig på at disse beslutningene ikke handlet om å ta opp sikkerhetsbekymringer eller si fra.” Notatet sier at selskapet ikke sier opp ansatte for å ta opp bekymringer, og at det er enig i anbefalingene.
Dette bør følges
Om METRs tilgang til OpenAIs modeller endres, og om selskapet offentlig gjentar forpliktelsen det ga i september om å gi uavhengige evaluatorer løpende tilgang på linje med ansatte. Det er det eneste kravet i brevet med et etterprøvbart svar.