Hvad brevet er
Tre sikkerheds- og alignmentforskere, som OpenAI fyrede i sidste uge, offentliggjorde et åbent brev torsdag stilet til selskabets sikkerhedsudvalg, dets rådgivende sikkerhedsgruppe og dets rådgivende missionsråd. Det er underskrevet af Tomek Korbak, Jasmine Wang og Mikita Balesni og har titlen “OpenAI cannot make AI safe on its own”.
OpenAI har oplyst, at de tre overtrådte selskabets regler ved at tilgå og håndtere følsomme virksomhedsoplysninger, og en talsperson sagde til TechCrunch, at en undersøgelse fandt et mønster af forsømmelser, der gik videre end at dele oplysninger med en ekstern evalueringsgruppe. Selskabet har ikke sagt hvilke regler.
Hvad de afviser
Brevet afviser, at de tre var kilden til et læk til The Information om nye, mindre overvågbare arkitekturer. “Vi ved ikke, hvem det var”, står der. “Vi havde ingen grund til at lække det; tværtimod undergravede artiklen vores eget arbejde med fælles grænser på tværs af selskaber for udvikling af ikke-overvågbare arkitekturer.”
Det afviser, at nogen af dem havde kontakt med udenforstående ud over deres jobmandat. Om Korbak hedder det, at undersøgelsen af Hugging Face-hændelsen var “uden fortilfælde, og interne regler blev udviklet undervejs”. Om Balesni, at han koordinerede med bestyrelsesmedlemmer og topledelsen og “var omhyggelig med at fjerne følsomme detaljer fra materialet, før han delte det”. Om Wang, at hendes adgang til en direktørs mail var delegeret til hende til rekruttering, at hun bad om at få den fjernet, og at it-afdelingen ikke gjorde det.

Argumentet om alle de andre
Kernen i brevet er ikke de tre fyringer. Det er, hvad fyringerne signalerede til dem, der stadig arbejder der.
“Hvis adfærd, der blev betragtet som normal i sidste måned, nu udgør grundlag for pludselig afskedigelse, sidder alle i OpenAI tilbage og gætter på, hvor grænsen går”, står der. Brevet hævder, at opsigelser “gennemført og kommunikeret så brat køler den åbne kultur ned, som OpenAI tidligere har værnet om”, og at friheden til at arbejde med eksterne eksperter uden frygt “i sig selv er en nødvendig sikkerhedsmekanisme”. Det tilføjer: “AI er ikke en normal teknologi, og OpenAI er ikke en normal virksomhed.”
Tre krav
For det første at OpenAI indfrier sidste måneds offentlige løfte om at indlejre eksterne sikkerhedsrevisorer, og at “vores fyring ikke bruges som påskud for at trække sig fra de samarbejder”. Brevet siger, at forfatterne frygter, at fyringerne bruges til at begrunde en afslutning på arbejdet med METR eller til at indsnævre eksterne revisorers adgang.
For det andet at OpenAI bevarer overvågbarheden af frontmodeller. Brevet siger, at den forringes, og citerer offentlige udtalelser indefra om, at overvågning af tankekæden er “skrøbelig og desværre på vej i en negativ retning”. Holdningen er, at så længe sikkerheden hviler på overvågbarhed, bør intet frontlaboratorium udsende arkitekturer, der mindsker den.
For det tredje at selskabet holder en åben kanal mellem sine sikkerhedsforskere og det bredere sikkerhedsmiljø. Brevet beder om at blive delt bredt internt.

OpenAIs position
OpenAI har ikke svaret formelt på brevet. Selskabet delte et internt notat fra en forskningsleder, der roser de tre og fastslår: “Jeg vil være meget tydelig: disse beslutninger handlede ikke om at rejse sikkerhedsbekymringer eller sige fra.” Notatet siger, at selskabet ikke afskediger medarbejdere for at rejse bekymringer, og at det er enigt i anbefalingerne.
Det skal følges
Om METRs adgang til OpenAIs modeller ændrer sig, og om selskabet offentligt gentager den forpligtelse, det gav i september, om at give uafhængige evaluatorer løbende adgang på linje med ansattes. Det er det eneste krav i brevet med et svar, der kan efterprøves.