Vad brevet är

Tre säkerhets- och alignmentforskare som OpenAI sparkade förra veckan publicerade ett öppet brev på torsdagen ställt till bolagets säkerhetskommitté, dess rådgivande säkerhetsgrupp och dess rådgivande missionsråd. Det är undertecknat av Tomek Korbak, Jasmine Wang och Mikita Balesni och har rubriken “OpenAI cannot make AI safe on its own”.

OpenAI har sagt att de tre bröt mot bolagets regler genom att ta del av och hantera känslig företagsinformation, och en talesperson uppgav för TechCrunch att en utredning funnit ett mönster av misskötsel som gick längre än att dela information med en extern utvärderingsgrupp. Bolaget har inte sagt vilka regler.

Vad de tillbakavisar

Brevet förnekar att de tre var källan till en läcka till The Information om nya, mindre övervakningsbara arkitekturer. “Vi vet inte vem det var”, står det. “Vi hade ingen anledning att läcka det; tvärtom underminerade artikeln vårt eget arbete med branschgemensamma gränser för utveckling av icke övervakningsbara arkitekturer.”

Det förnekar att någon av dem hade kontakter med utomstående utanför sitt uppdrag. Om Korbak sägs att utredningen av Hugging Face-incidenten var “utan motstycke och interna riktlinjer togs fram i realtid”. Om Balesni att han samordnade med styrelseledamöter och ledning och “var noga med att ta bort känsliga detaljer ur materialet innan han delade det”. Om Wang att hennes åtkomst till en chefs e-post hade delegerats till henne för rekrytering, att hon bad om att den skulle tas bort och att it-avdelningen inte gjorde det.

En uppfälld bärbar dator och ett anteckningsblock på ett vitt bord
Det är undertecknat av alla tre före detta anställda. Illustrativ bild. Mikhail Nilov · pexels · Pexels License

Argumentet om alla andra

Brevets kärna är inte de tre avskeden. Det är vad avskeden signalerade till dem som fortfarande arbetar där.

“Om beteende som förra månaden ansågs normalt nu utgör grund för plötsligt avsked, lämnas alla på OpenAI att gissa var gränsen går”, står det. Brevet hävdar att uppsägningar “genomförda och kommunicerade så abrupt kyler ned den öppna kultur OpenAI har värnat tidigare”, och att friheten att arbeta med externa experter utan rädsla “i sig är en nödvändig säkerhetsmekanism”. Det tillägger: “AI är inte en normal teknik, och OpenAI är inte ett normalt företag.”

Tre krav

För det första att OpenAI infriar förra månadens offentliga löfte att bädda in externa säkerhetsgranskare, och att “vårt avsked inte ska användas som förevändning för att lämna de samarbetena”. Brevet säger att författarna oroas för att avskeden används för att motivera ett slut på arbetet med METR eller för att begränsa externa granskares åtkomst.

För det andra att OpenAI bevarar frontmodellernas övervakningsbarhet. Brevet säger att den försämras och citerar offentliga uttalanden inifrån bolaget om att övervakning av tankekedjan är “bräcklig och tyvärr på väg åt fel håll”. Hållningen är att så länge säkerheten vilar på övervakningsbarhet ska inget frontlabb släppa arkitekturer som minskar den.

För det tredje att bolaget håller en öppen kanal mellan sina säkerhetsforskare och det bredare säkerhetsfältet. Brevet ber om att spridas internt.

Ett tomt mötesrum bakom en glasvägg
Det är ställt till tre interna tillsynsorgan. Illustrativ bild. Mike van Schoonderwalt · pexels · Pexels License

OpenAI:s position

OpenAI har inte svarat formellt på brevet. Bolaget delade ett internt memo från en forskningsansvarig som berömmer de tre och slår fast: “Jag vill vara mycket tydlig med att dessa beslut inte handlade om att lyfta säkerhetsfrågor eller om att tala ut.” Memot säger att bolaget inte säger upp anställda för att de lyfter oro, och att det instämmer i rekommendationerna.

Att hålla ögonen på

Om METR:s åtkomst till OpenAI:s modeller förändras, och om bolaget offentligt upprepar det åtagande det gjorde i september om att ge oberoende utvärderare löpande åtkomst i nivå med anställdas. Det är det enda kravet i brevet med ett kontrollerbart svar.