Tidligere end ugen før lancering

OpenAI offentliggjorde tirsdag et dokument, der beskriver, hvordan selskabet ønsker, at eksterne organisationer vurderer dets modeller. Selskabet kalder det prioriteter og principper for grundige, sikre og uafhængige eksterne sikkerhedsvurderinger af frontmodeller og deres sikkerhedsforanstaltninger.

Det væsentlige er en tidsforskydning. Hidtil er eksterne grupper blevet hentet ind kort før en model udsendes, for at vurdere noget, der allerede er tæt på færdigt. OpenAI siger nu, at vurderingsorganer kan arbejde under træning, evaluering og udrulning, skrev Bloomberg tirsdag.

Det betyder noget, fordi en vurdering før lancering kommer, efter at alle dyre beslutninger er truffet. En vurderer, der kan se træningskørslen, kan stille spørgsmål til valg, der stadig kan laves om.

Hvem der kan gøre det

OpenAI siger, at selskabet er i dialog med blandt andre METR og Redwood Research, ifølge The Next Web, der skrev, at intet formelt samarbejde er bekræftet, og ingen tidsplan oplyst. Begge organisationer har tidligere undersøgt en hændelse, hvor en OpenAI-model nåede systemer på Hugging Face, som den ikke skulle nå.

Lama Ahmad, der leder OpenAI’s kontakt til eksterne sikkerhedseksperter, opregnede de betingelser, selskabet mener sådanne gennemgange kræver: mekanismer for uafhængighed, videnskabelig stringens, sikkerhedspraksis og klart ansvar. OpenAI tilføjer, at nogle vurderingsorganer kan arbejde fra selskabets kontorer i de mest følsomme faser.

Folk til møde omkring et bord på et kontor
OpenAI siger, at nogle vurderingsorganer kan arbejde fra selskabets kontorer. Illustrationsbillede. Matheus Bertelli · pexels · Pexels License

Mindre konkret end det, Altman lovede

The Next Web bemærkede, at meldingen er løsere end den forpligtelse, Sam Altman gav ti dage tidligere, da han beskrev uafhængige vurderingsorganer med skriveborde, adgangskort og computere, og med ret til at publicere. Tirsdagens dokument nævner kontoradgang til det mest følsomme arbejde, men fastlægger hverken adgangsvilkår, publiceringsret eller en navngiven partner.

Afstanden mellem de to udmeldinger er hele spørgsmålet. En vurderer med adgangskort og uden ret til at publicere er en konsulent. En vurderer med ret til at publicere er en kontrol.

Sammenligningen ved siden af

OpenAI er ikke det eneste laboratorium, der lægger om. I sidste uge udpegede Anthropic Accenture som ekstern vurderer i en aftale, hvor hver part lægger en milliard dollar, samtidig med at selskabet erkendte, at det at betale sin egen eksaminator skaber et incitamentsproblem.

En person, der skriver på en klemplade inde i et industrianlæg
Ingen partner er nævnt, og ingen tidsplan er oplyst. Illustrationsbillede. Daniel Andraski · pexels · Pexels License

Europa har en anden model til samme opgave. Ved overensstemmelsesvurdering er det organ, der certificerer et produkt, akkrediteret af en myndighed frem for hyret af producenten, og det afhænger ikke af producenten for sin næste opgave. Intet af det, de to amerikanske laboratorier hidtil har meldt ud, fungerer sådan.

Hvad man skal holde øje med

Tre ting vil vise, om dette er en styringsændring eller en kommunikationsøvelse: om en partner rent faktisk bliver nævnt, om den partner må offentliggøre sine fund uden OpenAI’s godkendelse, og om vurderingsorganerne får adgang til træningsbeslutninger frem for en plads i lokalet, hvor færdige modeller vises frem.