Tidligere enn uken før lansering

OpenAI publiserte tirsdag et dokument som beskriver hvordan selskapet vil at eksterne organisasjoner skal vurdere modellene deres. Selskapet kaller det prioriteringer og prinsipper for grundige, sikre og uavhengige eksterne sikkerhetsvurderinger av frontmodeller og sikringstiltakene rundt dem.

Det vesentlige er en tidsforskyvning. Til nå har eksterne grupper blitt koblet inn kort tid før en modell slippes, for å vurdere noe som allerede er nær ferdig. OpenAI sier nå at vurderere kan arbeide under trening, evaluering og utrulling, meldte Bloomberg tirsdag.

Det betyr noe, fordi en vurdering før lansering kommer etter at alle dyre beslutninger er tatt. En vurderer som ser treningskjøringen, kan stille spørsmål ved valg som fortsatt kan gjøres om.

Hvem som kan gjøre det

OpenAI sier selskapet er i samtaler med blant andre METR og Redwood Research, ifølge The Next Web, som skrev at ingen formell avtale er bekreftet og ingen tidsplan opplyst. Begge organisasjonene har tidligere sett på en hendelse der en OpenAI-modell nådde systemer på Hugging Face den ikke skulle nå.

Lama Ahmad, som leder OpenAIs kontakt med eksterne sikkerhetseksperter, listet opp vilkårene selskapet mener slike gjennomganger krever: mekanismer for uavhengighet, vitenskapelig grundighet, sikkerhetsrutiner og klart ansvar. OpenAI sier også at noen vurderere kan arbeide fra selskapets kontorer i de mest følsomme fasene.

Folk i møte rundt et bord på et kontor
OpenAI sier noen vurderere kan arbeide fra selskapets kontorer. Illustrasjonsbilde. Matheus Bertelli · pexels · Pexels License

Vagere enn det Altman lovet

The Next Web påpekte at kunngjøringen er løsere enn forpliktelsen Sam Altman ga ti dager tidligere, da han beskrev uavhengige vurderere med pulter, adgangskort og maskiner, og med rett til å publisere. Tirsdagens dokument nevner kontoradgang for det mest følsomme arbeidet, men fastsetter verken adgangsvilkår, publiseringsrett eller en navngitt partner.

Avstanden mellom de to utsagnene er hele spørsmålet. En vurderer med adgangskort og uten publiseringsrett er en konsulent. En vurderer med publiseringsrett er en kontroll.

Sammenligningen ved siden av

OpenAI er ikke det eneste laboratoriet som legger om dette. Forrige uke utpekte Anthropic Accenture som ekstern vurderer, i en ordning der hver part legger inn én milliard dollar, samtidig som selskapet erkjente at det å betale sin egen eksaminator skaper et insentivproblem.

En person som skriver på et skriveunderlag inne i et industrianlegg
Ingen partner er navngitt og ingen tidsplan opplyst. Illustrasjonsbilde. Daniel Andraski · pexels · Pexels License

Europa har en annen modell for samme oppgave. Ved samsvarsvurdering er organet som sertifiserer et produkt akkreditert av en tilsynsmyndighet i stedet for engasjert av produsenten, og er ikke avhengig av produsenten for neste oppdrag. Ingenting som hittil er kunngjort av noen av de amerikanske laboratoriene fungerer slik.

Hva man bør følge med på

Tre ting vil vise om dette er en styringsendring eller en kommunikasjonsøvelse: om en partner faktisk navngis, om den partneren kan publisere funn uten OpenAIs godkjenning, og om vurdererne får innsyn i treningsbeslutninger framfor en plass i rommet der ferdige modeller vises fram.