Hva OpenAI slår på

OpenAI kunngjorde mandag at selskapet i løpet av de kommende ukene legger inn et usynlig vannmerke i tekst som ChatGPT og Codex produserer i EU, på alle abonnement. Fra samme dag kan API-kunder hvor som helst i verden slå på vannmerking for utvalgte modeller. I API-et er den avslått som standard, og selskapet opplyste at det “ikke gjør vannmerking av tekst til en global standard ved lansering”.

Utløseren er EUs KI-forordning, som krever at leverandører av generativ KI gjør maskingenerert tekst identifiserbar på en maskinlesbar måte. OpenAI åpner også for søknader om tilgang til detektoren, som gis fra sak til sak til godkjente forskere og ekspertorganisasjoner i tråd med EUs atferdskodeks. Den blir ikke offentlig tilgjengelig.

textGrain, og hva det gjør med modellen

Teknologien heter textGrain og virker ved å legge et usynlig statistisk signal inn i modellens ordvalg. OpenAI opplyste at textGrain matchet eller overgikk de andre metodene selskapet testet, blant dem Googles SynthID for tekst, og at det planlegger å slippe teknologien som åpen kildekode.

Tastaturet på en bærbar PC fotografert tett på et skrivebord
Merket legger et statistisk signal inn i modellens ordvalg. Illustrasjonsfoto. Christian Naccarato · pexels · Pexels License

Selskapet publiserte testresultater for Astra med og uten vannmerket og rapporterte ingen meningsfull forskjell: 49,57 mot 49,76 poeng på Artificial Analysis Intelligence Index, 94,44 mot 93,94 prosent på GPQA Diamond og 53,90 mot 56,06 prosent på Terminal-Bench 4.0. Dette er OpenAIs egne tall for selskapets egen modell.

Tallene som undergraver ideen

Det mest interessante i innlegget er hvor åpent det omtaler begrensningene. Ved en målsatt rate på 1 prosent falske positive opplyste OpenAI at detektoren fant vannmerket i omtrent 80 prosent av avsnitt på 200 tokens og omtrent 95 prosent av avsnitt på 400 tokens for innhold som psykologi. For matematikk, der ordvalget er mer bundet, var oppdagelsen vesentlig lavere.

Redigering bryter det ned raskere. I en vurdering av avsnitt på 400 tokens senket bytte av 10 prosent av ordene til synonymer oppdagelsen fra omtrent 92 til 66 prosent. Bytte av 25 prosent tok den til 17 prosent. Det er tallet å holde fast ved: en lett omskriving slår ut merket.

EU-flagg som vaier utenfor en bygning
Kravet kommer fra EUs KI-forordning. Illustrasjonsfoto. Christian Wasserfallen · pexels · Pexels License

OpenAI er tydelig på at et treff ikke måler menneskelig bidrag, ikke fastslår eierskap eller ansvar, ikke identifiserer brukeren og ikke bekrefter riktighet — og at fravær av vannmerke ikke beviser at et menneske skrev teksten, siden den kan være for kort, redigert, oversatt, fra en modell som ikke støttes, eller fra et annet selskaps verktøy.

Hva man skal følge med på

Selskapet bruker allerede Content Credentials på støttede bilder, følger C2PA og legger inn SynthID-merker i støttede bilder og lyd, med offentlige verktøy for å kontrollere begge. Tekst er den delen som motsetter seg metoden, fordi tekst er det folk skriver om. Det neste å følge er den oppdaterte tekniske rapporten, slippet av åpen kildekode, og om tilgangen til detektoren utvides utover den godkjente listen.