Hvad OpenAI slår til
OpenAI meddelte mandag, at selskabet i løbet af de kommende uger lægger et usynligt vandmærke i tekst, som ChatGPT og Codex producerer i EU, på alle abonnementer. Fra samme dag kan API-kunder hvor som helst i verden slå vandmærkning til for udvalgte modeller. I API’et er den slået fra som standard, og selskabet oplyste, at det “ikke gør vandmærkning af tekst til en global standard ved lanceringen”.
Udløseren er EU’s AI-forordning, som kræver, at leverandører af generativ AI gør maskingenereret tekst identificerbar på en maskinlæsbar måde. OpenAI åbner også for ansøgninger om adgang til detektoren, der gives fra sag til sag til godkendte forskere og ekspertorganisationer i tråd med EU’s adfærdskodeks. Den bliver ikke offentligt tilgængelig.
textGrain, og hvad det gør ved modellen
Teknologien hedder textGrain og virker ved at lægge et usynligt statistisk signal ind i modellens ordvalg. OpenAI oplyste, at textGrain matchede eller overgik de andre metoder, selskabet testede, heriblandt Googles SynthID til tekst, og at man planlægger at udgive teknologien som open source.

Selskabet offentliggjorde testresultater for Astra med og uden vandmærket og rapporterede ingen meningsfuld forskel: 49,57 mod 49,76 point på Artificial Analysis Intelligence Index, 94,44 mod 93,94 procent på GPQA Diamond og 53,90 mod 56,06 procent på Terminal-Bench 4.0. Det er OpenAI’s egne tal for selskabets egen model.
Tallene, der undergraver idéen
Det mest interessante i opslaget er, hvor åbent det beskriver begrænsningerne. Ved en målsat rate på 1 procent falske positive oplyste OpenAI, at detektoren fandt vandmærket i omkring 80 procent af passager på 200 tokens og omkring 95 procent af passager på 400 tokens for indhold som psykologi. For matematik, hvor ordvalget er mere bundet, var opdagelsen betydeligt lavere.
Redigering nedbryder det hurtigere. I en vurdering af passager på 400 tokens sænkede udskiftning af 10 procent af ordene med synonymer opdagelsen fra omkring 92 til 66 procent. Udskiftning af 25 procent tog den til 17 procent. Det er tallet, man skal holde fast i: en let omskrivning slår mærket ud.

OpenAI er tydelig om, at et fund ikke måler menneskeligt bidrag, ikke fastslår ejerskab eller ansvar, ikke identificerer brugeren og ikke bekræfter rigtighed — og at fravær af et vandmærke ikke beviser, at et menneske skrev teksten, da den kan være for kort, redigeret, oversat, fra en model uden understøttelse eller fra et andet selskabs værktøjer.
Hvad man skal følge
Selskabet bruger allerede Content Credentials på understøttede billeder, følger C2PA og indlejrer SynthID-mærker i understøttede billeder og lyd, med offentlige værktøjer til at kontrollere begge. Tekst er den del, der modsætter sig metoden, fordi tekst er det, folk skriver om. Det næste at følge er den opdaterede tekniske rapport, udgivelsen som open source, og om adgangen til detektoren udvides ud over den godkendte liste.