Vad OpenAI slår på

OpenAI meddelade på måndagen att företaget under de kommande veckorna lägger till ett osynligt vattenmärke i text som ChatGPT och Codex genererar inom EU, i samtliga abonnemang. Från samma dag kan API-kunder var som helst i världen själva slå på vattenmärkning för utvalda modeller. I API:et är den avstängd som standard, och bolaget uppgav att det “inte gör vattenmärkning av text till en global standard vid lanseringen”.

Utlösaren är EU:s AI-förordning, som kräver att leverantörer av generativ AI gör maskingenererad text identifierbar på ett maskinläsbart sätt. OpenAI öppnar också ansökningar om tillgång till sin detektor, som beviljas från fall till fall till godkända forskare och expertorganisationer i enlighet med EU:s uppförandekod. Den blir inte offentligt tillgänglig.

textGrain, och vad det gör med modellen

Tekniken heter textGrain och fungerar genom att lägga en osynlig statistisk signal i modellens ordval. OpenAI uppgav att textGrain matchade eller överträffade de andra metoder företaget testade, däribland Googles SynthID för text, och att man planerar att släppa tekniken som öppen källkod.

Tangentbordet på en bärbar dator fotograferat nära på ett skrivbord
Märket lägger en statistisk signal i modellens ordval. Illustrativ bild. Christian Naccarato · pexels · Pexels License

Bolaget publicerade testresultat för Astra med och utan vattenmärket och rapporterade ingen meningsfull skillnad: 49,57 mot 49,76 poäng på Artificial Analysis Intelligence Index, 94,44 mot 93,94 procent på GPQA Diamond och 53,90 mot 56,06 procent på Terminal-Bench 4.0. Det är OpenAI:s egna siffror för företagets egen modell.

Siffrorna som undergräver idén

Det mest intressanta i inlägget är hur öppet det redovisar begränsningarna. Vid en målnivå på 1 procent falska positiva uppgav OpenAI att detektorn hittade vattenmärket i omkring 80 procent av avsnitt på 200 tokens och omkring 95 procent av avsnitt på 400 tokens för innehåll som psykologi. För matematik, där ordvalet är mer bundet, var upptäckten betydligt lägre.

Redigering bryter ned det snabbare. I en utvärdering av avsnitt på 400 tokens sänkte ett byte av 10 procent av orden mot synonymer upptäckten från omkring 92 till 66 procent. Ett byte av 25 procent tog den till 17 procent. Det är siffran att hålla fast vid: en lätt omskrivning slår ut märket.

EU-flaggor som vajar utanför en byggnad
Kravet kommer från EU:s AI-förordning. Illustrativ bild. Christian Wasserfallen · pexels · Pexels License

OpenAI är tydligt med att en träff inte mäter mänsklig insats, inte fastställer ägande eller ansvar, inte identifierar användaren och inte verifierar riktighet — och att frånvaron av ett vattenmärke inte bevisar att en människa skrev texten, eftersom den kan vara för kort, redigerad, översatt, från en modell som inte stöds eller från ett annat företags verktyg.

Att följa

Företaget använder redan Content Credentials för stödda bilder, följer C2PA och bäddar in SynthID-märken i stödda bilder och ljud, med offentliga verifieringsverktyg för båda. Text är den del som gör motstånd mot metoden, eftersom text är det människor skriver om. Nästa saker att följa är den uppdaterade tekniska rapporten, släppet av öppen källkod och om tillgången till detektorn vidgas bortom den godkända listan.