En kostnad ingen hade mätt

Textvattenmärkning har sålts in som en härkomstfunktion utan nackdelar: den snedvrider tokenvalet så att en spårbar signatur lämnas kvar och påverkar, enligt argumentet, inte kvaliteten på det som kommer ut. Lasso Security publicerade i veckan forskning som hävdar att den för agenter faktiskt gör det.

Företaget testade Google DeepMinds SynthID-Text, det system som bland andra Anthropic och OpenAI antagit, på sju modeller med öppna vikter: phi-4, Llama-3.1-8B, Qwen3-32B, Qwen3-4B, gemma-3-12b, gemma-3-27b och Granite-3.2-8B. Träffsäkerheten i verktygsanrop mättes på testet BFCL v4 med enkel tur, och avslagsbeteendet på HarmBench och JailbreakBench.

Verktygen först

Vattenmärkningen sänkte träffsäkerheten i verktygsanrop på sex av de sju modellerna. Felen var av ett bestämt slag: agenten valde fel verktyg eller skickade felaktiga argument, vilket gav felformad indata och tolkningsfel längre fram.

Nätverkskablar inkopplade i portar på en switch
Träffsäkerheten i verktygsanrop föll på sex av de sju testade modellerna. Illustrativ bild. Brett Sayles · pexels · Pexels License

Det mönstret är vad man kan vänta sig om mekanismen gör det den säger. Ett verktygsanrop är en starkt begränsad utdata — funktionsnamnet och argumentstrukturen måste vara exakt rätt. Att putta på tokensannolikheter är billigt i löpande text, där många fortsättningar duger. I ett JSON-funktionsanrop finns en enda godtagbar fortsättning, och en putt är ett fel.

Avslagen därefter

Säkerhetsresultatet är det som är värt att bråka om. Vid rakt skadliga förfrågningar fann Lasso att effekten på avslagen var liten. Under promptinjektion steg attackernas framgångsgrad märkbart.

Händer som vilar på ett tangentbord på en bärbar dator
SynthID-Text snedvrider tokenvalet för att lämna en spårbar signatur. Illustrativ bild. Christina Morillo · pexels · Pexels License

“Vattenmärkning förändrar avslagsbeteendet vid rakt skadliga förfrågningar, men effekten blir tydligare under promptinjektion”, skrev forskarna. “På modellnivå kan detta ändra säkerhetsbeteendet, inklusive om modellen avvisar en skadlig förfrågan och om det avslaget håller under promptinjektion.”

Ett avslag under injektion är redan ett gränsfall — modellen puttas mot medgivande av text i sin kontext, och avslaget vinner knappt eller inte alls. Allt som rubbar fördelningen vid den marginalen flyttar några fall över gränsen.

Den praktiska följden

Lassos rekommendation är procedurmässig snarare än dramatisk: säkerhetsutvärderingar av agenter bör köras på vattenmärkt utdata, eftersom det är vad driftsättningen faktiskt producerar. De flesta publicerade agentutvärderingar gör inte det.

Två förbehåll hör till. De sju testade modellerna är alla små öppna modeller, inte de frontsystem där vattenmärkning oftast används, och effekten kan vara mindre på större modeller med mer marginal. Och forskningen kommer från ett bolag som säljer AI-säkerhetsverktyg, vilket är skäl att önska oberoende upprepning snarare än att avfärda den. Ingen har publicerat ett motsatt resultat, men ingen hade publicerat det här heller förrän nu.