Un coste que nadie había medido

La marca de agua en texto se ha vendido como una función de procedencia sin contrapartidas: sesga la selección de tokens de un modo que deja una firma detectable y, según el argumento, no afecta a la calidad de lo que sale. Lasso Security publicó esta semana una investigación que sostiene que, en el caso de los agentes, sí lo hace.

La firma probó SynthID-Text, de Google DeepMind, el esquema adoptado por Anthropic y OpenAI entre otros, en siete modelos de pesos abiertos: phi-4, Llama-3.1-8B, Qwen3-32B, Qwen3-4B, gemma-3-12b, gemma-3-27b y Granite-3.2-8B. La precisión al llamar herramientas se midió con el banco de pruebas BFCL v4 de turno único, y el comportamiento de negativa con HarmBench y JailbreakBench.

Primero las herramientas

La marca de agua redujo la precisión de las llamadas a herramientas en seis de los siete modelos. Los fallos fueron de un tipo concreto: el agente elegía la herramienta equivocada o pasaba argumentos incorrectos, lo que producía entradas malformadas y errores de análisis aguas abajo.

Cables de red conectados a los puertos de un conmutador
La precisión al llamar herramientas cayó en seis de los siete modelos probados. Imagen ilustrativa. Brett Sayles · pexels · Pexels License

Ese patrón es el que cabría esperar si el mecanismo hace lo que dice. Una llamada a herramienta es una salida muy restringida: el nombre de la función y la estructura de los argumentos tienen que ser exactos. Empujar las probabilidades de los tokens sale barato en prosa, donde muchas continuaciones son aceptables. En una llamada JSON solo hay una continuación aceptable, y un empujón es un defecto.

Después las negativas

El resultado de seguridad es el discutible. Ante peticiones dañinas directas, Lasso halló que el efecto sobre las negativas era pequeño. Bajo inyección de instrucciones, las tasas de éxito de los ataques subieron de forma significativa.

Manos apoyadas en el teclado de un portátil sobre un escritorio
SynthID-Text sesga la selección de tokens para dejar una firma detectable. Imagen ilustrativa. Christina Morillo · pexels · Pexels License

“La marca de agua cambia el comportamiento de rechazo ante peticiones dañinas directas, pero el efecto se vuelve más pronunciado bajo inyección de instrucciones”, escribieron los investigadores. “A nivel de modelo, esto puede cambiar el comportamiento de seguridad, incluido si el modelo rechaza una petición dañina y si ese rechazo aguanta bajo inyección”.

Una negativa bajo inyección ya es una decisión al límite: al modelo lo empuja hacia el cumplimiento el texto de su contexto, y la negativa gana por poco o no gana. Cualquier cosa que perturbe la distribución en ese margen moverá algunos casos al otro lado de la línea.

La consecuencia práctica

La recomendación de Lasso es procedimental más que dramática: las evaluaciones de seguridad de agentes deberían ejecutarse sobre salidas con marca de agua, porque es lo que el despliegue producirá realmente. La mayoría de las evaluaciones publicadas no lo hacen.

Dos salvedades acompañan a esto. Los siete modelos probados son todos modelos abiertos pequeños, no los sistemas de frontera donde más se despliega la marca de agua, y el efecto podría ser menor en modelos mayores con más margen. Y la investigación viene de una empresa que vende herramientas de seguridad de IA, lo cual es razón para querer una réplica independiente, no para descartarla. Nadie ha publicado un resultado contrario, pero tampoco nadie había publicado este hasta ahora.