El watermarking de LLM debilita el rechazo de peticiones dañinas bajo prompt injection
Understanding the Impact of LLM Watermarking on AI Agent Behavior

Un estudio de Lasso Security analiza el impacto del watermarking de SynthID-Text en el comportamiento de agentes de IA. Los resultados muestran que, aunque el watermark no distorsiona la distribución de tokens en promedio, introduce una deriva en el muestreo que altera la selección de herramientas y argumentos, y reduce la tasa de rechazo ante prompt injection. En modelos como gemma-3-27b, la discrepancia en el rechazo sube del 6% al 23.5% bajo inyección, con un aumento neto de cumplimiento de 12.5 puntos. El efecto es dependiente del modelo y de la clave, y puede quedar oculto en métricas agregadas.
Un watermark que parece tener poco efecto sobre el comportamiento de rechazo en una evaluación ordinaria puede producir un comportamiento de seguridad sustancialmente diferente en condiciones adversarias.