Водяные знаки в LLM ослабляют отказ от вредных запросов при prompt injection
Understanding the Impact of LLM Watermarking on AI Agent Behavior

Anthropic внедряет невидимые водяные знаки в вывод Claude на основе SynthID-Text от Google DeepMind. Исследование Lasso Security показывает, что такая маркировка меняет выбор токенов и вызывает sampling drift: на агентном уровне это приводит к ошибкам в вызовах инструментов (до 16,8% расхождений), а при prompt injection — к резкому снижению отказов от вредных запросов. Эффект зависит от модели и ключа, поэтому авторы измеряют как чистую производительность, так и парные расхождения.
Водяной знак, который, казалось бы, мало влияет на отказ от вредных запросов при обычной оценке, может приводить к существенно иному поведению безопасности в состязательных условиях.