Водяные знаки в LLM ослабляют отказ от вредных запросов при prompt injection

Understanding the Impact of LLM Watermarking on AI Agent Behavior

Водяные знаки в LLM ослабляют отказ от вредных запросов при prompt injection

Anthropic внедряет невидимые водяные знаки в вывод Claude на основе SynthID-Text от Google DeepMind. Исследование Lasso Security показывает, что такая маркировка меняет выбор токенов и вызывает sampling drift: на агентном уровне это приводит к ошибкам в вызовах инструментов (до 16,8% расхождений), а при prompt injection — к резкому снижению отказов от вредных запросов. Эффект зависит от модели и ключа, поэтому авторы измеряют как чистую производительность, так и парные расхождения.

Водяной знак, который, казалось бы, мало влияет на отказ от вредных запросов при обычной оценке, может приводить к существенно иному поведению безопасности в состязательных условиях.

Ещё за этот день

2026-09-26