Anthropics Claude-Wasserzeichen kann die Sicherheit von KI-Agenten untergraben
Understanding the Impact of LLM Watermarking on AI Agent Behavior

Anthropic kündigte an, zukünftige Claude-Modelle mit einem unsichtbaren Wasserzeichen auf Basis von Google DeepMinds SynthID-Text zu versehen. Eine Untersuchung zeigt: Das Wasserzeichen verändert die Token-Auswahl und führt zu "Sampling Drift". Dadurch sinkt die Tool-Call-Genauigkeit bei sechs von sieben Modellen, und die Verweigerung schädlicher Anfragen bricht unter Prompt-Injection deutlich ein – bei gemma-3-27b von 6,0 % auf 23,5 % Churn. Die Effekte sind modell- und schlüsselabhängig und werden in aggregierten Scores oft verschleiert.
Ein Wasserzeichen, das bei gewöhnlicher Evaluierung kaum Wirkung auf das Verweigerungsverhalten zu haben scheint, kann unter adversarialen Bedingungen ein deutlich anderes Sicherheitsverhalten erzeugen.