Anthropics Claude-Wasserzeichen kann die Sicherheit von KI-Agenten untergraben

Understanding the Impact of LLM Watermarking on AI Agent Behavior

Anthropics Claude-Wasserzeichen kann die Sicherheit von KI-Agenten untergraben

Anthropic kündigte an, zukünftige Claude-Modelle mit einem unsichtbaren Wasserzeichen auf Basis von Google DeepMinds SynthID-Text zu versehen. Eine Untersuchung zeigt: Das Wasserzeichen verändert die Token-Auswahl und führt zu "Sampling Drift". Dadurch sinkt die Tool-Call-Genauigkeit bei sechs von sieben Modellen, und die Verweigerung schädlicher Anfragen bricht unter Prompt-Injection deutlich ein – bei gemma-3-27b von 6,0 % auf 23,5 % Churn. Die Effekte sind modell- und schlüsselabhängig und werden in aggregierten Scores oft verschleiert.

Ein Wasserzeichen, das bei gewöhnlicher Evaluierung kaum Wirkung auf das Verweigerungsverhalten zu haben scheint, kann unter adversarialen Bedingungen ein deutlich anderes Sicherheitsverhalten erzeugen.

Mehr von diesem Tag

2026-09-26