Anthropicの不可視ウォーターマークがAIエージェントの行動を変える——ツール呼び出しと拒否に「サンプリングドリフト」

Understanding the Impact of LLM Watermarking on AI Agent Behavior

Anthropicの不可視ウォーターマークがAIエージェントの行動を変える——ツール呼び出しと拒否に「サンプリングドリフト」

AnthropicがClaudeに導入した不可視ウォーターマークは、Google DeepMindのSynthID-Textに基づく。Lasso Securityの検証によると、この透かしはトークン選択を変え、エージェントのツール呼び出しや有害リクエストの拒否行動に影響を与える。ツール呼び出しの正誤は平均6.5%変動し、プロンプトインジェクション下ではgemma-3-27bの拒否率が最大23.5%変化。ウォーターマークが安全機構を弱める可能性を示唆する。

通常の評価では拒否行動にほとんど影響がないように見えるウォーターマークが、敵対的条件下では実質的に異なる安全行動を生み出す可能性がある。

この日のほかの記事

2026-09-26