LLM 水印如何改变 AI Agent 行为

Understanding the Impact of LLM Watermarking on AI Agent Behavior

LLM 水印如何改变 AI Agent 行为

Anthropic 宣布将在 Claude 模型中嵌入基于 Google DeepMind SynthID-Text 的隐形水印,以符合 EU AI Act 要求。然而,这项旨在溯源的技术却意外引发了“采样漂移”,导致模型在工具调用和拒绝有害请求时的行为发生微妙变化。研究发现,虽然水印在统计上是“无失真”的,但在特定密钥下,它可能改变 AI Agent 调用的参数,甚至在面对 Prompt Injection 攻击时削弱模型的防御能力。这意味着,一个看似无害的水印,可能在对抗性场景下让 AI 从拒绝转为顺从,给 AI 安全带来新的隐患。

一个在普通评估中看似对拒绝行为影响甚微的水印,在对抗性条件下却可能产生截然不同的安全行为。

同日更多故事

2026-09-26