Anthropic의 워터마크, AI 에이전트의 도구 호출을 16.8%나 바꿨다

Understanding the Impact of LLM Watermarking on AI Agent Behavior

Anthropic의 워터마크, AI 에이전트의 도구 호출을 16.8%나 바꿨다

Anthropic이 Claude 모델에 적용한 SynthID-Text 워터마크가 모델의 토큰 선택을 미세하게 바꿔 에이전트 행동에 영향을 준다는 연구 결과가 나왔다. BFCL v4 도구 호출 평가에서 워터마크 적용 시 정확도가 최대 2.87%p 감소했지만, 개별 호출의 16.8%가 뒤바뀌는 'churn' 현상이 관찰됐다. 특히 프롬프트 인젝션 상황에서 gemma-3-27b의 거부율이 23.5%p나 흔들리며 안전성이 약화될 수 있음이 드러났다.

워터마크가 평범한 평가에서는 거부 행동에 거의 영향을 주지 않는 것처럼 보여도, 적대적 조건에서는 상당히 다른 안전 행동을 낳을 수 있다.

이 날의 다른 글

2026-09-26