你能认出哪条LLM回复被SynthID加上了水印?
Guess which of these LLM outputs is watermarked
这是一个关于LLM输出水印的实战测试。测试包含十个提示词,每个提示词对应三个不同的回复,其中只有一个回复使用了DeepMind的SynthID技术添加了文本水印。你需要仔细观察并猜测哪一个是带有水印的生成内容。这个测验旨在检验当前水印技术在真实场景中的可识别性,挑战人类对AI生成内容的辨别能力。无论你是否熟悉SynthID的工作原理,都可以尝试参与,看看自己能否在看似普通的文本中捕捉到那些细微的线索。
这个测验包含十个提示词,每个提示词对应三个回复,其中只有一个回复使用了SynthID文本水印。
HN 评论区
82- Noumenon72
我读到过,理论上除了加水印的实体之外,没人能检测到水印。这很合理,我在宏观层面也大致理解。
但我不知道也不明白的是,如果对已经加了水印的文本再次加水印会发生什么?它会同时检测出两个水印吗?还是只检测出第二个?或者结果不确定?
又或者我理解错了。是不是你能看出文本加了水印,但只有加水印的实体才能验证是不是他们加的水印?不过,我对多次加水印的困惑依然存在。
不管多次加水印会发生什么,无论结果如何,它都会削弱水印的效力。这取决于威胁模型,某种程度上让水印变得毫无意义。我无法想象在什么严肃场景下,水印只要被削弱了还能有用。如果你能通过纯机械手段给任意文本加水印,那“这段文本来自 LLM
- fwlr
这个信号也就无效了。
我也不清楚这对主流 LLM 会有什么影响。如果所有输出文本都加水印,那必须有一个“逃生舱口”(escape hatch)。否则,JSON 模式会失效(或者在 MCP 中留下漏洞,让未加水印的文本得以泄露),“原样返回这段文本,不做任何改动”将变得不可能,编写 diff 也会出问题。
我觉得我肯定漏掉了什么。
- bastawhiz
请在每次测试后报告成功或失败。让我阅读并对比 30 个写作样本才能收到任何反馈,这意味着我根本完不成。如果在我答错时立刻告诉我,我就能识别模式并改进我的猜测。
- lacker
我本来就没指望能做得很好。做到第三个时,我的 ADHD 就开始让我坐立难安了。我怀疑本来会更早,但因为第一个问题在我试图滚动时意外选出了答案,这让我有点惊喜,从而多集中了一会儿注意力。
为了避免后续问题出现同样情况,我就把手指按在手机屏幕上防止误触。结果这最终选中了一些文本,我下意识地轻点取消选择。这又触发了另一个随机选择,然后我就因为厌烦而一路点到了最后。