你能认出哪条LLM回复被SynthID加上了水印?
Guess which of these LLM outputs is watermarked
这是一个关于LLM输出水印的实战测试。测试包含十个提示词,每个提示词对应三个不同的回复,其中只有一个回复使用了DeepMind的SynthID技术添加了文本水印。你需要仔细观察并猜测哪一个是带有水印的生成内容。这个测验旨在检验当前水印技术在真实场景中的可识别性,挑战人类对AI生成内容的辨别能力。无论你是否熟悉SynthID的工作原理,都可以尝试参与,看看自己能否在看似普通的文本中捕捉到那些细微的线索。
这个测验包含十个提示词,每个提示词对应三个回复,其中只有一个回复使用了SynthID文本水印。
- bastawhiz
我读到过,理论上除了加水印的实体之外,没人能检测到水印。这很合理,我在宏观层面也大致理解。
但我不知道也不明白的是,如果对已经加了水印的文本再次加水印会发生什么?它会同时检测出两个水印吗?还是只检测出第二个?或者结果不确定?
又或者我理解错了。是不是你能看出文本加了水印,但只有加水印的实体才能验证是不是他们加的水印?不过,我对多次加水印的困惑依然存在。
不管多次加水印会发生什么,无论结果如何,它都会削弱水印的效力。这取决于威胁模型,某种程度上让水印变得毫无意义。我无法想象在什么严肃场景下,水印只要被削弱了还能有用。如果你能通过纯机械手段给任意文本加水印,那“这段文本来自 LLM
- Noumenon72
这个信号也就无效了。
我也不清楚这对主流 LLM 会有什么影响。如果所有输出文本都加水印,那必须有一个“逃生舱口”(escape hatch)。否则,JSON 模式会失效(或者在 MCP 中留下漏洞,让未加水印的文本得以泄露),“原样返回这段文本,不做任何改动”将变得不可能,编写 diff 也会出问题。
我觉得我肯定漏掉了什么。
- Lerc
请在每次测试后报告成功或失败。让我阅读并对比 30 个写作样本才能收到任何反馈,这意味着我根本完不成。如果在我答错时立刻告诉我,我就能识别模式并改进我的猜测。