LLM出力のどれが透かし入りか当ててみよう
Guess which of these LLM outputs is watermarked
Google DeepMindのSynthIDテキスト透かしは、LLMが生成したテキストに不可視のマークを埋め込む技術です。このクイズでは、10のプロンプトに対して3つの応答が表示され、そのうち1つがSynthIDで透かしを入れられています。あなたは人間の目で透かし入りの出力を見分けられるでしょうか?
このクイズには10のプロンプトがあり、それぞれ3つの応答が含まれています。そのうちの1つはSynthIDテキスト透かしで生成されたものです。どれか当てられますか?
HNでの議論
38- bastawhiz
透かしは理論上、それを入れた主体以外には検出不可能であるべきだと読んだことがあります。これは理にかなっていて、大まかには理解しています。
しかし、私が知らないし理解していないのは、透かし入りのテキストにさらに透かしを入れたらどうなるかということです。両方の透かしに陽性反応を示すのでしょうか? 2番目の透かしだけに? それとも判定不能?
あるいは、私の理解が間違っているのかもしれません。透かしが入っていることは分かるが、それが自分のものかどうかをテストできるのは、透かしを入れた主体だけなのでしょうか? しかし、複数回透かしを入れることについての私の混乱は依然として残ります。
複数回透かしを入れたときに何が起こるにせよ、結果に関係なく、透かしは弱まります。これは、脅威モデルによっては、意味をなさなくなる可能性があります。透かしがどのようにでも弱められるのに、それでも有用であり続けるような深刻な状況は想像できません。「これはLLMから来たものだ」というシグナルでさえ、純粋に機械的な手段で任意のテキストに透かしを入れられるなら、有効なシグナルにはなりません。
また、これが主流のLLMにどのように影響するかも私には明確ではありません。すべての出力テキストに透かしが入っているなら、必ず逃げ道がなければなりません。そうでなければ、JSONスキーマが壊れたり(またはMCPを通じて透かしのないテキストが漏えいする穴ができたり)、「このテキストを変更せずにそのまま返してください」が不可能になり、差分の作成も壊れるでしょう。
何か見落としているに違いないと感じています。
- Noumenon72
各テストの後に成功/失敗を報告してください。30の文章サンプルを読んで比較するように求められると、フィードバックを得るためだけに、私は最後までやり遂げられません。間違えたときにすぐに教えてもらえれば、パターンを認識して推測を改善できます。
- fwlr
完全に知覚不可能で、実際にはLLMのテキストがほとんどされることのない方法で顕微鏡で調べてもわからない。
誰の懸念が和らぐのか(おそらく、品質を低下させると誤って信じていた人々)、誰の懸念が高まるのか(おそらく、彼らの本当の反対は、AI生成テキストが検出可能になること)を見るのは興味深いでしょう。
- abathur
ここでの懸念の感覚は、透かしが誰かまたは何かから価値を奪うかもしれないということです。それが分かるかどうかに関係なく。だから、これらを良い順にランク付けして、その投票のセットが平均から有意に逸脱しているかどうかを見ようかと少し考えました。
とはいえ、最初の3つを読んで、どれも十分に苦しめられたので、残りを読む気にはなれません。
説得されたと言っていいでしょう。
- reactordev
わあ、実際に7/10でした。最初は判断しにくかったですが、選択肢の中でどれが高いスコアかを示す兆候がありました。