Kannst du den Wasserzeichen-Text erkennen?

Guess which of these LLM outputs is watermarked

Ein interaktives Quiz stellt zehn Prompts mit je drei Antworten vor, von denen eine mit dem SynthID-Wasserzeichen von Google DeepMind generiert wurde. Die Aufgabe: Errate, welche Ausgabe markiert ist. Der Test zeigt, wie schwer es ist, KI-generierten Text von menschlichem zu unterscheiden, selbst wenn ein Wasserzeichen eingebettet ist.

Dieses Quiz enthält zehn Prompts mit jeweils drei Antworten. Eine dieser drei Antworten wurde mit dem SynthID-Textwasserzeichen generiert. Kannst du erraten, welche?
  1. fwlr

    Völlig unerkennbar, selbst wenn man es unter dem Mikroskop untersucht, so wie LLM-Text in der Praxis nur selten untersucht wird.

    Es wird interessant sein zu sehen, wessen Bedenken zerstreut werden (vielleicht dachten sie wirklich, fälschlicherweise, dass es die Qualität verschlechtern würde) und wessen Bedenken verstärkt werden (vielleicht ist ihr eigentlicher Einwand, dass ihr KI-generierter Text erkennbar wird).

  2. bastawhiz

    Ich habe gelesen, dass Wasserzeichen theoretisch unmöglich zu erkennen sein sollten, außer durch die Entität, die sie angebracht hat. Das ist sinnvoll, und ich verstehe es auf hoher Ebene größtenteils.

    Aber was ich nicht weiß und nicht verstehe, ist, was passiert, wenn man mit Wasserzeichen versehenen Text erneut mit Wasserzeichen versieht. Testet er dann positiv auf beide Wasserzeichen? Nur auf das zweite? Unbestimmt?

    Oder vielleicht verstehe ich es falsch. Kann man erkennen, dass er mit einem Wasserzeichen versehen ist, aber nur die Entität, die das Wasserzeichen angebracht hat, kann testen, ob es ihres ist? Meine Verwirrung bezüglich des mehrfachen Versehens mit Wasserzeichen besteht jedoch weiterhin.

    Unabhängig davon, was passiert, wenn man mehrmals ein Wasserzeichen anbringt, schwächt es das Wasserzeichen, egal was dabei herauskommt. Das macht es, je nach Bedrohungsmodell, sozusagen gegenstandslos. Ich kann mir keine ernsthafte Situation vorstellen, in der ein Wasserzeichen, das auf irgendeine Weise geschwächt werden kann, immer noch nützlich ist. Selbst „das stammt von einem LLM“ ist kein gültiges Signal, wenn man JEDEN Text rein mechanisch mit einem Wasserzeichen versehen kann.

    Es ist mir auch nicht klar, wie sich dies auf Mainstream-LLMs auswirken wird. Wenn der gesamte Ausgabetext mit einem Wasserzeichen versehen ist, MUSS es eine Notluke geben. Andernfalls brechen JSON-Schemata (oder bieten Löcher, durch die nicht mit Wasserzeichen versehener Text über MCP exfiltriert werden kann), „geben Sie diesen Text exakt und unverändert zurück“ wird unmöglich, und das Schreiben von Diffs wird brechen.

    Ich habe das Gefühl, dass mir etwas entgehen muss.

  3. Noumenon72

    Bitte melden Sie nach jedem Test Erfolg/Fehlschlag. Wenn ich 30 Schreibproben lesen und vergleichen muss, um überhaupt Feedback zu bekommen, werde ich nicht fertig. Wenn mir sofort mitgeteilt wird, wenn ich einen Fehler gemacht habe, kann ich Muster erkennen und meine Vermutungen verbessern.

  4. lacker

    Das ist, als würde man dir drei Ausgaben von md5sum geben und dich bitten zu raten, bei welcher die Eingabe mit einem „q“ endete. Es gibt keine Möglichkeit, das zu erkennen, es sei denn, man bricht den Zufallsgenerator.

  5. Jowsey

    Interessanterweise scheint fast jede Gruppe von drei einem Muster zu folgen: Eine der drei Passagen hat im ersten Satz ein Schlüsselwort oder eine Schlüsselphrase ausgetauscht. Das heißt, bei jeder Gruppe von drei Passagen beginnen zwei mit fast identischen Sätzen, und eine hat ein Schlüsselwort oder Token geändert.

    Ich habe das früh bemerkt und es jedes Mal verwendet, und am Ende 2/10 erreicht, was schlechter ist als Zufall. Ich rieche einen Trick!

Mehr von diesem Tag

2026-08-22