Сможете ли вы угадать, какой из этих ответов LLM содержит водяной знак?
Guess which of these LLM outputs is watermarked
Интерактивная викторина, в которой представлены десять подсказок с тремя ответами от LLM. Один из ответов в каждом наборе был создан с помощью текстового водяного знака SynthID от Google DeepMind. Проверьте, сможете ли вы определить, какой именно ответ был помечен водяным знаком, и узнайте, насколько заметны такие метки.
Этот тест содержит десять подсказок с тремя ответами в каждой. Один из этих трех ответов был создан с помощью текстового водяного знака SynthID. Сможете ли вы угадать, какой именно?
- fwlr
Совершенно незаметно, даже при изучении под микроскопом, что для текста LLM на практике случается крайне редко.
Будет интересно посмотреть, чьи опасения будут развеяны (возможно, они искренне, хоть и ошибочно, считали, что это ухудшит качество), а чьи — усилятся (возможно, их настоящее возражение в том, что их сгенерированный ИИ текст станет обнаруживаемым).
- bastawhiz
Я читал, что водяной знак в теории должен быть невозможно обнаружить никому, кроме того, кто его поставил. Это разумно, и я в общих чертах понимаю.
Но чего я не знаю и не понимаю, так это что произойдет, если поставить водяной знак на текст, уже содержащий водяной знак. Будет ли тест положительным на оба знака? Только на второй? Или результат неопределенный?
Или, может, я неправильно понимаю. Можно ли определить, что текст содержит водяной знак, но только тот, кто его поставил, может проверить, его ли это знак? Моё замешательство по поводу многократного нанесения водяных знаков остаётся.
Независимо от того, что происходит при многократном нанесении, любой исход ослабляет водяной знак. Что, в зависимости от модели угроз, делает его бесполезным. Я не могу представить серьёзную ситуацию, где водяной знак, который можно ослабить, всё ещё был бы полезен. Даже сигнал «это от LLM» не является валидным, если можно пометить ЛЮБОЙ текст чисто механическими средствами.
Также мне неясно, как это повлияет на массовые LLM. Если весь выходной текст помечен, обязательно должен быть запасной выход. Иначе JSON-схемы сломаются (или появятся дыры, через которые непомеченный текст можно будет вытащить через MCP), «верни этот текст точно без изменений» станет невозможным, и написание диффов сломается.
Мне кажется, я что-то упускаю.
- Noumenon72
Пожалуйста, сообщайте об успехе/неудаче после каждого теста. Просьба прочитать и сравнить 30 образцов, чтобы получить хоть какую-то обратную связь, означает, что я не закончу. Немедленное сообщение о том, где я ошибся, позволит мне замечать закономерности и улучшать свои догадки.
- lacker
Это как дать вам три вывода md5sum и попросить угадать, для какого из них входные данные заканчивались на «q». Невозможно определить, если только не взломать ГПСЧ.
- Jowsey
Интересно, что почти каждый набор из трёх, кажется, следует шаблону: в одном отрывке из трёх в первом предложении заменено ключевое слово или фраза. То есть для каждого набора из трёх отрывков два начинаются с почти одинаковых предложений, а в одном изменено ключевое слово или токен.
Я заметил это рано и использовал каждый раз, и в итоге получил 2/10, что хуже случайного угадывания. Чую подвох!