LLM 워터마크, 사람이 구별할 수 있을까?
Guess which of these LLM outputs is watermarked
Google DeepMind의 SynthID 텍스트 워터마크가 생성한 응답을 사람이 얼마나 잘 구별하는지 테스트하는 퀴즈입니다. 총 10개의 프롬프트마다 세 개의 응답이 제시되며, 그중 하나는 SynthID로 워터마크된 것입니다. 이 글은 워터마크의 감지 가능성과 AI 생성 콘텐츠의 식별 가능성에 대한 흥미로운 질문을 던집니다.
이 퀴즈에는 각각 세 개의 응답이 있는 10개의 프롬프트가 포함되어 있으며, 그중 하나는 SynthID 텍스트 워터마크로 생성되었습니다. 과연 어느 것인지 맞힐 수 있나요?
HN 토론
82- Noumenon72
각 테스트 후에 성공/실패를 보고해 주세요. 피드백을 얻기 위해 30개의 글쓰기 샘플을 읽고 비교하라고 하면 끝내지 못할 거예요. 틀렸을 때 즉시 알려주면 패턴을 인식하고 추측을 개선할 수 있어요.
- fwlr
완전히 감지 불가능합니다. 실제로 LLM 텍스트가 거의 경험하지 못하는 방식으로 현미경으로 연구해도 말이죠. 누구의 우려가 완화되는지(아마도 품질이 저하될 것이라고 진심으로, 그러나 잘못 생각했을 수도 있는 사람들), 누구의 우려가 증폭되는지(아마도 그들의 진짜 반대는 자신의 AI 생성 텍스트가 감지 가능해질 것이라는 점일 수도 있음)를 보는 것이 흥미로울 것입니다.
- bastawhiz
워터마크는 이론상 워터마크를 넣은 주체 외에는 감지할 수 없어야 한다고 읽었습니다. 이는 합리적이며, 대체로 높은 수준에서 이해합니다. 하지만 제가 모르고 이해하지 못하는 것은 워터마크가 있는 텍스트에 다시 워터마크를 하면 어떻게 되는지입니다. 두 워터마크 모두에 양성으로 나오나요? 두 번째 것에만? 아니면 불확정? 아니면 제가 오해하고 있는 것일 수도 있습니다. 워터마크가 있는지 알 수 있지만, 워터마크를 넣은 주체만이 그것이 자신의 것인지 테스트할 수 있나요? 여러 번 워터마크를 하는 것에 대한 혼란은 여전히 남아 있습니다. 여러 번 워터마크를 할 때 어떤 일이 일어나든, 결과에 관계없이 워터마크를 약화시킵니다. 위협 모델에 따라 이것은 무의미하게 만들 수 있습니다. 워터마크가 어떤 식으로든 약화될 수 있고 여전히 유용한 심각한 상황을 상상할 수 없습니다. 순수하게 기계적인 수단을 통해 어떤 텍스트에도 워터마크를 할 수 있다면 '이것은 LLM에서 나왔다'는 것조차 유효한 신호가 아닙니다. 또한 이것이 주류 LLM에 어떤 영향을 미칠지 명확하지 않습니다. 모든 출력 텍스트에 워터마크가 있다면 탈출구가 반드시 있어야 합니다. 그렇지 않으면 JSON 스키마가 깨지거나(MCP를 통해 워터마크가 없는 텍스트가 유출될 수 있는 구멍을 제공), '이 텍스트를 변경 없이 정확히 반환하라'는 것이 불가능해지고, diff 작성이 깨질 것입니다. 뭔가 빠뜨리고 있는 것 같습니다.
- Jowsey
흥미롭게도, 거의 모든 세 개의 세트가 패턴을 따르는 것 같습니다: 세 개 중 하나는 첫 문장에서 핵심 단어나 구가 바뀌어 있습니다. 즉, 세 개의 지문 세트마다 두 개는 거의 동일한 문장으로 시작하고, 하나는 핵심 단어나 토큰이 변경되어 있습니다. 저는 이것을 일찍 알아차리고 매번 사용했는데, 결국 2/10을 받았습니다. 이는 무작위 확률보다 나쁩니다. 속임수가 있는 것 같습니다!
- lacker
이것은 md5sum에서 세 개의 출력을 주고 입력이 'q'로 끝나는 것을 맞히라고 하는 것과 같습니다. RNG를 깨지 않는 한 알 방법이 없습니다.