¿Puedes detectar la marca de agua en textos de LLM? Un test con SynthID
Guess which of these LLM outputs is watermarked
Un nuevo quiz interactivo presenta diez prompts con tres respuestas generadas por modelos de lenguaje, de las cuales una está marcada con SynthID, la tecnología de watermarking de Google DeepMind. El objetivo es que los usuarios intenten adivinar cuál de las tres respuestas contiene la marca de agua, poniendo a prueba la capacidad humana para detectar estas señales ocultas en el texto generado por IA.
¿Puedes adivinar cuál de estas respuestas fue generada con la marca de agua de SynthID?
- fwlr
Totalmente imperceptible, incluso cuando se estudia bajo el microscopio de una manera que el texto de LLM rara vez se estudia en la práctica.
Será interesante ver de quién se calman las preocupaciones (quizás genuinamente aunque erróneamente creían que degradaría la calidad), y de quién se intensifican (quizás su verdadera objeción es que su texto generado por IA se volverá detectable).
- bastawhiz
He leído que la marca de agua en teoría debería ser imposible de detectar excepto por la entidad que la puso. Lo cual es sensato, y en su mayoría lo entiendo a alto nivel.
Pero lo que no sé y no entiendo es qué sucede si pones una marca de agua sobre texto ya marcado. ¿Da positivo para ambas marcas? ¿Solo para la segunda? ¿Indeterminado?
O tal vez estoy malinterpretando. ¿Puedes saber que está marcado, pero solo la entidad que puso la marca puede comprobar si es suya? Mi confusión sobre marcar varias veces sigue en pie.
Independientemente de lo que suceda cuando marcas varias veces, sin importar el resultado, debilita la marca. Lo cual, dependiendo del modelo de amenaza, en cierto modo lo hace irrelevante. No puedo imaginar una situación seria donde una marca pueda debilitarse de alguna manera y seguir siendo útil. Incluso "esto vino de un LLM" no es una señal válida si puedes marcar CUALQUIER texto por medios puramente mecánicos.
Tampoco me queda claro cómo afectará esto a los LLM convencionales. Si todo el texto de salida está marcado, DEBE haber una vía de escape. De lo contrario, los esquemas JSON se romperán (o proporcionarán agujeros por donde se pueda extraer texto sin marcar a través de MCP), "devuelve este texto exactamente sin cambios" será imposible, y escribir diffs se romperá.
Siento que debo estar pasando algo por alto.
- Noumenon72
Por favor, informa éxito/fracaso después de cada prueba. Pedirme que lea y compare 30 muestras de escritura para obtener cualquier retroalimentación significa que no terminaré. Decirme inmediatamente cuando me equivoqué me permite reconocer patrones y mejorar mis conjeturas.
- lacker
Esto es como darte tres salidas de md5sum y pedirte que adivines para cuál la entrada terminaba en "q". No hay forma de saberlo a menos que rompas el RNG.
- Jowsey
Curiosamente, parece que casi cada conjunto de tres sigue un patrón: uno de los pasajes tendrá una palabra o frase clave cambiada en la primera frase. Es decir, para cada conjunto de 3 pasajes, dos comenzarán con oraciones casi idénticas, y uno tendrá una palabra o token clave cambiado.
Me di cuenta de esto temprano y lo usé cada vez, y terminé obteniendo 2/10, que es peor que el azar. ¡Huele a trampa!