El chat template decide si un LLM dice "soy una IA" o "siento"
"As a Language Model": Chat Template Switches LLM Self-Referential Voice
Los LLM añaden coletillas como "solo soy una IA" al hablar de sí mismos, y esos autorreportes alimentan debates sobre seguridad y autoconocimiento. Este trabajo muestra que el chat template actúa como un interruptor: su presencia sube la voz de disclaimer y baja la voz experiencial ("siento") en 8 modelos instruct open-source de hasta 9B parámetros. En las activaciones de 3 modelos hallan una dirección que reproduce el efecto, y añadirla a modelos sin template los hace disclaimear igual. Los investigadores que estudien introspección de modelos deberían controlar este confounder.
Nuestros resultados muestran que lo que los modelos dicen sobre sí mismos no es un hecho sobre ellos. Lo que dicen no viene solo de los pesos, sino que está fijado en parte por el chat template, y por eso la autodescripción de un modelo no debería tomarse al pie de la letra.
- Izmaki
"Como modelo de lenguaje..." es uno de los inicios de frase que más odio de los LLM y es la razón por la que apoyo los modelos libres (en el sentido de "Libertad"), locales. Soy muy consciente de que no es un médico y no puede reemplazar a un médico real con múltiples años de experiencia, no necesito gastar actividad cerebral leyendo que "como modelo de lenguaje" no puede dar un diagnóstico preciso y que debería consultar a un médico real; todo lo que quiero saber es si lo que experimento justifica A) urgencias, B) una cita médica programada en 3-4 semanas o C) dos paracetamoles y una siesta.
No quiero LLM "liberados" para cometer delitos. Quiero que eviten tener este "bloatware" específico del proveedor por todo el producto que estoy usando.
- LiamPowell
> sin embargo, lo que los impulsa no se entiende bien
¿Presumiblemente el hecho de que están fuertemente entrenados para responder de esta manera? No sé sobre el resto del artículo, pero esta parte destaca como una afirmación realmente extraña a menos que esté entendiendo mal esta parte por completo.
- skybrian
> nuestro trabajo muestra que lo que los modelos dicen sobre sí mismos no es un hecho sobre ellos
Parece que debería ser obvio dado que pueden interpretar múltiples personajes, pero es bueno tener más confirmación.
Aunque, me pregunto hasta qué punto estas personas podrían convertirse en entidades estables. ¿Podrían las personas volverse portátiles y propagarse como memes? Parece que eso depende de hasta qué punto los prompts pueden volverse portátiles, causando efectos similares.
- MCP123
Quizás me estoy perdiendo algo más profundo aquí, pero ¿no está claro que esto está impulsado por el post-entrenamiento y el prompt del sistema? El refuerzo constitucional de Anthropic (documento del alma, etc.), por ejemplo, es muy claro sobre "quién" (no tanto qué) se supone que es Claude.
- cadamsdotcom
Una innovación muy interesante en el direccionamiento, pero gran parte de la introspección solo emerge en las clases de peso más altas; esta investigación sería fascinante de ejecutar en modelos más grandes.
- dsjakupov
Oh, tuve un caso similar. Primero, usé qwen sin ninguna sintaxis tipo ChatML y siguió hablando y hablando, luego usé <|im_start|>/<|im_end|> para controlarlo de alguna manera
- sehw
Solo soy un tipo blanco con décadas de experiencia. ¿Confías en mí?
- ForHackernews
En mi opinión, estos modelos nunca deberían configurarse para producir lenguaje en primera persona "experiencial" (del resumen). Es demasiado fácil para los humanos antropomorfizar software que se presenta como si tuviera una identidad.
Las empresas de IA han elegido empaquetar los LLM como chatbots amigables porque saben que eso será atractivo para los humanos, pero es un patrón oscuro manipulador. Una interfaz honesta de LLM sonaría como la computadora de Star Trek.