Chat Template 如何切换LLM的自我声音

"As a Language Model": Chat Template Switches LLM Self-Referential Voice

LLM 常被要求回答关于自身的问题时,会加上“我只是一个人工智能”之类的免责声明。这项研究揭示,这种自我指涉的声音并非源于模型权重,而是由 Chat Template 控制。当 Chat Template 存在时,免责声明的声音增强,而“我感觉”这类体验性表达减弱;反之则相反。研究者在三个模型的激活空间中找到了一个可以操控这种行为的方向:移除该方向可减少免责声明,添加则增强。这意味着,模型关于自身的陈述不应被当作事实,而是受部署方式影响的结果。

模型关于自身的陈述并非事实,而是部分由 Chat Template 所设定。
  1. Izmaki

    "作为一个语言模型……"是我最讨厌的 LLM 开场白之一,也是我支持自由(指自由软件意义上的自由)和本地模型的原因。我很清楚它不是医生,也无法替代拥有多年经验的真医生,我不需要浪费脑细胞去读它说"作为一个语言模型"无法给出确切诊断、建议我咨询真医生这类废话——我只想知道我的症状是否属于 A) 去急诊,B) 预约 3-4 周后的门诊,还是 C) 吃两片扑热息痛睡一觉。

  2. LiamPowell

    我可不希望"越狱"的 LLM 去犯罪。我只是希望它们别再把我正在用的产品搞得满屏都是这种厂商专用的"臃肿软件"。

  3. skybrian

    > yet what drives them is not well understood

  4. MCP123

    这大概是因为它们被重度训练成这样回复吧?我不确定论文的其他部分,但这部分说法除非我完全理解错了,否则听起来真的很奇怪。

  5. cadamsdotcom

    > our work shows that what models say about themselves is not a fact about them

  6. dsjakupov

    考虑到它们能扮演多个角色,这似乎本该显而易见,但能有更多确认也不错。

  7. sehw

    不过,我确实好奇这些"人设"能在多大程度上变成稳定的实体。人设会不会像模因(memes)一样变得可移植并传播开来?这似乎取决于提示词(prompts)能在多大程度上变得可移植,从而产生类似的效果。

  8. ForHackernews

    也许我漏掉了什么更深层的东西,但这难道不是由后训练(post-training)和系统提示词(system prompt)驱动的吗?比如 Anthropic 的宪法强化学习(soul document 等),就非常清楚地定义了 Claude 应该是"谁"(而不是"什么")。

同日更多故事

2026-09-27