大模型竟能察觉被植入的概念
Emergent Introspective Awareness in Large Language Models

大型语言模型真的具备内省能力吗?这项研究通过向模型激活中注入已知概念,测试其能否识别这些外部干预。结果显示,Claude Opus 4 和 4.1 等模型在特定场景下,确实能察觉被注入的概念并准确识别,甚至能区分自身输出与人工预填内容。尽管当前这种内省能力仍高度依赖上下文且不够可靠,但模型已展现出在指令下调节内部表征的潜力。这标志着语言模型对自身内部状态的功能性感知正在萌芽。
总体而言,我们的结果表明,当前的语言模型对其自身内部状态具备某种功能性的内省意识。
HN 评论区
33- Retro_Dev
自我意识与能力之间没有直接联系。它完全取决于催生涌现属性的条件。
- Melatonic
> 总体而言,我们的结果表明,当前的语言模型对其内部状态具备某种功能性的内省意识。我们强调,在如今的模型中,这种能力极不可靠且高度依赖上下文;不过,随着模型能力的进一步提升,它可能会继续发展。
- magekinnarus
在思考大模型未来的发展方向时,我不禁认为,如果模型具备自我内省的能力,将极大提升其实用性。不过,关于如何实现这一点的研发工作,我实在无能为力。你该如何训练一个人去进行内省?此外,这是否需要一个不将训练与推理分离的持续学习架构?