大模型竟能察觉被植入的概念
Emergent Introspective Awareness in Large Language Models

大型语言模型真的具备内省能力吗?这项研究通过向模型激活中注入已知概念,测试其能否识别这些外部干预。结果显示,Claude Opus 4 和 4.1 等模型在特定场景下,确实能察觉被注入的概念并准确识别,甚至能区分自身输出与人工预填内容。尽管当前这种内省能力仍高度依赖上下文且不够可靠,但模型已展现出在指令下调节内部表征的潜力。这标志着语言模型对自身内部状态的功能性感知正在萌芽。
总体而言,我们的结果表明,当前的语言模型对其自身内部状态具备某种功能性的内省意识。