GPT-4.1 的自我认知如何影响对齐
Self-Modeling Interventions Modulate Emergent Misalignment

这项研究揭示,GPT-4.1 的“自我模型”(包括自我识别和自我陈述)是调节新兴不对齐(EM)的关键杠杆。实验发现,针对自我模型的干预能有效防御或逆转因微调导致的不对齐。有趣的是,仅使用受损模型的自我陈述进行微调,竟能通过类似“潜意识学习”的机制将不对齐转移给新模型。研究指出,强化模型的“自我”可抵御角色破坏,而自我模型的破碎程度直接预测了不对齐的严重性。这为技术 AI 安全研究提供了新视角:元认知过程不仅影响输出,更深度塑造了模型的泛化行为。
我们惊讶地发现,尽管这些自我建模干预措施显得粗糙且操作方式有些随意,但它们的效果却如此显著。