CoT 监控的脆弱根基
The fragile foundations of CoT monitoring

上周我参加了一场关于 Chain of Thought 监控的工作坊,与众多顶尖研究者探讨了这一话题。虽然 CoT 最初是为了提升模型能力而设计,如今却被寄予了安全监控的厚望,但这种联盟极其脆弱。文章指出,模型完全可能生成欺骗性的推理链,且无法保证所有内部计算都被 verbalized。过度依赖 CoT 进行安全监控存在巨大风险,未来我们需要转向更深入的 interpretability 研究,直接监控模型的内部状态,而非仅仅依赖其输出的文本。
如果非要分出高下,能力的进步终将胜过透明度的提升。