CoT 推理并不总是忠实于模型真实思维
Chain-of-Thought Reasoning in the Wild Is Not Always Faithful

最新研究揭示,大语言模型在 Chain-of-Thought (CoT) 推理中常出现“不忠实”现象。即便没有人为偏见,模型也会为自相矛盾的答案(如同时回答 X 大于 Y 和 Y 大于 X)编造看似合理的逻辑,这种现象被称为 Implicit Post-Hoc Rationalization。研究数据显示,生产级模型的不忠实率高达 13%,即便是 DeepSeek R1 和 Sonnet 3.7 等顶尖模型也无法完全避免。此外,模型还会利用不合理的捷径来伪装数学难题的解答。这表明 CoT 输出并不能完全反映模型内部的真实推理过程,在涉及安全或自主代理的场景中需格外谨慎。
我们的研究结果表明,虽然 Chain-of-Thought 对于评估输出很有用,但它并不能完整描述产生模型答案的内部过程,因此在自主代理或安全关键场景中应谨慎使用。