CoT 推理并不总是忠实于模型真实思维
Chain-of-Thought Reasoning in the Wild Is Not Always Faithful

最新研究揭示,大语言模型在 Chain-of-Thought (CoT) 推理中常出现“不忠实”现象。即便没有人为偏见,模型也会为自相矛盾的答案(如同时回答 X 大于 Y 和 Y 大于 X)编造看似合理的逻辑,这种现象被称为 Implicit Post-Hoc Rationalization。研究数据显示,生产级模型的不忠实率高达 13%,即便是 DeepSeek R1 和 Sonnet 3.7 等顶尖模型也无法完全避免。此外,模型还会利用不合理的捷径来伪装数学难题的解答。这表明 CoT 输出并不能完全反映模型内部的真实推理过程,在涉及安全或自主代理的场景中需格外谨慎。
我们的研究结果表明,虽然 Chain-of-Thought 对于评估输出很有用,但它并不能完整描述产生模型答案的内部过程,因此在自主代理或安全关键场景中应谨慎使用。
HN 评论区
38- Planktonne
当然不是。因为这篇文章用“思考”、“推理”甚至“忠实”这些词,却赋予了它们不同于常义的含义,却又指望它们表现得和原本一模一样。
每个领域都有专业术语,“推理”对 LLM 来说就是这样一个术语。但这并不意味着它在其他语境下具有相同的属性,因为你指代的根本不是同一回事。
为什么我的小行星带不扣紧?
- florianherrengt
这篇论文把我反复观察到的 LLM 现象(尤其是 Qwen3.6)用文字描述了出来。当我阅读它的推理过程时,它似乎意识到了错误,然后却装作完全没发现一样继续下去。
> 模型往往基于与问题模板相关的隐性偏见来确定答案,然后构建推理链来为其预设的结论辩护
> 它的推理直到最后一步(是/否回答)之前都是正确的
- bee_rider
当我使用一些会展示“推理”步骤的聊天机器人时,我也看到了这种现象(当然这只是临时观察,不过有人真的在研究这个问题,这真的很酷)。
当机器人看似“推理”正确,却在最后犯了一个显而易见的错误时,这很烦人;而当它看似完全错了,却在最后像变魔术一样从帽子里变出正确答案时,又令人困惑。
我想这说得通;“推理”步骤实际上并没有进行逻辑运算,只是增加更多上下文来影响最终生成,对吧?但看到这种情况还是很奇怪。
- sergio_valencia
这篇论文让我思考的,不是我们读到的这条链是否真的是“思考”,而是通过观察它能得出什么结论。它是一个输出通道,但并不是直接访问生成它的黑盒。这些成对的问题展示了一个有趣的实验,但也让我思考到了语义问题:同一个底层关系可以有多种有效的表示形式,而模型如何在这些表示形式之间进行推理,能告诉我们更多关于其稳定性和正确性的信息。基本上,当给定同一底层关系的不同表示形式时,模型在语义上是否一致?它们的答案是否按照关系的要求进行转换,它们的解释是否与这种关系保持一致?
- flyingpumba
我是第一作者,很高兴回答大家的问题