停止将中间Token拟人化为推理痕迹
Stop Anthropomorphizing Intermediate Tokens as Reasoning/Thinking Traces

中间Token生成(ITG)已成为提升语言模型推理能力的标准手段,这些输出常被称作“推理痕迹”或“思考痕迹”,暗示模型像人类一样分步思考。然而,这种拟人化并非无害的比喻,而是危险的误导。它模糊了模型的真实运作机制,导致研究方向的偏差和用户对系统能力的错误认知。本文呼吁社区停止将中间Token视为人类思维过程的映射,重新审视其本质,以更科学的方式理解和利用这一技术。
这种拟人化并非无害的比喻,而是危险的误导——它混淆了这些模型的本质,阻碍了有效使用,并引发可疑的研究方向。
HN 评论区
21- kgeist
这里除了术语之外,还有一个很有用的工程后果。
如果中间 Token 不能忠实反映计算过程,那么它们作为审计痕迹也非常糟糕。我们可能不应该试图让模型的内部独白更具可解释性,而应该让围绕它的计算过程更具可复现性。
记录实际的输入、模型/版本/配置、工具观测结果和输出,然后让执行过程足够可重放,以便隔离不同运行之间的差异。
换句话说,不要问模型它想了什么,而是让系统能够展示实际发生了什么。
- xiphias2
非常讨厌那些在标题里就告诉我该怎么做论文,尤其是当论文自己都承认中间 Token 与解题正确性之间只有松散的相关性时。
我的方案行之有效,事实胜于雄辩。
- fabsalvadori
虽然人类可能会说“啊哈”来表示内部状态的突然变化,但这种解释对于没有任何此类内部状态的模型来说是不恰当的;而且在下一次前向传播中,它们与“啊哈”之前的传播唯一的区别,仅仅是上下文中包含了这一个 Token。将“啊哈”时刻解读为有意义,恰恰体现了长期以来被忽视的关于长 CoT 模型的假设——即推导痕迹具有语义意义的错误观念,无论是与算法轨迹相似,还是与人类推理相似。
这篇论文解决了一直困扰我的 LLM 问题:你读到它们的推理过程,看到类似“等等,这不对”的内容,然后眼睁睁看着它们犯下刚刚指出的那个错误。