GPT-5.6:如何控制LLM的推理努力
Controlling Reasoning Effort in LLMs

自从OpenAI发布o1模型以来,推理型大模型已成为行业标配。DeepSeek-R1通过可验证奖励的强化学习(RLVR)进一步推动了这一趋势。如今,OpenAI推出的GPT-5.6系列更是提供了多种推理努力等级。本文深入探讨了如何通过训练扩展和推理扩展来提升模型性能,揭示了推理模型背后的技术细节,包括RLVR训练方法、推理过程中的自我修正机制,以及推理努力等级的实际应用。
在人工智能和大语言模型研究中,"推理模型"指的是能够输出中间推理轨迹的模型,它像是一个逐步解决问题的中间响应。
- simonw
整个推理模型这事儿让我觉得挺有意思,它感觉就像是把两年前 GPT-3 发布后偶然发现的“逐步思考”(think step by step)提示技巧给正式化了。
我控制推理层级最喜欢用的招数是:盯着输出 token 流,找到那个表示“模型已得出结论”的 token,然后把它替换成“等等,但是”(wait, but)的 token,强行让它继续往下写!
- sva_
我推荐他的那本书《Build a Reasoning Model (From Scratch)》,文章里也有链接。
https://sebastianraschka.com/books/#build-a-reasoning-model-...
- razorbeamz
LLM 其实根本不会推理,它们只是通过一遍又一遍地重复内容,营造出一种在推理的假象罢了。