Qwen 3.8 27B:优秀但默认过度思考

Qwen 3.8 27B is excellent, but it defaults to overthinking things

Qwen 3.8 27B:优秀但默认过度思考

我测试了阿里云最新发布的 Qwen 3.8 27B 模型,它在本地运行表现卓越,但默认开启的 xhigh 推理模式令人啼笑皆非。面对“画个圆”这种简单指令,模型竟花费 21 分钟生成复杂的动画 SVG,消耗大量 token 进行过度分析。相比之下,关闭推理模式仅需两分钟,虽质量略降但效率倍增。尽管在绘制边界框和驱动 Pi 编程代理方面表现出色,但我强烈建议用户手动将推理级别调低,否则在消费级硬件上将体验极慢。

这是一个极其滑稽的默认设置,尤其是在消费级硬件上运行时,绝对不是一个好的运行方式。
  1. chvid

    我 fork 了 llama.cpp,并添加了一个粗糙的机制来严格控制这种行为——本质上是通过在特定阈值处策略性地注入文本来引导推理过程。这主要是为了驯服 Qwen3.6-27B 而拼凑出来的,但我推测 3.8 版本也会有类似的反应。

    Fork 地址在这里 - https://github.com/laurencehardman/llama-mindcontrol/tree/ma...

    当然,这类 hack 并不完美,由于注入的文本可能会让模型略微偏离分布,性能可能会有轻微下降,因此字符串常量需要精心选择——Qwen3.5 的技术白皮书在这方面提供了一些指导。这个机制绝对更像是一个 hack 而非正式功能,我推测一旦 llama.cpp 支持更合适的推理控制,它就会变得多余——但在现阶段,我发现它相当有用。

  2. jatora

    “一个 17GB 的文件就能在我的家用机器上完成所有这些工作,这简直是个奇迹。再次为本地模型今年取得的巨大进步感到欣喜和惊叹。”

    我觉得这才是应该闪烁显示的头条——这展示了消费级硬件能做到什么程度。

  3. hellajack3d

    当前所有时代的模型都会过度思考,这是它们 RL 激励(或蒸馏自具有此类激励的模型)的产物。

    根据我对 Fable 5 和 Opus 5 System cards 的阅读,我的重构如下:

    完成任务 → 制造任务已完成的外部可观测证据 → 检查自己的工作 → 修复问题 → 不要过早停止 → 全面满足评估者的要求。

    这对 SWE 基准测试和自主代理来说棒极了。但这也会自然地产生病理现象:

    回答不足代价高昂;回答过度则成本低廉。

  4. xlayn

    我有一个 llama.cpp 的分支,除了其他功能(比如修补模板以避免破坏 kv cache,以及将对话保存到磁盘以便几天后能快速恢复)外,还在此处支持 reasoning effort 标志:https://github.com/alainnothere/llama.cpp/tree/disk-cache-ev...

    我做过测试,reasoning effort 可以针对每条消息单独设置。我之前不知道 @xscott 提到的 none 选项,我测试过但没看到任何变化。我认为只有三个值:xhigh、medium 和 low,参考 https://huggingface.co/Qwen/Qwen3.8-27B-FP8。我做过测试,这东西可以“自言自语一千万个词以确保没漏掉什么”,然后切换到更快的模型,再切换……我做过测试,它能保持连贯性并遵循其思维链条(train of though-kens),你可以在此查看结果... https://github.com/alainnothere/llama.cpp/blob/disk-cache-ev...

  5. RachelF

    对我来说,令人惊叹的是我们现在拥有了本地模型,其推理能力可与大约一年前的高端模型相媲美。

    我希望这一趋势能持续下去。

  6. shifto

    这无法满足那些只想把模型扔进现有工具集就直接运行的人,但我认为有很多方法可以处理这个过度思考的问题。

    例如,虽然这算是退步,但我设置了 {"reasoning_effort":"none"} 并牵着它的鼻子走:

    用户:我们要做一个 <愚蠢的演示>。请制定一个计划,但先不要写代码。

    代理:<简短且合理的计划>

    用户:现在请按照该计划编写代码。不要有其他对话。

    代理:<在合理时间内生成的合理代码>

    也许这可以用 Jinja 模板或其他方式修复,或者这只是对你 harness 的一种 hack,但它表明你可以让模型进行合理的推理。

  7. jedbrooke

    我觉得 LLM 当前所做的这种“推理”最终肯定会走入死胡同。每次我读到另一个带有“但等等”和“实际上”的答案,看着它们通过“推理”一步步走向(有时是)更好的答案时,我都觉得一定有一种方法可以直接跳转到正确的答案,而不是消耗这么多 token 在原地打转,模仿真正的思考过程。

  8. dexterlagan

    我对它推理 effort 的对比 [0] 似乎表明它实际上只支持 3 种模式:none、low 和 xhigh。

    Low 和 medium 基本上是一样的。

    此外,在 3090 上运行所消耗的电力也不容忽视,因此如果不算硬件成本,通过 API 使用 Luna high 比在本地运行 Qwen 3.8 27b 更便宜。

    [0]: https://aibenchy.com/compare/qwen-qwen3-8-27b-high/qwen-qwen...

同日更多故事

2026-08-17