Qwen3.8 27B量化测试:4-bit稳健,1-bit崩盘

Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses

Qwen3.8 27B量化测试:4-bit稳健,1-bit崩盘

我花了3000美元在Modal上租用GPU,对Qwen3.8 27B模型进行了全面的量化基准测试。结果显示,17GB的Q4_K_M版本在Terminal-Bench 2.1等关键任务中表现与完整的BF16模型几乎无异,甚至能在RTX 4090上流畅运行。然而,当压缩至1-bit时,模型性能遭遇断崖式下跌,在GPQA Diamond测试中得分甚至低于随机猜测,且推理时间越长表现越差。这次测试证实了量化并非总是牺牲质量,但1-bit压缩确实存在不可逾越的极限。

压缩最终会遇到悬崖:在1-bit精度下,模型在GPQA Diamond测试中的表现接近随机猜测,而更长的推理过程只会让情况变得更糟。
  1. spider-mario

    第二,除了噪声(柱状图显示的是 Wilson 95% 置信区间,对于运行间的噪声来说非常保守),4-bit 以下几乎没有差异;只有 2-bit 的分数稍低一些。

    置信区间与运行间的变化毫无关系。它们与人们通常归因于它们的大多数事情也没什么关系(https://link.springer.com/article/10.3758/s13423-015-0947-8),而与运行间变化的关系更是微乎其微(https://link.springer.com/article/10.1007/s10654-016-0149-3 misconception 22)。

  2. sharmajai

    这证实了我关于使用低精度量化时质量损失极小的一个理论(我使用的是 IQ3_XXS 配合 8-bit KV cache)以及 XHIGH(默认)思考级别。

    众所周知,虽然量化会影响采样概率分布(在给定相同上下文的情况下,下一个最可能的 token 是什么),但 Qwen 3.8 27b 似乎通过增加思考量来抵消这一点,从而最终完成任务(无论是基准测试还是其他任务)。

    因此,只要思考过程(尽管更长)是合理的,就会导致相同的成功率(如文章所示),但可能会以消耗更多 token 和更多时间为代价。

    我认为除了成功率之外,进一步绘制每种量化级别所使用的 token 数量也会很有用。

    感谢进行并分享这项研究!

  3. purpleflame1257

    这里在 Q3 处确实有个大漏洞。一个关键的断点在于 16GB 以下的显卡,这涵盖了 5080、5070 Ti、5060ti 以及上一代和本代的几款其他显卡。如果能看看质量拐点(knee)在哪里,会很有启发性。

  4. alentred

    我对 *KV cache* 量化的类似基准测试非常感兴趣。

    我有时会用 Qwen3.8 27B Q4_K_M 进行代码生成,因此需要相对较长的上下文。我最终选择了 q8_0,因为这是唯一能将模型 + 100k tokens 塞进 24GB VRAM 的方法,但我仍然想知道在质量上损失了多少,以及还有哪些其他选项。

    我还听说,随着上下文变长,KV cache 量化的重要性会更高。基准测试这一点也可能会很有趣:在不同组合(模型量化 × KV cache 量化 × 上下文大小)下的质量表现如何。

  5. Farmadupe

    嗯,假设这篇文章是部分由 claude 撰写、部分由人类撰写的,谁能帮我总结一下判断“这篇文章是否值得读”的经验法则吗?

    因为一方面,行文和呈现方式很痛苦(叙述无关紧要的点、非线性的 X 轴、模糊的图表标签等等),

    但另一方面,我假设作者想要传达的结果(“在这些评估中,生成质量似乎相当不错”)听起来值得分享?

    因为我目前真的很纠结这个问题。我是否有权做出不利的推断,即“如果文章将无关文本与数据并列呈现,这可能表明作者并不理解他们试图撰写的任务”?

同日更多故事

2026-09-08