Qwen3.8 27B量化测试:4-bit稳健,1-bit崩盘
Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses
我花了3000美元在Modal上租用GPU,对Qwen3.8 27B模型进行了全面的量化基准测试。结果显示,17GB的Q4_K_M版本在Terminal-Bench 2.1等关键任务中表现与完整的BF16模型几乎无异,甚至能在RTX 4090上流畅运行。然而,当压缩至1-bit时,模型性能遭遇断崖式下跌,在GPQA Diamond测试中得分甚至低于随机猜测,且推理时间越长表现越差。这次测试证实了量化并非总是牺牲质量,但1-bit压缩确实存在不可逾越的极限。
压缩最终会遇到悬崖:在1-bit精度下,模型在GPQA Diamond测试中的表现接近随机猜测,而更长的推理过程只会让情况变得更糟。
HN 评论区
97- spider-mario
第二,除了噪声(柱状图显示的是 Wilson 95% 置信区间,对于运行间的噪声来说非常保守),4-bit 以下几乎没有差异;只有 2-bit 的分数稍低一些。
置信区间与运行间的变化毫无关系。它们与人们通常归因于它们的大多数事情也没什么关系(https://link.springer.com/article/10.3758/s13423-015-0947-8),而与运行间变化的关系更是微乎其微(https://link.springer.com/article/10.1007/s10654-016-0149-3 misconception 22)。
- sharmajai
这证实了我关于使用低精度量化时质量损失极小的一个理论(我使用的是 IQ3_XXS 配合 8-bit KV cache)以及 XHIGH(默认)思考级别。
众所周知,虽然量化会影响采样概率分布(在给定相同上下文的情况下,下一个最可能的 token 是什么),但 Qwen 3.8 27b 似乎通过增加思考量来抵消这一点,从而最终完成任务(无论是基准测试还是其他任务)。
因此,只要思考过程(尽管更长)是合理的,就会导致相同的成功率(如文章所示),但可能会以消耗更多 token 和更多时间为代价。
我认为除了成功率之外,进一步绘制每种量化级别所使用的 token 数量也会很有用。
感谢进行并分享这项研究!
- purpleflame1257
这里在 Q3 处确实有个大漏洞。一个关键的断点在于 16GB 以下的显卡,这涵盖了 5080、5070 Ti、5060ti 以及上一代和本代的几款其他显卡。如果能看看质量拐点(knee)在哪里,会很有启发性。
- alentred
我对 *KV cache* 量化的类似基准测试非常感兴趣。
我有时会用 Qwen3.8 27B Q4_K_M 进行代码生成,因此需要相对较长的上下文。我最终选择了 q8_0,因为这是唯一能将模型 + 100k tokens 塞进 24GB VRAM 的方法,但我仍然想知道在质量上损失了多少,以及还有哪些其他选项。
我还听说,随着上下文变长,KV cache 量化的重要性会更高。基准测试这一点也可能会很有趣:在不同组合(模型量化 × KV cache 量化 × 上下文大小)下的质量表现如何。
- Farmadupe
嗯,假设这篇文章是部分由 claude 撰写、部分由人类撰写的,谁能帮我总结一下判断“这篇文章是否值得读”的经验法则吗?
因为一方面,行文和呈现方式很痛苦(叙述无关紧要的点、非线性的 X 轴、模糊的图表标签等等),
但另一方面,我假设作者想要传达的结果(“在这些评估中,生成质量似乎相当不错”)听起来值得分享?
因为我目前真的很纠结这个问题。我是否有权做出不利的推断,即“如果文章将无关文本与数据并列呈现,这可能表明作者并不理解他们试图撰写的任务”?