24GB显卡跑满Qwen3.8:50 tok/s实测
Qwen3.8-27B at 256K on a 24GB RTX PRO 4000 SFF (432 GB/s): 50 tok/s with MTP

我在24GB显存的RTX PRO 4000 SFF上,成功让Qwen3.8-27B在256K长上下文下跑出了50 tok/s的吞吐量。实验证明,单纯堆砌“最佳”组件往往适得其反,真正的性能来自量化方案、MTP推测解码、CUDA内核与内存布局的精密配合。从Q4_0的意外胜出到NVFP4的精度陷阱,再到n=8时的MTP性能跃升,每一步调整都揭示了本地推理的复杂权衡。最终,通过定制llama.cpp构建和针对性的iMatrix校准,系统在满载缓存下依然稳定,证明了精细调优比盲目升级硬件更有效。
获胜的配置源于量化方案、推测器、CUDA内核、内存布局与工作负载之间的完美契合,没有任何单个组件能独自胜出。
HN 评论区
11- gitowiec
为什么被标记了?
- simonw
“把它们合并成一个英雄般的加速效果会是个更好的标题,但也是个更烂的基准测试。”
“这台机器立刻教会了我,容量估算不过是入场券罢了。”
“在生产环境中很有用,但在内核对比中却是毒药。”
请别再发布这类文章了,读起来让人精疲力竭。你可以把那些内容删掉。
这篇文章最棒的部分其实是底部的“来自最终模型的五个 xhigh 伪影”章节,我建议要么把它移到前面,要么至少在文章顶部显著地推广它。
- supermatt
能不能试一下并发模式,看看能跑出多少 token?我见过的几乎所有针对更易获取显卡的基准测试,都只跑了单个请求。
- Tepix
标题里一定要写上量化版本!
- nodja
整个网站看起来、读起来都像是 AI 生成的垃圾。结论也毫无逻辑,感觉根本没过严谨的测试(不,让 Claude 帮你测试可不算严谨)。