24GB显卡跑满Qwen3.8:50 tok/s实测
Qwen3.8-27B at 256K on a 24GB RTX PRO 4000 SFF (432 GB/s): 50 tok/s with MTP

我在24GB显存的RTX PRO 4000 SFF上,成功让Qwen3.8-27B在256K长上下文下跑出了50 tok/s的吞吐量。实验证明,单纯堆砌“最佳”组件往往适得其反,真正的性能来自量化方案、MTP推测解码、CUDA内核与内存布局的精密配合。从Q4_0的意外胜出到NVFP4的精度陷阱,再到n=8时的MTP性能跃升,每一步调整都揭示了本地推理的复杂权衡。最终,通过定制llama.cpp构建和针对性的iMatrix校准,系统在满载缓存下依然稳定,证明了精细调优比盲目升级硬件更有效。
获胜的配置源于量化方案、推测器、CUDA内核、内存布局与工作负载之间的完美契合,没有任何单个组件能独自胜出。