Qwen3.8 27Bを24GB GPUで256Kコンテキスト実行、50 tok/sを達成
Qwen3.8-27B at 256K on a 24GB RTX PRO 4000 SFF (432 GB/s): 50 tok/s with MTP

NVIDIA RTX PRO 4000 SFF (24GB) 上で、Qwen3.8 27Bをフル256Kコンテキストで動作させ、MTP (Multi-Token Prediction) により平均50.44 tok/sを達成。カスタム量子化 (NVFP4とQ5_K/Q6_Kのハイブリッド) とllama.cppの最適化ビルドにより、クリーンなmaster比で21.97%の高速化を実現。また、MTPドラフターの精度向上がかえって性能を低下させるなど、個々の最適化が全体最適に繋がらないという知見も得た。
最適なローカル推論セットアップは、個々に「最良」の部品から作られることはめったにない。