Qwen3.8 27Bを24GB GPUで256Kコンテキスト実行、50 tok/sを達成
Qwen3.8-27B at 256K on a 24GB RTX PRO 4000 SFF (432 GB/s): 50 tok/s with MTP

NVIDIA RTX PRO 4000 SFF (24GB) 上で、Qwen3.8 27Bをフル256Kコンテキストで動作させ、MTP (Multi-Token Prediction) により平均50.44 tok/sを達成。カスタム量子化 (NVFP4とQ5_K/Q6_Kのハイブリッド) とllama.cppの最適化ビルドにより、クリーンなmaster比で21.97%の高速化を実現。また、MTPドラフターの精度向上がかえって性能を低下させるなど、個々の最適化が全体最適に繋がらないという知見も得た。
最適なローカル推論セットアップは、個々に「最良」の部品から作られることはめったにない。
HNでの議論
13- simonw
それらを1つの英雄的な高速化にまとめると、見出しは良くなるが、ベンチマークとしては悪くなるだろう。
「そのマシンはすぐに、容量の見積もりは単なる入場券だと教えてくれた。」
「本番では有用だが、カーネル比較では毒だ。」
こういう書き方はやめてください。読むのが疲れます。そういう部分は編集で削れます。
この記事で一番良いのは、最後の「完成モデルからの5つのxhighアーティファクト」のセクションです。それを上に移動するか、少なくとも記事の冒頭で目立つように宣伝することをお勧めします。
- supermatt
何らかの並行処理で、どれだけのトークン数を得られるか試していただけませんか?私が見てきた、より手頃なカードでのベンチマークは、ほぼ全てが単一リクエストのものばかりです。
- Tepix
タイトルには常に量子化を入れてください!
- nodja
サイト全体がAIスラップのように見え、読めます。結果も意味をなさず、厳密にテストされているとは感じられません(Claudeにテストさせたからといって、厳密とは言えません)。
- gitowiec
なぜフラグが立てられているのですか?