ローカルLLMが「賢くない」と感じる本当の理由
Why your local LLM feels dumber than it is

ローカルLLMの性能がリファレンス実装より劣って見える原因を、数学的・実装的な観点から検証。vLLMのアテンションバックエンドの違いやKVキャッシュ量子化、重み量子化がトークン選択に与える影響を、Qwen3.6-27Bを使った実験で示す。特に、量子化によるツール呼び出しの失敗や、コンテキスト長が長くなると精度が低下する現象を再現。同じ重みでも実行環境によって結果が変わることを強調し、ベンチマークの重要性を説く。
量子化されたモデルは、同じ重みでも実行環境によって結果が変わる。
HNでの議論
196- big-chungus4
ちょうどMacBook Proでqwen 3.8 27b mlxを動かしてみたんだけど、正直、これがこんなに賢いとは思わなかった。
- heywoods
システムプロンプトとコンテキストウィンドウ管理に関するセクションは的確だ。多くの人は、人気のあるランナーのデフォルト量子化が、フルFP16と比べて論理的思考をどれだけ劣化させるかに気づいていない。著者が、長いコンテキストでの推論におけるKVキャッシュ圧縮の影響をベンチマークしているかどうか興味がある。というのも、私のローカルLlama 3環境では、まさにそこで性能が崩れ始めるからだ。
- jonplackett
こういう理由から、私は次のルールを守っている:
a) KVキャッシュは量子化しない
b) LLMの量子化は、利用可能な最良のQ8(例えばqwen 3.8 27Bのようなモデルでunsloth GGUFの最大ファイルサイズ)よりも悪いものは使わない。遅くても構わないが、より正確に動作しているという確信が欲しい。
- utopiah
Qwen3.8 27bの4ビット量子化でさえ、社内テストではGemini 3.7 flashと見分けがつかなかった。RTX5090とninferを使えば、約800 TPSのトークン生成(c=8)、シングルストリームで毎秒約140トークンを実現できる。
- a11r
私は4090でQwen3.8 aggressive uncensored Q4_K_Pを、2026 CrackMe CTFチャレンジに対するループで実行している。
oh-my-piを、Qwen自身にも構築させたプリビルト環境で使っている。
Codexはファイルを調べようともしなかった。文字通り、CTFと書かれたものを読むとすぐにシャットダウンした。より賢くないモデルにフォールバックすることさえ提案しなかった。