ローカルLLMが「賢くない」と感じる本当の理由
Why your local LLM feels dumber than it is

ローカルLLMの性能がリファレンス実装より劣って見える原因を、数学的・実装的な観点から検証。vLLMのアテンションバックエンドの違いやKVキャッシュ量子化、重み量子化がトークン選択に与える影響を、Qwen3.6-27Bを使った実験で示す。特に、量子化によるツール呼び出しの失敗や、コンテキスト長が長くなると精度が低下する現象を再現。同じ重みでも実行環境によって結果が変わることを強調し、ベンチマークの重要性を説く。
量子化されたモデルは、同じ重みでも実行環境によって結果が変わる。