vLLM v0.28.0リリース:Kimi-K3とDeepSeek V4の性能を大幅に最適化

vLLM v0.28.0がリリースされた。584コミット、270人のコントリビューター(うち76人は新規)による大規模アップデートで、Kimi-K3向けの大規模最適化(Decode Context Parallel、FlashKDAカーネル、適応的投機的トークン予算など)とDeepSeek V4のエンドツーエンド対応(sparse MLA、AMD Quark NVFP4、ROCmサポート)が目玉。さらに、Model Runner V2の成熟、Tiered KV cacheオフロード、RustフロントエンドとgRPCの強化、新しいデフォルト設定(max_num_batched_tokensを16384に引き上げ)などが含まれる。bitsandbytesは外部プラグインに移行し、Transformers 5.15.0が必要となる破壊的変更もある。

Kimi-K3の最適化により、カーネルレベルで1.5〜3倍の高速化を達成し、適応的投機的トークン予算でDSpark TTFTを約60%改善した。

この日のほかの記事

2026-08-29