vLLMの内部構造:高スループットLLM推論システムの解剖
vLLM: Anatomy of a High-Throughput LLM Inference System

この記事では、vLLMのコアコンポーネントと高度な機能を段階的に解説します。LLMエンジンの基本(スケジューリング、ページドアテンション、連続バッチ処理)から、チャンク化プレフィル、プレフィックスキャッシュ、投機的デコード、P/D分離などの高度な機能、シングルGPUからマルチGPUへのスケールアップ、サービング層、ベンチマークと自動チューニングまでをカバーします。V1エンジンに焦点を当て、システム全体の正確な高レベルなメンタルモデルを構築できるようにします。
KVキャッシュマネージャーは、利用可能なKVキャッシュブロックのプール(free_block_queue)を維持しており、ページドアテンションでは、ブロックがトークンを計算済みのKVキャッシュブロックにマッピングするインデックス構造として機能します。