vLLM が AMD GPU 上で投機的デコーディングを検証、スループットは手法次第
Speculative Decoding in vLLM on AMD GPUs
vLLM チームが AMD Instinct MI300X/MI355X GPU と ROCm 上で、投機的デコーディングの出力トークンスループットへの影響を調査。ネイティブ MTP、Gemma 4 MTP、EAGLE-3、DFlash、DSpark の5つのドラフト手法を比較し、その効果はモデルファミリーやドラフトチェックポイント、ワークロード、受理率に依存することが判明。各手法の仕組みと有効化方法、チューニングの実践的な考慮事項も解説する。
投機的デコーディングは、複数のドラフトトークンを単一のターゲットモデルパスで検証できるようにする。