vLLM 在 AMD GPU 上实现 Speculative Decoding
Speculative Decoding in vLLM on AMD GPUs
Speculative Decoding 让 vLLM 能在一次目标模型推理中验证多个候选 token。我们在 AMD Instinct MI300X 和 MI355X GPU 上测试了五种 drafting 方法:native MTP、Gemma 4 MTP、EAGLE-3、DFlash 和 DSpark。实验显示,吞吐量提升效果因 drafting 策略、提案长度、模型家族及接受率而异。Speculative Decoding 通过“草稿-验证”机制,在保持目标模型输出行为不变的前提下,显著减少推理轮次。本文详细解析了各 drafting 架构如何从目标模型获取隐藏状态或 KV cache,并对比了它们在 ROCm 平台上的实际表现,为大规模 LLM 服务优化提供实践参考。
Speculative decoding 允许 vLLM 在单次目标模型推理中验证多个草稿 token。