AMD GPU에서 vLLM의 추측 디코딩 성능 분석
Speculative Decoding in vLLM on AMD GPUs
vLLM 블로그는 AMD Instinct MI300X 및 MI355X GPU에서 ROCm 플랫폼을 사용하여 추측 디코딩의 출력 토큰 처리량에 대한 실험 결과를 공유합니다. 네이티브 MTP, Gemma 4 MTP, EAGLE-3, DFlash, DSpark 등 다섯 가지 드래프팅 방법을 비교했으며, 각 방법의 성능은 모델 계열, 드래프트 체크포인트, 작업 부하, 수락 동작에 따라 달라졌습니다. 또한 각 방법의 작동 방식과 vLLM에서 활성화하는 방법, 실용적인 튜닝 및 관찰 가능성 고려 사항을 설명합니다.
추측 디코딩은 원래 모델을 대체하지 않습니다. 대신 원래 모델을 최종 출력을 담당하는 타깃 모델로 유지하고, 그 앞에 더 빠른 제안 단계를 추가합니다.