Speculative Decoding in vLLM auf AMD-GPUs: Durchsatz variiert stark je nach Methode
Speculative Decoding in vLLM on AMD GPUs
Speculative Decoding verspricht, die Token-Produktion großer Sprachmodelle zu beschleunigen, indem mehrere Kandidaten-Token in einem einzigen Verifikationsschritt des Zielmodells geprüft werden. In diesem Beitrag untersucht das vLLM-Team, wie sich verschiedene Drafting-Methoden – native MTP, Gemma 4 MTP, EAGLE-3, DFlash und DSpark – auf den Output-Token-Durchsatz auf AMD Instinct MI300X- und MI355X-GPUs mit ROCm auswirken. Die Ergebnisse zeigen: Der Effekt variiert stark je nach Modellfamilie, Draft-Checkpoint, Workload und Akzeptanzverhalten. Der Artikel erklärt die Funktionsweise von Autoregressive Decoding und Speculative Decoding, beschreibt die Architektur der fünf Methoden und gibt praktische Hinweise zur Aktivierung und Optimierung in vLLM.
Wenn mehrere Draft-Token akzeptiert werden, kann das System mehrere Ausgabe-Token aus einem einzigen Verifikationsschritt des Zielmodells committen, während das Ausgabeverhalten des Zielmodells erhalten bleibt.