Как vLLM ускоряет генерацию на AMD GPU: разбор спекулятивного декодирования
Speculative Decoding in vLLM on AMD GPUs
Спекулятивное декодирование — это техника, которая позволяет проверять несколько черновых токенов за один проход целевой модели, сокращая число шагов декодирования. В блоге vLLM представлены результаты экспериментов на GPU AMD Instinct MI300X и MI355X с использованием ROCm. Рассматриваются пять методов чернового декодирования: нативный MTP, Gemma 4 MTP, EAGLE-3, DFlash и DSpark. Показано, что влияние на пропускную способность зависит от метода, длины предложения, семейства моделей и других факторов. Приводятся практические рекомендации по настройке и наблюдению за производительностью.
Спекулятивное декодирование не заменяет исходную модель: она остается целевой моделью, отвечающей за конечный результат, а перед ней добавляется более быстрый этап предложения кандидатов.