Как vLLM ускоряет генерацию на AMD GPU: разбор спекулятивного декодирования

Speculative Decoding in vLLM on AMD GPUs

Как vLLM ускоряет генерацию на AMD GPU: разбор спекулятивного декодирования

Спекулятивное декодирование — это техника, которая позволяет проверять несколько черновых токенов за один проход целевой модели, сокращая число шагов декодирования. В блоге vLLM представлены результаты экспериментов на GPU AMD Instinct MI300X и MI355X с использованием ROCm. Рассматриваются пять методов чернового декодирования: нативный MTP, Gemma 4 MTP, EAGLE-3, DFlash и DSpark. Показано, что влияние на пропускную способность зависит от метода, длины предложения, семейства моделей и других факторов. Приводятся практические рекомендации по настройке и наблюдению за производительностью.

Спекулятивное декодирование не заменяет исходную модель: она остается целевой моделью, отвечающей за конечный результат, а перед ней добавляется более быстрый этап предложения кандидатов.

Ещё за этот день

2026-09-07