Decodificación especulativa en vLLM sobre GPUs AMD: un análisis práctico

Speculative Decoding in vLLM on AMD GPUs

Decodificación especulativa en vLLM sobre GPUs AMD: un análisis práctico

La decodificación especulativa permite a vLLM verificar múltiples tokens propuestos en una sola pasada del modelo objetivo, pero su efecto en el rendimiento varía según el método de borrador y la longitud de la propuesta. Este análisis explora cinco enfoques—MTP nativo, MTP de Gemma 4, EAGLE-3, DFlash y DSpark—y presenta mediciones en GPUs AMD Instinct MI300X y MI355X con ROCm. Los resultados muestran que el rendimiento depende del modelo, el checkpoint de borrador, la carga de trabajo y la tasa de aceptación, ofreciendo pautas para ajustar y observar el sistema en producción.

Cuando varios tokens de borrador son aceptados, el sistema puede confirmar múltiples tokens de salida en un solo paso de verificación del modelo objetivo, preservando el comportamiento de salida del modelo.

Más de este día

2026-09-07