DFlash 2: 20% más de tokens por verificación con solo un 1% de latencia añadida

DFlash 2: Keep Drafting Parallel

DFlash 2: 20% más de tokens por verificación con solo un 1% de latencia añadida

Inco AI presenta DFlash 2, una mejora de su técnica de decodificación especulativa que predice bloques de tokens en paralelo. Con un selector de trayectorias ligero y un módulo convolucional que combate la degradación del sufijo, logra más de un 20% de aumento en la longitud de aceptación con apenas un 1% de latencia adicional. En SGLang, alcanza 2.7–3.4× el rendimiento de la decodificación autorregresiva en Qwen3.8-27B. Ya disponible en SGLang, vLLM, llama.cpp y oMLX.

Elegir es más barato que predecir.

Más de este día

2026-08-19