vLLM v0.28.0: 584 commits, DeepSeek V4 y Kimi-K3 con optimizaciones de rendimiento

vLLM v0.28.0 llega con 584 commits de 270 contribuyentes (76 nuevos). Destaca el impulso de rendimiento para Kimi-K3, con soporte Decode Context Parallel (DCP), kernels fusionados FlashKDA, y un presupuesto adaptativo de tokens especulativos que mejora el TTFT de DSpark en ~60%. DeepSeek V4 ahora funciona de extremo a extremo con sparse MLA, soporte AMD Quark NVFP4 y habilitación en ROCm. Además, se incluyen avances en decodificación especulativa (DFlash2, DSpark), maduración del Model Runner V2, offloading de KV cache en disco, y un frontend en Rust con gRPC. Nuevos modelos: Muse Glimmer, Ling 3.0 Flash, Dots3 NOTE e Interns2mobius. Cambios importantes: bitsandbytes se convierte en plugin externo, Transformers se actualiza a 5.15.0, y se eliminan funciones obsoletas.

Kimi-K3 ahora también se ejecuta en ROCm con el Model Runner V2.

Más de este día

2026-08-29