vLLM v0.28.0: 584 Commits, 270 Contributors, und massive Performance-Sprünge für Kimi-K3 und DeepSeek V4
vLLM v0.28.0 ist da – mit 584 Commits von 270 Mitwirkenden (76 neue). Im Fokus stehen große Performance-Optimierungen für Kimi-K3, darunter Decode Context Parallelism, fusionierte FlashKDA-Kernel und ein adaptives spekulatives Token-Budget, das die DSpark TTFT um ~60% verbessert. DeepSeek V4 erhält end-to-end sparse MLA für Decode, MTP und DSpark sowie AMD Quark NVFP4-Support. Weitere Highlights: Model Runner V2 mit E/P/D-Disaggregation und Weight Offloading, Tiered KV Cache Offloading auf Disk, ein Rust-Frontend mit gRPC, neue Modelle wie Muse Glimmer und Ling 3.0 Flash, sowie neue Defaults wie max_num_batched_tokens=16384. Breaking Changes: bitsandbytes wird zum out-of-tree Plugin, Transformers erfordert 5.15.0.
Kimi-K3 erhält ein adaptives spekulatives Token-Budget, das eine ~60% bessere DSpark TTFT liefert.