vLLM v0.28.0: оптимизация Kimi-K3, поддержка DeepSeek V4 и 584 коммита
Вышел vLLM v0.28.0 — крупное обновление с 584 коммитами от 270 контрибьюторов (76 новичков). Главные изменения: значительная оптимизация производительности для Kimi-K3 (включая Decode Context Parallel, fused-ядра FlashKDA, адаптивный бюджет спекулятивных токенов, экономию ~17 GiB памяти на GPU), поддержка DeepSeek V4 (sparse MLA, AMD Quark NVFP4, ROCm), прогресс в спекулятивном декодировании (DFlash2, DSpark), созревание Model Runner V2, выгрузка KV-кэша на диск, Rust-фронтенд с gRPC и новые модели (Muse Glimmer, Ling 3.0 Flash и др.). Также изменены значения по умолчанию и есть несколько ломающих изменений, включая перенос bitsandbytes в отдельный плагин.
Kimi-K3 также теперь работает на ROCm с V2 model runner.