vLLM 0.28.0:Kimi-K3 与 DeepSeek V4 性能大跃升
vLLM v0.28.0
vLLM 项目发布了 v0.28.0 版本,汇聚了 270 位贡献者的 584 次提交。此次更新重点优化了 Kimi-K3 和 DeepSeek V4 模型,通过 Decode Context Parallel 支持、融合 FlashKDA 内核以及自适应推测令牌预算,显著提升了推理速度与内存效率。Model Runner V2 进一步成熟,实现了 E/P/D 解耦与权重卸载。此外,新版本还引入了 Rust 前端、gRPC 多模态推理、分层 KV 缓存卸载等关键特性,并全面支持 NVIDIA、AMD ROCm 及 Intel XPU 硬件。对于追求极致性能的开发者而言,这次更新在推测解码、量化技术及大规模服务架构上带来了实质性突破。
Kimi-K3 现在可以在 ROCm 上运行,并配备了 V2 模型运行器。