vLLM v0.28.0 출시: Kimi-K3 및 DeepSeek V4 성능 대폭 최적화

vLLM v0.28.0이 584개의 커밋과 270명의 기여자(신규 76명)로 출시되었습니다. 이번 릴리스의 핵심은 Kimi-K3와 DeepSeek V4 모델에 대한 대규모 성능 최적화입니다. Kimi-K3는 Decode Context Parallel(DCP), fused FlashKDA 커널, SiTU activation, GEMM-RS 시퀀스 병렬화, 적응형 speculative 토큰 예산(약 60% TTFT 개선), GPU당 약 17GiB 메모리 절약 등의 개선이 포함됩니다. DeepSeek V4는 sparse MLA가 일반 decode, MTP, DSpark speculative decoding에서 엔드투엔드로 작동하며, AMD Quark NVFP4 지원, ROCm gfx11/gfx950 지원이 추가되었습니다. 또한 speculative decoding의 DFlash2와 DSpark 개선, Model Runner V2의 E/P/D 분리, tiered KV cache offloading(디스크 offload 포함), Rust 프론트엔드와 gRPC 멀티모달 추론, 새로운 기본값(예: max_num_batched_tokens 16384) 등이 포함됩니다. breaking changes로는 bitsandbytes가 out-of-tree 플러그인으로 전환되고, Transformers 5.15.0으로 업그레이드되었습니다.

Kimi-K3의 적응형 speculative 토큰 예산은 DSpark TTFT를 약 60% 개선했으며, 선택적 shared-expert sharding은 GPU당 약 17GiB의 메모리를 절약합니다.

이 날의 다른 글

2026-08-29