DeepSeek-V4.1 Flash, KV Cache를 4배 압축해 1M 토큰을 선형 비용으로 처리하다

DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression

DeepSeek-V4.1 Flash, KV Cache를 4배 압축해 1M 토큰을 선형 비용으로 처리하다

DeepSeek-V4.1 Flash는 552B 파라미터의 멀티모달 MoE 모델로, Causal Encoder-Decoder 구조를 통해 Prefill 시 8B, Decode 시 16B 파라미터만 활성화한다. CSA2 아키텍처와 FP4 양자화로 런타임 KV Cache를 기존 대비 1/4, 영구 저장소는 1/8로 줄였으며, 1M 토큰 범위에서 연산량이 거의 선형으로 증가한다. Long-horizon Agent 워크플로우의 컨텍스트 증가 문제를 해결하기 위한 설계다.

DeepSeek-V4.1 Flash는 KVCache 압축을 극한까지 밀어붙이는 것을 목표로 한다.

이 날의 다른 글

2026-09-17