DeepSeek-V4.1 Flash komprimiert den KV-Cache um das Vierfache

DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression

DeepSeek-V4.1 Flash komprimiert den KV-Cache um das Vierfache

DeepSeek-V4.1 Flash ist ein multimodales Mixture-of-Experts-Modell mit 552B Parametern und 1M-Token-Kontext, das den KV-Cache radikal reduziert. Durch die Causal Encoder-Decoder-Architektur (CED) werden im Prefill nur 8B Parameter pro Token aktiviert, im Decode 16B. Die CSA2-Attention kombiniert lokales Sliding Window mit globaler Sparse-Retrieval und Cross-Layer-KV-Reuse; FP4-Quantisierung senkt den Speicherbedarf auf etwa 890 Bytes pro Token. Der Laufzeit-KV-Cache schrumpft auf ein Viertel, der persistente auf ein Achtel – bei besserer Gesamtleistung als DeepSeek-V4-Flash.

Obwohl DeepSeek-V4.1-Flash deutlich größer ist als DeepSeek-V4-Flash, beträgt sein benötigter Laufzeit-KVCache-Speicher bei gleicher Sequenzlänge nur etwa 1/4 des letzteren, und sein persistenter KVCache-Speicher nur etwa 1/8 des letzteren.

Mehr von diesem Tag

2026-09-17