DeepSeek-V4.1 Flash:KV Cache 压缩极限

DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression

DeepSeek-V4.1 Flash:KV Cache 压缩极限

起初我以为 DeepSeek-V4.1 Flash 只是 DeepSeek-V4 的常规迭代,直到发现其推理速度飙升至 420 Tokens/s,且官方宣布 DeepSeek-V4 Pro 将下线,才意识到这绝非小事。这篇技术报告揭示了其核心突破:通过 Causal Encoder-Decoder 架构与 CSA2 技术,将 KV Cache 存储压缩至原来的 1/4。它采用 FP4 精度量化,在 Prefill 阶段仅激活 8B 参数,解码阶段激活 16B 参数,专门针对长上下文 Agent 场景优化。这不仅解决了 HBM 和 SSD 的存储瓶颈,更让百万 token 级长文本处理成为可能,堪称 DeepSeek-V5 级别的架构革新。

进一步减小 key-value cache 的占用空间,对于缓解存储和通信瓶颈、降低长上下文服务成本至关重要。
  1. arikrahman

    我对 KV Cache 压缩工作以及前缀缓存(prefix caching)同样印象深刻,这让查询的收敛成本几乎为零。

  2. mmastrac

    我一直在使用启用的自动增量上下文压缩器,它 surprisingly helpful(出奇地好用)。在 DS41f 上效果尤为显著——我觉得当时的有效会话长度达到了 5M,而模型实际运行在 300k-400k 左右,同时保持了速度和智能水平。

    老实说,我也跑了那个 400tok/s 的预览版,简直疯了。我让它在一天内反复压缩,攻克了几个棘手的问题。

  3. vivzkestrel

    博客页面 404?https://zartbot.github.io/blog/

同日更多故事

2026-09-17