DeepSeek-V4.1 Flash、KV Cacheを4分の1に圧縮して長文脈エージェントを変える
DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression

DeepSeek-V4.1 Flashは552BのマルチモーダルMoEモデルで、最大100万トークンの文脈を扱いながら、実行時のKV CacheはDeepSeek-V4-Flashの約4分の1、永続ストレージは約8分の1に抑える。鍵はCEDアーキテクチャで、Prefill時は最初の20層のみを通し、活性化パラメータを8Bに削減。CSA2がチャネル・系列・層の3次元でKVを圧縮し、FP4量子化も併用する。
DeepSeek-V4.1-Flash is a multimodal mixture-of-experts model designed for more aggressive KVCache compression.
HNでの議論
10- arikrahman
KV Cacheの圧縮作業と、プレフィックスキャッシュによってクエリがほぼ無料で収束するようになったことには、とても感銘を受けています。
- mmastrac
自動インクリメンタルコンテキストコンパクタを有効にして作業しているのですが、驚くほど役に立っています。特にDS41fでは効果的でした。実効セッション長が5Mで、モデルは300k~400k程度で動いていて、速度と知能の両方を維持していました。
正直なところ、400tok/sのプレビューも動かしてみましたが、あれはもうただただすごかったです。いくつかの難しい問題に取り組みながら、一日かけてひたすらコンパクト化を繰り返させていました。
- vivzkestrel
ブログページが404? https://zartbot.github.io/blog/