DeepSeek-V4.1 Flash сжимает KV-кэш в 4 раза, ускоряя prefill до 420 токенов/с

DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression

DeepSeek-V4.1 Flash сжимает KV-кэш в 4 раза, ускоряя prefill до 420 токенов/с

DeepSeek-V4.1 Flash — это 552B MoE-модель с поддержкой мультимодального ввода и контекстом до 1M токенов. Благодаря архитектуре Causal Encoder-Decoder, CSA2 и FP4-квантованию удалось сократить хранилище KV-кэша в 4 раза, а постоянное — в 8 раз по сравнению с DeepSeek-V4-Flash. При этом активируется всего 8B параметров на prefill и 16B на decode, что критично для длинных агентных сценариев.

DeepSeek-V4.1 Flash — это мультимодальная MoE-модель, спроектированная для более агрессивного сжатия KV-кэша.

Ещё за этот день

2026-09-17