DeepSeek-V4.1 Flash comprime la KV Cache 4 veces más y acelera los agentes de contexto largo

DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression

DeepSeek-V4.1 Flash comprime la KV Cache 4 veces más y acelera los agentes de contexto largo

DeepSeek-V4.1 Flash es un modelo multimodal de 552B parámetros que comprime la KV Cache hasta 4 veces más que su predecesor. Con solo 20 de sus 40 capas activas durante el prefill, reduce los parámetros activados a 8B en prefill y 16B en decode. Su arquitectura Causal Encoder-Decoder y CSA2 logran un almacenamiento de solo 890 bytes por token, ideal para agentes de contexto largo.

DeepSeek-V4.1-Flash es un modelo multimodal de mezcla de expertos diseñado para una compresión de KVCache mucho más agresiva.

Más de este día

2026-09-17