DeepSeek выпустила V4.1-Flash: 552B параметров при 8B активных
DeepSeek v4.1 Flash
DeepSeek представила V4.1-Flash — самую компактную модель в новой архитектурной линейке с нативным визуальным пониманием. Это MoE на 552B параметров с асимметричной архитектурой Causal Encoder–Decoder: всего 8B активных параметров на входе и 16B на выходе. KV-кэш требует в 4 раза меньше HBM и в 8 раз меньше SSD по сравнению с предыдущим поколением. Модель уже доступна в DeepSeek API под именем deepseek-flash, а старые V4-Flash и V4-Flash-Vision-Exp временно перенаправляются на неё. Цены снижены, в непиковые часы — скидка 50%.
Cache-hit charges often account for a large share of agent costs. Compressing the cache cuts those costs significantly.