Kimi Linear:线性注意力架构的新突破
Kimi Linear: An Expressive, Efficient Attention Architecture

Kimi Team 推出了 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文及强化学习缩放等场景中全面超越全注意力机制。其核心是 Kimi Delta Attention(KDA),通过更细粒度的门控机制优化有限状态 RNN 内存的使用。团队还开发了定制的块状算法,利用 Diagonal-Plus-Low-Rank(DPLR)变体矩阵大幅提升硬件效率。实验显示,在相同训练策略下,Kimi Linear 在各项任务中显著优于全 MLA,KV 缓存使用减少高达 75%,百万级上下文解码吞吐量提升 6 倍。该模型已开源 KDA 内核和 vLLM 实现,并发布了预训练与指令微调的模型检查点,为长输入输出任务提供高效替代方案。
Kimi Linear 首次在各种场景下公平比较中全面超越全注意力机制,包括短上下文、长上下文和强化学习缩放模式。