Kimi Linear:线性注意力架构的新突破
Kimi Linear: An Expressive, Efficient Attention Architecture

Kimi Team 推出了 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文及强化学习缩放等场景中全面超越全注意力机制。其核心是 Kimi Delta Attention(KDA),通过更细粒度的门控机制优化有限状态 RNN 内存的使用。团队还开发了定制的块状算法,利用 Diagonal-Plus-Low-Rank(DPLR)变体矩阵大幅提升硬件效率。实验显示,在相同训练策略下,Kimi Linear 在各项任务中显著优于全 MLA,KV 缓存使用减少高达 75%,百万级上下文解码吞吐量提升 6 倍。该模型已开源 KDA 内核和 vLLM 实现,并发布了预训练与指令微调的模型检查点,为长输入输出任务提供高效替代方案。
Kimi Linear 首次在各种场景下公平比较中全面超越全注意力机制,包括短上下文、长上下文和强化学习缩放模式。
HN 评论区
133- oakpond
为了支持进一步的研究,我们开源了 KDA 内核和 vLLM 的实现,并发布了预训练和指令微调后的模型检查点。
这真是太棒了。
- delichon
如果你想相信 Kimi 的成功归功于蒸馏攻击,那就无视这条评论吧。
- pooyamo
领域内的专家能否确认,我们在前沿模型中看到的这种智能,是否真的是只有在架构扩展后才出现的“涌现”现象?
这不是很奇怪吗?拥有相同架构的 100 万参数模型连基础谜题都解不开,但突然之间,1 万亿参数的模型就能为雅可比猜想构造反例?
这很反直觉,因为据我所知,算法开发的基本准则之一就是,对于某些复杂问题,你无法仅仅靠暴力穷举来找到解决方案。例如,如果你给朴素排序算法投入更多算力,它依然无法击败快速排序。但在现代大语言模型领域,人们似乎都在竞相扩大规模,进行实证实验,并希望同样的算法或架构能最终找到解决方案。
- senko
虽然有点旧但依然相关:如果你阅读最近发布的 Kimi K3 论文 [0],你会发现它 heavily 基于这里讨论的 Kimi Linear,将其扩展并添加了许多新特性(如原生视觉能力和强化学习改进)。
- bratao
我开始用它构建内部模型,随后 Gated Deltanet 2 发布了 (https://arxiv.org/abs/2605.22791),它看起来是 Kimi Linear 在表达能力上的进化。在我们的测试中,它的表现确实更好。