Kimi Delta Attention其实不难推导
You Could Have Come Up with Kimi Delta Attention
现代线性注意力变体往往显得复杂难懂,让人望而却步。本文带你从基础的二次注意力出发,逐步拆解从线性注意力到DeltaNet,再到Gated DeltaNet,最终推导出Kimi Delta Attention(KDA)的全过程。文章揭示了这些看似高深的公式,其实源于对隐藏状态更新的简单直觉:与其直接写入数值,不如写入预测误差。通过这种视角,我们不仅能理解Qwen和Kimi模型背后的数学逻辑,还能看到如何从简单的假设自然演进到复杂的算法设计。
线性注意力给了我们一个紧凑的关联记忆,但它的更新行为像是加号等于,而我们真正想要的是接近赋值号的行为。
HN 评论区
126- TrackerFF
依我之见,机器学习领域在过去 15 年里一直需要(甚至可以说早就急需)一套统一的数学符号体系。话虽如此,情况以前更糟——那时机器学习论文来自全球各地的研究者,你经常会看到一些极其狂野的符号用法。
很多人可能不同意我的观点,但在我看来,符号的不一致(尤其是跨论文的不一致)就是摩擦成本。至少在这篇文章里,作者在开篇就明确解释了所用符号……但这并不总是如此,甚至很少见。
补充:我甚至没注意到符号的切换,非常感谢指出。
- benjiro29
> 你本可以想出……
创造或组合出某种全新的、此前不存在的东西,其实难如登天!
一旦这东西被展示出来,人们就会说:“哦,这也没那么难嘛”,“我也能搞定”,或者类似的胡扯。一旦有人完成了最艰难的工作,一切看起来都变得简单无比。
作为开发者,我们都有过这种经历:自以为发明了某种新东西,结果……却发现早在 70 年代就有人做出来了,而且遍地都是。只是因为从未与你相遇,你才从未意识到它的存在。
- croemer
这肯定是 LLM 写的:
> 恒等式 [...] 才是整个技巧的核心。外积是一个矩阵,内积是一个标量。我们不再存储每一个过去的 key 和 value。我们只存储它们的外积之和,保存在固定大小的状态 S_t 中。
- dr_kretyn
对于我来说,bra-ket 符号让这一切变得非常简单/直观。提到“向量”时,我总是搞不清哪个是横向、哪个是纵向,然后我就跟着那些模糊的符号块走,分心走神,最后直接放弃。而有了 bra-ket 符号,整个过程非常直观!我现在打算把其他文章也转换成这种符号,因为我肯定错过了很多好东西!
(附注:我拥有物理学博士学位,并伴有轻度阅读障碍)
- HonshinM
可视化教程:https://snowchord.com/blog/linear-attention-visualized/
- xp84
当我看到这类文章和标题时,我不禁对那些远比我聪明得多的人 [1] 感到无比感激。这也让我更加谦卑,因为我在高中和本科阶段曾被认为是个“非常聪明的人”。事实上,对于普通人来说我确实算“聪明”,但肯定有数百万人让我相形见绌,显得像个乡巴佬。
[1] 我特指那些能够在大脑中容纳极其庞大复杂的概念和系统,并对其进行推理的人,这似乎是数学家的关键天赋。
- alex-moon
“机器学习架构对我们 AI 研究者来说已是第二本能,所以很容易忘记普通人可能只知道梯度下降和 ReLU 的公式。”
“当然还有 softmax。”
- _Microft
顺便提一句,在你问之前:是的,bra-ket 符号之所以这么叫,就是因为那些括号。