Kimi Delta Attention其实不难推导
You Could Have Come Up with Kimi Delta Attention
现代线性注意力变体往往显得复杂难懂,让人望而却步。本文带你从基础的二次注意力出发,逐步拆解从线性注意力到DeltaNet,再到Gated DeltaNet,最终推导出Kimi Delta Attention(KDA)的全过程。文章揭示了这些看似高深的公式,其实源于对隐藏状态更新的简单直觉:与其直接写入数值,不如写入预测误差。通过这种视角,我们不仅能理解Qwen和Kimi模型背后的数学逻辑,还能看到如何从简单的假设自然演进到复杂的算法设计。
线性注意力给了我们一个紧凑的关联记忆,但它的更新行为像是加号等于,而我们真正想要的是接近赋值号的行为。