Kimi Delta Attention の導出:DeltaNet ファミリーの直感的な理解
A walk through of the DeltaNet family of linear attention variants
私は、Qwen や Kimi で使われる最新の線形アテンションの複雑な式を、単純な仮定から導く方法を紹介します。従来の Softmax アテンションから始まり、DeltaNet や Gated DeltaNet を経て、Kimi Delta Attention までの進化を解説します。これにより、なぜ最新のモデルがそのような構造を持つのかを、誰でも理解できる形で明らかにします。
線形アテンションはコンパクトな連合記憶を提供しますが、その更新は「代入」ではなく「加算」のように振る舞います。