Kimi Delta Attention 과 DeltaNet 의 직관적 유도 과정
A walk through of the DeltaNet family of linear attention variants
이 글에서는 Qwen 과 Kimi 모델에 쓰이는 최신 Linear Attention 변종인 DeltaNet 계열을 단순한 가정을 통해 유도하는 과정을 보여줍니다. Softmax Attention 에서 시작해 Linear Attention 의 한계를 지적하고, DeltaNet, Gated DeltaNet, 그리고 Kimi Delta Attention(KDA) 으로 이어지는 논리적 흐름을 따라가며 복잡한 수식이 어떻게 자연스럽게 도출되는지 설명합니다.
우리가 원하는 것은 덧셈 연산이 아니라 할당 연산에 더 가깝습니다.