Wie man Kimi Delta Attention selbst herleiten könnte: Ein Weg durch DeltaNet
A walk through of the DeltaNet family of linear attention variants
Ich zeige, wie man von der quadratischen Softmax-Attention schrittweise zu komplexen linearen Varianten wie DeltaNet und Kimi Delta Attention gelangt. Durch einfache Annahmen über den Hidden State lässt sich die scheinbar undurchdringliche Mathematik hinter den neuesten Qwen- und Kimi-Modellen nachvollziehen und verständlich machen.
Der Trick besteht darin, dass das äußere Produkt eine Matrix ist, während das innere Produkt nur eine Zahl ist.