Cómo se podría haber inventado la atención Kimi Delta desde cero
A walk through of the DeltaNet family of linear attention variants
Explico cómo derivar las variantes de atención lineal de la familia DeltaNet, incluyendo Kimi Delta Attention, partiendo de principios simples. Muestro la evolución desde la atención softmax hasta las ecuaciones complejas usadas en Qwen y Kimi, demostrando que estas arquitecturas surgen naturalmente al corregir errores de memoria en lugar de simplemente sumar valores.
La escritura no hace que la memoria devuelva el valor correcto; simplemente suma ese valor a lo que la memoria ya devolvía.