Kimi Linear: Eine neue, effiziente Attention-Architektur für KI-Modelle
Kimi Linear: An Expressive, Efficient Attention Architecture (2025)

Wir stellen Kimi Linear vor, eine hybride lineare Attention-Architektur, die Full Attention in verschiedenen Szenarien übertrifft. Unser Ansatz nutzt Kimi Delta Attention und ein spezialisiertes chunkwise Algorithmus für hohe Hardware-Effizienz. Mit einem 3B-Modell erreichen wir bis zu 6-fache Decodiergeschwindigkeit bei 1M Kontext und reduzieren den KV-Cache um 75%, was Kimi Linear zu einer leistungsstarken Alternative macht.
Kimi Linear kann als direkter Ersatz für Full Attention-Architekturen dienen und bietet dabei überlegene Leistung und Effizienz, selbst bei Aufgaben mit längeren Eingabe- und Ausgabelängen.