Apples Neural Engine: Ein Blick zurück auf das Ende des NPU-Zeitalters
Retrospectively Reverse-Engineering Apple's Neural Engine

Vor drei Jahren stellte ich die Arbeit am reverse-engineerten ANE-Treiber ein, weil die Architektur zu speziell für allgemeine Beschleunigung war. Jetzt, da der M5 die ANE-Kerne in die GPU integriert, rekonstruiere ich die interne Architektur des M1-ANE – Compute, Datenpfad, Scheduler, Speicher und Ausführungsmodell –, um zu verstehen, welche Annahmen über ML-Workloads Apple 2017 in Silizium goss und was das über den Wandel von CNN-NPUs zu GPUs für Transformer sagt.
Die Annahme, die Transformer brachen, besonders beim autoregressiven Decoding, waren vorhersagbare Wiederverwendungsmuster, die die ANE ausnutzte, um einen Datenfluss zu entwerfen, der effizient genug war, um auf Telefonen zu laufen.