Apple M3 Neural Engine verliert 50 GB/s: Ein 1-MiB-Erratum bremst die KI-Beschleunigung aus

Getting 50 GB/S Back from the Apple Neural Engine

Apple M3 Neural Engine verliert 50 GB/s: Ein 1-MiB-Erratum bremst die KI-Beschleunigung aus

Ein RTL-Performance-Erratum im Apple M3 Neural Engine drosselt die DRAM-Gewichts-Streaming-Bandbreite von nominal 45–60 GB/s auf 17–19 GB/s, sobald die Gesamtgewichtsgroesse ein ganzzahliges Vielfaches von 1 MiB ist. Das betrifft 7 von 15 ANEMLL-Modellen. Die Umgehung des problematischen Pfads im spekulativen Prefetch-Ring der Kernel-DMA-Engine steigert den Llama 3.2 1B Token-Durchsatz von 10,0 auf 24,3 Tokens/s (DRAM-Nutzung von 24,7 auf 60,0 GB/s) und Qwen3-8B von 1,36 auf 2,97 Tokens/s (DRAM-Nutzung von 22,4 auf 48,7 GB/s).

Bei Vielfachen von D = 2048 fällt der Durchsatz scharf von den nominalen 45–60 GB/s auf 17–19 GB/s ab und erholt sich erst nach etwa 256 Zeilen wieder auf den Nominalwert.

Mehr von diesem Tag

2026-09-12