El Neural Engine del M3 esconde una errata que hunde el ancho de banda a 17 GB/s

Getting 50 GB/S Back from the Apple Neural Engine

El Neural Engine del M3 esconde una errata que hunde el ancho de banda a 17 GB/s

Un error de rendimiento en el Neural Engine del Apple M3 reduce el streaming de pesos desde DRAM de 45–60 GB/s a solo 17–19 GB/s cuando el tamaño total es múltiplo de 1 MiB, afectando a 7 de los 15 modelos de ANEMLL. Evitando el camino problemático en el anillo de prefetch especulativo del DMA, Llama 3.2 1B pasó de 10.0 a 24.3 tokens/s y Qwen3-8B de 1.36 a 2.97 tokens/s.

Nunca pensé que haría una FFT del rendimiento (GB/s) contra la dimensión del tensor (D), pero aquí está.

Más de este día

2026-09-12