Apple M3 Neural Engine의 RTL 버그로 50 GB/s 대역폭을 되찾다

Getting 50 GB/S Back from the Apple Neural Engine

Apple M3 Neural Engine의 RTL 버그로 50 GB/s 대역폭을 되찾다

Apple M3 Neural Engine의 RTL 성능 에라텀으로 가중치 크기가 1 MiB의 정수 배수일 때 DRAM 스트리밍 대역폭이 45–60 GB/s에서 17–19 GB/s로 떨어진다. 커널 DMA 엔진의 투기적 프리페치 링에서 문제 경로를 회피한 결과, Llama 3.2 1B의 토큰 처리량이 10.0에서 24.3 tokens/s로, Qwen3-8B는 1.36에서 2.97 tokens/s로 향상됐다.

2048의 배수에서 처리량은 공칭 45–60 GB/s에서 17–19 GB/s로 급감하고, 약 256라인 떨어진 곳에서 공칭으로 회복된다.

이 날의 다른 글

2026-09-12