GPU가 메모리를 읽을 때 일어나는 일: RTX 4090 내부 추적기
What happens when a GPU reads memory

이 글은 RTX 4090에서 CUDA 커널의 전역 로드 명령(LDG)이 레지스터에서 L1 캐시, TLB, L2 캐시, DRAM까지 이동하는 과정을 역공학과 타이밍 실험을 통해 추적합니다. 벡터 덧셈 커널을 예로 들어, 각 단계의 지연 시간(예: L1 히트 15.4ns, L2 히트 127ns)을 측정하고, 주소 변환, 캐시 집합 매핑, DRAM 구조 등 하드웨어 세부사항을 설명합니다. NVIDIA가 문서화하지 않은 부분을 실험으로 밝혀내며, 성능 최적화에 관심 있는 개발자에게 유용한 통찰을 제공합니다.
L1 히트는 약 15.4ns — 40사이클이 걸립니다.
HN 토론
19- empiricus
오랫동안 칩 제조사들은 하드웨어를 단순화하고 소프트웨어가 적응하고 최적화하는 데 의존하는 경향이 있었습니다. 그러나 수십 년 동안 이러한 시도는 실패했습니다. 이제 우리는 비교적 빠르게 커널을 미세 조정할 수 있는 끊임없는 AI를 갖게 되었습니다. 아마도 더 단순한 하드웨어가 이번에는 작동할까요? 참고: TPU/NPU가 단순할 뿐만 아니라 너무 제한적이지 않은지 확실하지 않습니다.
- xyzsparetimexyz
> 이 경로에 대한 세부 사항은 NVIDIA에 의해 거의 문서화되어 있지 않습니다. 적어도 우리가 원하는 수준은 아닙니다. 그래서 우리는 하드웨어 자체에서 타이밍 실험을 실행하여 결정할 것입니다.
또는 AMD ISA를 사용할 수도 있습니다.
- KellyCriterion
아주 좋은 기사입니다. 다음이 생각나네요:
"프로그래머가 메모리에 대해 알아야 할 모든 것"
https://github.com/Ty-Chen/Reading-List/blob/master/What%20e...