GPU가 메모리를 읽을 때 일어나는 일: RTX 4090 내부 추적기
What happens when a GPU reads memory

이 글은 RTX 4090에서 CUDA 커널의 전역 로드 명령(LDG)이 레지스터에서 L1 캐시, TLB, L2 캐시, DRAM까지 이동하는 과정을 역공학과 타이밍 실험을 통해 추적합니다. 벡터 덧셈 커널을 예로 들어, 각 단계의 지연 시간(예: L1 히트 15.4ns, L2 히트 127ns)을 측정하고, 주소 변환, 캐시 집합 매핑, DRAM 구조 등 하드웨어 세부사항을 설명합니다. NVIDIA가 문서화하지 않은 부분을 실험으로 밝혀내며, 성능 최적화에 관심 있는 개발자에게 유용한 통찰을 제공합니다.
L1 히트는 약 15.4ns — 40사이클이 걸립니다.