GPU가 메모리를 읽을 때 일어나는 일: RTX 4090 내부 추적기

What happens when a GPU reads memory

GPU가 메모리를 읽을 때 일어나는 일: RTX 4090 내부 추적기

이 글은 RTX 4090에서 CUDA 커널의 전역 로드 명령(LDG)이 레지스터에서 L1 캐시, TLB, L2 캐시, DRAM까지 이동하는 과정을 역공학과 타이밍 실험을 통해 추적합니다. 벡터 덧셈 커널을 예로 들어, 각 단계의 지연 시간(예: L1 히트 15.4ns, L2 히트 127ns)을 측정하고, 주소 변환, 캐시 집합 매핑, DRAM 구조 등 하드웨어 세부사항을 설명합니다. NVIDIA가 문서화하지 않은 부분을 실험으로 밝혀내며, 성능 최적화에 관심 있는 개발자에게 유용한 통찰을 제공합니다.

L1 히트는 약 15.4ns — 40사이클이 걸립니다.
  1. empiricus

    오랫동안 칩 제조사들은 하드웨어를 단순화하고 소프트웨어가 적응하고 최적화하는 데 의존하는 경향이 있었습니다. 그러나 수십 년 동안 이러한 시도는 실패했습니다. 이제 우리는 비교적 빠르게 커널을 미세 조정할 수 있는 끊임없는 AI를 갖게 되었습니다. 아마도 더 단순한 하드웨어가 이번에는 작동할까요? 참고: TPU/NPU가 단순할 뿐만 아니라 너무 제한적이지 않은지 확실하지 않습니다.

  2. xyzsparetimexyz

    > 이 경로에 대한 세부 사항은 NVIDIA에 의해 거의 문서화되어 있지 않습니다. 적어도 우리가 원하는 수준은 아닙니다. 그래서 우리는 하드웨어 자체에서 타이밍 실험을 실행하여 결정할 것입니다.

    또는 AMD ISA를 사용할 수도 있습니다.

  3. KellyCriterion

    아주 좋은 기사입니다. 다음이 생각나네요:

    "프로그래머가 메모리에 대해 알아야 할 모든 것"

    https://github.com/Ty-Chen/Reading-List/blob/master/What%20e...

이 날의 다른 글

2026-08-21