El viaje de una lectura de GPU: de la instrucción a la DRAM

What happens when a GPU reads memory

El viaje de una lectura de GPU: de la instrucción a la DRAM

Este artículo de ingeniería inversa sigue el camino de una instrucción de carga global (LDG) en una RTX 4090, desde el warp hasta la DRAM. Explica cómo el coalescedor agrupa las peticiones, cómo la caché L1 virtualmente direccionada decide un fallo, cómo la traducción de direcciones lleva la petición a la caché L2 física, y cómo el controlador de memoria activa una fila y lee columnas en un chip GDDR6X. Incluye mediciones de latencia para cada etapa: 40 ciclos para un acierto en L1, 11 ciclos para un fallo de TLB, 330 ciclos para un acierto en L2, y el coste de la activación y las lecturas en DRAM. El autor utiliza experimentos de temporización para deducir detalles no documentados por NVIDIA.

Servir una sola instrucción LDG.E requiere cuatro sectores de 32 bytes, una línea de caché, una traducción de dirección, un cruce de crossbar, una de las 36 particiones de L2 y, cuando falla en todas partes, una activación y cuatro lecturas de columna en un chip de DRAM.

Más de este día

2026-08-21