RTX 4090: как GPU обрабатывает запрос на чтение памяти — от инструкции до DRAM
What happens when a GPU reads memory

В этом техническом разборе автор прослеживает путь инструкции LDG.E от ядра CUDA до физической памяти на видеокарте RTX 4090. Он объясняет, как работает коалесцер, виртуальная адресация, кэши L1 и L2, а также устройство GDDR6X. Статья основана на экспериментах с таймингами и раскрывает детали, не документированные NVIDIA.
Один LDG.E запрашивает четыре байта в каждой из 32 линий, и его обслуживание требует четырех 32-байтовых секторов, одной строки кэша, одной трансляции адреса, пересечения crossbar, одного из 36 срезов L2, а при промахе — активации и четырех чтений столбцов в микросхеме DRAM.