RTX 4090: как GPU обрабатывает запрос на чтение памяти — от инструкции до DRAM
What happens when a GPU reads memory

В этом техническом разборе автор прослеживает путь инструкции LDG.E от ядра CUDA до физической памяти на видеокарте RTX 4090. Он объясняет, как работает коалесцер, виртуальная адресация, кэши L1 и L2, а также устройство GDDR6X. Статья основана на экспериментах с таймингами и раскрывает детали, не документированные NVIDIA.
Один LDG.E запрашивает четыре байта в каждой из 32 линий, и его обслуживание требует четырех 32-байтовых секторов, одной строки кэша, одной трансляции адреса, пересечения crossbar, одного из 36 срезов L2, а при промахе — активации и четырех чтений столбцов в микросхеме DRAM.
- empiricus
Долгое время производители чипов стремились упрощать аппаратное обеспечение, полагаясь на то, что программное обеспечение будет адаптироваться и оптимизироваться. Но десятилетиями эта ставка проваливалась. Теперь у нас есть неустанный ИИ, способный относительно быстро настраивать ядра. Может, в этот раз более простое «железо» сработает? Примечание: не уверен, что TPU/NPU не только просты, но и слишком ограничены.
- xyzsparetimexyz
> Мало деталей этого пути задокументировано NVIDIA, по крайней мере, не на том уровне, который нам бы хотелось, поэтому мы определим его, проводя эксперименты по таймингам на самом оборудовании
Или можно просто использовать ISA от AMD.
- KellyCriterion
ОЧЕНЬ хорошая статья, напоминает мне:
«Что каждый программист должен знать о памяти»
https://github.com/Ty-Chen/Reading-List/blob/master/What%20e...