Was passiert, wenn eine GPU Speicher schreibt
What happens when a GPU writes memory

Aufbauend auf einer früheren Analyse des Ladevorgangs verfolgt dieser Artikel die STG.E-Instruktion auf einer RTX 4090 durch die Hardware: vom Warp über die Load/Store-Unit und den Coalescer durch den L1-Cache, über das Crossbar zu einem der 36 L2-Slices bis hin zum DRAM. Der Autor erklärt, warum Stores im Gegensatz zu Loads asynchron ablaufen, wie Dirty-Masken und RRPV-Werte die Eviction steuern und warum eine 8-Dirty-Regel nötig ist, um DRAM-Schreibbursts zu glätten.
In der Tat erreichen die Daten für diesen Kernel nie den DRAM!