Un STG.E tarda 6 ciclos, pero el dato no llega a DRAM hasta mucho después
What happens when a GPU writes memory

Tras seguir un LDG.E por todo el hardware de una RTX 4090, este análisis hace lo mismo con STG.E: la instrucción que escribe el resultado de una suma vectorial en memoria global. El warp la emite en unos 6 ciclos y sigue a lo suyo, pero el dato atraviesa el coalescer, una L1 write-through y una de las 36 slices de L2, donde queda sucio bajo una máscara. Solo cuando una miss lo elige como víctima, y tras pasar por el memory controller, alcanza DRAM. El autor reconstruye con experimentos la política de reemplazo RRPV y la regla de las 8 líneas sucias que evita ráfagas de escritura.
En realidad, para este kernel, ¡los datos nunca llegan a DRAM! El hardware ahora mantiene nuestros datos sucios en L2.