GPUがメモリを読むとき、何が起きるのか——RTX 4090の内部をタイミング実験で追う

What happens when a GPU reads memory

GPUがメモリを読むとき、何が起きるのか——RTX 4090の内部をタイミング実験で追う

前回の記事では、ベクトル加算カーネルがnvccからワープに至るまでを追いましたが、今回はその続きとして、SASS命令(グローバルロード)がハードウェアを通過する経路を、RTX 4090上でのタイミング実験に基づいて解説します。L1キャッシュのヒットは約15.4ns、L2は約127ns、TLBミスは約4.4nsといった実測値を交えながら、レジスタからL1、アドレス変換、L2、DRAMに至るまでの詳細な流れを、NVIDIAが公開していないレベルまでリバースエンジニアリングで明らかにします。

L1ヒットは約15.4ns(40サイクル)かかる。この数値は、L1に常駐するラインのランダムな置換を追跡する依存チェーンを1スレッドで実行した結果から得られたものだ。

この日のほかの記事

2026-08-21