AMD Zen 3の1コアでFP32行列積を85.3 GFLOPSに最適化、理論ピークの63.5%を達成
85.3 GFlops: Optimizing FP32 Matrix Multiplication on a Single AMD Zen 3 Core
AMD Zen 3マイクロアーキテクチャの1コア上で、FP32行列乗算(GEMM)をAVX2/FMA intrinsicsを用いて系統的に最適化した研究。28種類の構成(MX01〜MX28)をテストし、キャッシュブロッキング、レジスタブロッキング、FMAチェーン、パッキング、メモリアライメント、ソフトウェアプリフェッチ、非一時ストアなどの効果を評価。最良のMX24モデルは85.30 GFLOPS(理論ピークの63.5%)を達成し、ナイーブ実装の56.5倍、AMD AOCLやOpenBLASなどの最適化ライブラリに匹敵する性能を示した。
最良のモデルMX24は85.30 GFLOPSを維持し、ナイーブな実装を56.5倍上回り、AMD AOCLやOpenBLASなどの最適化ライブラリと同等の性能を達成しました。