从 Pascal 到 Blackwell:Warp 分歧真相
Characterizing Warp Divergence from Pascal to Blackwell

自 Volta 引入独立线程调度(ITS)以来,业界普遍认为 NVIDIA GPU 处理 Warp 分歧的方式已固定不变。这项研究通过对比 Pascal 到 Blackwell 的多代架构,结合微基准测试与硬件计数器,揭示了令人意外的结论:Warp 执行效率始终遵循 32/k 的线性下降规律,且该成本模型早在 ITS 出现前就已存在。尽管编译器生成的重汇聚机制发生了显著变化,从 Pascal 的栈指令演变为 Blackwell 的屏障寄存器指令,但核心的性能惩罚模型却保持稳定。研究还发现,Blackwell 引入的两级收敛屏障分类在实测中并未带来运行时差异,证明分歧带来的性能成本依然是可预测且稳定的。
尽管 NVIDIA 的控制流指令集架构和重汇聚机制持续演进,但分歧依然保持着稳定且可预测的性能成本。