NVIDIA GPU 워프 발산, Pascal부터 Blackwell까지 예측 가능한 비용 유지

Characterizing Warp Divergence from Pascal to Blackwell

NVIDIA GPU 워프 발산, Pascal부터 Blackwell까지 예측 가능한 비용 유지

Volta가 ITS(Independent Thread Scheduling)를 도입한 이후, NVIDIA GPU는 워프 발산을 고정된 방식으로 처리한다고 널리 알려져 왔습니다. 이 가정을 Ampere, Hopper, 그리고 데이터센터 및 컨슈머용 Blackwell GPU에서 테스트하고, ITS 이전의 Pascal을 기준선으로 삼았습니다. 사이클 정확한 마이크로벤치마크, 하드웨어 카운터, 컴파일러 생성 SASS의 정적 분석을 결합하여 안정적인 동작과 아키텍처 변경을 분리했습니다. 테스트한 모든 세대에서 발산 경로는 경로 수 k에 따라 선형적으로 직렬화되며, T(k)≈sk를 따르고 초선형 재수렴 패널티는 없습니다. 워프 실행 효율은 32/k로 떨어지고, 패널티는 점유율과 무관하며, predication은 직렬화 비용을 제거합니다. 동일한 동작이 Pascal에서도 나타나, 이 프로그래머가 인지하는 비용 모델이 ITS 이전부터 존재했음을 보여줍니다. 그러나 컴파일러가 생성하는 재수렴 메커니즘은 크게 변경되었습니다. Pascal은 워프당 SSY/SYNC 명령어 스택을 사용하는 반면, 이후 세대는 배리어 레지스터 명령어를 사용합니다. 즉시 post-dominator를 넘어선 지연 재수렴은 Ampere의 29건에서 Blackwell의 2건으로 감소했습니다. Blackwell은 또한 2계층 수렴 배리어 분류, 균일 분기 명령어, 명시적 부분 마스크 워프 동기화를 도입했으며, 이는 Ampere나 Hopper에는 없습니다. 통제된 비트 플립 실험은 새로운 배리어 클래스가 정적 컴파일러 분류로, 테스트에서 관찰 가능한 런타임 효과가 없음을 나타냅니다. 따라서 발산은 NVIDIA의 제어 흐름 ISA와 재수렴 메커니즘이 계속 진화하는 동안에도 안정적이고 예측 가능한 성능 비용을 유지합니다.

같은 날의 다른 소식

2026-08-03