PyTorch Monarch, AMD GPU에서도 단일 컨트롤러 분산 학습 지원
Bringing PyTorch Monarch to AMD GPUs

PyTorch Monarch는 단일 Python 프로그램으로 전체 GPU 클러스터를 오케스트레이션하는 새로운 분산 프로그래밍 패러다임입니다. 이 블로그에서는 Monarch를 AMD Instinct GPU의 ROCm 소프트웨어 스택으로 포팅한 과정과, 노드 장애 발생 시 전체 학습을 중단하지 않고 동적으로 복구하는 방법을 소개합니다. SLURM 16노드(128 GPU) 및 Kubernetes 32노드(256 GPU) 클러스터에서 Llama 3 8B 모델 학습을 통해 검증했으며, 장애 주입에도 불구하고 학습이 중단 없이 진행되고 손실 곡선이 안정적으로 수렴함을 확인했습니다. 이는 AMD GPU에서 대규모 AI 학습의 안정성을 높이는 중요한 진전입니다.
대규모 AI 모델 학습에는 원시 컴퓨팅 성능뿐 아니라 불가피한 하드웨어 장애를 우아하게 처리할 수 있는 탄력적인 인프라가 필요합니다.