PyTorch Monarch auf AMD GPUs: Fehlertolerantes Training ohne Checkpoint-Neustarts
Bringing PyTorch Monarch to AMD GPUs

PyTorch Monarch, ein Single-Controller-System für verteiltes Training, wurde auf AMD Instinct GPUs mit ROCm portiert. Die Portierung umfasste die Anpassung von Collective Communications über RCCL, GPU-Speicherverwaltung und RDMA-Integration. In Tests auf einem 16-Knoten-SLURM-Cluster mit 128 MI300 GPUs und einem 32-Knoten-Kubernetes-Cluster mit 256 MI355 GPUs zeigte sich, dass das Training auch bei häufigen Knotenausfällen ohne vollständige Neustarts fortgesetzt werden konnte. Die Kombination aus Monarch, TorchTitan und TorchFT ermöglicht eine dynamische Fehlerbehandlung mit Peer-Checkpoint-Transfer und Quorum-basierter Synchronisation.
Ein einzelner GPU-Speicherfehler, eine Netzwerkpartition oder ein Knotenabsturz kann einen gesamten Trainingslauf beenden, der seit Tagen oder Wochen läuft.