PyTorch Monarch 登陆 AMD GPU,实现弹性容错训练

Bringing PyTorch Monarch to AMD GPUs

PyTorch Monarch 登陆 AMD GPU,实现弹性容错训练

在大规模训练 LLM 时,硬件故障是常态而非意外。PyTorch Monarch 现已支持 AMD Instinct GPU 和 ROCm 平台,通过单控制器架构实现分布式训练的弹性容错。该系统无需全局重启,即可在节点故障时动态恢复,显著减少计算浪费。结合 TorchFT 和 TorchTitan,Monarch 在 128 到 256 张 GPU 的集群上验证了无缝故障恢复能力,让训练过程更加稳定高效。

在这个规模下,硬件故障不再是例外事件,而是预期会发生的情况。

同日更多故事

2026-07-25