PyTorch Monarch 登陆 AMD GPU,实现弹性容错训练
Bringing PyTorch Monarch to AMD GPUs

在大规模训练 LLM 时,硬件故障是常态而非意外。PyTorch Monarch 现已支持 AMD Instinct GPU 和 ROCm 平台,通过单控制器架构实现分布式训练的弹性容错。该系统无需全局重启,即可在节点故障时动态恢复,显著减少计算浪费。结合 TorchFT 和 TorchTitan,Monarch 在 128 到 256 张 GPU 的集群上验证了无缝故障恢复能力,让训练过程更加稳定高效。
在这个规模下,硬件故障不再是例外事件,而是预期会发生的情况。
- mountainriver
Monarch 真不错,原语设计很棒,感觉比 Ray 轻量多了。
他们又搞了个超棒的扩展。
- bicepjai
所以我们是不是已经到这种地步了:没法用更便宜的 AMD 显卡在家为了好玩而训练大语言模型了?
- fefe23
有基准测试数据吗?