PyTorch Monarch llega a las GPU AMD: entrenamiento distribuido tolerante a fallos en ROCm
Bringing PyTorch Monarch to AMD GPUs

Entrenar LLMs con miles de millones de parámetros en cientos o miles de GPU requiere tolerancia a fallos: un solo error de memoria o una caída de nodo puede arruinar semanas de cómputo. PyTorch Monarch, ahora disponible para GPU AMD Instinct con ROCm, introduce un paradigma de programación distribuida de un solo controlador que aísla fallos y permite que los nodos sanos sigan entrenando mientras los caídos se recuperan. Con TorchFT y TorchTitan, se validó en clústeres SLURM y Kubernetes, logrando una convergencia estable incluso con fallos inyectados cada 180 segundos.
A esta escala, los fallos de hardware no son eventos excepcionales; son esperados.