PyTorch Monarch llega a las GPU AMD: entrenamiento distribuido tolerante a fallos en ROCm

Bringing PyTorch Monarch to AMD GPUs

PyTorch Monarch llega a las GPU AMD: entrenamiento distribuido tolerante a fallos en ROCm

Entrenar LLMs con miles de millones de parámetros en cientos o miles de GPU requiere tolerancia a fallos: un solo error de memoria o una caída de nodo puede arruinar semanas de cómputo. PyTorch Monarch, ahora disponible para GPU AMD Instinct con ROCm, introduce un paradigma de programación distribuida de un solo controlador que aísla fallos y permite que los nodos sanos sigan entrenando mientras los caídos se recuperan. Con TorchFT y TorchTitan, se validó en clústeres SLURM y Kubernetes, logrando una convergencia estable incluso con fallos inyectados cada 180 segundos.

A esta escala, los fallos de hardware no son eventos excepcionales; son esperados.

Más de este día

2026-07-25