Zombies en nuestros sistemas: cómo un cuello de botella de CPU provocó caídas en los jobs de Ray

Finding zombies in our systems: A real-world story of CPU bottlenecks

Zombies en nuestros sistemas: cómo un cuello de botella de CPU provocó caídas en los jobs de Ray

El equipo de plataforma Kubernetes de Pinterest (PinCompute) investigó durante más de tres meses las intermitentes caídas de los jobs de entrenamiento de Ray en GPUs. El síntoma inicial eran resets del driver de red ENA de AWS, correlacionados con un uso del 100% de CPU en un solo núcleo durante varios segundos. Tras descartar allocators, huge pages y afinidad de CPU, descubrieron que el culpable era un proceso 'zombie' que consumía CPU de forma esporádica, identificado mediante perf y mpstat. La solución implicó ajustar la configuración del kernel y del driver, resolviendo el problema.

En nuestro análisis offline, descubrimos que a veces un solo núcleo de CPU (en la siguiente captura, CPU 39) usaba el 100% de su CPU de sistema durante varios segundos.

Más de este día

2026-08-03