Zombies in unseren Systemen: Wie CPU-Engpässe Pinterest-ML-Training lahmlegten

Finding zombies in our systems: A real-world story of CPU bottlenecks

Zombies in unseren Systemen: Wie CPU-Engpässe Pinterest-ML-Training lahmlegten

Das Kubernetes-Team von Pinterest untersuchte über drei Monate, warum Ray-Trainingsjobs auf GPU-Clustern immer wieder abstürzten. Die Ursache: CPU-Engpässe, die zu Netzwerk-Resets der ENA-Treiber führten. Erst durch zeitaufgelöstes Profiling mit perf und mpstat entdeckten sie einzelne CPU-Kerne, die über Sekunden zu 100 % ausgelastet waren. Die Lösung: Zombie-Prozesse, die regelmäßig die System-CPU blockierten.

Wir stellten fest, dass manchmal ein einzelner CPU-Kern (im folgenden Screenshot CPU 39) über mehrere Sekunden hinweg 100 % seiner System-CPU nutzte – und das korrelierte mit dem Auftreten eines Netzwerk-Resets.

Mehr von diesem Tag

2026-08-03