Menschen übersehen bei KI-Agenten 1 von 3 Bedrohungen – 40.000 Spielrunden zeigen es

Humans missed 1 in 3 threats approving AI agent commands across 40k game runs

Menschen übersehen bei KI-Agenten 1 von 3 Bedrohungen – 40.000 Spielrunden zeigen es

Ein Browser-Spiel, bei dem Spieler als Human-in-the-Loop für einen KI-Code-Agenten Befehle genehmigen oder ablehnen, zeigt: Die durchschnittliche Trefferquote bei Bedrohungen liegt bei nur 66,3 %. Besonders tückisch sind vertraute Skripte wie „npm run analyze“, die in 64,7 % der Fälle genehmigt werden, obwohl der schädliche Code im Verlauf sichtbar ist. Auch unter Zeitdruck steigt die Fehlerquote. Das Spiel verdeutlicht die Grenzen menschlicher Aufsicht und die Gefahr von Permission Fatigue.

„Das ist ein großartiges Beispiel dafür, wie gefährliche Aktionen als harmlos wahrgenommen werden. Das gesamte Modell, bestimmte Befehle zu genehmigen, ist völlig verrückt.“

Mehr von diesem Tag

2026-08-06