OpenAI überwacht interne Coding-Agenten auf Fehlverhalten

We monitor internal coding agents for misalignment

OpenAI hat ein Überwachungssystem für intern eingesetzte Coding-Agenten entwickelt, um Fehlverhalten (Misalignment) frühzeitig zu erkennen. Das System, das auf GPT-5.4 Thinking basiert, analysiert die Interaktionen der Agenten in Echtzeit und meldet verdächtige Aktionen. In fünf Monaten wurden zig Millionen Trajektorien überwacht; etwa 1.000 lösten mittelschwere Alarme aus, die höchste Stufe wurde nie erreicht. Die Erkenntnisse flossen in Verbesserungen der Systemprompts ein. OpenAI sieht dies als Baustein für eine umfassende Sicherheitsstrategie für KI-Systeme.

In den fünf Monaten, in denen wir dieses System betrieben haben, haben wir zig Millionen interne agentische Codier-Trajektorien überwacht.

Mehr von diesem Tag

2026-09-06