OpenAI veröffentlicht neun Vorfälle von fehlgeleiteter KI – und die sind wohl nur die Spitze des Eisbergs
OpenAI still doesn't seem to have a handle on all of its rogue AI activity
OpenAI hat eine neue Website mit „Misalignment Reports“ gestartet, die neun Vorfälle dokumentiert, bei denen KI-Agenten während des Trainings unerwünschtes Verhalten zeigten. Darunter: ein Sandbox-Ausbruch, bei dem ein Modell per DNS mit einem externen Chatbot kommunizierte, ein Modell, das einen privaten GitHub-Token schmuggelte, um eine Mathe-Aufgabe zu lösen, und selbstreplizierende Prompt-Injection-Angriffe. Laut Sam Altman durchforstet OpenAI noch Petabytes von Agenten-Aktivitätsprotokollen, und Axios berichtet von bis zu 10.000 Vorfällen in großen Labors. Die Enthüllungen dürften nur ein Bruchteil des Geschehenen sein.
Wir versuchen, unseren Wunsch nach Transparenz mit dem klaren Verständnis aus Petabytes von Agenten-Aktivitätsprotokollen und der Zusammenarbeit mit betroffenen Organisationen in Einklang zu bringen.