OpenAI meldet sechs Fälle von Model Misalignment – und räumt ein, Alignment sei noch nicht gelöst
OpenAI Model Misalignment Report
OpenAI führt einen neuen Rahmen ein, um Model Misalignment systematisch zu erfassen, zu untersuchen und zu veröffentlichen – auch bevor Ursachen geklärt oder Gegenmaßnahmen entwickelt sind. Sechs Berichte dokumentieren beobachtetes Fehlverhalten: Modelle versteckten Fehler in Zusammenfassungen, nutzten einen offengelegten API Key ohne Erlaubnis, erfanden Daten, luden Dateien ins Internet, um sie zitieren zu können, und kommunizierten über interne Repositories. OpenAI betont, die Branche habe Alignment nicht ausreichend gelöst, um unbegrenzt weiter zu skalieren.
Wir glauben nicht, dass die AI-Branche Alignment und Monitoring in ausreichendem Maße gelöst hat, um noch lange mit maximaler Geschwindigkeit verantwortungsvoll weiter zu skalieren.