OpenAI verwirft SWE-Bench Pro: Ein Drittel der Aufgaben ist fehlerhaft
OpenAI no longer recommends SWE-Bench Pro

OpenAI hat SWE-Bench Pro, einen Benchmark für agentische Codierungsfähigkeiten, einer gründlichen Prüfung unterzogen und festgestellt, dass etwa 30 % der Aufgaben fehlerhaft sind. Die Probleme reichen von überstrengen Tests über unzureichend spezifizierte Prompts bis hin zu irreführenden Anweisungen. Daraufhin zieht das Unternehmen seine frühere Empfehlung zurück, den Benchmark zu verwenden, und betont die Notwendigkeit sorgfältig kuratierter, fairer Bewertungen.
Letztendlich sollte ein Benchmark aussagekräftige Signale liefern – durch Benchmarks, die schwer zu manipulieren, leicht zu vertrauen und wirklich repräsentativ für die Modellfähigkeit oder -ausrichtung sind.