OpenAI, SWE-Bench Pro 권장 철회…벤치마크의 30%가 결함
OpenAI no longer recommends SWE-Bench Pro

OpenAI가 코딩 벤치마크 SWE-Bench Pro에 대한 자체 감사 결과, 작업의 약 30%가 결함이 있는 것으로 나타나 이전의 권장을 철회했습니다. 문제는 지나치게 엄격한 테스트, 불완전한 프롬프트, 낮은 테스트 커버리지, 오해를 불러일으키는 프롬프트 등 네 가지 범주로 분류되었습니다. OpenAI는 이러한 발견이 벤치마크 큐레이션의 어려움을 강조하며, 에이전트 기반 데이터 품질 검사의 유용성을 보여준다고 밝혔습니다.
궁극적으로 평가는 게임하기 어렵고, 신뢰하기 쉬우며, 모델의 능력이나 정렬을 진정으로 반영하는 벤치마크를 통해 의미 있는 신호를 제공해야 합니다.