OpenAI、コーディング評価ベンチマーク「SWE-Bench Pro」の推奨を撤回

OpenAI no longer recommends SWE-Bench Pro

OpenAI、コーディング評価ベンチマーク「SWE-Bench Pro」の推奨を撤回

OpenAIは、人気のコーディングベンチマーク「SWE-Bench Pro」の監査を実施し、タスクの約30%に問題があることを発見した。問題の主なカテゴリは、過度に厳格なテスト、不十分なプロンプト、低いテストカバレッジ、誤解を招くプロンプトの4つ。この結果を受け、OpenAIは以前の推奨を撤回し、モデル開発者に結果を慎重に検討するよう促している。また、エージェントを活用したデータ品質チェックの有用性も強調している。

結局のところ、評価は、ゲームが難しく、信頼しやすく、モデルの能力や整合性を真に反映したベンチマークを通じて、意味のあるシグナルを提供すべきです。

この日のほかの記事

2026-07-08