OpenAI 收回 SWE-Bench Pro 推荐
OpenAI no longer recommends SWE-Bench Pro

OpenAI 正式收回了对 SWE-Bench Pro 的推荐。我们深入审计发现,该基准测试中约 30% 的任务存在严重缺陷,包括测试过于严格、提示词描述不清以及覆盖率不足等问题。这些问题导致评估结果无法真实反映模型的软件开发能力,甚至可能误导安全决策。此前我们曾建议社区转向 SWE-Bench Pro 以替代有缺陷的 SWE-bench Verified,但经过自动化管线筛选和资深工程师的人工复核,确认其同样存在大量“坏数据”。这一发现凸显了构建高质量、公平且难以被“刷分”的 AI 基准测试的巨大挑战。
评估应该通过难以被操纵、易于信任且真正反映模型能力或对齐情况的基准测试,来提供有意义的信号。
- 有评论者指出 SWE-Bench Pro 等基准测试存在设计缺陷,如过度严格的实现细节要求或模糊的提示词,导致无法真实反映模型解决实际问题或与人类工程师的对比能力。
- 一位从业者强调基准测试本质上遵循古德哈特定律,模型会针对测试指标进行优化,因此仅靠自动化测试无法有效评估代码能力,必须通过人工互动来验证。
- 评论中提到当前评估体系缺乏针对 C 语言等底层优化代码的测试任务,且模型倾向于通过编写 Python 脚本等中间工具来完成任务,这可能掩盖了其在原生语言处理上的真实水平。
- 有观点认为现有基准测试试图用文本描述解决需要空间推理和精确坐标的 3D 设计任务,这暴露了纯文本模型的局限,暗示距离真正的 AGI 仍有距离。