OpenAI retira su recomendación de SWE-Bench Pro tras hallar fallos en el 30% de sus tareas
OpenAI no longer recommends SWE-Bench Pro

OpenAI ha auditado el benchmark de codificación SWE-Bench Pro y ha encontrado que alrededor del 30% de sus tareas están rotas, con problemas como pruebas demasiado estrictas, prompts poco especificados o engañosos, y cobertura de pruebas insuficiente. La compañía, que previamente había recomendado este benchmark tras abandonar SWE-bench Verified, ahora retira esa recomendación y advierte a los desarrolladores de modelos que examinen cuidadosamente los resultados. El análisis combinó un pipeline automatizado, agentes de investigación basados en Codex y una campaña de anotación humana con ingenieros experimentados.
En última instancia, una evaluación debería proporcionar una señal significativa a través de benchmarks que sean difíciles de engañar, fáciles de confiar y que reflejen genuinamente la capacidad o alineación del modelo.