Terminal-Bench-Science: un benchmark donde los científicos, no los modelos, marcan el listón de la IA
Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

Investigadores de Stanford y el equipo de Terminal-Bench lanzan Terminal-Bench-Science, un benchmark continuo que evalúa a los agentes de IA en 70 flujos de trabajo científicos reales, desde análisis de datos hasta demostración de teoremas. En su primera versión, el mejor modelo, Claude Opus 5, resuelve solo el 30% de las tareas, lo que evidencia el amplio margen de mejora. El proyecto busca que los propios científicos definan qué significa capacidad científica en IA, con contribuciones abiertas y revisión rigurosa.
Los científicos, no los desarrolladores de modelos ni los proveedores de datos, establecen el listón de la capacidad científica en IA.
- j_maffe
Las tareas son lo que realmente hay que mirar aquí:
https://github.com/harbor-framework/terminal-bench-science/t...
- johnnyApplePRNG
No me sorprende ver a Claude significativamente más alto en inteligencia científica que Sol.
Se nota que Claude realmente comprende una amplia gama de matices científicos y matemáticos muy específicos... mientras que Codex es básicamente solo para programar y ya está.
Esa es la impresión que me dan ambos, y he usado los dos en el plan 20x durante la última semana y de forma extensa.
No me malinterpretes, Codex es genial para encontrar errores y crear juegos. Es genial.
- CJefferson
Me preocupa que esto no verifique la corrección. Últimamente he notado que Claude es pésimo siguiendo instrucciones: le pido que implemente el algoritmo de un artículo y hace algo más simple y lento, y cuando se lo cuestiono, hace su estúpida disculpa. No se puede confiar en él para nada que vaya a poner en un artículo; miente demasiado. La versión 4.6 no podía hacer tareas tan complejas, pero hacía lo que se le pedía.
- boorang
Saqué bastante provecho de la ingeniería de contexto, añadiendo mis heurísticas de programación personales a mi AGENTS.md y referenciando subdocumentos con un patrón de "cuando hagas X, consulta Y". Supongo que otros hacen cosas similares, pero me sorprendió bastante cuando logré que generara código bastante cercano a lo que yo haría si lo hiciera manualmente. Me pregunto si los científicos y matemáticos están haciendo cosas así. "Cuando veo X, normalmente reviso Y" o lo que sea que sean sus heurísticas de dominio.
- jerpint
El hecho de que opus 5 supere a fable me resulta extraño.
Por experiencia personal, opus 5 se siente netamente inferior a fable en casi todos los aspectos (para tareas de programación).