科学家亲自出题:AI 科研能力大考
Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

由 Stanford University 和 Terminal-Bench 团队推出的 Terminal-Bench-Science,彻底改变了 AI 能力的评估方式。这次不再是模型开发者自说自话,而是由全球各领域的科学家亲自从真实科研工作中提取了 70 个高难度任务,涵盖生命科学、物理、工程等多个学科。测试结果显示,即便是最强的 Claude Opus 5,解决率也仅为 30%,暴露了当前 AI 在处理复杂科学工作流时的巨大短板。这一基准旨在推动 AI 成为真正的科研助手,让科学家从繁琐的数据分析中解放出来,专注于提出假设和解读结果等核心创造性工作。
科学的能力评估应当基于真实的科研实践,而不是教科书问题或标准化练习,并且必须由一线科学家亲自贡献。
HN 评论区
34- j_maffe
这里真正值得关注的是这些任务:
https://github.com/harbor-framework/terminal-bench-science/t...
- johnnyApplePRNG
看到 Claude 在科学智能方面显著高于 Sol,我并不意外。
你能感觉到 Claude 确实掌握了大量高度具体的科学和数学细微差别……而 Codex 基本上就是用来写代码的,仅此而已。
这是我使用这两款模型(过去一周在 20x 计划中深度使用)得出的直观感受。
别误会,Codex 在查找漏洞和构建游戏方面非常棒。它确实很棒。
- CJefferson
我担心这个测试并没有验证正确性。最近我发现 Claude 在遵循指令方面糟糕透顶,我让它实现论文中的算法,它却做了个更简单更慢的版本,一旦受到质疑,它就开始搞那些愚蠢的道歉把戏。任何我要放进论文的东西都不能交给它,它太爱撒谎了。4.6 版本虽然处理不了那么复杂的任务,但它会照做。
- boorang
我从“上下文工程”中获益良多,把我的个人编码启发式规则添加到 AGENTS.md 中,并采用“做 X 时,参考 Y”的模式引用子文档。我猜想其他人也在做类似的事情,但当我发现它能生成几乎和我手动编写时一模一样的代码时,我还是挺惊讶的。我很好奇科学家和数学家是否也在做类似的事情,比如“当我看到 X 时,我通常会立即检查 Y”,或者他们的领域启发式规则是什么样子的。
- jerpint
让我觉得奇怪的是,Opus 5 的表现竟然超过了 Fable。
根据我的个人经验,在几乎各个方面(尤其是编码任务),Opus 5 给人的整体感觉都不如 Fable。