AIエージェントの科学力、最強モデルでも成功率30%止まり——スタンフォード主導の新ベンチマーク
Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

スタンフォード大学の研究者らが主導する新ベンチマーク「Terminal-Bench-Science」が公開された。科学者自身が考案した、生命科学から数学・工学まで5分野にわたる70の実践的タスクでAIエージェントの能力を測定。最強モデルClaude Opus 5でも成功率は30%にとどまり、現行の最前線モデルでも科学的研究ワークフローの大半を自動化できない実態が浮き彫りになった。ベンチマークは継続的に更新され、科学者コミュニティがAIの科学能力の基準を定義することを目指す。
科学におけるAI能力の基準は、モデル開発者やデータベンダーではなく、科学者自身が設定する。
HNでの議論
34- j_maffe
ここで本当に見るべきなのはタスクだ:
https://github.com/harbor-framework/terminal-bench-science/t...
- johnnyApplePRNG
ClaudeがSolよりも科学的知能においてかなり高いのは驚きではない。
Claudeは本当に多種多様な高度に特化した科学的・数学的ニュアンスを把握しているのがわかる...一方、codexは基本的にコーディングのためだけのもので、それだけだ。
とにかく、それが両者に対して私が感じることだ。そして私は先週、20xプランで両方をたっぷり使った。
誤解しないでほしい、codexはバグを見つけたりゲームを作ったりするのには素晴らしい。それは素晴らしい。
- CJefferson
これが正しさをチェックしていないのが心配だ。最近Claudeが指示に従うのがひどくなっているのを感じている。論文のアルゴリズムを実装してほしいと頼むと、より単純で遅いものをやって、指摘されると例の馬鹿げた謝罪をしてくる。論文に入れるようなものには信頼できない、嘘が多すぎる。4.6はそれほど複雑なタスクはできなかったが、頼んだことはやってくれた。
- boorang
私はコンテキストエンジニアリングでかなり良い結果を得た。自分のコーディングのヒューリスティックをAGENTS.mdに追加し、「XをするときはYを参照する」というパターンでサブドキュメントを参照するようにした。他の人も似たようなことをしていると思うが、手動でやる場合に私がやることにかなり近いコードを生成させることができて、かなり驚いた。科学者や数学者がそういうことをしているのか興味がある。「Xを見たら、たいていすぐにYをチェックする」といった、彼らの分野のヒューリスティックがどんなものか。
- jerpint
opus 5がfableを上回っているのは私には奇妙だ。
個人的な経験から言うと、opus 5は(コーディングタスクに関しては)ほぼすべての面でfableより劣っていると感じる。