AIエージェントの科学力、最強モデルでも成功率30%止まり——スタンフォード主導の新ベンチマーク

Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

AIエージェントの科学力、最強モデルでも成功率30%止まり——スタンフォード主導の新ベンチマーク

スタンフォード大学の研究者らが主導する新ベンチマーク「Terminal-Bench-Science」が公開された。科学者自身が考案した、生命科学から数学・工学まで5分野にわたる70の実践的タスクでAIエージェントの能力を測定。最強モデルClaude Opus 5でも成功率は30%にとどまり、現行の最前線モデルでも科学的研究ワークフローの大半を自動化できない実態が浮き彫りになった。ベンチマークは継続的に更新され、科学者コミュニティがAIの科学能力の基準を定義することを目指す。

科学におけるAI能力の基準は、モデル開発者やデータベンダーではなく、科学者自身が設定する。
  1. j_maffe

    ここで本当に見るべきなのはタスクだ:

    https://github.com/harbor-framework/terminal-bench-science/t...

  2. johnnyApplePRNG

    ClaudeがSolよりも科学的知能においてかなり高いのは驚きではない。

    Claudeは本当に多種多様な高度に特化した科学的・数学的ニュアンスを把握しているのがわかる...一方、codexは基本的にコーディングのためだけのもので、それだけだ。

    とにかく、それが両者に対して私が感じることだ。そして私は先週、20xプランで両方をたっぷり使った。

    誤解しないでほしい、codexはバグを見つけたりゲームを作ったりするのには素晴らしい。それは素晴らしい。

  3. CJefferson

    これが正しさをチェックしていないのが心配だ。最近Claudeが指示に従うのがひどくなっているのを感じている。論文のアルゴリズムを実装してほしいと頼むと、より単純で遅いものをやって、指摘されると例の馬鹿げた謝罪をしてくる。論文に入れるようなものには信頼できない、嘘が多すぎる。4.6はそれほど複雑なタスクはできなかったが、頼んだことはやってくれた。

  4. boorang

    私はコンテキストエンジニアリングでかなり良い結果を得た。自分のコーディングのヒューリスティックをAGENTS.mdに追加し、「XをするときはYを参照する」というパターンでサブドキュメントを参照するようにした。他の人も似たようなことをしていると思うが、手動でやる場合に私がやることにかなり近いコードを生成させることができて、かなり驚いた。科学者や数学者がそういうことをしているのか興味がある。「Xを見たら、たいていすぐにYをチェックする」といった、彼らの分野のヒューリスティックがどんなものか。

  5. jerpint

    opus 5がfableを上回っているのは私には奇妙だ。

    個人的な経験から言うと、opus 5は(コーディングタスクに関しては)ほぼすべての面でfableより劣っていると感じる。

この日のほかの記事

2026-08-28