Terminal-Bench-Science: лучшие AI-агенты решают лишь 30% научных задач

Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

Terminal-Bench-Science: лучшие AI-агенты решают лишь 30% научных задач

Исследователи из Stanford University и команда Terminal-Bench запустили Terminal-Bench-Science — бенчмарк для оценки AI-агентов на реальных научных рабочих процессах. Первый релиз включает 70 задач из естественных, физических, математических и инженерных наук, отобранных из 920 предложений. Лучшая модель, Claude Opus 5, решает лишь 30% задач, что подчеркивает разрыв между возможностями AI и требованиями науки. Бенчмарк непрерывно развивается, позволяя ученым добавлять новые задачи и отслеживать прогресс.

Ученые, а не разработчики моделей или поставщики данных, устанавливают планку научных возможностей AI.
  1. j_maffe

    Задания — вот на что действительно стоит смотреть:

    https://github.com/harbor-framework/terminal-bench-science/t...

  2. johnnyApplePRNG

    Не удивлён, что Claude значительно превосходит Sol в научном интеллекте.

    Видно, что Claude действительно понимает широкий спектр узкоспециализированных научных и математических нюансов... а codex — это просто для кодинга, и всё.

    Такое ощущение у меня от них обоих, в любом случае, и я пользовался обоими по плану 20x в течение последней недели.

    Не поймите меня неправильно, codex отлично находит баги и создаёт игры. Он хорош.

  3. CJefferson

    Меня беспокоит, что здесь не проверяется корректность. В последнее время я замечаю, что Claude ужасно следует инструкциям: прошу реализовать алгоритм из статьи, а он делает что-то более простое и медленное, а когда я его критикую, он начинает свои тупые извинения. Ему нельзя доверять ничего, что я бы включил в статью, он слишком много врёт. 4.6 не мог выполнять такие сложные задачи, но делал то, что просили.

  4. boorang

    Я получил довольно хорошие результаты от контекстной инженерии, добавляя свои личные эвристики программирования в AGENTS.md и ссылаясь на поддокументы по принципу «когда делаешь X, смотри Y». Предполагаю, что другие делают что-то подобное, но я был удивлён, когда мне удалось заставить его генерировать код, который довольно близок к тому, что я бы написал вручную. Интересно, делают ли учёные и математики что-то подобное. «Когда я вижу X, я обычно сразу проверяю Y» или что-то вроде их доменных эвристик.

  5. jerpint

    То, что opus 5 превосходит fable, кажется мне странным.

    По личному опыту, opus 5 ощущается уступающим fable почти во всех аспектах (для задач кодинга)

Ещё за этот день

2026-08-28