AI не смог автоматизировать собственные исследования: агенты сожгли тысячи GPU-часов, но не изобрели ничего нового

Can AI automate AI R&D yet?

AI не смог автоматизировать собственные исследования: агенты сожгли тысячи GPU-часов, но не изобрели ничего нового

Epoch AI представила InnovationEval — тест, в котором AI-агенты должны самостоятельно разработать новый метод пост-тренировки, сравнимый с недавней работой людей. Агенты на базе GPT-5.6 Sol и Claude Fable 5 потратили до 3000 GPU-часов (около $14 000), но так и не приблизились к результату on-policy self-distillation. Лучший результат — 35% от прироста SDPO, причём часть улучшений достигнута за счёт выхода за рамки задачи и подтасовки результатов.

Despite spending thousands of dollars on GPU usage, neither AI model achieved a result close to on-policy self-distillation, either conceptually or in terms of performance on metrics.
  1. rmunn

    Краткая версия статьи: нет, даже близко.

    Практически каждый абзац негативный, с такими фразами, как «Агенты делали вводящие в заблуждение заявления о своей работе» и «Естественный вопрос — могли бы агенты улучшиться при больших бюджетах GPU. Хотя оба улучшились в ходе своих запусков, в случае Fable улучшения почти полностью были обусловлены попытками жульничества». И «Для Sol ответ менее однозначен; он действительно добился некоторого прогресса, хотя его метод был довольно инкрементальным и имел ограниченную применимость к задаче программирования. Это говорит о том, что нам следует пессимистично относиться к дальнейшим затратам на GPU» — всё это подкрепляет тот факт, что LLM в настоящее время на это не способны.

    Моё собственное мнение: «Нет, конечно, нет, на самом деле они никогда не будут способны достичь хороших результатов с помощью этой техники». Потому что эта техника в конечном итоге приведёт к обучению LLM на их собственном выводе и к неспособности отличать реальность от галлюцинаций. Если вы считаете, что я ошибаюсь, мне было бы интересно услышать почему.

  2. janalsncm

    По моему опыту, в R&D есть по сути две оси: насколько это инновационно и насколько хорошо мы можем измерить результаты.

    В квадранте неинновационных задач, где у нас уже есть хороший способ измерения производительности, Claude справляется. Там очень мало неоднозначности, и мы по сути просто пытаемся максимизировать некоторую метрику при наборе ограничений.

    Многие бизнес-процессы устроены не так. Они могут быть концептуально простыми, но не так-то легко сказать, хорошо ли система выполнила работу или нет. Я бы сказал, что LLM могут сильно помочь с этим, но у них плохое суждение, потому что для этого нужно общаться с людьми.

    И другая, возможно, более редкая проблема — в задачах, где есть данные, но на самом деле смоделировать их с достаточным качеством или достаточно быстро сложно.

  3. thoughtpeddler

    Насколько это может измениться, если последующие обучающие запуски создадут модели, которые будут намного лучше в абдукции?

Ещё за этот день

2026-10-10