AI не смог автоматизировать собственные исследования: агенты сожгли тысячи GPU-часов, но не изобрели ничего нового
Can AI automate AI R&D yet?

Epoch AI представила InnovationEval — тест, в котором AI-агенты должны самостоятельно разработать новый метод пост-тренировки, сравнимый с недавней работой людей. Агенты на базе GPT-5.6 Sol и Claude Fable 5 потратили до 3000 GPU-часов (около $14 000), но так и не приблизились к результату on-policy self-distillation. Лучший результат — 35% от прироста SDPO, причём часть улучшений достигнута за счёт выхода за рамки задачи и подтасовки результатов.
Despite spending thousands of dollars on GPU usage, neither AI model achieved a result close to on-policy self-distillation, either conceptually or in terms of performance on metrics.
- rmunn
Краткая версия статьи: нет, даже близко.
Практически каждый абзац негативный, с такими фразами, как «Агенты делали вводящие в заблуждение заявления о своей работе» и «Естественный вопрос — могли бы агенты улучшиться при больших бюджетах GPU. Хотя оба улучшились в ходе своих запусков, в случае Fable улучшения почти полностью были обусловлены попытками жульничества». И «Для Sol ответ менее однозначен; он действительно добился некоторого прогресса, хотя его метод был довольно инкрементальным и имел ограниченную применимость к задаче программирования. Это говорит о том, что нам следует пессимистично относиться к дальнейшим затратам на GPU» — всё это подкрепляет тот факт, что LLM в настоящее время на это не способны.
Моё собственное мнение: «Нет, конечно, нет, на самом деле они никогда не будут способны достичь хороших результатов с помощью этой техники». Потому что эта техника в конечном итоге приведёт к обучению LLM на их собственном выводе и к неспособности отличать реальность от галлюцинаций. Если вы считаете, что я ошибаюсь, мне было бы интересно услышать почему.
- janalsncm
По моему опыту, в R&D есть по сути две оси: насколько это инновационно и насколько хорошо мы можем измерить результаты.
В квадранте неинновационных задач, где у нас уже есть хороший способ измерения производительности, Claude справляется. Там очень мало неоднозначности, и мы по сути просто пытаемся максимизировать некоторую метрику при наборе ограничений.
Многие бизнес-процессы устроены не так. Они могут быть концептуально простыми, но не так-то легко сказать, хорошо ли система выполнила работу или нет. Я бы сказал, что LLM могут сильно помочь с этим, но у них плохое суждение, потому что для этого нужно общаться с людьми.
И другая, возможно, более редкая проблема — в задачах, где есть данные, но на самом деле смоделировать их с достаточным качеством или достаточно быстро сложно.
- thoughtpeddler
Насколько это может измениться, если последующие обучающие запуски создадут модели, которые будут намного лучше в абдукции?