Fable 5 побеждает в NanoGPT Speedrun: 153 автономных забега и рекорд 2726
NanoGPT Speedrun Frontier

Prime Intellect провела 153 автономных забега 18 frontier-моделей на оптимизационном спидранe nanoGPT. Лучший результат — у Fable 5 (2726 токенов, 81.7% закрытого разрыва), за ней следуют Opus 5 и Kimi K3. Сравнение при равных бюджетах показывает, что человеческий рекорд (2600) превзойдён всеми моделями, а Fable 5 достигает 3010 за 24 часа. Доступны полные траектории агентов.
Мы провели 153 автономных забега на 18 frontier-моделях на оптимизационном спидранe nanoGPT.
- lhl
Довольно интересно наблюдать за фронтом обучения. Я использовал большинство этих моделей для полуавтономной работы (по несколько дней подряд) над оптимизацией ядра (кроме Fable — она почти сразу срабатывала на защитные механизмы и отбрасывала меня к Opus 4.8 на тот момент). Думаю, для многих людей это может быть самой большой проблемой, хотя похоже, что Opus 5 всё ещё работает хорошо.
Я обнаружил, что если оставить их без присмотра и без направления, модели (особенно GPT-модели) зацикливаются, но с правильной обвязкой это, похоже, работает довольно хорошо. Мой общий цикл — начинать с фазы идей и профилирования, ограничивать количество запусков перед принудительным переходом к следующему пункту списка, а затем итерировать, возможно, смешивая модели со "свежим взглядом". Это, вероятно, можно полностью автоматизировать, но мне нравится проверять раз в день или около того, что происходит, и перенаправлять.
- vibe42
"Почти все модели находят одни и те же выигрышные идеи. Что отличает лучшие трассы, так это то, что оставляет после себя эксперимент. Они сохраняют слабые сигналы достаточно долго, чтобы проверить их, но также лучше понимают результаты."
Любопытно, изменило бы результат использование обвязки, которая помогала бы сохранять сигналы в каком-то журнале истории.
Также любопытно, изменили бы результат разные целевые промпты. Не куча промпт-инжиниринга; небольшие различия, например, "рассмотрите новые решения, отслеживайте слабые сигналы".
На мой взгляд, они выделили довольно много времени GPU на один и тот же целевой промпт.
- nsingh2
Что происходит с sol? В примечании сказано, что она много времени проводит в ожидании — неужели она просто неэффективно использовала время (например, параллельные запуски), так что её график растягивается по временной оси?
Также я вижу примечания, например, к Opus 5, где говорится, что это был запуск с более старой последовательной версией program.md, так что графики не совсем сопоставимы один к одному?
Редактирую: в блоге, похоже, это рассматривается https://www.primeintellect.ai/blog/measuring-autonomous-rese...
- totetsu
"Мы провели 153 автономных запуска на 18 frontier-моделях в speedrun по оптимизации nanoGPT."
Хм.. ладно.. но что такое запуск… читаю блог
"Мы хотим измерить, насколько хорошо frontier-модели могут проводить исследования…" "мы провели 153 автономных запуска в speedrun по оптимизации nanoGPT на"
Ладно, но что такое запуск оптимизатора и какое отношение это имеет к умению хорошо исследовать?
"Для сравнения, внутренняя автоматизированная оценка ИИ-исследований Anthropic оптимизирует модель на CPU-узле,"
Так мне стоит посмотреть, что делала Anthropic, чтобы понять?
Почему бы просто не объяснить, что это значит, в их блоге?..
- espadrine
Мне было бы интересно увидеть третью ось X с долларами.
Время иногда больше связано с инфраструктурой вывода (особенно с систолическими чипами), чем с качеством модели (и провайдеры крутят ручки, чтобы поддерживать большие батчи в ущерб задержке).
Токены не всегда полностью эквивалентны между моделями.