44% на ARC-AGI-1 за 67 центов

44% on ARC-AGI-1 in 67 cents

44% на ARC-AGI-1 за 67 центов

Автор обучил небольшой трансформер с нуля за 1,5 часа на GPU NVIDIA 5090, достигнув 44% на ARC-AGI-1 — результат, сопоставимый с TRM и HRM, но за 67 центов. В статье описаны улучшения по сравнению с предыдущей моделью: современная архитектура (SwiGLU, RMSNorm), обучение только на выходных токенах, 3D RoPE и пер-таск эмбеддинги, а также оптимизация затрат за счёт сокращения аугментаций и использования NorMuon. Автор обсуждает абляции, критику подхода (включая обвинения в «тренировке на тесте») и планы по достижению 65%.

Я не понимаю, почему другие этого не поняли. Это просто трансформер с самым очевидным представлением. Этот бенчмарк открыт уже 6 лет, был на слуху, и за него предлагали миллион долларов!
  1. evilmathkid

    Привет! Я автор. Удивлён, что это попало на HN. Готов ответить на любые вопросы!

    Немного контекста:

    - Это НЕ LLM. Это маленький авторегрессионный трансформер, обученный с нуля. Одна из целей — показать, что чрезвычайно сложные задачи можно решать без LLM.

    - До v1 этого результата этот бенчмарк масштабировался только LLM или их дообучением (естественно, с огромными затратами на обучение). Другие попытки показывали неплохие результаты, но использовали очень сложные архитектуры или крайне большие объёмы вычислительных ресурсов. Никто не ожидал, что простой AR-трансформер покажет такой результат при такой низкой стоимости и на таком малом количестве обучающих примеров.

    - Эффективность выборки — одна из самых важных нерешённых проблем в ИИ сегодня. Именно на это я и нацеливался в этой работе. Мы знаем, что легко увеличить SE за счёт увеличения вычислений/параметров, поэтому было важно максимально ограничить затраты (именно поэтому в Parameter Golf от OpenAI был фиксированный объём вычислений, и почему Modded NanoGPT считается очень эффективным по выборке).

    - Можно ли улучшить результат? Да, но конкурс ещё идёт, так что я не могу об этом говорить.

    - Лично я считаю, что сегодняшние фронтирные модели можно превзойти, обучая с нуля. Но я это ещё не доказал.

    - Забавно: я был новичком в ML, когда впервые опубликовал это (декабрь '25). Я по сути использовал ARC как способ выучить ML.

  2. foota

    > Согласен, что редко встречаются наборы задач в реальной жизни, где все задачи даны сразу. Даже если это экзамен, люди обычно могут решать только по одной задаче за раз.

    Просто небольшой фрагмент, который мне показался интересным. Я всегда просматривал весь экзамен перед началом. И чтобы найти наиболее простые для меня задачи, и потому что иногда это помогает понять остальные вопросы :-)

  3. foota

    > Запретить офлайн-обучение/предобучение. Модели должны обучаться с нуля после отправки.

    Раньше это считалось невозможным правилом. Моя модель показывает, что это возможно.

    Гарантирует, что нельзя использовать синтетические данные.

    Это делает сравнение честным для разных моделей. Иначе некоторые модели, такие как LLM, могут накрутить ARC, используя невероятные объёмы офлайн-обучения (поскольку бенчмарк существует давно, было создано много наборов данных, похожих на ARC).

    Я не исследователь ML, так что как повезёт, но... как модель может научиться отвечать на эти вопросы ARC-AGI без предварительного обучения?

  4. lackoftactics

    Похоже, отличный день для тебя, топ-5 на Kaggle с такой публикацией. Похоже, скоро ты будешь в самолёте до Сан-Франциско.

  5. bee_rider

    Я думаю(?), ты уже хорошо объяснил эту критику для полуинформированных людей. Но можешь ли ты объяснить это ещё проще для тех, кто почти полностью вне контекста?

    > Обучение на оценочных головоломках — это читерство / "обучение на тесте"

    > Нет, это ложь. "Обучение на тесте" конкретно означает обучение на метках тестовых данных. Метки не были использованы для обучения.

    > Кроме того, ARC — это метаобучающий бенчмарк, так что предполагается, что вы учитесь на оценочных головоломках.

    > Жаргон: ARC имеет набор обучающих головоломок и набор оценочных головоломок. Каждая головоломка имеет пары примеров и тестовые пары. Пара состоит из входной сетки + выходной сетки.

    > В ARC метка — это только выходная сетка тестовой пары в оценочной головоломке.

    > Эти метки не использовались для обучения. Они скрыты. Вы можете удалить их заранее, если хотите.

    Я думаю, что здесь я понимаю, что тест приходит с одним набором обучающих задач, на которых все согласны можно обучаться. Но, возможно, оценочные задачи также содержат пары вход/выход (чтобы помочь определить задачу), и обучение на них спорно? Я не вижу, почему это было бы спорно, но это ли критика?

  6. xeonax

    Ещё круче его упоминание о спасении собственной жизни в разделе "обо мне" https://mvakde.github.io/ > Спас себя в медицинской чрезвычайной ситуации (врачи не знали, что такое рабдомиолиз)

  7. rappatic

    У меня нет никакого ML-образования, но я всегда думал, что эффективность выборки — это великая нерешённая проблема ИИ. У людей невероятно хорошая эффективность выборки; часто мы можем надёжно выучить что-то на одном-двух примерах. Это главная область, в которой LLM сильно, сильно отстают от нас.

  8. kvn95ss

    > Кроме того, я не уверен, что "общие рассуждения" вообще существуют? Может, люди тоже специализированы.

    Я задавался тем же вопросом. Мы сейчас подвергаемся такому количеству стимулов, что нас обманывают, заставляя думать, что это норма — иметь разумное понимание обо всём, если только не требуется специализация.

Ещё за этот день

2026-09-01