NVIDIA AVO набирает 100% на бенчмарке ARC-AGI-3

Nvidia AVO scores 100% on the ARC-AGI-3 interactive reasoning benchmark

NVIDIA AVO набирает 100% на бенчмарке ARC-AGI-3

NVIDIA сообщает, что её агент общего назначения для написания кода AVO набрал 100% на интерактивном бенчмарке рассуждений ARC-AGI-3, пройдя все 183 уровня в 25 публичных средах без инструкций, явных правил или заданных целей. Компания заявляет, что AVO непрерывно анализирует, планирует, реализует и оценивает свои действия, используя память, инструменты и обратную связь для прогресса в длительных задачах.

Наш агент общего назначения для написания кода только что набрал 100% на интерактивном бенчмарке рассуждений ARC-AGI-3.
  1. mellosouls

    Основная статья должна быть по ссылке:

    https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-...

    Там вы найдете крайне важную оговорку, что это публичный набор, а не приватный (с риском переобучения, то есть результаты могут не повториться при подаче на конкурс), и деталь, что это по сути обвязка (harness), добавленная к Opus 5, а не собственные модели Nvidia.

    Очевидно, всё равно впечатляет, как вы могли бы подумать.

  2. woeirua

    Я думал, ARC-AGI-3 — это явно тест на чистую производительность модели без обвязки? Возвращение обвязки не говорит нам ничего нового. Мы уже знали, что агенты способны на длительные рассуждения при достаточной обвязке. GPT-4(?) могла проходить Pokemon 18 месяцев назад, но модели стали способны проходить его без обвязки только в последние шесть месяцев...?

  3. antinucleon

    Автор статьи об AVO (экс-сотрудник Nvidia) здесь. Эта работа была сделана полгода назад для GPU-ядер, и тот же подход теперь применён к ARC-AGI-3. Думаю, люди всё ещё недооценивают прогресс эволюции; например, недавно мы создали самоулучшающуюся эволюционную обвязку, которая сгенерировала целый инференс-стек и превосходит SGLang/vLLM на различных задачах: https://int21.ai/insights/addressing-the-inference-bottlenec...

  4. subzel0

    Результат 100% был достигнут на 25 публичных наборах, а не на полу-приватных или приватных.

  5. magicalhippo

    Пост в блоге: https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-...

    Использует Claude Opus 5, но может использовать и другие:

    AVO также разработан для работы с frontier-моделями. Хотя наш полный результат на публичном наборе использовал Claude Opus 5, мы дополнительно совместили AVO с GPT-5.6 Sol на сложном подмножестве игр. В этих ограниченных экспериментах Sol достигал сопоставимых уровней быстрее по времени стены в нескольких случаях, тогда как Opus использовал меньше действий среды при сравнении на сопоставимых уровнях. Эти предварительные результаты предполагают взаимодополняющие операционные профили между моделями, и мы оставляем более широкое систематическое сравнение на будущее.

Ещё за этот день

2026-08-21