NVIDIA AVO набирает 100% на бенчмарке ARC-AGI-3
Nvidia AVO scores 100% on the ARC-AGI-3 interactive reasoning benchmark
NVIDIA сообщает, что её агент общего назначения для написания кода AVO набрал 100% на интерактивном бенчмарке рассуждений ARC-AGI-3, пройдя все 183 уровня в 25 публичных средах без инструкций, явных правил или заданных целей. Компания заявляет, что AVO непрерывно анализирует, планирует, реализует и оценивает свои действия, используя память, инструменты и обратную связь для прогресса в длительных задачах.
Наш агент общего назначения для написания кода только что набрал 100% на интерактивном бенчмарке рассуждений ARC-AGI-3.
- mellosouls
Основная статья должна быть по ссылке:
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-...
Там вы найдете крайне важную оговорку, что это публичный набор, а не приватный (с риском переобучения, то есть результаты могут не повториться при подаче на конкурс), и деталь, что это по сути обвязка (harness), добавленная к Opus 5, а не собственные модели Nvidia.
Очевидно, всё равно впечатляет, как вы могли бы подумать.
- woeirua
Я думал, ARC-AGI-3 — это явно тест на чистую производительность модели без обвязки? Возвращение обвязки не говорит нам ничего нового. Мы уже знали, что агенты способны на длительные рассуждения при достаточной обвязке. GPT-4(?) могла проходить Pokemon 18 месяцев назад, но модели стали способны проходить его без обвязки только в последние шесть месяцев...?
- antinucleon
Автор статьи об AVO (экс-сотрудник Nvidia) здесь. Эта работа была сделана полгода назад для GPU-ядер, и тот же подход теперь применён к ARC-AGI-3. Думаю, люди всё ещё недооценивают прогресс эволюции; например, недавно мы создали самоулучшающуюся эволюционную обвязку, которая сгенерировала целый инференс-стек и превосходит SGLang/vLLM на различных задачах: https://int21.ai/insights/addressing-the-inference-bottlenec...
- subzel0
Результат 100% был достигнут на 25 публичных наборах, а не на полу-приватных или приватных.
- magicalhippo
Пост в блоге: https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-...
Использует Claude Opus 5, но может использовать и другие:
AVO также разработан для работы с frontier-моделями. Хотя наш полный результат на публичном наборе использовал Claude Opus 5, мы дополнительно совместили AVO с GPT-5.6 Sol на сложном подмножестве игр. В этих ограниченных экспериментах Sol достигал сопоставимых уровней быстрее по времени стены в нескольких случаях, тогда как Opus использовал меньше действий среды при сравнении на сопоставимых уровнях. Эти предварительные результаты предполагают взаимодополняющие операционные профили между моделями, и мы оставляем более широкое систематическое сравнение на будущее.