NVIDIA AVO在ARC-AGI-3测试中获满分

Nvidia AVO scores 100% on the ARC-AGI-3 interactive reasoning benchmark

NVIDIA AVO在ARC-AGI-3测试中获满分

NVIDIA AI发布重磅消息,其通用编程代理NVIDIA AVO在ARC-AGI-3交互式推理基准测试中取得了100%的满分成绩。该代理在没有指令、明确规则或既定目标的情况下,成功完成了25个公共环境中全部183个关卡的挑战。NVIDIA AVO通过持续检查、规划、实施和评估,利用记忆、工具及执行反馈来积累经验,从而在长周期任务中保持持续进步,而非每次都在新上下文中重新开始。这一突破展示了AI在自主推理和复杂任务执行上的巨大潜力。

NVIDIA AVO在没有指令、明确规则或既定目标的情况下,自行摸索并完成了所有任务。
  1. mellosouls

    原文的链接应该是这个:

    https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-...

    你会发现一个极其重要的限定条件:这是公开数据集,而非私有数据集(存在过拟合风险,即提交竞赛运行时结果无法复现),以及一个细节:这本质上只是给 Opus 5 加的一个 harness(执行框架),并非 Nvidia 自家的模型。

    显然这依然令人印象深刻,你会这么想吧。

  2. woeirua

    我以为 ARC-AGI-3 明确就是测试原始模型性能,排除 harness 的?把 harness 加回来并不能告诉我们任何新东西。我们早就知道,只要有足够的 harness,智能体就能进行长程推理。GPT-4(?) 在 18 个月前就能打败 Pokemon,而模型直到最近六个月才在不依赖 harness 的情况下做到这一点……?

  3. antinucleon

    AVO 论文的作者(前 Nvidia 员工)就在这儿。这项工作半年前是为 GPU kernel 做的,现在同样的方法应用到了 ARC-AGI-3 上。我觉得大家还是在低估进化的进展;例如,最近我们做了一个自我进化的 harness,生成了整个推理栈,在各种任务上都优于 SGLang/vLLM:https://int21.ai/insights/addressing-the-inference-bottlenec...

  4. subzel0

    100% 的分数是在 25 个公开数据集上取得的,而不是在半私有或私有数据集上。

  5. magicalhippo

    博客文章:https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-...

    使用的是 Claude Opus 5,但也可以用其他模型:

    AVO 的设计初衷就是能在前沿模型上运行。虽然我们的完整公开集结果使用的是 Claude Opus 5,但我们还将 AVO 与 GPT-5.6 Sol 配对,在具有挑战性的游戏子集上进行了测试。在这些有限的实验中,Sol 在几种情况下以更快的墙钟时间达到了匹配水平,而 Opus 在匹配水平的比较中使用了更少的环境操作。这些初步结果表明不同模型具有互补的运行特征,我们将更广泛的系统比较留给未来的工作。

同日更多故事

2026-08-21