ARC-AGI 榜单:AI 解题效率大比拼

ARC-AGI Leaderboard

ARC-AGI 榜单:AI 解题效率大比拼

ARC-AGI 榜单已从单纯测试流体智力的 ARC-AGI-1 和 2,进化到挑战 AI 在新型互动环境中即时适应的 ARC-AGI-3。最新数据通过散点图直观展示了每任务成本与性能之间的关键关系,揭示了真正的智能不仅在于解题,更在于以最少资源高效解题。榜单涵盖了 Anthropic 的 Claude 系列、xAI 的 Grok 4.5 以及 OpenAI 的 GPT-5.6 等多款模型,对比了 Base LLM 与具备推理能力的系统在 Kaggle 竞赛约束下的表现。随着推理时间的增加,性能曲线呈现渐近趋势,而专为 ARC Prize 设计的系统则在严格计算预算下展现了独特的优化策略。

真正的智能不仅仅是解决问题,而是以最小的资源高效地解决问题。
  1. KaoruAoiShiho

    看起来这就是典型的刷榜行为

    https://x.com/quietnning/status/2080786711861407883

  2. dinp

    我上次查看时,ARC-AGI 3 的排行榜规则是:给模型一个简单的提示和游戏输入,要求它直接玩游戏,不允许使用任何 harness 或工具。如果允许使用 harness,我预计这个基准测试早就被刷爆了。确实有过几次尝试使用 harness,但它们只能在公开数据集上评估,所以无法进行公平对比。

    我猜测 Opus 5 分数的大幅跃升,主要是因为找到了合适的 RL 训练环境。

    构建和运行有意义的基准测试正变得越来越难、越来越贵。看看 ARC-AGI 4 会怎么做会很有趣,也许直接扔给它 Gameboy 或 Steam 游戏,看看它们与人类基线相比表现如何?游戏中的延迟要求和极长的决策 horizon 对 LLM 来说可能是一个有趣的挑战。

  3. throwaw12

    为什么 Anthropic 的模型总是能在这个基准测试上大幅领先,但在实际工作中,我总觉得用了三周后,感觉又回到了 Claude Opus 4.5 的水平?(不管我用的是哪个模型,Fable 是个例外,刚发布时确实强了一天)

  4. MaskNinja

    不可能吧。我不明白 Opus 5 怎么能拿到这么高的分数。他们是在私有数据集和预留数据集上跑的吗?

  5. codedokode

    为什么没有 Kimi 3?GLM5.2 也没跑第三个基准测试?我更想知道开源权重模型的能力如何。

  6. albatross79

    ARC-AGI 就是一场给猪选美的比赛,猪的主人比拼谁给猪涂的口红最像样。

  7. NooneAtAll3

    这些游戏很棒(对人类来说),

    但我有点希望能自己选择关卡……我不小心点了重定向按钮,等我回来时,又被带回了第 1 关,所有进度都没了 :(

  8. tudelo

    > 仅展示运行成本低于 10,000 美元的系统。(备注 [1])

    是我看错了吗,还是这个排行榜上有很多模型(包括 Opus 5)都符合这个条件?

同日更多故事

2026-07-25