ARC-AGI 榜单:AI 解题效率大比拼
ARC-AGI Leaderboard

ARC-AGI 榜单已从单纯测试流体智力的 ARC-AGI-1 和 2,进化到挑战 AI 在新型互动环境中即时适应的 ARC-AGI-3。最新数据通过散点图直观展示了每任务成本与性能之间的关键关系,揭示了真正的智能不仅在于解题,更在于以最少资源高效解题。榜单涵盖了 Anthropic 的 Claude 系列、xAI 的 Grok 4.5 以及 OpenAI 的 GPT-5.6 等多款模型,对比了 Base LLM 与具备推理能力的系统在 Kaggle 竞赛约束下的表现。随着推理时间的增加,性能曲线呈现渐近趋势,而专为 ARC Prize 设计的系统则在严格计算预算下展现了独特的优化策略。
真正的智能不仅仅是解决问题,而是以最小的资源高效地解决问题。