Schema Harness在ARC-AGI-3公榜斩获99%

Schema Harness Achieves ~99% on Arc‑AGI‑3 Public

ARC-AGI-3公榜上,Schema Harness配合Claude Opus 4.8和Fable 5实现了惊人的99% RHAE得分。这套系统不改动模型权重,而是像物理学家一样工作:先通过State Grounding从原始像素中构建状态,再通过Mechanism Discovery推演世界规则。当预测失败时,它不仅能调整规则,还能重构对状态本身的定义。相比传统方法,Schema Harness让模型在未知环境中展现出接近人类的推理与修正能力,证明了‘如何使用模型’比模型本身更关键。

关键启示在于:你如何使用模型,其重要性远超模型本身。
  • 有评论者指出,Schema Harness 的核心价值不在于单纯刷高 ARC-AGI-3 分数,而在于构建了一种通用的架构,使模型能通过构建世界模型和可执行规则来高效解决新问题,这超越了简单的模型参数提升。
  • 部分观点质疑该方案是否属于'作弊',认为利用模拟器或特定工具(Harness)绕过直接推理,就像在代数考试中允许使用计算器,未能真正测试模型在未知环境中的连续学习和泛化能力。
  • 针对'工具使用非人类智能'的担忧,有评论反驳称,能够编写工具来解决难题恰恰是智能的体现,试图要求 AI 必须像人类一样思考才能被称为 AGI 是一种危险的思维定式。
  • 一位从业者提到,将复杂任务拆解为初级模型处理简单部分、高级模型处理难点的层级化工作流,才是企业应对 Token 成本的最优解,而非盲目追求单一模型的端到端能力。

同日更多故事

2026-07-16