67美分训练Transformer拿下ARC-AGI-1 44%
44% on ARC-AGI-1 in 67 cents

我在1.5小时内用5090显卡从头训练了一个小型Transformer,仅花费67美分就在ARC-AGI-1上取得了44%的得分,表现超越许多大型语言模型。这次升级不仅速度更快、成本更低,而且完全开源。通过引入现代架构、优化数据多样性以及采用NorMuon优化器,我成功提升了样本效率。尽管有人质疑在评估集上训练是否违规,但这实际上是元学习基准所鼓励的测试时训练(TTT)。我相信在Transformer框架内,65%的得分完全可达,关键在于降低实验成本,让全球研究者都能参与探索。
我认为样本效率是当今AI领域最重要的问题,而我的目标就是解决它。
HN 评论区
94- evilmathkid
你好!我是作者。没想到这篇帖子现在会上到 HN。很乐意回答任何问题!
关于这篇工作的一些背景:
- 这 NOT 是一个 LLM。它是一个从头训练的小型自回归(AR)Transformer。其中一个核心观点是:即使没有 LLM,也能解决极其复杂的问题。
- 直到这个结果的 v1 版本之前,这个基准测试的突破仅由 LLM 或其微调模型实现(当然伴随着巨大的训练成本)。其他尝试表现尚可,但要么使用了极其复杂的架构,要么消耗了海量的训练算力。没人预料到一个简单的 AR Transformer 能以如此低的成本和如此少的训练样本取得这么好的效果。
- 样本效率(Sample Efficiency)是当今 AI 领域最重要的未解难题之一。这也是我这项工作的目标。我们知道增加算力或参数量很容易提升样本效率,因此尽可能限制成本至关重要(这也是为什么 OpenAI 的 Parameter Golf 固定了算力,以及为什么 Modded NanoGPT 被认为具有极高的样本效率)。
- 性能还能提升吗?可以,但比赛还在进行中,所以不能细说。
- 就我个人而言,我认为今天的前沿模型可以通过从头训练来超越。不过我还没能证明这一点。
- 趣事:我第一次发布这个结果(2025 年 12 月)时还是 ML 新手。我基本上是把 ARC 当作学习 ML 的途径。
- foota
> 我同意,在现实生活中很少见到所有问题一次性给出的场景。即使有(比如考试),人类通常也只能一次尝试一个问题。
我只是觉得有一个小片段挺有意思。我通常会在开始做题前通读整份试卷。这样做既是为了找到对我来说最容易入手的问题,也是因为有时候这能帮我理清其他题目的思路 :-)
- lackoftactics
看来今天是你走运的一天啊,Kaggle 排名前 5,还发表了这样的论文。感觉你很快就要飞往旧金山了。
- foota
> 禁止离线训练/预训练。模型必须在提交后从头开始训练。
以前这被认为是不可能的,所以成了规则。我的模型证明了这是可行的。
这保证了无法使用合成数据。
这让不同模型之间的比较更加公平。否则,像 LLM 这样的模型可以通过使用海量的离线训练来刷 ARC 的分数。(因为这个基准已经存在很久了,很多类似 ARC 的数据集已经被创建出来)
我不是 ML 研究员,所以仅供参考(YMMV),但……一个模型如果不预先训练,怎么可能学会回答这些 ARC-AGI 问题呢?
- bee_rider
我觉得(?)你已经很好地为那些半懂不懂的人解释了这些批评。但能不能再通俗一点,给我们这些几乎完全跟不上节奏的人讲讲?
> 在评估谜题上训练就是作弊/“在测试集上训练”。
> 不,这是错的。“在测试集上训练”特指使用测试数据的标签进行训练。我们并没有使用标签进行训练。
> 此外,ARC 是一个元学习(metalearning)基准,所以本就应该从评估谜题中学习。
> 术语解释:ARC 包含一组训练谜题和一组评估谜题。每个谜题都包含示例对和测试对。一对由一个输入网格和一个输出网格组成。
> 在 ARC 中,评估谜题的标签仅仅是测试对的输出网格。
> 这些标签并没有被用于训练。它们是隐藏的。如果你愿意,可以在训练前删除它们。
我理解的意思是:测试附带了一批训练题,大家都同意可以在上面训练。但也许评估题也附带了输入/输出示例(用来帮助定义问题),而在这些示例上训练是有争议的?我看不出这有什么好争议的,但这就是批评的焦点吗?