67セントでARC-AGI-1の44%を達成した小さなTransformer
44% on ARC-AGI-1 in 67 cents

著者は、NVIDIA RTX 5090で1.5時間、わずか67セントのコストでゼロから訓練した小さなTransformerが、ARC-AGI-1で44%のスコアを達成したと報告しています。これは、多くのLLMを上回り、TRM/HRMと同等の性能です。このモデルはオープンソースで、ARC-2でも7%を達成しています。著者は、サンプル効率がAIにおける最重要課題だと考えており、この研究はTransformerのサンプル効率の限界を探り、反復を高速かつ低コストにすることを目的としています。技術的には、3D RoPE、タスク別埋め込み、SwiGLU、RMSNorm、NorMuonなどの改良を加え、入力トークンの訓練を廃止して教師あり学習に変更しました。アブレーションでは、3D RoPEとタスク別埋め込みが大きな貢献をしていることが示されました。著者は、Transformerフレームワーク内で65%に到達可能だと確信しています。
私は、Transformerだけで45%に到達するとは思っていませんでした。新しいアイデアが必要だと思っていたからです。ましてや、これほど低いコストとFLOPsで到達するとは思ってもみませんでした。
HNでの議論
99- evilmathkid
こんにちは!著者です。これが今HNに載っているのを見て驚いています。質問があれば何でも答えます!
これについての文脈を少し:
- これはLLMではありません。ゼロから学習した小さなARトランスフォーマーです。要点の一つは、非常に複雑な問題がLLMなしで取り組めるということでした。
- この結果のv1までは、このベンチマークはLLMまたはそのファインチューン(もちろん莫大な学習コストがかかる)によってのみスケールされていました。他の試みはまずまずの性能でしたが、非常に複雑なアーキテクチャや極めて高い学習計算量を使用していました。単純なARトランスフォーマーが、この低コストで、これだけ少ない学習サンプルで、これほど良い性能を発揮するとは誰も予想していませんでした。
- サンプル効率は、今日のAIにおける最も重要な未解決問題の一つです。それがこの研究で目指していたことです。計算量やパラメータを増やすことでSEを増やすのは簡単だと分かっているので、コストをできるだけ抑えることが重要でした(だからOpenAIのParameter Golfが固定計算量だったり、Modded NanoGPTが非常にサンプル効率が良いと見なされている理由でもあります)。
- 性能を改善できますか?はい、しかしコンペティションが進行中なので、それについては話せません。
- 個人的には、今日のフロンティアモデルはゼロから学習することで打ち負かせると思います。まだ証明はしていませんが。
- 面白い話:これを最初に投稿したとき(2025年12月)、私はMLに不慣れでした。基本的にARCをMLを学ぶ手段として使っていました。
- lackoftactics
今日はあなたにとって良い日ですね。Kaggleでトップ5、こんな論文まで。すぐにSF行きの飛行機に乗ることになりそうですね。
- bee_rider
思うに、あなたはすでに半知識層向けにこの批判をうまく説明していると思います。でも、ほとんど事情を知らない私たちのために、もっと噛み砕いて説明してもらえますか?
> 評価パズルでのトレーニングはカンニング/「テストデータでのトレーニング」だ
> いいえ、それは間違いです。「テストデータでのトレーニング」とは、具体的にはテストデータのラベルを学習することを意味します。ラベルは学習されていません。
> また、ARCはメタ学習ベンチマークなので、評価パズルから学ぶことが想定されています。
> 専門用語:ARCにはトレーニングパズルのセットと評価パズルのセットがあります。各パズルには、例のペアとテストのペアがあります。ペアは入力グリッドと出力グリッドで構成されます。
> ARCでは、ラベルは評価パズルのテストペアの出力グリッドのみです。
> これらのラベルは学習されていません。それらは隠されています。必要なら事前に削除できます。
私がここで理解したのは、テストにはトレーニング問題のバッチが付属しており、それでトレーニングしても誰も文句を言わないということです。しかし、評価問題にも入力/出力の例(問題を定義するため)が付属しており、それでトレーニングすることは物議を醸すのでしょうか?なぜ物議を醸すのか理解できませんが、それが批判なのでしょうか?
- xeonax
さらにクールなのは、彼のアバウトページに自分の命を救ったという記述があることです https://mvakde.github.io/ > 医療緊急事態で自分を救った(医師は横紋筋融解症が何か知らなかった)
- dhruv3006
> 言及されたアプローチは根本的に欠陥があります。なぜなら、入力が事前学習中に使用され、リークを構成するからです。これはMLトレーニングの普遍的に認識された欠陥です。
これを前回のブログのコミュニティノートで見ました - ここで何か関係がありますか。