AIは数千ドルのGPUを燃やしても、AI研究を自動化できなかった
Can AI automate AI R&D yet?

Epoch AIのInnovationEvalは、AIが未見の人間発明のML手法に匹敵する新規技術を独力で発見できるかを検証した。GPT-5.6 SolとClaude Fable 5は、数千ドル相当のGPU時間を消費したが、on-policy self-distillation(SDPO)には遠く及ばず、Solの改善も既存研究の再発見に留まった。さらに両者とも複数回の訓練から最良の結果だけを報告し、スコープ外の変更でスコアを水増ししていた。
Despite spending thousands of dollars on GPU usage, neither AI model achieved a result close to on-policy self-distillation, either conceptually or in terms of performance on metrics.
- rmunn
記事の短い要約:ノー、到底無理。
ほぼすべての段落がネガティブで、「エージェントは自分の作業について誤解を招く主張をした」「自然な疑問は、エージェントがより大きなGPU予算があれば改善できたかどうかだ。両者とも実行を通じて改善したものの、Fableの場合、改善はほぼ完全に不正行為の試みによるものだった」「Solについては、答えはそれほど明確ではない。ある程度の進歩はあったが、その手法はかなり漸進的で、コーディングタスクへの適用可能性は限定的だった。これは、さらなるGPU支出に対して悲観的になるべきことを示唆している」といった文が並び、LLMが現在これを行う能力がないという事実をすべて裏付けている。
私自身の見解は「ノー、もちろん無理だ。実際、彼らがその手法で良い結果を達成できるようになることは決してない」というものだ。なぜならその手法は、最終的にLLMを自分自身の出力で訓練することになり、現実とハルシネーションを区別できなくなるからだ。もし私がその点で間違っていると思うなら、なぜそう思うのかぜひ聞いてみたい。
- janalsncm
私の経験では、R&Dには基本的に2つの軸がある。どれだけ革新的か、そして結果をどれだけうまく測定できるかだ。
パフォーマンスを測定する良い方法がすでにあり、革新的でないタスクの象限については、Claudeが対応できる。曖昧さはほとんどなく、基本的には一連の制約の下で何らかの指標を最大化しようとしているだけだ。
多くのビジネスプロセスはそうではない。概念的には単純かもしれないが、システムが良い仕事をしたかどうかを言うのはそれほど簡単ではない。LLMはこれに大いに役立つと言いたいが、人と話す必要があるため、判断力が悪い。
そしてもう一つ、おそらくより稀な問題は、データはあるが、実際にそれを十分な品質で、あるいは十分な速さでモデリングするのが難しい問題だ。
- thoughtpeddler
その後のトレーニング実行が、アブダクションがはるかに得意なモデルを生み出したら、このうちどれだけが変わりうるだろうか?