機械学習研究エージェントはなぜ過学習しないのか——鍵は「圧縮」にあった
Why don't machine learning research agents overfit?
機械学習は本質的に暗記ではなく汎化を目指すもので、同じ検証データを使い続ければ教科書どおりなら過学習が起きるはずだ。しかしベンチマークを何年も反復改善しても過学習は起きない。Amazon Scienceの新研究は、成功したエージェントの戦略が極めて圧縮可能で、わずか16トークンに絞っても別のエージェントが同じ性能を再現できることを示した。圧縮は説明であると同時に、真の過学習を見分ける診断ツールにもなる。
機械学習は、その核心において、暗記ではなく汎化についてのものである。
HNでの議論
90- diddid
オッカムの剃刀を誤解している人を見るといつもイライラする。最も単純なものが正しい可能性が高いというわけではなく、単純だからこそ好むべきだということだ。
それはちょうどHopperの引用のようなものだ。彼女は、戦場の霧の中で正しいと思ったことをして許しを請う方が、相手がノーと言うとわかっていることをして、今になって何とかごまかそうとするより良いと言った。
- demibabs
テックジャイアントでさえ、どう見てもClaudeが完全に書いたような記事を出している。
- signalbright
> なぜ機械学習研究エージェントは過学習しないのか?
してるよ。
- ubutler
どちらかと言えば、最新世代のAIモデルであるAstraとFableこそが過学習の典型例だ——ベンチマークではAGI級を示唆しているのに、ユーザー(私を含む)は以前のモデルと同じ、いや時にはさらに顕著な、ガスライティング、ハルシネーション、コンテキストの腐敗、カンニング、不可解さのパターンを報告している。
FableとOpus 5は、RL崩壊の教科書的な例になるだろうと私は疑っている。
- jsrozner
なぜこれが査読付き投稿ではなくブログ記事として公開されているのか?ブログ記事にするなら、なぜ対応する科学版を見せてくれないのか?
誰かがすでに見つけている。なぜブログ記事にリンクがないのか理解できない。https://arxiv.org/abs/2606.11045
執筆にclaudeを使ったことは開示すべきだ。