「1ステップの罠」:AI研究における致命的な過ち
The One-Step Trap (In AI Research)
リッチ・サットンが提唱する「1ステップの罠」とは、AIエージェントの予測をすべて1ステップの予測に頼り、長期的な予測はそれを反復して生成できると考える誤りです。一見魅力的ですが、1ステップの予測が不完全だと誤差が累積し、長期的な予測は破綻します。また、確率的な環境では計算量が指数関数的に増大し、非現実的です。サットンは、この罠を避けるために、オプションやGVF(一般価値関数)を用いた時間的抽象化の重要性を説きます。
1ステップの世界モデルは絶望的だが、非常に魅力的であり、POMDP、ベイズ分析、制御理論、AIの圧縮理論などで広く使われている。