La trampa del paso único: por qué los modelos de un solo paso no predicen el futuro en IA
The One-Step Trap (In AI Research)
Rich Sutton, pionero del aprendizaje por refuerzo, advierte sobre un error común en la investigación de IA: confiar en modelos de transición de un solo paso para predecir consecuencias a largo plazo. Aunque atractivos por su analogía con la física, estos modelos acumulan errores y su complejidad computacional crece exponencialmente en entornos estocásticos. Sutton propone usar modelos temporalmente abstractos, como options y GVFs, para superar esta limitación.
En la práctica, iterar predicciones de un solo paso suele producir malos resultados; los errores de un paso se acumulan y se convierten en grandes errores en las predicciones a largo plazo.