AI 연구의 '한 단계 함정': Rich Sutton이 경고하는 치명적 오류
The One-Step Trap (In AI Research)
강화학습의 선구자 Rich Sutton은 AI 연구자들이 흔히 빠지는 '한 단계 함정'을 지적한다. 이는 세계의 모든 예측을 한 단계 모델로 학습하고, 장기 예측은 이를 반복 적용해 생성하려는 오류다. 만약 한 단계 예측이 완벽하다면 문제없지만, 현실에서는 오류가 누적되고 계산 복잡도가 지수적으로 증가하여 실패한다. Sutton은 해결책으로 옵션과 GVF(일반 가치 함수)를 통한 시간적 추상화를 제안한다.
한 단계 세계 모델은 절망적이지만 극도로 매력적이며, POMDP, 베이지안 분석, 제어 이론, AI의 압축 이론에서 널리 사용된다.