DeepMind, 탐색 전략을 스스로 개선하는 Dream-RSI 공개

DeepMind Paper: Dream-RSI: Recursive Self-Improvement Through Evolving Worlds

DeepMind의 Dream-RSI는 AI 에이전트가 스스로 탐색 전략을 개선하도록 돕는 프레임워크다. 과거 탐색 기록을 리플레이 시뮬레이터로 활용해 값비싼 온라인 평가 없이 오프폴리시 피드백을 얻고, 개선된 정책을 다시 온라인에 배포해 탐색 공간을 확장한다. 알고리즘 엔지니어링, 수학적 최적화, GPU 커널 엔지니어링에서 경쟁력 있는 발견 품질을 유지하면서 비용을 크게 줄였다.

우리의 핵심 통찰은 축적된 발견 역사가 실현된 탐색 공간에 대한 리플레이 시뮬레이터로 작동할 수 있다는 것이다.

이 날의 다른 글

2026-09-16