DeepMind предлагает Dream-RSI: агенты улучшают себя, «видя сны» о собственных открытиях
Dream-RSI: Recursive Self-Improvement through Evolving Worlds
Dream-RSI — фреймворк для рекурсивного самосовершенствования AI-агентов. Вместо дорогостоящей онлайн-оптимизации он строит симулятор-реплей из накопленных деревьев поиска и «грезит» в нём, получая дешёвую off-policy обратную связь для настройки стратегий исследования. Улучшенная политика возвращается в онлайн, а пул симуляторов растёт в самоусиливающемся цикле. В задачах алгоритмической инженерии, математической оптимизации и разработки GPU-ядер подход сохраняет или повышает качество находок при существенном снижении затрат.
Наша ключевая идея в том, что накопленная история открытий может служить симулятором-реплеем по уже исследованному пространству поиска.