DeepMind propone Dream-RSI: agentes que se auto-mejoran soñando con sus propios descubrimientos
Dream-RSI: Recursive Self-Improvement through Evolving Worlds
El auto-mejoramiento recursivo exige explorar de forma eficaz, pero las estrategias fijas no escalan y la optimización online es costosa. Dream-RSI introduce una capa de orquestación que hace explícita la exploración sin tocar el agente de código subyacente. Su clave: usar el historial de descubrimientos como simulador de replay donde 'soñar' genera retroalimentación offline barata para refinar la política, que luego vuelve online en un bucle auto-mejorable. Logra calidad competitiva y menor costo en ingeniería de algoritmos, optimización matemática y kernels de GPU.
Nuestra idea clave es que el historial de descubrimientos acumulado puede servir como un simulador de replay sobre el espacio de búsqueda realizado.