DeepMind propone Dream-RSI: agentes que se auto-mejoran soñando con sus propios descubrimientos

Dream-RSI: Recursive Self-Improvement through Evolving Worlds

El auto-mejoramiento recursivo exige explorar de forma eficaz, pero las estrategias fijas no escalan y la optimización online es costosa. Dream-RSI introduce una capa de orquestación que hace explícita la exploración sin tocar el agente de código subyacente. Su clave: usar el historial de descubrimientos como simulador de replay donde 'soñar' genera retroalimentación offline barata para refinar la política, que luego vuelve online en un bucle auto-mejorable. Logra calidad competitiva y menor costo en ingeniería de algoritmos, optimización matemática y kernels de GPU.

Nuestra idea clave es que el historial de descubrimientos acumulado puede servir como un simulador de replay sobre el espacio de búsqueda realizado.

Más de este día

2026-09-16