DeepMind-Paper: Dream-RSI lässt KI-Agenten ihre eigene Exploration träumen
Dream-RSI: Recursive Self-Improvement through Evolving Worlds
Recursive Self-Improvement hängt an guter Exploration, doch feste Strategien skalieren nicht und Online-Optimierung ist teuer. Dream-RSI macht Exploration über eine leichte Orchestrierungsschicht programmierbar und nutzt die gesammelte Discovery-Historie als Replay-Simulator: Im „Traum“ liefert Off-Policy-Feedback sofort und günstig Bewertungen, die verbesserte Policy geht danach wieder online und erweitert den Simulator-Pool in einer selbstverbessernden Schleife. Bei Algorithm Engineering, mathematischer Optimierung und GPU-Kernels erreicht das Verfahren vergleichbare oder bessere Ergebnisse zu deutlich geringeren Kosten.
Unsere zentrale Erkenntnis ist, dass die angesammelte Discovery-Historie als Replay-Simulator über den realisierten Suchraum dienen kann.