DeepMind 新框架:在梦境中自我进化
Dream-RSI: Recursive Self-Improvement through Evolving Worlds
自主 AI 代理的递归自我改进正面临探索策略难以优化的瓶颈。DeepMind 团队提出的 Dream-RSI 框架,通过构建基于历史发现的重放模拟器,让 AI 在“梦境”中进行低成本的政策评估与优化。这种方法无需重复昂贵的在线评估,即可即时获取反馈并改进探索策略,随后将优化后的策略重新部署以驱动更多发现。在算法工程、数学优化及 GPU 内核工程等多个领域,Dream-RSI 不仅提升了发现质量,还显著降低了探索成本,为 AI 的自主进化开辟了新路径。
通过在由历史发现树构建的重放模拟器中进行梦境推演,Dream-RSI 能够获取即时且低成本的离线策略反馈,从而在无需调用重复且昂贵的在线评估的情况下评估并优化探索策略。