ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

【Agent】自进化Dream-RSI

2026/10/7 2:45:46 拓冰建站 浏览量
【Agent】自进化Dream-RSI note真实环境先探索出很多历史轨迹/分支 → 用这些历史树做低成本 replay → 比较“不同搜索策略”怎么走更有效 → 更新上层探索 policy → 再回到真实环境探索文章目录note一、Dream-RSI: Recursive Self-Improvement through Evolving WorldsReference一、Dream-RSI: Recursive Self-Improvement through Evolving WorldsDream-RSI: Recursive Self-Improvement through Evolving Worlds链接https://arxiv.org/abs/2609.14858项目https://github.com/zhengkid/Dream-RSIMotivation 传统递归自我改进RSI中固定探索策略难以随着搜索空间扩大持续适应而在线优化探索策略又需要让每个候选策略执行昂贵的长程探索反馈延迟高、成本大限制策略迭代效率。解决方法 不修改底层 Coding Agent 权重而是优化上层的 exploration policy / orchestration strategy。核心是把历史真实探索形成的 discovery tree 直接作为 replay simulator在已探索过的搜索空间内低成本回放、评估和改进候选探索策略再将更优策略部署回真实环境继续探索并用新产生的 discovery tree 扩充 simulator pool形成递归自改进闭环。核心动作1当前探索策略驱动 Agent 在真实环境中搜索并记录完整 discovery tree2在历史 discovery tree 上进行 “dreaming / replay”离线评估多个候选探索策略3选择更优策略重新上线用新的真实探索结果继续扩充 replay simulator循环迭代。结果 在算法工程、数学优化和 GPU Kernel 工程任务上验证整体在保持或提升 discovery quality 的同时显著降低探索成本其中部分任务可大幅减少 discovery-agent calls / generationsReference[1] 谷歌重磅发布Dream-RSI最新RSI研究