Dream-RSI: Recursive Self-Improvement through Evolving Worlds 深度拆解

arXiv 2609.14858 · 2026-09-14 提交(v1) · cs.CL · 12 页正文 + 24 页附录 · 17 位作者 机构: Google / Google DeepMind / University of Maryland / University of Virginia GitHub…

arXiv 2609.14858 · 2026-09-14 提交(v1) · cs.CL · 12 页正文 + 24 页附录 · 17 位作者 机构: Google / Google DeepMind / University of Maryland / University of Virginia GitHub: zhengkid/Dream-RSI(313★,代码未发布) · 项目页: dream-rsi.com 研究日期: 2026-09-17(发布后第 3 天)


0. TL;DR

一句话:Google 把"发现历史"从静态上下文变成可回放的离线评估环境("重放模拟器"),让探索策略的改进从"昂贵的在线试错"变成"零执行成本的历史回放打分"——这是把 model-based RL 的 Dreamer 思想搬到 LLM 发现系统的元层,工程上聪明且实验有效,但"世界"只覆盖已实现的历史,策略改进被结构性限制在"旧地图上重新导航"。

核心判断三条:

1. 问题真实、方案对症。 "元层反馈延迟且昂贵"确实是长程发现系统的真瓶颈(评估一个探索策略要看几百次提案-评估周期的后果)。用已记录的发现树做确定性回放来离线评估候选策略,一次昂贵在线运行支撑上千次零成本离策略(off-policy)评估——这个杠杆是全文最坚实的一步。 2. 受控实验干净,但头尾都有水分。 与共享一切的 Recursive Fixed Exploration 基线相比(同 agent/评估器/初始化/预算,仅"策略是否随轮次改进"不同),增益可信:Lasso 任务省 1.7× 调用且质量更好,kernel 任务省 1.79–2.43× 世代或同预算性能高 1.44–2.09×。但与 SimpleTES 的"162×/两个数量级"对比存在系统差异混杂;数学三任务上,Auto Correlation 一项 Dream-RSI(1.456375)严格差于自己的固定策略基线(1.456001,该指标越低越好),Sum Diff 提升在小数点后第四位——论文用"competitive"带过。 3. RSI 定位:有界 L5 的又一个实例。 按 Theseus 综述(2609.11873,参见我 09-16 对账报告)的分级,Dream-RSI 改进的正是 L5 定义列举的四对象之一(search policy),但改进器本身(LLM 策略开发 agent + 回放 argmax 选择)固定不动,且"单调改进保证"只在固定历史的回放分数上成立——与 HGM 同属"有界 L5"。论文比 Theseus 综述晚 3 天提交,两者互不知晓;你的谱系里 Meta^n(Metan)被本文相关工作引用,Ornith/CoE/HGM/HarnessOpt/OpenRSI/NeoHorse 均缺席。


1. 论文要解决什么问题

背景:LLM 驱动的发现系统(AlphaEvolve 家族、FunSearch 后继)靠迭代发现循环运转——生成候选、评估、吸收反馈、再生成。随着目标变难,发现需要跨越数千次提案-评估周期的长程探索。决定烧掉的算力是否值得的,是探索的编排:开多少分支、每支精炼多深、怎么组并行批、失败分支救不救、何时停。

两难困境(论文 §1):

  • 固定策略(现有 Evolve 家族的默认做法):无法从积累的经验学习,反复把计算浪费在无效方向;
  • 在线优化策略(EvoX 等近期路线):评估一个探索策略要看它塑造后续整个发现过程的长程后果——反馈延迟且昂贵;且元策略空间巨大,试错本身就要烧在线预算。
论文的直觉很简洁:如果有一个快速廉价的"发现过程模拟器",就能在昂贵的在线部署前评估成百上千个候选策略。而这样的模拟器已经免费躺在手里——完成的历史本身。


2. 核心思想:发现历史 = 重放模拟器("世界")

2.1 类比与命名

导航类比(§2):第一次穿陌生环境走弯路、撞死胡同,但走过的路成了地图;此后任何新导航策略都可以在地图上规划而不必实地重访。对应 model-based RL / 世界模型脉络(Sutton 1990;Ha & Schmidhuber 2018;Dreamer 家族 Hafner 2019–2025):学一个环境动力学模型,在模型里"做梦"训练策略。

Dream-RSI 的"做梦"不是在学出来的参数化模型里,而是在真实记录的非参数树里——没有模型误差,但支持集受限(见 §6.1)。

2.2 发现树:把自由探索规约成"分支×尝试网格"

发现树根于初始工作区 r;每个非根节点 v 恰有一个主父节点,记录一次"生成-评估"尝试的完整结果:文件系统快照、生成产物、评估诊断、分数 s_v。

关键的共享决策接口(在线与离线用同一套):策略观察当前已揭示的树,从可选节点集 A(T) = {根} ∪ {叶} 中选一个批次 C(≤W 个并行 worker),批次同时决定"从哪继续"和"并行开几个"。

注意一个容易忽略的结构性约束:在线时每个节点按记录只有一个子节点延续(工作区线性精炼),所以整棵历史被规约为提示词里所说的 "frozen, irregular branch×attempt grid"(冻结的不规则分支×尝试网格)。策略的真实自由度只剩四件事:开哪些根、每支走多深、批怎么组、何时停。这是把"无限的策略空间"工程化为可回放、可比较的有限调度空间——聪明,但也限定了"改进"的天花板(见 §6.2)。

2.3 三阶段循环(Figure 1)

1. ❶ Online Explore:当前策略(可执行 Python 代码)驱动固定 discovery agent(Gemini CLI 跑 Gemini-3.1-Pro / 3.7-Flash)扩展发现树;固定评估器打分。rollout 至多 K₁ 轮决策,树 T_t 完成后追加进历史 H_t。 2. ❷ Construct Replay Simulator:每棵历史树变成一个回放"世界",入池。 3. ❸ Dreaming-based Policy Improvement:离线阶段构造并评估 M 个策略版本。每个版本在所有历史树上回放:从只含根的已揭示子树出发,策略选批 → 确定性返回已记录的子节点(不再生成新候选)→ 揭示的观察暴露给下一步。固定的 LLM 策略开发 agent 看回放轨迹与分数,修订策略代码产生下一版本。最终 π_{t+1} = argmax_m V^m,部署上线,回到 ❶。

唯一变化的是探索策略代码;底层模型、评估器、执行接口全固定。

2.4 回放目标函数

\[V_i^m = \underbrace{\max_{v} s_v}_{\text{发现质量}} - \underbrace{\beta_1 N_i^m}_{\text{执行成本}} + \underbrace{\beta_2 \frac{N_i^m}{\max\{1,k\}}}_{\text{并行度奖励}}\]

N 为揭示的非根节点数(轨迹隐含的生成-评估请求数),k 为决策轮数。第三项奖励"每轮平均并行执行的尝试数"——在线部署时并行 worker 不额外烧墙钟,所以回放目标显式偏好会组批的策略(串行策略罚≈1,满批≈1/W)。策略版本总分 = 历史平均回放分。

2.5 单调改进保证——及其边界

因候选集含当前策略,选择满足 V^{m*} ≥ V^0:所选策略在固定历史回放分上不劣于当前策略。这是全文唯一的"保证",要准确理解其边界:

  • 它保证的是回放分单调,不是在线表现单调;
  • 回放分与在线表现之间的泛化 gap(off-policy → on-policy)没有任何理论刻画,只靠实证(Fig 3b / Fig 4 / Fig 6 的在线曲线)背书。

2.6 防作弊设计:prefix-only 接口

策略在回放中只能用前缀可观察信息:可调 question.observed()(已揭示前缀)、legal_actions()probe_batch() 等 API;硬约束"不得使用未揭示分数、硬编码获胜节点 ID、绝对分数目标"。策略开发 agent 也不得把特定 trace 的分支/cell id/分数复制进策略逻辑(提示词软约束)。这套防护是提示词级别的,没有形式化验证器——防泄漏更多靠纪律而非机制(见 §6.4)。


3. 实验拆解与证据强度

3.1 任务与设置

任务模型轮次
算法工程Lasso 正则路径求解器(SimpleTES benchmark,17 训练实例 + 6 留出下游数据集)Gemini-3.1-Pro(10 并行×11 精炼=110 调用/轮)、Gemini-3.7-Flash(32×20=640/轮)5
数学优化Sum-Difference / Autocorrelation / Circle Packing(n=26,32)Gemini-3.1-Pro10
GPU kernelKernelBench:VGG16 / LayerNorm / ConvDiv / ConvMaxGemini-3.1-Pro递归多轮
受控基线 Recursive Fixed Exploration:同一 discovery agent、评估器、初始化、资源约束,仅策略跨轮不变。两法第一轮行为完全相同——之后的一切差异归因于"策略改进"本身。这是我见过的此类论文里最干净的因果设计

3.2 结果逐项评估

Lasso(主实验,可信度最高):

  • Gemini-3.1-Pro:Dream-RSI 用 317 次调用(基线 550)把留出集平均运行时从 3587.1 ms 降到 2931.0 ms——省 42% 调用同时更快;
  • Gemini-3.7-Flash:1879 vs 3200 调用,2516.7 → 2350.6 ms;
  • 两版发现的求解器在全部 6 个留出数据集上胜过 sklearn 和 glmnet;
  • 发现的求解器(Appendix C 全文给出,C++/Eigen 实现)有真实技术含量:strong-rule 筛选 + 自适应 Cauchy–Schwarz KKT 剪枝 + 不相交 active-set 簿记 + 惰性 Gram 矩阵 + 硬件感知优化——与 SimpleTES"按问题维度切换 LARS/坐标下降"不同的第三条路,在 RCV1 这类大规模矩阵上尤其强。
与 SimpleTES 的"162×"对比要打折:SimpleTES(GPT-OSS-120B,51,200 generations)是一次性运行,Dream-RSI 是递归多轮结构,系统架构、模型、评估协议都不同;表中 SimpleTES 与 SimpleTES† 两行数字差异巨大(avg 3804.8 vs 8318.4),† 行含义(复现?重测?)论文未在提取文本中说明。"两个数量级预算节省"作为方向性结论可接受,作为精确倍数则不严谨。

数学三任务(证据最弱):

  • Sum Diff(↑):1.145427,超 SimpleTES(1.143975)与 RFE(1.144047)——但提升幅度 0.0012,处于小数点后第四位,论文未报告方差/种子敏感性;
  • Circle Packing:2.635983,与最强报告结果持平(该指标已在多个系统间饱和);
  • Auto Correlation(↓):1.456375,不仅输给 SimpleTES(1.453675),还严格差于自己的固定策略基线 RFE(1.456001)。论文措辞是"remains competitive"。这一项实际上构成反例:回放分 argmax 选出的策略在线上更差了——正是 §2.5 所说泛化 gap 的实例,论文未讨论。
GPU kernel(可信):VGG16 / LayerNorm 同性能省 2.43× / 1.79× 世代;ConvDiv / ConvMax 同预算性能高 2.09× / 1.44×。

3.3 两个高价值的分析实验(§5)

1. 历史当模拟器 > 历史当语义指导(图 5):自然替代方案是把历史轨迹抽象成高层"方向性洞见"注入 prompt。结果:无论对固定策略还是 Dream-RSI,语义指导一致更差——强归纳偏置在长程发现中过度约束搜索空间。这个发现本身有独立价值:它说明历史的价值不在"总结出的道理"而在"可回放的细节"。 2. 策略学到的自适应行为(图 6,ConvDiv):9 轮中 round-best 性能 0.427 → 1.898(4.4×);策略先在性能上升期收缩算力(评估尝试数 110→50),平台期后重新加码(80–91),与性能再升同步。元层确实学到了非平凡的算力调度行为,而不是瞎调。

3.4 成本核算盲区

"317 次调用"只计 discovery-agent 调用。策略开发 agent 的 M 次修订 × 每版在 t 个世界上回放的 LLM 读记录成本、以及编排层自身的开销,全部没有报告。回放读记录应该便宜,但 M×t 的 LLM 上下文调用不免费。论文宣称的"发现成本大降"应理解为"在线发现预算大降,元层成本外部化"。这是此类元优化论文的通病(DGM、Meta-harness 同样如此),但值得点名。


4. 与 RSI 谱系的对账

4.1 本文引用的元层同类(相关工作一句话带过)

"Recent work has begun to optimize meta-level mechanisms (Kim et al. 2026; Liu et al. 2026a; Wang et al. 2026; Yan et al. 2026a; Zhang et al. 2026c)"——逐一对应:

引用系统与 Dream-RSI 的差异
Kim et al. 2608.24735Meta^n(=你的 Metan)递归涌现深度的自改进;Dream-RSI 单层元改进
Liu et al. 2602.23413EvoX同为"优化搜索策略本身",但 EvoX 在线评估策略;Dream-RSI 的差异化恰是离线回放评估。两者无 head-to-head 实验——最近的直接竞品缺席对比,是实验部分最大的缺口
Wang et al. 2607.05297MetaSkill-Evolve技能层双时间尺度进化
Yan et al. 2605.08039PACEvolve++长程进度感知进化
Zhang et al. 2603.19461Hyperagents(Theseus 认定的 L5 候选)通用超代理
另外引用了 DGM(Zhang & Clune, ICLR 2026)、Meta-harness(Lee et al. 2603.28052)、SkyDiscover、SwarmResearch 等。

4.2 你的谱系在本文的命运

谱系条目本文处理
Metan (Meta^n)被相关工作引用(元层机制优化五连引之一)
Hyperagents被引用(self-evolving agents 段)
Ornith / CoE / HGM / HarnessOpt / OpenRSI / NeoHorse全部缺席
与 Theseus 综述(09-16 对账)合并看:Dream-RSI 也不在 Theseus 的 L5 核心圈名单里(时间上不可能——综述 09-10 定稿,本文 09-14 提交)。两份 Google/学界文献互相不知道对方,说明 RSI 文献爆发速度已超过任何综述的覆盖能力。

4.3 按 Theseus 框架定位

  • 改进对象:search policy(探索编排策略代码)——恰是 Theseus L5 定义列举的四对象(improver / evaluator / search policy / research goals)之一;
  • 改进器:固定 LLM 策略开发 agent + 回放 argmax 选择——改进机制本身不在被改进范围内;
  • 继承:发现树历史(持续增长)+ 策略代码版本链;
  • 结论:有界 L5(bounded L5),与 HGM 的定位等级相当。且比 Theseus 的诊断更进一步暴露了两个 L5 通病:①argmax 继承在"回放分"上单调、在线上不保证(Auto Correlation 反例);②跨任务泛化未测——每个任务的策略独立改进,没有"学到的探索策略迁移到新任务"的实验。

4.4 学术脉络上真正该对齐而没对齐的:OPE

Dream-RSI 本质是把 off-policy evaluation(OPE) 引入 LLM 发现系统的元层:在已记录的决策-结果数据上评估替代策略。区别于 RL 里 importance-sampling / doubly-robust 那条线,这里是"真实记录的确定性回放"——无估计方差、无模型误差,但只能评估历史支持集内的策略。论文完全没引用 OPE 文献,类比只落在 Dreamer/世界模型上。这个定位缺口不是虚文:OPE 文献中的支持集坍缩(support collapse)、覆盖度度量(如集中系数)恰好是 §6.1 批评的形式化语言。


5. 实现细节里的黄金(附录 B 提示词)

附录 B 的两条提示词是全文工程含量最高的部分,值得单列:

1. 在线探索提示词(B.1):要求 agent"读全部历史而非抽样"、"区分坏想法 vs 好想法被 bug 拖累(后者定位到具体 bug 才许重试)"、"识别局部最优簇并强制结构异化"。这是一份发现系统 prompt 工程的范本。 2. 策略改进提示词(B.2) 暴露了"策略"的真实形态:

  • 核心是一个标量 beta 旋钮(单回合内固定,跨回合自适应):高 beta = 更宽、更有耐心、弱剪枝;低 beta = 少探、早停、强剪枝。跨回合默认 beta 有一条证据驱动的调整规则(性能升→保持;平台期且 sweep 显示高 beta 更优→+0.1~0.2;高 beta 试过无效→降;证据不足→0.6);
  • plan_grid(branch_count, refine_count) 在每轮在线探索前规划网格形状;
  • 失败分类学:硬性不可恢复 / 可修复实现失败 / 弱但欠探索 / 反复无望——"编译错误 ≠ 算法失败,一次可修复失败不得永久饿死该分支";
  • 批组合规则:动态组合 exploitation + exploration + 至多一个 recovery,禁止固定配额、禁止随机、禁止"只选最优的单点"。
所以"递归改进探索策略"落到实处,大部分是在学:beta 默认值、网格形状、排序与剪枝阈值、批组合逻辑。表达力受限,但可回放、可比较、可单调选择——这是设计上的取舍而非缺陷,理解这点才能正确预期该框架的能力边界。


6. 批判性评估

6.1 "世界"的支持集截断——根本性限制

回放对所选节点返回的是已记录的子节点;历史中没有的分支,回放返回 ∅,策略只能止步。因此 dreaming 只能评估"已实现搜索空间的重编排":换分支选择、换顺序、换并行组、换停止点。一个真正新颖的策略(想打开历史上从未存在过的方向)在回放中不可见其价值——它的增量恰好被支持集截断掉。

这与 Dreamer 的本质差异:Dreamer 的参数化世界模型可(带误差地)外推到未经历状态,Dream-RSI 的非参数世界零误差但零外推。推论:随着轮次推进,策略改进会越来越偏向"更好地开采旧地图",而"开辟新大陆"的价值系统性被低估——一种结构性的保守化偏差。论文的并行度奖励与"新根优先"提示词部分缓解,但机制上无解。长期看,当历史池足够大时这不是大问题(在线探索本身在扩池),但它框定了该框架改进的是 exploration efficiency(探索效率)而非 exploration horizon(探索疆域)

6.2 "Evolving Worlds" 名不符实的一点

标题里 evolving 的是 simulator pool(池随轮次增长),单个"世界"(历史树)是 frozen 的。而每棵树又被规约为线性精炼的分支网格(§2.2)。严格说这是"frozen grid worlds, growing pool"。营销名与机制之间的落差,读论文时需要祛魅。

6.3 回放目标 vs 在线目标的不一致

回放目标 V = max s_v − β₁N + β₂(N/k) 与在线评价(论文用的在线指标是留出性能、最终分数、累计调用数)并不相同。尤其 max 项:回放奖励"在历史树中找到最好节点",这可能奖励与历史分布契合的策略,而在线面对的是未采样的空间。Auto Correlation 的反例(§3.2)与此一致。β₁、β₂ 的取值论文未披露(未在正文/提取的附录中找到具体数值),复现无从校准。

6.4 防泄漏是纪律不是机制

prefix-only 约束写在提示词里,没有静态检查器验证策略代码没用私有信息(如"恰好总是选中历史赢家"的隐式过拟合)。策略开发 agent 读过回放轨迹与 beta_sweep 后写代码,过拟合路径是开着的。缓解证据是在线部署的持续改进(Fig 3b/4/6)——若纯过拟合,在线不该持续赢。但 Auto Correlation 反例提示这个风险不是零。

6.5 统计纪律

所有实验单次运行、无种子重复、无误差棒。Lasso 数学任务上的差异量级(第四位小数)在该纪律下无法与噪声区分。这在 2026 年的发现系统论文里是普遍水平(领域病),不单独扣 Dream-RSI 的分,但读者应当知道。

6.6 论文没做的四件事

① 与 EvoX 的 head-to-head(最近同类);② 策略跨任务迁移;③ 元层自身成本的完整核算;④ 任何安全/失控讨论(RSI 论文在 2026 年已无理由整体缺席安全章节;仅有的安全痕迹是提示词里"禁止 pkill/killall"的工程安全)。


7. 亮点清单(值得抄走的东西)

1. "历史当环境用,而非当上下文用" 的范式转换——对一切积累型 agent 系统可迁移;§5.1 进一步证明"历史 → 语义总结 → prompt"这条常见路线劣于"历史 → 回放环境",反直觉且重要。 2. 受控基线设计:Recursive Fixed Exploration 让"策略改进"成为唯一变量,第一轮全同。任何做递归改进实验的人都该学这个设计。 3. argmax 单调选择:候选集含当前策略,保证回放分不退——一行设计换来"永不更差"的下界,性价比极高。 4. 并行度进目标函数(β₂·N/k):把墙钟效率显式编码进离线评估目标,弥合离线评分与在线成本之间的缝隙。 5. beta 旋钮 + plan_grid:把不可控的"策略代码空间"压缩成几个可扫描、可解释、可跨轮调度的旋钮——LLM 改代码 + 网格扫描的混合元优化,工程上很稳。 6. 失败分类学(可修复 vs 算法性失败)写进策略规范——把 bandit 文献里的"乐观面对可修复失败"变成可执行接口。


8. 复现与开源状态

  • GitHub zhengkid/Dream-RSI:313★ / 15 fork / 4 commits,仅含论文 PDF、项目页链接、引用文件;Full codebase、Discovered programs、Reproduction scripts 全部标注 "Being prepared",无 LICENSE;
  • 附录 C 给出了发现的 Lasso 求解器完整 C++/Eigen 源码(唯一现在就可跑的产物);
  • β₁/β₂/M/K₂ 等关键超参未在提取文本中找到披露;
  • 结论:当前不可复现,可信度暂时全部押在论文数字与作者信用(Google/GDM 背景)上。代码若发布,值得复查 Auto Correlation 反例与回放-在线 gap。

9. 总评

维度评价
问题选择★★★★★ 元层反馈延迟/昂贵是真瓶颈,且此前无人用这个杠杆
核心思想★★★★☆ 历史→重放模拟器的转换简洁有力;但非参数回放的支持集截断是硬顶
实验设计★★★★☆ 受控基线极干净;缺 EvoX 对比、无种子重复
证据强度★★★☆☆ Lasso/kernel 可信;数学任务一项反例、一项第四位小数
工程披露★★★☆☆ 提示词全公开是加分项;超参缺失、代码未发布
RSI 意义★★★★☆ 有界 L5 的清晰实例;把 OPE 思想引入发现系统元层,预计会被后续工作大量借力
给你(RSI 谱系跟踪者)的三点行动含义:

1. Dream-RSI 与 Metan/Meta^n 已在同一引用簇,与 EvoX 是直接竞争关系但没打照面——下一个值得盯的是谁先做"replay-based 元改进 × 在线元进化"的合并; 2. 这些us 框架的"有界 L5"判定对 Dream-RSI 同样适用,且 Auto Correlation 反例给"回放分单调 ≠ 在线单调"提供了现成案例,可作为检验其他 argmax-继承系统的标尺; 3. 该框架的杠杆(历史→离线评估环境)与具体发现系统无关,AlphaProof-Nexus、果蝇项目、任何长程 agent 都可以嫁接——这也是 Google 把它做成"轻量编排层、底层 agent 不动"的原因:它志在成为所有 Evolve 家族的外挂元层,而非又一个 Evolve 变体。


附:快速事实卡

  • 提交:2026-09-14 00:10 UTC,v1,777KB;通讯 xidongwu@ / zzhangx@ google.com;一作 Tong Zheng(Google+UMD,亦为 Parallel-R1、LLMs-improving-LLMs 2605.08083 作者,Google agentic discovery 一脉)
  • 基座:discovery agent = Gemini CLI 跑 Gemini-3.1-Pro / Gemini-3.7-Flash;策略 = Python OptimalPolicy.solve() + plan_grid()
  • 8 任务:Lasso path、Sum-Diff、Autocorrelation、Circle Packing(26/32)、VGG16、LayerNorm、ConvDiv、ConvMax
  • 头条数字:Lasso 省 1.7× 调用(RFE 对照)/ 162×(SimpleTES 对照,含架构混杂);kernel 省 1.79–2.43× 世代或 +1.44–2.09× 性能;数学三任务两平一胜一负
  • 第三方覆盖:alphaXiv / HuggingFace papers / Moonlight(均为复述性,无独立批评评审);Turing Post "9 Paths Toward True RSI" 发表更早(09-13 前),未收录本文
👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens