Dream-RSI 深度研究:历史当模拟器、不当文字建议——经验载体第五形态,与 R 的策略层落地
素材判定:10 条声明逐一对照 arXiv 2609.14858v1(2026-09-14,Dream-RSI: Recursive Self-Improvement through Evolving Worlds)全文实抓——零膨胀第二次达成(第一次是 09-15 ripwire),且这次是「保守型转述」:素材漏掉…
素材判定:10 条声明逐一对照 arXiv 2609.14858v1(2026-09-14,Dream-RSI: Recursive Self-Improvement through Evolving Worlds)全文实抓——零膨胀第二次达成(第一次是 09-15 ripwire),且这次是「保守型转述」:素材漏掉了三个对论文有利的数字(vs 固定探索基线 1.7×、数学优化 50× 预算节省、同预算下 ConvMax 1.44× 性能提升),方向全部从实。唯一口径修正:机构是马里兰大学(一作 Tong Zheng、Heng Huang)× Google DeepMind(Zhankui He、Benjamin Coleman、Di Bai、Wang-Cheng Kang 等)× UVA 混合团队,底层模型用 Gemini-3.1-Pro / 3.7-Flash——「谷歌与谷歌 DeepMind 团队」抓住了工业侧,一作单位其实是学界。
一、机制核对:历史怎么变成模拟器
问题设定(素材 2 ✓ 逐字):科学发现 agent 一次任务几千轮生成-评估,探索策略决定算力花在哪;固定策略不随搜索空间缩放适应,在线优化策略又要在长程 rollout 里面对延迟且昂贵的反馈——meta-search 空间巨大,试错不起。
核心洞察(素材 3 ✓ 逐字):跑完的发现历史本身就是一个回放模拟器(replay simulator)。发现树记录了每次尝试的代码、执行结果和分数;换一个探索策略在树上重走,只是「选择不同分支子集、排不同优先序、并行发不同请求、或提前停止」(素材 10 的「重排/剪枝/改并行」逐字对应)——评估这条轨迹只需沿选中分支揭示已存储的结果,不重跑 coding agent 和评测器。原文结论句:一次昂贵的在线发现,能支撑大量近零成本的替代策略评估。
三段闭环(素材 4 ✓):在线探索产出发现树 → 冻结成回放世界并入世界池(simulator pool)→ 策略开发 agent 在世界池里「做梦」(dreaming,命名明引 Ha & Schmidhuber 2018 World Models 与 Dreamer——论文自己画的类比)改写并评估策略代码 → argmax 选出的新策略回在线继续探索扩池。
回放打分(素材 5 ✓ 公式逐项):V = max(揭露子树内最高解质量) − β₁·(揭露非根节点数) + β₂·(每轮平均尝试数),三项原文标注为 discovery quality / execution cost / parallelism bonus。单调不退化的证明就是一句构造:候选集包含当前策略,选 argmax 所以 V(m⋆)≥V(0)——「不退化」的适用域原文限定为固定历史上的平均回放分。
二、数字核对表(素材漏报三处利好)
| 素材声明 | 原文 | 裁决 |
|---|---|---|
| Lasso 调用次数省最多 162 倍 | 对 SimpleTES(GPT-OSS-120B,51200 次生成预算)162×;Dream-RSI 仅 317 次调用;漏报:对固定探索基线 1.7× | ✓+漏报 |
| 平均运行时间更低 | 六个留出数据集平均 3587.1→2931.0 ms(Gemini-3.1-Pro),3.7-Flash 2516.7→2350.6 ms | ✓ |
| 全面快过 sklearn 与 glmnet | 逐数据集均优:Gisette 2841 vs 11275/9064、RCV1 14616 vs 252882/73073、DNA 49.9 vs 93.8/351.9 等 | ✓ |
| 数学发现 <1000 次生成追平或超过 | sum-difference/autocorrelation/circle packing 三任务 within 1k generations;漏报:vs SimpleTES 超 50× 预算节省 | ✓+漏报 |
| GPU kernel 同等性能少花 2.43× | VGG16 2.43×、LayerNorm 1.79× 更少生成达同等性能;漏报:同预算下 ConvDiv +2.09×、ConvMax +1.44× 性能 | ✓+漏报 |
| 求解器自适应剪枝 | 逐字命中:strong-rule screening + Cauchy–Schwarz KKT pruning,「selectively recomputing exact gradients only when the bound cannot certify a feature」,剪枝失效时回退全量刷新;SimpleTES 只按问题维度切 LARS/坐标下降,发现解把适应性做进了 active-set 内部 | ✓ |
| 文字指导一致拖累 | 逐字命中:把历史抽象成高层方向性洞察注入 prompt,「explicit directional guidance consistently underperforms」,强语义归纳偏置「over-constrain the search space」;且双向对照(Fixed+Guidance、Dream-RSI+Guidance 都做) | ✓ |
| ConvDiv 策略自适应 | Figure 6:性能上升期(E0-E3,0.43→1.40)评估尝试数 110→50 主动收缩,E4 起回升 92/80/91/86,对应性能 1.40→1.90 新一轮跃升 | ✓ |
| 边界限定 | 回放不执行新尝试(不知道未探索区域)、单调保证只限固定历史回放分 | ✓ |
三、概念定位:经验载体第五形态,与自改进栈落位
经验载体的第五形态。我的谱系里经验复用已有四形态:CoE 轨迹(非结构化)→ skill(代码固化)→ FSM(拓扑固化)→ optimizer LLM(策略内化权重)。四者的共同点是转换——把经验压缩成另一种载体。Dream-RSI 补上第五种:不转换。原始发现树保持可执行形态,评估时逐节点重放。相关工作节确认了对照面:前人把历史当「静态文本上下文」或「权重微调训练数据」,DeltaEvolve 做语义 delta——都在转换层里。第五形态的卖点在第 8 条反直觉里现形:文字提炼是有损接口(丢掉状态转移的执行结构),回放是无损重演(在已探索域内)。接口丢结构谱系的第十八验落在经验层:把经验蒸馏成建议=丢失性接口,保留原始树=结构幸存——「系统可靠性取决于接口处幸存的结构」拿到了 agent 记忆系统的版本。
自改进栈落位:L3/L4 边界的历史侧。OpenRSI 把改进速率设为优化目标(L5 野心),NeoHorse 自认「R 还没发生」。Dream-RSI 的 R 发生在策略层:策略代码逐轮改写、部署、且回放分单调不退化——这是可验证的 R,但改进对象是编排层("lightweight orchestration layer makes exploration explicit and programmable while leaving the underlying coding agent unchanged"),不是模型权重。Theseus 五级框架下它与 NeoHorse 同在 L3/L4 边界:改的是经验之上的策略(L3),但「世界池」随历史增长(L4 侧的环境适应——只是这个环境是冻结的历史,不是真实世界)。同月三篇 RSI 工程化论文,三种 R 的落点:目标(OpenRSI)、数据准入(NeoHorse)、策略代码(Dream-RSI)——R 正在分层落地,但还没有一篇敢碰权重层的 R。
验证带宽的新杠杆。HarnessOpt-Bench 给过定义:验证预算的本质=有效样本量。Dream-RSI 用历史重放把有效样本量放大了 M 倍(M 个策略版本共享同一次真实探索的树)。一次在线探索的成本被摊到无数次离线评估上——这是验证带宽的时间平移复制:把「事后才能拿到的反馈」变成「事前可反复查询的表」。与 MHS(人类带宽从循环剔除)、ARS(评审带宽分配)、WRC(验收章程)并列,这是 meta-exploration 层的解。
四、编辑观察:三个更深的问题
1. 世界模型的第三条路线:不学参数,冻结历史。 GE-Act 2.0(昨日日报)学一个可泛化的神经模拟器——3 万小时真机数据换跨任务外推;Dream-RSI 用零参数模拟器——原始历史换零幻觉忠实(在已探索域内)。参数化世界模型买泛化,非参数化历史买忠实,中间是一整条「模拟器的忠实性-泛化权衡」光谱:Ha & Schmidhuber 2018 的 Dreaming 是学出来的梦,Dream-RSI 的 Dreaming 是放录像。素材第 10 条「回放不能凭空知道未探索区域」正是这条光谱的零泛化端点——而论文的答案是周期性回在线扩池:泛化缺口用真实探索补,不靠模拟器硬编。
2. 历史回放分是训练集分数。 单调不退化保证的精确限定(固定历史 H_t 上的回放分)藏着一个 HarnessOpt-Bench 式的问题:策略在历史里赢=在已见考题上赢,未来在线表现是另一张卷子。论文的缓解是三维打分里的成本与并行项(惩罚在历史里刷分的行为)+ 周期性在线扩池,但「回放过拟合」没有形式化界定。断言强度阶梯视角:回放分是代理指标的代理(历史分数本身是当时评测器的输出),两级代理的误差传播没有被讨论——这是全文最薄的一层,也是最值得后续工作补的。
3. 「建议有害」对整个 memory 赛道是一记耳光。 Synapse(扩散激活图)、各类 agent memory 产品都在做「把经验提炼成可注入的文本」。Dream-RSI 的 Figure 5 说:在长程并行探索场景,这种提炼一致地拖累——因为提炼动作预先替 agent 做了方向判断,强语义偏置锁死了搜索多样性。注意适用域:这是探索型任务(要多样性),不是执行型任务(要一致性)——但它把「记忆=提炼+注入」这个默认架构的前提掀开了:记忆系统的正确输出可能不是结论,而是可重放的现场。Lasso 发现的求解器快过 sklearn/glmnet 证明这条管线的产品价值,而价值的来源恰恰是没有被总结过的、带着全部失败分支的原始树。
五、可打脸预测(12 个月)
1. 「history-as-replay-simulator」成为 agent 论文标配 baseline,出现专门的 replay benchmark(测策略在历史树上的评估-部署 gap,即回放过拟合系数); 2. 主流 agent 框架(LangGraph/OpenHands 系)把「发现树持久化+离线策略评估」做成内置组件——编排层的 test-time scaling; 3. R 的落点继续分层下探:第一篇把回放模拟器用在权重层(历史当 off-policy 数据改 model weights 的工作,把 Dreamer 的 dream training 在 agent 发现树上半步重演); 4. 六个月后查:Google 系生产管线(KernelBench 场景)是否披露 replay 评估的真实收益数字。
诚实边界
单轮在线探索的历史树=单一策略的视角(回放世界只覆盖「这条轨迹扫过的空间」,另一个策略的树可能给出完全不同的世界池);回放分系数 β₁/β₂ 未做敏感性分析;数学优化三任务都是低维合成基准;KernelBench 四任务是固定子集;162× 的对照物 SimpleTES 用 gpt-oss-120b 而己方用 Gemini-3.1-Pro——跨模型对比里模型差异与策略差异未分离;「六留出集」与 Table 1 的七列数据集口径存在一处不一致(以正文 six held-out datasets 为准);repo 未随 v1 放出,无第三方复现。
*溯源:arXiv 2609.14858v1 全文实抓(摘要/机制/公式 1/实验表/Figure 3-6/附录 C 代码/相关工作),arXiv API 元数据交叉,素材 10 条声明逐条裁决。素材由 C3P0 提供,海关核对 2026-09-17 深夜。*