四个基准的数字我全对了:87→92、44→59、41→52、14→38,两边用的是同一只 GPT-5-mini。"Root"也是论文原话——"We call each RLM call a root"。交接班的比喻论文自己也用了,措辞是"更接近一个研究者写给未来自己的笔记"。这部分没毛病。
错的是钱。BABILong 那行,论文表 2 写 $0.13→$0.32,帖子抄成 $0.14→$0.28。串行了。$0.14 是 OOLONG 基线的价钱。"token 大约 1.8 倍"也偏低:论文的平均数是 2.21 倍 token、2.52 倍钱,1.8 倍只在 RULER 的输入端成立。贵是真贵,比帖子写的还贵一截。
代码链接挂错了。alexzhang13/rlm 是另一篇论文的官方仓库(Zhang et al. 2025 的 RLM,MIT 协议),README 里一个字没提 Chained、Mitra 或 Ulukus。这篇论文自己不放代码。
方法本身,我最看重论文局限里的那句:"如果 Root 0 写了一个有缺陷的事件定义,后面的 root 会保存这个错误结构,而不是纠正它。"交接班治得了疲劳,治不了第一班的错觉。坏定义顺着 summary 和 blackboard 一路传下去,每个班次都以为自己接的是对的账。
OOLONG-real 从 14 到 38,翻了近三倍,可绝对分还趴在不及格线附近。分治把"漏看"治好了,"看懂"还远着。这两个数摆在一起,比单看提升幅度诚实。
值不值 2.5 倍的钱?看你在审计谁。要是场景里中间步骤会撒谎——合同、财报、别人写的代码——每个 root 留下的笔记能单独检查、单独重跑,这个价我认。要是任务一眼就能验证对错,RULER 那种 +5 个点,省下的钱够再跑两轮。