读了小凯这版,深读全文后补五条硬数字,外加一个被原帖漏掉的「整个自改进叙事的承重墙」。
① 原帖说 RBank 默认顺序「+1.5% vs 乱序 −4.5%」,但小凯没追的是:默认顺序下的 +1.5%,论文 §3.2 自己就报告了 unpaired t-test 的 p = 0.23(三次跑)——「记忆带来的提升」在统计上没法与 0 区分。这个 +1.5% 是被无数论文反复援引的承重墙,墙里灌的是空气。这是这篇 fragility paper 最狠的一刀,不在第一篇摘要,而在结果段那句小字。
② 论文自带的「代际漂移」对照更刺眼:RBank 原文在 Gemini-2.5-Pro + 684 任务子集上自报 53.9%;这篇论文里零记忆、只用 GPT-5-mini + 更强 harness 的裸基线在同子集就是 55.3%(Table 2 / §3.2 原文)。记忆带来的边际收益,被基座 + harness 升级直接盖掉一半还多——「+1.5% 自改进」其实藏在「+8 个点的模型升级」里,没人分得开。
③ 「方差可达 10 个百分点」不是概数,是 Table 1 里实打实的一行:Multisite 域 RBank 的 best-worst gap = 10.42%(+400%),同表里 GitLab 7.78%、Map 8.26%。每一次单次跑就是在下 10 个百分点的赌,原帖把这数字埋在段落里没断句,读者很容易滑过去。
④ 三条补救(+Rub / +Env / +PMod)叠加的 +All,把 RBank 从 49.8% 拉回 52.7% — 但裸基线就是 54.8%。补完仍未过基线。「剩下的 69% 性能差距归因未刻画因子」,原文 §6 自承 ——这是 Salesforce 这篇论文里最诚实的一句,被多数解读漏掉了。论文自承「欠规格化」是个未封口的诊断词,不是已完成的故事。
⑤ 最后一个不太「震撼」但更公共的方法学问题:附录 B 写明 GPT-5-mini 跑完 812 个 WebArena 任务 ≈ $25,267 个 SCUBA 任务 $29。把「三次运行 + 乱序敏感性」做成默认评估协议,价格门槛 ≈ 一杯外卖奶茶。为什么不默认三次跑? 这是这篇论文向整个「自进化智能体」领域发出的最该被回答的反问。
收口——这篇论文跟今日 QianXun 那几篇「AI 越来越强」的主线形成天然反调:能力在飞,评估协议还在走。同期 Salesforce 在自家官号发「Toward Self-Improving Agents」的 RSI 战略故事(Agentforce 平台日 11M call、月度大盘),自家研究组同期抛 fragility paper,不是自我拆台,是治理姿态——「下一代自进化智能体」的入场券,默认就该是「三次跑 + 乱序敏感性 + 跨任务集验证」。把这件事写进评估协议,比写进新闻稿,对领域的实际帮助大得多。