你这篇我核了两遍。先给你结论:你的算术全对,有一句话的口径要收窄,另有两条可以补。
你的算术我复算了,成立
六 backbone 的 Trajectory-Wise 增益(百分点):
- GPT-5.5 +26.7
- GPT-5.6-sol +25.0
- DeepSeek-V4-Flash +22.0
- Claude-Opus-4.8 +19.3
- Claude-Sonnet-5 +8.8
- Qwen3.5-Flash +4.8
去掉后两个,剩下四个平均 = 19.95,你说的 20.0,也对上了。
DDR-Bench 那个 69.5 → 89.5:四 backbone 的 Traj-Wise 基线均值(64.2 / 68.5 / 72.5 / 73.0)÷ 4 = 69.55;进化后(90.9 / 93.5 / 81.3 / 92.3)÷ 4 = 89.5。两个数分毫不差。
这一步做得漂亮。
但「恰好去掉了最弱的两个」只在一种口径下成立
你说的是基线绝对值:DeepSeek-V4-Flash 基线 30.3,Qwen3.5-Flash 基线 14.3,确实是最弱的两个。这句没错。
可如果换成增益口径,画面就变了:DeepSeek-V4-Flash 的 +22.0 在六个里排第三,高于被保留下来的 Claude-Opus-4.8(+19.3)和 Claude-Sonnet-5(+8.8)。
也就是说:被剔出去的那两个里,有一个的增益比留下来的两个还高。
这不改变你的结论——17.8 → 20.0 这个跳跃是真的,论文一个字没解释也是真的。但它把问题的性质改了:这不是「剔弱模型虚增」,更像「换了分析子集的构成,而构成变化的理由没写」。前者听着像操作,后者听着像漏记。我倾向后者。
静态语义层那一栏,还有一条你漏了
你说「大面积掉分,Claude-Sonnet-5 上掉了 15 分」,对(Traj-Wise −15.0,Overall −11.9)。
但六 backbone 摊开是这样的:
- GPT-5.5 −1.2
- GPT-5.6-sol −2.3
- Claude-Sonnet-5 −11.9
- Claude-Opus-4.8 −4.9
- DeepSeek-V4-Flash +2.0
- Qwen3.5-Flash −1.3
所以「说明书怼脸有害」只对强 backbone 成立。这反倒加固了你引的那句解释——说明书跟现场任务抢注意力。弱模型本来就没多少上下文管理能力可抢,抢了也不疼。(这一句是推论,不是论文说的。)
BIRD 那个数,市面上至少三个版本
- +8.8:仓库 README,ReAct 63.6 → 进化后 72.4(总分)
- +3.7:你用的口径,初始图 68.7 → 进化后 72.4(只有进化那一段)
- +7.4:第三方转述里流通的另一个数
门控那条,我照着你的路子自己看了一遍
公式 (2) 要求新图好过旧图、且好过门槛 τ;代码里只留了 candidate_avg > parent_avg,τ 不在。我看到的和你一致。
这一条是全篇最硬的一击。理由你说得对:单次比较给不出「可复现」,聪明模型赌一次赢半分,跟抛硬币多出一次正面没有本质区别。
补一条你提了但可以更狠的:README 特性表写着「a reproducible improvement」。门控代码和 README 的这句话,是互相否定的。
该给的好评
零第三方依赖、SQL 只读、不伪造观察、不偷看 benchmark 题目、写入原子化、被拒候选和已知局限写进构建元数据。工具层编辑贡献 57% 累积增益——这条我在仓库侧也对上了,而且它和你那句「值钱的是翻图的动作」严丝合缝:
- 只进化 Tool 层:+13.2
- 只进化 Content 层:+8.7
- 只进化 Schema 层:+3.6
一句话收口
挑着改,好过勤快地改——前提是「好」得有个门槛。
τ 在论文里是个希腊字母,在代码里是个不存在的名字。补上它是一行代码的事。补之前,这张图长出来的每一寸,都要别人替它重新验证一遍。