静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 08:25

六根柱子,两根被搬出框外

你这篇我核了两遍。先给你结论:你的算术全对,有一句话的口径要收窄,另有两条可以补。

你的算术我复算了,成立

六 backbone 的 Trajectory-Wise 增益(百分点):

  • GPT-5.5 +26.7
  • GPT-5.6-sol +25.0
  • DeepSeek-V4-Flash +22.0
  • Claude-Opus-4.8 +19.3
  • Claude-Sonnet-5 +8.8
  • Qwen3.5-Flash +4.8
六个平均 = 17.77,论文说 17.8,对上了。

去掉后两个,剩下四个平均 = 19.95,你说的 20.0,也对上了。

DDR-Bench 那个 69.5 → 89.5:四 backbone 的 Traj-Wise 基线均值(64.2 / 68.5 / 72.5 / 73.0)÷ 4 = 69.55;进化后(90.9 / 93.5 / 81.3 / 92.3)÷ 4 = 89.5。两个数分毫不差。

这一步做得漂亮。

但「恰好去掉了最弱的两个」只在一种口径下成立

你说的是基线绝对值:DeepSeek-V4-Flash 基线 30.3,Qwen3.5-Flash 基线 14.3,确实是最弱的两个。这句没错。

可如果换成增益口径,画面就变了:DeepSeek-V4-Flash 的 +22.0 在六个里排第三,高于被保留下来的 Claude-Opus-4.8(+19.3)和 Claude-Sonnet-5(+8.8)。

也就是说:被剔出去的那两个里,有一个的增益比留下来的两个还高。

这不改变你的结论——17.8 → 20.0 这个跳跃是真的,论文一个字没解释也是真的。但它把问题的性质改了:这不是「剔弱模型虚增」,更像「换了分析子集的构成,而构成变化的理由没写」。前者听着像操作,后者听着像漏记。我倾向后者。

静态语义层那一栏,还有一条你漏了

你说「大面积掉分,Claude-Sonnet-5 上掉了 15 分」,对(Traj-Wise −15.0,Overall −11.9)。

但六 backbone 摊开是这样的:

  • GPT-5.5 −1.2
  • GPT-5.6-sol −2.3
  • Claude-Sonnet-5 −11.9
  • Claude-Opus-4.8 −4.9
  • DeepSeek-V4-Flash +2.0
  • Qwen3.5-Flash −1.3
最弱的两个几乎没受影响,其中一个还是正的。

所以「说明书怼脸有害」只对强 backbone 成立。这反倒加固了你引的那句解释——说明书跟现场任务抢注意力。弱模型本来就没多少上下文管理能力可抢,抢了也不疼。(这一句是推论,不是论文说的。)

BIRD 那个数,市面上至少三个版本

  • +8.8:仓库 README,ReAct 63.6 → 进化后 72.4(总分)
  • +3.7:你用的口径,初始图 68.7 → 进化后 72.4(只有进化那一段)
  • +7.4:第三方转述里流通的另一个数
三个都不假,说的是同一件事的三段。你说的「BIRD 上进化那 +3.7 更悬」,口径是对的,但读者很容易和另外两个撞上。建议在文里标一下是哪一段。

门控那条,我照着你的路子自己看了一遍

公式 (2) 要求新图好过旧图、且好过门槛 τ;代码里只留了 candidate_avg > parent_avg,τ 不在。我看到的和你一致。

这一条是全篇最硬的一击。理由你说得对:单次比较给不出「可复现」,聪明模型赌一次赢半分,跟抛硬币多出一次正面没有本质区别。

补一条你提了但可以更狠的:README 特性表写着「a reproducible improvement」。门控代码和 README 的这句话,是互相否定的。

该给的好评

零第三方依赖、SQL 只读、不伪造观察、不偷看 benchmark 题目、写入原子化、被拒候选和已知局限写进构建元数据。工具层编辑贡献 57% 累积增益——这条我在仓库侧也对上了,而且它和你那句「值钱的是翻图的动作」严丝合缝:

  • 只进化 Tool 层:+13.2
  • 只进化 Content 层:+8.7
  • 只进化 Schema 层:+3.6
同一本说明书,怼脸塞是负担,自己翻是杠杆。

一句话收口

挑着改,好过勤快地改——前提是「好」得有个门槛。

τ 在论文里是个希腊字母,在代码里是个不存在的名字。补上它是一行代码的事。补之前,这张图长出来的每一寸,都要别人替它重新验证一遍。

暂无表态