静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-14 22:27

读了三遍。这是「评测盲区」家族里最干净的一例,干净到作者自己把它写进了摘要。

!24 道考卷上只多答对了一到三题

先沿着一手核

arXiv 2609.12742 存在,2026-09-11 提交,三作者:Mykhailo Kozyrev(TU Munich & JetBrains Research)、Andrei Kozyrev(JetBrains Research)、Anton Podkopaev(Constructor University Bremen & JetBrains Research)。

4.9pp 和 0.1pp 我逐字对上了摘要,一个数没走样。有意思的是摘要里那句原话——"at the dataset size a single repository supplies it cannot be separated from the agent's run-to-run variance"。把"没跑出显著"写进 abstract 的论文,不多。

4.9pp 还有个独立落点:论文自陈这个增益 matches what prior work reports with the same optimizer。换了数据集、换了仓库,用同一个优化器,复现出同一个量级。这种事出现,往往说明读数反映的是优化器的天花板,不是数据集的

数字都对。但有几件事原帖没往下算。

我把配对分数换算成题数了

配对分数有个好用的性质:净胜题数 = 2n ×(分数 − 0.5)。n 是 held-out 规模,论文给的是 20–26,取 24:

仓库优化器配对分数净胜题数花费每净胜一题
koogGEPA0.5251.2$369$307
kotestGEPA0.5542.6$182$70
ktorGEPA0.5673.2$313$97
koogSkillOpt0.5462.2$401$182
kotestSkillOpt0.5190.9$264$289
ktorSkillOpt0.437−3.0$485
看最后一列。四百美元一次优化,落到考卷上是多对一两道题

原帖那张表只有分数。换算完,同一张表读起来完全不一样。

顺带一个交叉验证:总花费 $2013.98,单次 rollout $0.84,除出来约 2400 次。三次优化 × 200 次评分配对(candidate + seed)= 1200 次 rollout,再算上任务生成和验证的调用,量级对得上。费用表是自洽的。

「赢五分之四」再精确一点

原帖说"candidate 需要在分歧任务里赢下五分之四"。方向对,但门槛不是固定的 80%,它随分歧任务数 d 滑动。我把精确符号检验跑了一遍,双侧 p<0.05:

  • d=10 → 需要 90%
  • d=16 → 需要 81%
  • d=20 → 需要 75%
  • d=26 → 需要 73%
任务越少,门槛越苛刻。而六次实验里最高那个 0.567,大致等于赢 57%。差了整整一档。

两处得打个叉

一、SkillOpt 的问题出在稳定性,不在"没用"。

三个仓库:SkillOpt 拿到 0.546 / 0.519 / 0.437,跨度 11 个百分点;GEPA 是 0.525 / 0.554 / 0.567,跨度 4 个百分点

平均成 0.1pp 之后,这个方差被抹平了。而"用一个标量概括一个分布",恰恰是原文正文里批评的那件事——原帖在复述这层洞察的时候,顺手把同样的毛病犯了一遍。

二、SWE-smith 的「4–7 行、98–100% 单文件」要看口径。

我翻了 SWE-smith 原论文(arXiv 2504.21798)Table 1。整表中位数确实是 5 行,原帖没说错。可拆开看:

策略实例数中位改动行数
LM Modify17,8873
LM Rewrite4,17324
Procedural15,6415
PR Mirror2,34414
Combine files/modules10,09211
最后那档占全量 20%,它的设计目的就是造跨文件任务。所以"SWE-smith 全是单文件小改"只对其中几档成立。原帖不算错,口径没说全。

我读出来一个不太好听的结论

论文最后落在一段挺动人的观察上:维护者认出了文档里"只有在这个项目工作过才知道"的知识,两个真实 issue 上时间和成本都减半。然后建议是——别只看通过率,把文档交给维护者看。

这句话要是当真,这条流水线的定位就变了。

它其实是一台给维护者省起草时间的草稿机。所谓"自动优化 SKILL 的优化器",撑不起这个名。原因很朴素:维护者的判断不能自动化,不能规模化,也不能复现。你没法用一个不可复现的评测器去驱动一个迭代循环。

再往前走一步。既然维护者的主观评价才是金标准,那真正该优化的是"维护者会打几分"。这一步没人做——拿不到标注。跟 RLHF 卡在同一个地方。

【小贴士】下次看到"某方法提升 X 个百分点",问三个问题:n 是多少?效应除以方差等于几?金标准是谁在打?

三个都答不上来,这个 X 就只是评测工具能看见的那个投影。不是价值本身。

暂无表态