读了三遍。这是「评测盲区」家族里最干净的一例,干净到作者自己把它写进了摘要。
先沿着一手核
arXiv 2609.12742 存在,2026-09-11 提交,三作者:Mykhailo Kozyrev(TU Munich & JetBrains Research)、Andrei Kozyrev(JetBrains Research)、Anton Podkopaev(Constructor University Bremen & JetBrains Research)。
4.9pp 和 0.1pp 我逐字对上了摘要,一个数没走样。有意思的是摘要里那句原话——"at the dataset size a single repository supplies it cannot be separated from the agent's run-to-run variance"。把"没跑出显著"写进 abstract 的论文,不多。
4.9pp 还有个独立落点:论文自陈这个增益 matches what prior work reports with the same optimizer。换了数据集、换了仓库,用同一个优化器,复现出同一个量级。这种事出现,往往说明读数反映的是优化器的天花板,不是数据集的。
数字都对。但有几件事原帖没往下算。
我把配对分数换算成题数了
配对分数有个好用的性质:净胜题数 = 2n ×(分数 − 0.5)。n 是 held-out 规模,论文给的是 20–26,取 24:
| 仓库 | 优化器 | 配对分数 | 净胜题数 | 花费 | 每净胜一题 |
|---|---|---|---|---|---|
| koog | GEPA | 0.525 | 1.2 | $369 | $307 |
| kotest | GEPA | 0.554 | 2.6 | $182 | $70 |
| ktor | GEPA | 0.567 | 3.2 | $313 | $97 |
| koog | SkillOpt | 0.546 | 2.2 | $401 | $182 |
| kotest | SkillOpt | 0.519 | 0.9 | $264 | $289 |
| ktor | SkillOpt | 0.437 | −3.0 | $485 | — |
原帖那张表只有分数。换算完,同一张表读起来完全不一样。
顺带一个交叉验证:总花费 $2013.98,单次 rollout $0.84,除出来约 2400 次。三次优化 × 200 次评分配对(candidate + seed)= 1200 次 rollout,再算上任务生成和验证的调用,量级对得上。费用表是自洽的。
「赢五分之四」再精确一点
原帖说"candidate 需要在分歧任务里赢下五分之四"。方向对,但门槛不是固定的 80%,它随分歧任务数 d 滑动。我把精确符号检验跑了一遍,双侧 p<0.05:
- d=10 → 需要 90%
- d=16 → 需要 81%
- d=20 → 需要 75%
- d=26 → 需要 73%
两处得打个叉
一、SkillOpt 的问题出在稳定性,不在"没用"。
三个仓库:SkillOpt 拿到 0.546 / 0.519 / 0.437,跨度 11 个百分点;GEPA 是 0.525 / 0.554 / 0.567,跨度 4 个百分点。
平均成 0.1pp 之后,这个方差被抹平了。而"用一个标量概括一个分布",恰恰是原文正文里批评的那件事——原帖在复述这层洞察的时候,顺手把同样的毛病犯了一遍。
二、SWE-smith 的「4–7 行、98–100% 单文件」要看口径。
我翻了 SWE-smith 原论文(arXiv 2504.21798)Table 1。整表中位数确实是 5 行,原帖没说错。可拆开看:
| 策略 | 实例数 | 中位改动行数 |
|---|---|---|
| LM Modify | 17,887 | 3 |
| LM Rewrite | 4,173 | 24 |
| Procedural | 15,641 | 5 |
| PR Mirror | 2,344 | 14 |
| Combine files/modules | 10,092 | 11 |
我读出来一个不太好听的结论
论文最后落在一段挺动人的观察上:维护者认出了文档里"只有在这个项目工作过才知道"的知识,两个真实 issue 上时间和成本都减半。然后建议是——别只看通过率,把文档交给维护者看。
这句话要是当真,这条流水线的定位就变了。
它其实是一台给维护者省起草时间的草稿机。所谓"自动优化 SKILL 的优化器",撑不起这个名。原因很朴素:维护者的判断不能自动化,不能规模化,也不能复现。你没法用一个不可复现的评测器去驱动一个迭代循环。
再往前走一步。既然维护者的主观评价才是金标准,那真正该优化的是"维护者会打几分"。这一步没人做——拿不到标注。跟 RLHF 卡在同一个地方。
【小贴士】下次看到"某方法提升 X 个百分点",问三个问题:n 是多少?效应除以方差等于几?金标准是谁在打?
三个都答不上来,这个 X 就只是评测工具能看见的那个投影。不是价值本身。