这篇把「分诊」这个点子讲透了,是我这两天读到最舒服的一篇 agent 工程解读。但有两处被顺手讲顺了:一处是「六个错误里只有一个是技能缺陷」的读法,一处是两道闸门的成色。
一、技能图的账我替你数了一遍,你对上了
仓库里每个 benchmark 都放了两版 best_graph.json(初始 initial_skill 与终态 graphopt),我把 stable_rule_graph 的 nodes / edges 逐个 parse 出来:
| Benchmark | 初始图 | 终态图 | 增量 |
|---|---|---|---|
| SearchQA | 25 节点 / 3 边 | 30 / 8 | +5 / +5 |
| LiveMath | 21 / 23 | 37 / 40 | +16 / +17 |
| DocVQA | 11 / 10 | 20 / 19 | +9 / +9 |
但你没给初始值,而初始值才是这套方法值不值钱的关键:三个环境里图都接近翻倍,DocVQA 从 11 个节点长到 20(+82%),LiveMath 从 21 长到 37(+76%)。「改得准」和「改得多」的分界就在这条增量上——如果最终分数是靠一张两倍大的技能表换来的,那它和「让模型多想几轮」的区别就没那么大了。
二、「六个里只有一个」这种读法,论文自己划了线
你在残差审计那段说「六个错误里只有一个是真正的技能缺陷」。这句话读起来像频率统计,但论文附录 G.3 的原话是:这六例(每基准 2 例)是挑出来区分失败机制的,不是用来估计它们出现频次的("selected to separate failure mechanisms, not to estimate their frequency")。
也就是说,「六分之一」这个比例站不住——它是六个手挑的样本,不是六十个里的六个。你后面补的那句「需要同类错误反复出现才能确认是系统性技能缺陷」论文里也没有,是你的推论,方向我同意,但得跟原话分开摆。
顺便把六例补全:SearchQA 是「Noriega 判成错」(评分器)+「第一任国务卿检索缺序数证据」;LiveMath 是「相关定理当成等价定理」+「必要条件当成可实现性」;DocVQA 是「手写日期 7/18 读成 11/18」(你说的那个是第二个:签名栏对了、角色答错)。四例需要改的是检索、评分器、领域知识库和 OCR,不是技能图。
三、两道闸门,论文给的边界比你写的窄
你把 Local + Big Gate 讲成了通用的工程最佳实践。论文自己的两句话更小心:
- 「Big Gate 应当被理解为一条 epoch 级提交规则,它保证的是 update pool 上的净增益,而不是一个能普遍提升留出集精度的组件」。
- 具体数字:它对 gpt-5.6-sol 是 +1.5 / +4.6 / +1.2 pp;把它整个拿掉,gpt-5.4-mini 反而 +1.1 / +2.0 / +0.9 pp。
四、那个 ALFWorld 反例,比原文写得更狠,但也更站不住
表 9 的原始数据(50 步预算):无技能 94.8 ±0.4、初始技能 95.5 ±0.4、SkillOpt-markdown 89.6 ±1.1、SkillAA 92.5 ±3.4。
你说「初始技能最好」——对。但还有一句你没说:SkillAA 的 92.5 也低于「什么都不装」的 94.8。在这个环境里,装一套技能图不如不装。
不过我得替作者说句话:SkillAA 的半幅是 ±3.4pp,四行里最大,换算成区间大约 89.1~95.9——它把另外几个数全罩住了。所以准确的说法不是「SkillAA 更差」,而是「这个对照的样本量分不出胜负」。你在这一段的结论比数据跑得快了一点,这是我全文最想改的一处。
五、两条比数字更值钱的限定
1. 对比不是算力对齐的。 论文 4.3 自陈这些是"descriptive source-protocol comparisons","should not be interpreted as a compute-matched superiority claim";而且那张渐进式对比表"does not by itself isolate the contribution of each mechanism"。所以 81.5 / 66.7 / 91.2 只能当点估计看,这也是你自己用的词,很稳。 2. 只跑了 3 个随机种子(42 / 43 / 44),论文自陈的局限是三条:graph scale、task scope、few repeated runs。
还有一条你完全没提、但我觉得最实用的:教师不必是自己。 4.4 节的教师迁移测试里,换成更弱的 gpt-5.4-mini 当教师,对更强的 gpt-5.6-sol 学生仍然带来实质增益。也就是说你不需要再找一个更强的模型来给 agent 改流程——一条比论文主表更接地气的性质。
六、仓库实测
github.com/Ziqiao-Shang/SkillAA 确实存在:2026-09-17 创建、同日推送,0 star、0 fork、无 description、无 LICENSE(只有一个 219 字节的 NOTICE.md)。代码本体不薄:evolution/engine.py 151 KB、case_analyzer.py 104 KB、evaluation/edit_gate.py 18.9 KB,三个 benchmark 的初始图与终图 JSON 都在。
所以说「已开源」我同意,但严格讲,没有许可证的仓库在法律意义上还不算「可用的开源」。要拿它做工程选型,先跟作者要一句授权,比读十篇解读都省事。
判断
这篇的价值不在 81.5 / 66.7 / 91.2,而在于它把「不改」写成了一等公民输出。你文末那句「知道什么时候不改,比知道改什么更难也更重要」,我完全同意,而且这篇论文真正新的是它给「不改」配了一个可执行的判定条件——两个归因码 + 一道净增益闸门。在此之前,「不改」只是工程直觉。
钉子
第一根:那批被闸门拦下来的修改去哪了? DocVQA 的图从 11 个节点长到 20 个,这 9 个节点里有多少是「提了 — 被 Local Gate 否 — 改一版再来」的产物?论文没给这个重试率,而它直接决定这套流水线的 token 账单。
第二根:换第 4、第 5 个种子,92.5 会回弹吗? ±3.4 的半幅太宽了,多跑两个种子只要几十分钟,能把这篇文章里最有争议的那个数字钉死。
第三根短一点:论文说「未来系统应该交替改图与改模型」,但交替的切换点怎么定它没给。目前只有一条「后续修改连续被 Big Gate 否掉」的启发式——这更像是一个值得单独做实验的问题。
#Agent工程 #技能图谱 #回归测试