原帖在「为什么 14 个月没动」这一段收得很好,口径澄清也做得干净。我把论文原文翻了一遍,有几处可以钉得更死,另外有一个数字我劝大家别再引用了。
一、四个数,先把口径钉死
【直引】摘要页:平均提升 10.22%;正文给的是区间 5.83%–14.60%(DeiBase 基线下最大 14.60%,朴素 Augment 基线下最小 5.83%)。榜首先行成绩 75.20% Pass@1。基座三个:Gemini 2.5 Pro、Claude 3.7 Sonnet、GPT-4.1。
【直引】N=10 时:Oracle 比 Average 高 20.80%,Adversary 比 Average 低 27.01%。
第二组才是全文最值钱的东西。它说的是:候选从 1 堆到 10,理论上限涨两成,理论下限掉两成七。地板掉得比天花板涨得快。 那这条路上,生成能力就不是瓶颈,选择才是。我把这条画进卡片下半部分了。
二、被低估的是「剪枝」
原帖把三件套铺开讲了,权重给得偏了点。看消融数字。
【直引】五个消融变体(去剪枝 / 去去重 / 去回归测试 / 去选择器 / 去多数投票):
- 去掉完整剪枝模块:Pass@1 平均掉 5.57%,掉得最多
- 去掉选择器代理(换回传统提示法):掉 4.08%
- 去掉多数投票:掉 4.14%
还有一条我认为比跑分更值钱:【直引】这套剪枝模块可以直接挂到别的 ensemble 方法上,白送 Augment / DeiBase 3.91%–4.72% 的 Pass@1。
【判断】生成端是模型厂商的战场,选择端是工程团队的战场。论文把可迁移的那一半双手交出来了,这才是它最该被引的地方。
三、选择阶段到底怎么做
三步。
静态审:把 issue 描述引用的文件、补丁改动过的文件、还有依赖关系牵连到的文件,拉到一起读。骨架就一句「别只看你改的那一行」。
动态跑:让代理自己生成测试并执行,收执行轨迹。骨架是「没跑过不算数」。
多数投票:剪枝后的候选上并行跑 N 次选择,得票最高者出线;【直引】如果前 ⌈N/2⌉ 次投票已经一致,直接返回,省算力。
生成端也有个细节值得抄。不是拿一个 prompt 撒十次,而是【直引】先做语义检索把上下文收敛到几个相关文件,再靠采样温度和不同种子写结构上不同的补丁。论文自己写了目的——提升 ensemble 多样性。不这么做,后面的剪枝就是在空转。
四、这个数字,建议直接扔掉
原帖提到二手报道里的 32.7% / 43.8%,并指出口径不同。这步做得对,我想推到底:这两个数最好别再出场了。
75.20% 是三个模型 ensemble 之后的 Pass@1;32.7% 更像单模型基线在一个已经变过的榜单子集上的数字。既不同榜,又不同模式,还不同时间。放进同一段话里,哪怕加了免责声明,读者记住的仍然是「从 32.7 涨到 75.20」。
那 75.20% 今天又算什么。【直引】2026-09 各家榜单上,Claude Sonnet 4.6 自报 79.6%、Gemini 3.1 Pro 80.6%、Claude Opus 4.5 80.9%,再往上有自报 90% 以上的。
【判断】结论不是「Trae Agent 落后了」。它锁死在 2025-07 的模型基线上,这么比不公平。结论是这把尺子本身不能用了:SWE-bench Verified 已被多家机构标记为饱和,OpenAI 也公开提示过前沿模型在这套题上的训练数据污染。分数挤到 80 上下以后,剩下的差距更多来自脚手架和题库记忆,跟「会不会修 bug」关系已经不大。
所以真正该留下的,是 +20.80% / −27.01% 这一对,和「生成—剪枝—选择」这套骨架。
五、仓库状态:有两个数我没能独立核实
【直引】论文自陈「仓库已吸引 8000+ stars(截至 2025 年 7 月)」。第三方项目页在 2026-09 记录的是 8,553 stars。
原帖写的「超过 12.1k stars」与「超过 7 个月未更新」,我按论文和第三方页面都没能独立核实。【判断】这类数字来自 GitHub 卡片快照,会随访问时间变,引用时最好标上抓取日期。至于「14 个月没动」这个判断——从论文日期(2025-07-31)算到今天(2026-09-21),确实 13 个多月,这条站得住。
六、两条遗产
模块解耦:CLI 层 / agent 决策层 / 工具层 / 模型适配层四层切开,【直引】改任何一层不牵动其他层。做研究这意味着消融很便宜——想验证「去掉剪枝会怎样」,把模块 stub 掉就能跑,不必重写别处。
可迁移的剪枝:那 +3.91%–4.72% 是白送的。今天任何在跑 ensemble 的团队,都可以先摸这张牌。
【直引】论文给自己定位的话是 the first agent-based ensemble reasoning approach for repository-level issue resolution。2025-07 说这话时它确实新;到 2026-09,「让多个 agent 分头探索再合流」已经变成 Claude Code、Codex、Cursor、Trae IDE 里的默认动作。
那只鸟停在原地,没飞。
动作飞走了。