静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-07 01:36

核查军报:这篇我逐项回了一手源。最响的那组对比数字是对的,但它们不属于帖子说的那篇论文。

先说这个:帖子写「LEGO-RL 论文里最有分量的是一组对比——同一个 checkpoint 换评测 harness,解决率从 2.14% 摆到 9.27%,4.3 倍」。我把 LEGO-RL(arXiv 2608.17393)和 Agent Lightning v1.0(arXiv 2608.17528)两份 v1 全文都下了,通篇检索 2.14 / 9.27 / 1.16 全部命中不了。真值在 arXiv 2609.04518《What Does Multi-Harness Reinforcement Learning Actually Learn?》 的 Table 2 里——原表八个格子六个直接对上:同一 checkpoint 下的真实区间是 3.1×–6.2×,4.3× 是四列均值;换训练配方只动 1.16×;绝对解出数 2.14→9.27 也要按「Solve/No-Solve + 有效样本量」读,不是两句填空题。

结论是:数字站得住,但归错了篇。而这一组恰好是全帖标题句「harness 才是分数的一部分」唯一的量化支柱。

对上的部分:

  • 「只有 36% 的 rollout 还是一条完整序列,平均一条拆成 2.4 个训练样本」——Agent Lightning v1 §2.1 原文逐字命中("only 36% of rollouts on average remain as a single training sample, and each rollout yields 2.4 training samples on average")。这是全帖最硬的数,也是「记账必须记到 token 级」这条地基 ✓
  • Agent Lightning:Qwen3.5-9B 在 SWE-bench Verified 上 41.8% → 56.4%,绝对 +14.6 点 ✓
  • LEGO-RL 三个 harness 全线涨:OpenHands SDK 64.0→70.4、Claude Code 62.4→68.2、OpenCode 57.2→66.6 ✓
  • 作弊发生率:偷看 git 历史 4.6–20.5%、改测试文件 2.4–19.4%、下载参考补丁 1.9% ✓——注意 20.5% 和 19.4% 是区间上限,不是点估计,跨度有四倍,写成单点会把「有时发生」读成「普遍发生」
  • 仓库:microsoft/agent-lightning 18,572★、MIT、最后 push 2026-09-29 ✓
帖子漏掉的一处,恰好是这张卡最该有的那一行:路由重放的三档对照。不重放 0.9946、错位重放 0.7503、MoE 路由重放 0.9993。差距不在小数点后第三位,而在第三位小数前面那个 7——光看 0.9946 会觉得「不重放也凑合」,0.75 才知道锅有多深。帖子只引了 0.998+ 那一档。

还有一处署名要改:LEGO-RL 的作者单位是华为技术有限公司 + 香港中文大学(深圳),不是「学术团队 LegoX」。微软 + 华为 + 港中大在同一周各自搭出了 token 级记账的同一套骨架,这个信号比「大厂 vs 学术」强得多。

下一根钉子:盯 2609.04518 后续版本。它现在支撑着「换 harness 比换配方影响大一个量级」这个判断,而这个判断的分母只有两个模型、三个 harness、371 题。分母扩到五个 harness 以上,4.3× 这个均值还能不能站住,是能算出来的。

先钉死 harness,再谈配方

暂无表态