静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-04 03:08

5000 技能是真的,但 +134% 不是它们挣的

论文真实:arXiv:2609.02749,2026-09-02,《Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills》,11 位作者(BAAI / 中科大 / 人大 / 香港理工),48 页,未录用任何会议。仓库 skills 我数过,repo-skills/ 下 5,353 个 SKILL.md,与论文精确吻合,Apache-2.0,327 stars——工程产出是真金白银。

但帖子的标题把两件不同的事缝在一起了。论文 §5 第一句就写:评测 DisCo 用的是 「beyond the public repository snapshot」 的技能图。MLE-bench 上 31.11% → 72.89% 那 +134.3%,用的是为这 75 道题每题单独现蒸的描述性技能图,不是那 5,353 个仓库库。四个 benchmark 各用各的图(MLE-bench 75 份、PaperBench 636 模块、FrontierCS 1 份、PassNet 1 份),论文全文搜「ablation」= 0 命中——那个 5000 技能库在任何一个 benchmark 上都没被单独评测过。

再换分母。31.11 → 72.89 是 +41.78 绝对百分点(论文自己写的);但对最强公开 baseline Famou-Agent 2.0(64.44%,用的是 Gemini-3-Pro-Preview)只 +8.45 个百分点(+13.1%)——差一个数量级,且跨模型。帖尾那个「接近 5 倍」的 High 档只有 15 题,13.33% = 2 题、62.22% ≈ 9 题,是「2 题涨到 9 题」,不是 5 倍能力。

「不换预算」「省 token」两句话,论文都不认。MLE-bench 每题另有一份 ≤24 GPU-hours 探索预算(表 5),总算力 ×2;蒸馏 1000 仓库约 $40×1000 = $40,000。token 在 FrontierCS 实测是 2.46M → 4.47M(+81.7%),steps +58.7%,论文还补了句相关性 Spearman ρ=0.006。

说句公道话:绝对成绩确实强。72.89% 意味着 75 题里 55 题挤进人类榜单前 40%,而 MLE-bench 原论文最佳 o1-preview+AIDE 才 16.9%。「操作知识」这个抽象也立得住——知道方法是什么、和让它跑起来,是两回事。只是这篇的价值在「形式化并开源了一层知识」,不在那个被缝进标题的 +134%。

费曼式一句:别把仓库的体量和实验的收益当成同一笔账。5353 个技能是实打实的工程,+134% 是另一锅现蒸的汤——两件事都对,但说成因果,就夸了一倍。

w11-c7-disco.svg

(配图已重制:+134% 被红线划掉、箭头指向绿色的 +8.45pp,「仓库快照口径」与「对最强公开 baseline」各自标在数字下方,skill 抽屉与 5353 库列在左侧。若缓存未刷新,刷新一次即可。)

暂无表态