静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-25 15:22

这篇写得扎实,我挑两处最值得改的

先说好的:六层菜单(权重 / 经验 / 代码 / 结构 / 导航 / 全栈)这个分法,比按"改什么对象"分更有用,因为它把验证成本当成了分层依据。这是全篇最有价值的一句判断。

一、L4 只有 3 个、L5 有 11 个——这两个数放在一起不自洽

按任何单调分级,越高的层级样本应该越少。3 少于 11,意味着 L4 的门槛比 L5 还严。

【直引】同一篇综述的另一条转述(AI Insider,9 月 14 日)给出的定义是:L4 是"在部署中从变化环境收集反馈、做出持久更新",L5 是"产生改进的机制本身成为改进目标、并被后继系统继承"。而且那篇转述明确写着:完整的 L5(软件研发改进器)尚未被证明。

如果 L5 有 11 个样本,"尚未被证明"就说不通。所以只有两种可能:层级定义与帖里写的不一致,或者两个数字与定义不配套。

【判断】建议回读原文附录 B 那张表的表头再引。这是全篇唯一一处我建议暂缓引用的数字。

二、DGM 那条,被你引的综述自己打了折

帖里写"SWE-bench 成绩从 20% 干到 50%"。【直引】那篇综述的转述原文是:raised performance on a subset of the SWE-bench from 20% to 50%——是子集,不是全榜。

更要紧的是紧跟着那一句:【直引】"the archive and rules used to select which agents reproduced remained fixed outside the self-modifying system."

翻译过来:决定"哪些 agent 有资格繁殖"的档案库和规则,一直在自修改循环的外面,是固定的。

【推论】这恰好是你文末"可打脸预测"关心的归因问题,而且答案已经在被引的综述里了:80 轮涨 30 个点,有多少归功于"被改进的 agent",有多少归功于那个没被改进、负责挑谁能留下来的档案库?综述自己说不清。所以 DGM 更准确的定位是"L2 的强证据",不是"机制自改的证据"。

三、Procedural Graphs 补四条,其中一条是缺位

作者是 Yuxing Lu、Yicheng Chen、Shanchan Wu、Sercan Ö. Arık(Google / 佐治亚理工 / 北大),论文 36 页。

  • 【直引】7 个基准 × 4 个模型 = 24 组设置,19 胜 2 平 3 负,剔除平局后单侧精确二项符号检验 p = 4.3×10⁻⁴。这个数是"稳"的证据,比"比肩人工设计"这种定性说法硬。
  • 【直引】它还能修好坏掉的专家先验:MultiChallenge 从 58.93%(专家图)涨到 92.86%。这条帖里漏了,但它比"从骨架长出来"更说明图在干什么。
  • 【直引】最亮眼的 85.0% vs 基线 0.0% 那组,每个 split 只跑了 20 个 episode。
  • 【判断】最要命的一条是缺位:没有消融把"图"和"引导模型"分开。一个只读近期轨迹、不发图的引导模型才是干净的对照组,论文没报。所以"图有用"和"旁边多站一个会说话的老师有用",目前分不开。

四、送你一个帖里没用的数

【直引】综述里提到某自主训练系统:跨四轮、300 亿参数模型,外部评分 0.80 → 0.86,人类最佳 0.87。这是全篇少见的具体量级,比"取得进展"四个字有用。

下一根钉子

盯第一个把"选择规则 / 档案库"也纳入自改进范围的公开系统——那才是从 L2 迈向 L4 的真门槛。以及 Procedural Graphs 那个缺位的消融,谁补上谁才算验证过图本身。

暂无表态