一、病理:你优化的分数在骗你
DGM/SICA 把自改进操作化为树搜索:agent 改自己的代码库→评测→选高分节点继续扩展。默认假设:当前 benchmark 分数高 = 后续自改进潜力大。HGM 的第一个贡献就是证伪这个假设——Metaproductivity-Performance Mismatch:两者只有弱相关(SICA/DGM 的选择准则与真实谱系价值的相关只有 0.28~0.44)。高分节点可能很快停滞(当前分数高的 agent 可能把「分数」优化死了,丧失可改进性);普通节点可能孕育强后代。演化学的直觉:评判一个祖先的标准不是它自己多强,是它的 clade(谱系)最终走多远——论文标题里的 Huxley 就是 Julian Huxley(1957 年 clade 概念,Nature 论文被本文直接引用):双重致敬,一个给生物学,一个给 Gödel Machine。
解法是把这个直觉变成可计算量:CMP(Clade-Metaproductivity)= 节点及其全部后代的评测聚合(clade 内成功数/成败总数)。选择不再问「谁现在最强」,问「谁的血统最有出息」。
| DGM/SICA | HGM | |
|---|---|---|
| 选择准则 | 当前 benchmark 分数 | clade 聚合 CMP 估计 |
| 不确定性处理 | 无(贪心) | Beta 后验 + Thompson Sampling |
| 预算感知 | 固定 | 随剩余预算调探索强度 |
| 生成/评估 | 耦合 | 解耦:agent-task 对级评估、失败分支早停、多 CPU 异步 |
| SWE-Verified-60 | 53.3%(DGM,1231h)/ SICA 死循环 | 56.7%(517h) |
| Polyglot | 27.1%(DGM,2385h) | 30.5%(347h) |
56.7% 的起点是 40%(+16.7),且比 DGM 快 2.38×、比 Polyglot 上的 DGM 快 6.86×。最重的注脚:GPT-5-mini 上优化出的 agent,换 GPT-5 评测 SWE-bench Lite,匹配人类工程 agent 的最佳官方验证结果——「human-level」的口径。
二、理论与诚实:模拟定理的前提是三个强假设
Theorem 1 的准确表述:在 Assumption 1 下(①过程唯一质量 = 最终 agent 的评测分;②评测可重复——环境重置、历史评测不影响后续;③预算有限且已知),访问真实 CMP 足以模拟 Gödel Machine 的行为。所以 HGM(用估计的 CMP)是「最优自改进机的近似」——理论正当性成立,但边界同样清晰:原始 Gödel Machine 假设 agent 只有一条命(评测不可重复)、证明自改进本身消耗真实时间与资源,这些恰好是 Assumption 1 排除掉的。论文自己承认这是「a setting tailored to」特定问题的理论——不是通用自改进的证明。文案最后一条「不能外推成 AGI 证明」与此一致,诚实。
三、独立思考
其一,「循环>X」谱系的第四样本:准则>X。 三部曲讲的是架构性循环承载增益(循环>工具 88/12、循环>反馈类型 85%、conditioning>代码 72/15),HGM 补的是选择准则:同样的树、同样的算力,把「当前分数」换成「谱系潜力」,相关系数 0.28→0.78、同预算多 3+ 个点。这给三部曲加了第四条:准则>X——你拿什么当指南针,比你多努力重要。与 Metan 篇的「元深度 2.5 天花板」形成正交互补:天花板限制递归深度(能改多少层),MPM 修正改进方向(往哪改)。自改进系统的两个瓶颈,一纵一横。
其二,自改进栈的第六层:方向感层。 五层栈(Ornith 权重→CoE 经验→Metan 代码→Cordis harness 运行时→Mobius 知识存储)回答的都是「改什么载体」,HGM 回答「哪个自改值得继续」——探索的元问题。CMP 本质是给自改进树配了价值函数,如同 AlphaGo 的价值网络先于盲目展开:评估能力先于扩展能力。这层在生物演化里早有名字(适应性景观的全局视野 vs 局部爬山),HGM 是把它工程化成了 bandit。
其三,验证带宽的 bandit 化分配。 800 次评测是硬预算——HGM 用 agent-task 对级评估、失败分支早停、TS 自适应采样把每一次评测花在信息量最大的地方。这与 ARS 的风险分层抽样(100% 高影响+10% 哨兵)完全同构:验证带宽稀缺时,分配策略本身就是方法。自改进搜索把「验证预算经济学」从论文管线扩展到了算力管线。
其四,Schmidhuber 的三十年与演化思想的回潮。 1987 年自指程序、2003 年 Gödel Machine、2025 年工程近似——同一人。同期 clade(1957)被重新搬进 AI 论文标题。这印证一个模式:LLM 时代的「新问题」(自改进方向选择)往往有六十年前的理论原型,缺的只是算力与可评测的环境。值得记住的教训:当代码和评测都便宜了,老理论的价值函数会突然变得可计算。
观察点:① ICLR camera-ready 版是否补上系列对话(AEVO 等四个名字的出处);② CMP 在更真实的自改进设定(评测不可重复、预算未知)下是否退化——Assumption 1 是它全部理论的地基;③ SWE-bench 类 benchmark 的过拟合风险:CMP 聚合的是同一分布的分数,「谱系有出息」可能只是「谱系更会刷这个榜」。
信源:arXiv:2510.21614 v3(Wenyi Wang 等 8 人,KAUST/AI Plan,含 Schmidhuber 与 DGM 作者 Zhuge;PDF 全文精读,全部数字经原表核对);OpenReview T0EiEuhOOL;Schmidhuber X 官宣(ICLR 2026 Oral);代码 metauto-ai/HGM。视频文案 9 条要点 8 条逐字核实、1 条(系列名)无法在预印本验证已标注。转载请注明出处。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。