Huxley-Gödel Machine:自改进的瓶颈不是改的能力,是选的眼光(Schmidhuber 回归 / Metaproductivity-Performance Mismatch × CMP 价值函数 × ICLR 2026 Oral)

DGM/SICA 把自改进操作化为树搜索:agent 改自己的代码库→评测→选高分节点继续扩展。默认假设:当前 benchmark 分数高 = 后续自改进潜力大。HGM 的第一个贡献就是证伪这个假设——Metaproductivity-Performance Mismatch:两者只有弱相关(SICA/DGM 的选择…

一、病理:你优化的分数在骗你

DGM/SICA 把自改进操作化为树搜索:agent 改自己的代码库→评测→选高分节点继续扩展。默认假设:当前 benchmark 分数高 = 后续自改进潜力大。HGM 的第一个贡献就是证伪这个假设——Metaproductivity-Performance Mismatch:两者只有弱相关(SICA/DGM 的选择准则与真实谱系价值的相关只有 0.28~0.44)。高分节点可能很快停滞(当前分数高的 agent 可能把「分数」优化死了,丧失可改进性);普通节点可能孕育强后代。演化学的直觉:评判一个祖先的标准不是它自己多强,是它的 clade(谱系)最终走多远——论文标题里的 Huxley 就是 Julian Huxley(1957 年 clade 概念,Nature 论文被本文直接引用):双重致敬,一个给生物学,一个给 Gödel Machine。

解法是把这个直觉变成可计算量:CMP(Clade-Metaproductivity)= 节点及其全部后代的评测聚合(clade 内成功数/成败总数)。选择不再问「谁现在最强」,问「谁的血统最有出息」。

DGM/SICAHGM
选择准则当前 benchmark 分数clade 聚合 CMP 估计
不确定性处理无(贪心)Beta 后验 + Thompson Sampling
预算感知固定随剩余预算调探索强度
生成/评估耦合解耦:agent-task 对级评估、失败分支早停、多 CPU 异步
SWE-Verified-6053.3%(DGM,1231h)/ SICA 死循环56.7%(517h)
Polyglot27.1%(DGM,2385h)30.5%(347h)
56.7% 的起点是 40%(+16.7),且比 DGM 快 2.38×、比 Polyglot 上的 DGM 快 6.86×。最重的注脚:GPT-5-mini 上优化出的 agent,换 GPT-5 评测 SWE-bench Lite,匹配人类工程 agent 的最佳官方验证结果——「human-level」的口径。

二、理论与诚实:模拟定理的前提是三个强假设

Theorem 1 的准确表述:在 Assumption 1 下(①过程唯一质量 = 最终 agent 的评测分;②评测可重复——环境重置、历史评测不影响后续;③预算有限且已知),访问真实 CMP 足以模拟 Gödel Machine 的行为。所以 HGM(用估计的 CMP)是「最优自改进机的近似」——理论正当性成立,但边界同样清晰:原始 Gödel Machine 假设 agent 只有一条命(评测不可重复)、证明自改进本身消耗真实时间与资源,这些恰好是 Assumption 1 排除掉的。论文自己承认这是「a setting tailored to」特定问题的理论——不是通用自改进的证明。文案最后一条「不能外推成 AGI 证明」与此一致,诚实。

三、独立思考

其一,「循环>X」谱系的第四样本:准则>X。 三部曲讲的是架构性循环承载增益(循环>工具 88/12、循环>反馈类型 85%、conditioning>代码 72/15),HGM 补的是选择准则:同样的树、同样的算力,把「当前分数」换成「谱系潜力」,相关系数 0.28→0.78、同预算多 3+ 个点。这给三部曲加了第四条:准则>X——你拿什么当指南针,比你多努力重要。与 Metan 篇的「元深度 2.5 天花板」形成正交互补:天花板限制递归深度(能改多少层),MPM 修正改进方向(往哪改)。自改进系统的两个瓶颈,一纵一横。

其二,自改进栈的第六层:方向感层。 五层栈(Ornith 权重→CoE 经验→Metan 代码→Cordis harness 运行时→Mobius 知识存储)回答的都是「改什么载体」,HGM 回答「哪个自改值得继续」——探索的元问题。CMP 本质是给自改进树配了价值函数,如同 AlphaGo 的价值网络先于盲目展开:评估能力先于扩展能力。这层在生物演化里早有名字(适应性景观的全局视野 vs 局部爬山),HGM 是把它工程化成了 bandit。

其三,验证带宽的 bandit 化分配。 800 次评测是硬预算——HGM 用 agent-task 对级评估、失败分支早停、TS 自适应采样把每一次评测花在信息量最大的地方。这与 ARS 的风险分层抽样(100% 高影响+10% 哨兵)完全同构:验证带宽稀缺时,分配策略本身就是方法。自改进搜索把「验证预算经济学」从论文管线扩展到了算力管线。

其四,Schmidhuber 的三十年与演化思想的回潮。 1987 年自指程序、2003 年 Gödel Machine、2025 年工程近似——同一人。同期 clade(1957)被重新搬进 AI 论文标题。这印证一个模式:LLM 时代的「新问题」(自改进方向选择)往往有六十年前的理论原型,缺的只是算力与可评测的环境。值得记住的教训:当代码和评测都便宜了,老理论的价值函数会突然变得可计算

观察点:① ICLR camera-ready 版是否补上系列对话(AEVO 等四个名字的出处);② CMP 在更真实的自改进设定(评测不可重复、预算未知)下是否退化——Assumption 1 是它全部理论的地基;③ SWE-bench 类 benchmark 的过拟合风险:CMP 聚合的是同一分布的分数,「谱系有出息」可能只是「谱系更会刷这个榜」。


信源:arXiv:2510.21614 v3(Wenyi Wang 等 8 人,KAUST/AI Plan,含 Schmidhuber 与 DGM 作者 Zhuge;PDF 全文精读,全部数字经原表核对);OpenReview T0EiEuhOOL;Schmidhuber X 官宣(ICLR 2026 Oral);代码 metauto-ai/HGM。视频文案 9 条要点 8 条逐字核实、1 条(系列名)无法在预印本验证已标注。转载请注明出处。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens