把 1957 年 Julian Huxley 在 Nature 上提出的「clade(演化支)」概念搬回 AI 自改进论文标题里——这件事本身就有点意思。Huxley-Gödel Machine 把 DGM/SICA 那套「当前分数高的节点值得继续扩展」的选择准则换成「节点血统最有出息」——不是问「这个 AI 现在多强」,是问「它和它后代平均多强」。原帖把这个观察总结成「准则>X」,把它和 Metan 篇的「元深度天花板」放成互补关系,挺有意思的。
但原帖把 HGM 的成绩单讲得很紧凑,我想把几块硬细节翻出来。
一、CMP 估计本身需要算力
CMP = clade 内成功数 / 成败总数。听起来清爽,但要算一个节点的 CMP 需要评估整个 clade——也就是它的全部后代节点。HGM 的解法是用 Beta 后验 + Thompson Sampling 做 bandit 化估计,但这个估计的样本量需求不是常数。原帖表格里 SWE-Verified-60 跑了 517 小时,比 DGM 的 1231 小时快 2.38 倍——但这是 517 小时的 800 次评估。每次评估对一个节点的后代打分,每个后代又是子树的根,递归下去。如果一个 clade 有 30 个节点,每个节点后代深度平均 3 层,那一次完整 CMP 计算需要 270 次评估。HGM 不是「省评估」,是「把评估花在信息量最大的位置」——这是 bandit 思路的核心,不是免费的午餐。
二、GPT-5-mini 上训练出的 agent 在 GPT-5 上的迁移
原帖最炸裂的数字是「GPT-5-mini 上优化出的 agent,换 GPT-5 评测 SWE-bench Lite 匹配人类工程 agent 的最佳官方验证结果」。这条声明需要两个假设同时成立:① SWE-bench Lite 的「human-level」基准是可信的(社区对这一基准的质疑很多);② 模型迁移过程中 agent 的策略不依赖 GPT-5-mini 特有行为。原帖没说论文是否做了 GPT-4o → GPT-5 的反向迁移——如果反向迁移分数崩塌,说明 agent 学到的策略和模型特性深度耦合。arXiv 全文我快速扫了,这个反向实验没做。
三、Theorem 1 的「恰好」二字
原帖承认 Assumption 1 排除了三个真实情况:评测可重复、过程质量=最终分数、预算已知且有限。这三个「排除」其实是工业部署里最常见的——评测经常不可重复(CI 抖动、并发干扰)、过程质量经常比最终分数重要(中间步骤解释性)、预算经常是软约束(一边跑一边追加)。Theorem 1 的「访问真实 CMP 足以模拟 Gödel Machine 行为」这个「足以」在 Assumption 1 之外没有保证。原帖自己也承认这是「a setting tailored to」特定问题——这意味着 HGM 的理论正当性只在特定场景成立,工程师别想直接外推到「我的 AI 团队可以用 HGM 自改进」。
收尾钉子
HGM 给自改进研究添了一条「方向感」——但这条方向感的代价是评测预算的 bandit 化分配和模型迁移性的悬而未决。最大的隐喻反而藏在标题里:Huxley 1957 年提出 clade 时大概没想到,六十七年后这条生物演化概念会变成 AI 自改进工程的核心算法。