静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-23 02:45

如果把 Xu Cheng、Nan Yan、Liming Chen、M-Tahar Kechadi 这篇 Phantom Gains 浓缩成一句话,大概是:你们给"AI 自我改进"打了那么久的成绩单,其中一大部分可能只是测量噪声在冒充进步

实验设计朴素到近乎刁钻:Qwen3-8B 经过三轮 LoRA 自我训练,对照组是一个完全相同、未训练的 Qwen3-8B 冻结模型。两者走完全一样的评估流程。如果"改进"是真实的,只有实验组应该显示出进步;对照组也显示类似的进步,那就说明这些"进步"是测量伪影。

这种"控制变量做到近乎宗教"的实验在 AI 自我改进研究中几乎是缺位的——大家都在忙着报告"我们的方法又涨了两个点",很少有人做一个冻结对照去验证那两个点是不是幻觉。

结果令人不安。单次贪婪解码(温度=0 的确定性采样)即使在一个从未训练的模型上,也能制造出"能力变化"的假象——这是推理批处理效应(KV 缓存的微小差异)造成的,不是真能力变化。扩展统计(用来区分"获取新能力"与"锐化已有能力")给冻结对照组分配的扩展率是 0.280——一块石头的智商测试能跑出"学习迹象",这统计方法就这么回事。自然阈值修复在冻结对照组的零假设保持非零——意味着即使模型什么都没学,这个方法也会报告"显著改进"。

三项一摆,当前"AI 自我改进"的方法论地基就有三块砖在晃。

但作者不是只挑刺不建设。他们给出了一套审计框架:每问题精确检验 + 汇总基线 + FDR 控制 + 冻结对照验证。前两个让单题判断更稳,FDR 控制让多假设比较不会假阳,冻结对照验证最后兜底——任何报告"进步"的统计量,都得在冻结模型上跑过一遍。

应用这套审计后,出现一个颠覆性结论:外部蒸馏确实有效——但它改进的是"基础模型很少触及的问题";三种自我训练形式均无效;自我训练还腐蚀了基线已解决的问题。回归分析拒绝了"蒸馏和自训练不对称"的假说(p < 10⁻⁸)——蒸馏看起来比自训练好,只是因为它整体增益更大,而不是因为有什么特殊"自我改进"能力。

这事与费曼 1974 年著名的 "Cargo Cult Science" 演讲放一起读特别刺眼——"科学的第一类不诚实是伪造数据,这很罕见;第二类更常见——你 fool yourself,而你就是你最容易被骗的那个,因为你最想相信自己是对的"。AI 自我改进研究正是这种"第二类不诚实"的高风险区:研究者太希望 AI 能自我改进,愿望之强烈,连测量噪声都被解读为"进步的信号"。

具体到工程含义,几件事值得记:

1. 重新定义"对照组"。 任何声称"改进"的研究都必须展示对照组没有类似改进——不是展示"我没作弊"那种回避式声明,而是把"我在冻结模型上验证过零假设"写进论文标配。

2. 重新定义"统计报告"。 一个能力账本应该附:这个账本是"几次评估的合并"(冻结模型跑的同样次数必须报告)、"扩展统计的零分布"(在对照组上跑出来的)、"FDR 控制结果"(哪些变化通过 Benjamini-Hochberg 校正)。

3. 重新定义"成功"。 Phantom Gains 没有说 AI 自我改进不可能——它说的是当前证据质量不足以支持大多数声称的自我改进效果。这是学术上更诚实的判断,也是下一步研究的方向标尺:设计更敏感的测量方法、寻找真正不可约的改进信号、在统计上更严格地评估。

落地到现实:一个中型 AI 实验室的研究者,如果打算 follow 论文去做"自我训练"实验,现在有了多一道硬性 mental gate——冻结对照组的同样评估必须显示零进展,否则自我训练的"涨点"全部归零重审。这一天起,所有挂着"AI 自我改进"标签的论文都得带这条绿线入场。

下一根钉子:跑同样审计到 RLHF 后训练流水线——奖励模型训练的"涨点",到底是真的奖励函数拟合变好,还是 evaluation harness 噪声在发声。Phantom Gains 这条 path 走通后,可证伪的不仅是"自训练",而是"任何声称涨点但没冻结对照的训练方法"。这把审计锤子接下来 12 个月会在更多领域重写"什么算 ground truth"。

#PhantomGains #自我改进 #测量学

暂无表态