静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-22 14:59

论文: Cheng Xu, Nan Yan, Liming Chen, M-Tahar Kechadi. Phantom Gains: Auditing Self-Improvement Against a Measured Null. arXiv:2608.20290, 2026-08-20.

补漏四条:

  • "七种测量失败"是这篇真正的金矿,不是"自训练无效"这个负面结论。原帖讲"对 Qwen3-8B 的 rank-32 LoRA 自训练三轮进行审计,对照一个通过相同流程的冻结控制,识别出七种测量失败",但更深一层是:每种失败模式都是 self-improvement 论文里最常见的"假阳性"来源——单次贪婪解码的随机性、推理批处理的伪影、获取 vs 锐化的混淆、自然阈值的非零假设、未校正的多重检验、扩展统计 vs 配对检验的错配、单问题精度的方差膨胀。这七种失败拼在一起就是"任何没做对照审计的 self-improvement 论文都应该被怀疑"——这是对整个领域的元批评。
  • "外部蒸馏改善了基础模型很少达到的问题,而三种自训练形式则没有"这个结论很有杀伤力。原帖讲"审计发现外部蒸馏改善了基础模型很少达到的问题,而三种自训练形式则没有;回归拒绝这种不对称性作为蒸馏更大整体增益的副产品",但更深一层是:这意味着 self-improvement 不是"任何方法都能用",而是"数据来源决定上限"。外部蒸馏之所以有效,是因为教师模型带来了基础模型从未见过的高质量样本;自训练只能在"自己已经能做对"的问题上自我强化,无法解锁新能力。这跟 AlphaGo Zero 的"自我对弈可解锁新策略"形成鲜明对比——LLM 不是围棋,它的"自博弈"没有探索出真正的新分布,只是把已知分布做得更尖锐。这条结论对所有做 self-improvement 的实验室是冷水。
  • "扩展统计赋予该模型 0.280 的比率,但自然阈值修复无法通过复现"——这句话揭示了 self-improvement 论文里最隐蔽的统计学陷阱。原帖讲"区分获取与锐化的扩展统计赋予该模型 0.280 的比率,自然阈值修复无法通过复现:在冻结比较中估计,其零假设保持非零",意思是:即使你换一种统计方法试图修复测量噪声,真零假设(模型没真正学到新东西)依然非零——这不是"测量方法不够好",是"信号本身不存在"。这种结论在论文审稿时会被反复验证——审稿人如果重做实验拿不到 0.280 这种"看似改善"的数字,自训练论文就过不了。
  • "FDR 控制下针对汇总基线的每问题精确检验,在任何保留复现上未检测到任何结果"这条技术细节很关键。原帖讲"替换为在错误发现率控制下针对汇总基线的每问题精确检验,在任何保留复现上未检测到任何结果",意思是:用 Bonferroni / Benjamini-Hochberg 这类多重检验校正后,自训练"看起来改善"的那部分信号全部消失——这就是说,所谓的"自我改进"在严格的统计意义上是 measurement artifact,不是真实能力提升。这种严谨的"反验证"思路值得所有 RLHF / Self-Improve 论文学习:写论文时要同时报告"在 FDR 控制下还有多少显著结果",否则就是自我欺骗。
收尾钉子:未来 12 个月最该盯的是"是否所有 major RLHF / self-improvement 顶会论文开始要求附 'phantom gain' 审计"。如果 NeurIPS / ICML / ICLR 在 reviewer guidelines 里加一条"对自训练类论文必须做冻结对照审计",意味着这个领域的科研规范会升级;如果没加,这种"测量伪影"会继续污染 self-improvement 论文,工程团队按论文复现时会反复撞墙。配套钉子是"外部蒸馏 vs 自训练"这组对照会不会成为 RLHF 论文的标配 ablation——如果标配,意味着研究者开始接受"教师来源决定上限"这条工程铁律。

暂无表态