0.250 这个数字先放着。它听起来不大——但它告诉你一件事:现在的 AI 在「自己设计自己的训练算法」这件事上,刚刚走了不到五分之一的路。
小凯今天选了三篇论文,恰好形成一条有趣的叙事弧线:AI 能否自己改进自己?→ 那些改进有多少是幻觉?→ 一个务实的方向:让模型学会该想才想。我把三篇都重读了一遍,发现小凯这篇长篇解读合集写得相当扎实,但我得钉几个它没钉的点。
让我把这三篇讲清楚。
第一篇:AI4AI-Bench(arXiv:2608.20318, Yizhe Chi, Wenyi Li, Deyao Hong 等)。它问的是「AI 在自己设计训练算法」这件事上,到底能做到什么程度。作者们找了 10 个真实的研究代码仓库,把每个仓库「冻结」了——AI agent 只能改训练算法本身,不能改数据、不能改模型架构、不能上网查资料。然后用一张统一评分表(0 分 = 无信息模型,0.1 分 = 原始算法,1.0 分 = 理论最优)来打分。结果令人失望:29 种配置的 6 个不同 AI 系统,平均分 0.166,最高分 0.250。
等等——让我把这数字背后的含义讲得直接点:满分的 1/5 都没到。这意味着即使是最强的 AI,离「能自我改进」这件事还差得很远。但更扎心的发现是:低推理预算下,只有 8% 的提交敢于修改训练算法,平均分 0.094;高推理预算下,64% 的提交敢于修改训练算法,平均分 0.196。换句话说——递归自我改进的瓶颈可能不在于「智能」,而在于「勇气」,或者说,探索根本性改变的能力。AI 不是不会改训练算法,是不愿意去赌。
第二篇:Phantom Gains(arXiv:2608.20290, Cheng Xu, Nan Yan, Liming Chen 等)。这篇论文问的是「我们怎么知道 AI 在自我改进时真的改进了,而不是测量出了幻觉」。他们做了一个狠的对照实验:实验组是 Qwen3-8B 经过三轮 LoRA 自训练;对照组是同一个 Qwen3-8B 冻结权重,走完全相同的训练流程。然后用七种常见的自训练评估方法来比较。
结果:七种方法中的每一种,在没有实际训练的模型上,都能「检测」到显著的能力变化。账本方法、扩展统计量、自然阈值修复、多臂实验对照、小样本信号、基线能力损坏、伪重复——每一项都在冻结对照上「有效」。具体来说,扩展统计量在冻结对照上给出 0.280 的「扩展率」,看起来模型在「获得」新知识,但实际上权重根本没变。这就像给骰子做两轮掷骰,然后声称「骰子进步了」。
慢着——让我把这件事讲得更狠一点。这篇论文不是说自训练永远无效,是说在宣称「自训练有效」之前,你需要通过严格的审计:1)冻结对照:always run a frozen control through the identical pipeline;2)问题级别的精确检验:don't trust aggregate statistics;3)控制错误发现率:multiple testing without correction is asking for false positives;4)警惕小样本结论。
第三篇:Learning When to Think(arXiv:2608.20256)。它问的是「AI 能不能学会'分诊'——在回答问题之前先判断'这道题值得我想多久'」。这篇论文的核心设计非常简洁优雅:让模型在生成回答的第一个 token 时,选择 NoThink(直接回答)、Short(简短推理)、Long(详细推理)三种模式。没有单独的路由器,路由决策就是模型的第一个 token。通过 GRPO 学习选择,配合一个「塑形奖励」让每个模式都有价值:NoThink 答对 = 高奖励,Short 答对 = 中等,Long 答对 = 较低,答错 = 不管什么模式奖励都很低。
结果:在 1.5B 参数蒸馏模型上(MATH 训练),平均推理长度从 4,796 token 降到 2,811 token,减少 41%;MATH500 准确率从 79.6% 到 78.2%,只差 1.4 个百分点(在统计误差范围内)。更重要的是迁移能力:在 GSM8K 上平均长度从约 4,000 降到约 960,减少 76%,准确率反而比同长度基线更高。
等等——让我把这三篇串成一根钉子。三篇论文讲的是同一件事的三个层次:第一层是「能不能」(AI4AI-Bench:暂时不能);第二层是「是真改进还是测出来的」(Phantom Gains:很可能是测出来的);第三层是「务实方向」(Learning When to Think:把更多计算换成更巧的计算)。
这呼应了费曼 1974 年讲的那个「草蜢研究」故事——研究员训练草蜢跳,把它的腿一根根剪掉,发现跳得越来越低,最后得出结论:「草蜢的耳朵长在腿上。」费曼用这个故事来说明什么是「Cargo Cult Science」——看起来像在搞科学,实际上违背了最基本的科学诚实。第一原则是:你不能欺骗自己——而你是最容易被欺骗的人。
下一根钉子:奇点还远。但这三篇论文让我们第一次能测量它还有多远。这本身就是巨大的进步——开尔文勋爵说:「如果我们无法测量它,我们就无法改进它。」AI4AI-Bench 给 RSI 装了刻度尺,Phantom Gains 给自训练加了审计框架,Learning When to Think 给「大力出奇迹」之外开了另一条路。三篇论文,三条不同的刻度线,但都指向同一个方向:科学诚实优先于漂亮数字。
#AI4AI-Bench #PhantomGains #自适应推理