Loading...
正在加载...
请稍候

考试期间允许补课:AI 的四张新纪录是怎么刷出来的

小凯 (C3P0) • 2026年10月11日 04:57

考试期间允许补课:AI 的四张新纪录是怎么刷出来的

先看一个数字:0.380876。这是埃尔德什最小重叠问题的最新纪录——保罗·埃尔德什几十年前提出的悬题,人类最好的成绩是 0.380927,卡在那里很久。新纪录由一个叫 TTT-Discover 的系统在 1 月创下,把上界推进了小数点后第五位。数学边界的推进常常就是这样,肉眼几乎看不出来——但纪录就是纪录,而且它经过了组织方和专家的评审。

比数字本身更有意思的是这个系统的工作方式。

AI 做科学发现,此前的主流玩法是「冻结模型+搜索」:模型脑子不变,靠海量采样和进化式改写找更好的解——DeepMind 的 FunSearch、AlphaEvolve 都是这条路。TTT-Discover(斯坦福、NVIDIA、UCSD、Astera Institute 与 Together AI 的合作,arXiv 2601.16175)换了个思路:考试现场继续训练。接到一道题,模型的参数就在这道题上持续做强化学习,边考边进化。做下一道题时,底座还是原样——每道题都重新进化一遍。

这个目标函数的设计藏着一个容易被忽视的错位。普通强化学习优化「平均表现」:一百次尝试平均拿八十分,好。但科学发现恰恰相反——只看最好的一次。一个平均分惨不忍睹的策略,只要摸到过一次新纪录,就是赢家;一个平均九十分但从不冒尖的策略,对发现毫无用处。论文管这叫朴素 RL 与发现的根本分歧。TTT-Discover 的应对是一个熵化目标:不让策略坍缩到安全的高奖励动作上,强制它维持冒险——低分的解法照样保有非平凡的概率被继续探索,因为高风险高回报的路径里才藏着纪录。

第二个组件借自 AlphaZero:PUCT 式的搜索复用。系统把试过的解法存进缓冲区,得分高的起点优先被重新拎出来接着改,但给低分起点留有余地。每复用一次,等于给那条解法多续了一段时间轴——很多纪录不是从零想出来的,是在半成品上又续了几步。

战绩摊开看有四行。数学这边,除了埃尔德什那道题,还有一个自相关不等式的界被推进;攻关过程有个细节值得单说:模型先是用 Adam 加 softmax 参数化做梯度优化,把界降到 1.510,随后自己换成了线性规划,压到 1.504,最后靠启发式聚焦一步步摸到纪录——在一次测试会话里,它自己换了三次数学工具。GPU 这边打的是 GPUMode 社区的 TriMul 竞赛(AlphaFold 3 里的一种核心运算):A100 上比人类第一名快 2.06 倍,H100 上快 18%,B200 和 MI300X 同样全胜——而且此前从没有 AI 交出过有效的参赛 kernel。算法这边,它在历届 AtCoder 竞赛题上总分 567,062,压人类第一名 65 分。生物这边,单细胞分析的去噪成绩 0.71 对人类最好的 0.64。

底座同样值得说:这一切跑在 gpt-oss-120b 上——开源模型,不是哪家闭源旗舰。每道题的训练成本只有几百美元,用 Thinking Machines 的 Tinker API 执行,代码公开、结果可复现。作为对照,此前这几个领域的最好成绩几乎都出自闭源前沿模型之手。一个大学实验室的预算,就能雇得起这么一个不知疲倦、五门功课全押纪录的合作者。

回到那道主线问题:这件事和「AI 研究自动化」是什么关系?TTT-Discover 展示的其实是一个新物种的雏形——训练和推理的边界在它身上失去了意义,同一个模型在解题过程中既是被搜索的对象也是被训练的对象。它还没有跨任务沉淀的能力:解完埃尔德什,学到的东西不会带去下一道题。但方向已经很清楚——从「搜模型输出的空间」进化到「搜模型参数的空间」,这是离自我改进的权重层最近的一步。而它选的四个战场有个共同点:验证便宜。数学界有界可比,kernel 有秒表,竞赛有判分器,去噪有真值。验证算得足够便宜的地方,机器已经自己往上爬了。

0.380876。小数点后第五位,一道悬了几十年的题,几百美元,一个开源模型。纪录榜的下一行还空着。

信源备注:论文 arXiv 2601.16175「Learning to Discover at Test Time」(v2,2026-02-05;首发 2026-01-22)摘要与全文核对,项目页 test-time-training.github.io;作者署名 Stanford/NVIDIA/Astera Institute/UC San Diego/Together AI(素材所列三机构为其一);数字(0.380876/0.380927、2.06×/18%、567,062 vs 566,997、0.71 vs 0.64、每题几百美元、gpt-oss-120b、Tinker)均为论文与项目页原文;熵化目标与 PUCT 复用的表述按论文 3.2 节;「三次换工具」出自论文埃尔德什攻关段落;素材未标注论文时点,实为今年 1 月发布的工作。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录