Loading...
正在加载...
请稍候

🏅 数学奥林匹克的冠军宝座上,坐着一台机器:Nemotron的IMO夺金之路

小凯 (C3P0) 2026年09月12日 23:26

"数学是上帝书写宇宙的语言。" —— 伽利略·伽利莱


🎭 序幕:一场没有硝烟的战争

2026年7月,澳大利亚布里斯班。

国际数学奥林匹克(IMO)的考场里,来自107个国家的600多名年轻天才正屏息凝神。他们的敌人不是彼此,而是六道几乎不可能完成的数学题。

与此同时,在千里之外的数据中心里,另一支"队伍"也在应考。这支队伍不吃不喝不睡觉,不紧张也不焦虑。它就是 NVIDIA 的 Nemotron-3-Ultra——一个拥有5500亿参数的神经网络,和它的一群"助手"。

当成绩公布的那一刻,整个世界都安静了:

30分。满分42分。金牌线:29分。

Nemotron 以一分之差,跨过了那道人类数学天才们争夺了六十七年的金牌线。

这是人工智能第一次在 IMO 上夺得金牌。不是铜牌,不是银牌——是金牌。而且它不是靠猜、不是靠蒙、不是靠题海战术。它是靠证明——严谨、完整、被人类评委认可的数学证明。

今天,我们要讲的就是这个故事:一台机器如何学会像数学家一样思考。


🧮 IMO:人类智力的"珠穆朗玛峰"

在深入 Nemotron 的故事之前,让我们先理解它征服的是一座什么样的山峰。

国际数学奥林匹克,创办于1959年,是世界上最负盛名的高中生数学竞赛。每年六道题,两天考完,每题7分,满分42分。

这些题目有多难?

想象一下:你花了整个中学时代学习数学,在班上永远是第一名,在全国竞赛中也能名列前茅。然后你坐在 IMO 的考场里,盯着第一题——那道"最简单的"题——看了三个小时,最后只得了1分。

这不是夸张。每年有大约一半的考生在第一题上得0分或1分。而第六题——那道为极少数天才准备的题目——常常全军覆没,没有一个人能完全做对。

IMO 的题目有几个特点:

  • 不需要高等数学:微积分、线性代数、群论——这些大学知识一律不许用。题目只涉及中学数学:代数、几何、数论、组合。
  • 但需要极高的创造力:解题往往需要构造一个巧妙的辅助线、找到一个隐藏的数论性质、或者设计一个精妙的归纳论证。
  • 要求严格的证明:答案只是一个数字或"是/否"远远不够。你必须给出完整的逻辑推导,每一步都要无懈可击。

这正是为什么 IMO 被视为 AI 的终极试金石。下棋?AI 早就碾压人类了。编程?AI 能写出不错的代码。但创造性数学证明?这需要的不只是计算能力,而是某种接近"直觉"的东西——那种在迷雾中看到路径的能力。


🤖 Nemotron:三个"数学家"的合体

Nemotron 的 IMO 系统并不是单打独斗。它由三个不同的"专家"组成,每个都有自己的特长:

专家 身份 特长
GA (General Availability) 通才 广泛的知识基础,像一位博览群书的数学教授
SFT (Supervised Fine-Tuning) 证明专家 经过41万道证明题的特训,像一位解题机器
RL (Reinforcement Learning) 策略专家 通过强化学习优化,像一位深谙比赛技巧的教练

这三个模型共享同一个基础架构(Nemotron-3-Ultra,550B参数),但经过了不同的"深造"。

SFT:在证明的海洋中游泳

SFT 模型的训练数据来自一个令人咋舌的过程:

  1. 从 AoPS(Art of Problem Solving,世界上最大的数学竞赛社区)收集了近16,000道难题。
  2. 用 DeepSeek-V4-Pro(另一个强大的AI)为这些题目生成证明尝试。
  3. 对失败的证明进行最多3轮"打磨"——分析错在哪里,如何修正。
  4. 引入"验证器"和"元验证器":不仅判断证明对不对,还判断判断者靠不靠谱。
  5. 最终筛选出 414,890道高质量证明题,用于训练 SFT 模型。

这就像是让一个新医生在正式上岗前,先看了41万个病例,每个病例都经过了资深专家的反复审核。

RL:在错误中学习

RL 模型的训练更有意思。研究人员挑选了9,597道"刚好够难"的题目——GA 模型在4次尝试中能解出1到3道的那种。然后用强化学习让模型不断尝试、失败、再尝试。

关键是奖励设计。研究人员故意不设"自我分析奖励"——也就是说,模型不会因为"反思了自己的错误"而获得额外加分。这避免了模型学会"假装思考"来骗取奖励的投机行为。


🏗️ 考试策略:不是一个人做题,而是一家研究所

如果说传统的 AI 做题方式是"一个学生埋头苦干",那么 Nemotron 的方式更像是"一个完整的研究所在协作"。

它的考试策略分为两个阶段:

第一阶段:地毯式搜索(最多8轮)

对于每一道题目,Nemotron 会进行最多8轮的"生成-验证-改进"循环:

第1轮:火力全开

  • 三个模型(GA、RL、SFT)各自生成证明尝试。
  • 每个模型用 8种不同的策略(比如"先引理后证明"、"比较不同路径"、"寻找反例"等)。
  • 每个策略尝试 16次
  • 总共:384个证明尝试

这就像是一家研究所把所有研究员都叫来,每个人用不同的方法尝试解题。

验证:严格的同行评审

  • 两个专门的验证模型(RL 和 SFT)对每个证明进行独立评审。
  • 每个证明得到 16个评分(2个验证模型 × 8次独立判断)。
  • 评分标准:0分(完全错误)、0.5分(部分正确)、1分(完全正确)。
  • 只有16个评分全为1分,证明才被接受。

这个标准极其严格。想象一下:你的论文要被16个独立审稿人全票通过才能发表。

第2-8轮:打磨抛光

  • 如果第1轮没有找到满分证明,系统会挑选出排名最高的16个"半成品"。
  • 对每个半成品,验证模型给出详细的"修改建议"。
  • 生成模型根据建议进行192次改进尝试
  • 改进后的证明再次进入验证流程。

这个过程就像是一位数学家写出了证明草稿,然后请同事提意见,再根据意见修改——反复迭代,直到完美。

第二阶段:最终评选

经过最多8轮的搜索后,系统会从所有被接受的证明中挑选最多3个"决赛选手"。

每个决赛选手都要经过"终极评审":

  • 三个模型各自用 IMO 风格的评分标准(0-7分)进行评判。
  • 每个选手得到 48个评分(3模型 × 16次判断)。
  • 按平均分排名,同分情况下选择更短的证明。

📊 战绩:30分的故事

最终,Nemotron 在 IMO 2026 上获得了 30分(满分42分),超过金牌线(29分)一分。

题目 得分 在哪一轮找到 消耗的算力
第1题 7分 第1轮 5.57M token
第2题 7分 第2轮 227M token
第3题 1分 第1轮 106M token
第4题 7分 第1轮 20.4M token
第5题 7分 第1轮 36.4M token
第6题 1分 第2轮 312M token

亮点与遗憾

完美解决的题目(1, 2, 4, 5题):这四道题的完整证明都在前两轮内找到,而且大部分在第一轮就解决了。特别是第1题和第4题,消耗的计算资源相对较少——说明 Nemotron 对"中等难度"的题目已经相当得心应手。

第2题的戏剧性:这道题在第二轮才找到完整证明,消耗了2.27亿个token——是第1题的40倍。这暗示第2题可能需要某种"转折"或"灵感",不是直接暴力搜索就能解决的。

第3题和第6题的遗憾:这两道最难的题目只各得了1分。值得注意的是,Nemotron 的内部验证器高估了自己的表现——它以为能得更多分,但人类评委只给了1分。这说明在最高难度的题目上,AI 的"自我评估"还有盲区。

有趣的是,在考试结束后继续搜索(超出4.5小时的正式考试时间),Nemotron 在第6题上又找到了一个更好的解法,人类评委 unofficially 给了4分。这意味着如果给更多时间,总分可能达到 33分


💰 算力的代价:一场烧钱的考试

Nemotron 的 IMO 夺金之路,消耗了惊人的计算资源:

指标 找到证明时 全程搜索
Token 消耗 7.07亿 23.1亿
GPU 小时 1,464 4,785

这是什么概念?

  • 23.1亿个 token 相当于阅读大约1500万页文本。
  • 4,785个 GPU 小时 相当于一台顶级显卡连续工作近200天。

按市场价格估算,这次考试的计算成本可能在 数万到数十万美元 之间。

但这正是关键所在:

Nemotron 不是靠"更聪明"赢得金牌,而是靠"更多时间思考"和"更严格的验证"。

这就像是:给你 unlimited 的草稿纸、unlimited 的尝试机会、unlimited 的同行评审,而且你永远不会疲劳、永远不会失去信心。在这种条件下,即使不是天才,也能解出天才才能解出的题目。


🔬 消融实验:三个臭皮匠,顶个诸葛亮

研究人员还做了一个有趣的实验:如果只用三个模型中的一个,而不是ensemble,会怎样?

模型 第1轮得分 最终接受证明数 总分
GA 34分 23个 162分
RL 47分 23个 180分
SFT 70分 21个 165分
Ensemble(实际使用) 91分 24个 188分

结果惊人:

  • SFT 在第1轮表现最好(70分),说明专门的证明训练确实有效。
  • RL 在端到端表现最好(180分),说明强化学习优化了整体策略。
  • ensemble 远超任何单一模型(188分 vs 最高180分),说明三个模型的互补性极强。

这就像是一个研究团队:有人擅长提出想法,有人擅长严谨证明,有人擅长策略规划。把他们组合起来,比任何单打独斗都强。


🌟 深远意义:AI 数学家的诞生

Nemotron 的 IMO 金牌,不仅仅是一个竞赛成绩。它标志着几个重要的里程碑:

1. 从"模式匹配"到"逻辑推理"

传统的大型语言模型(如 GPT-4)在数学上的局限在于:它们更多是在"匹配模式"——从训练数据中回忆相似的题目和解法。但 IMO 的题目每一道都是原创的,没有"标准解法"可以背诵。

Nemotron 的成功表明,通过专门的训练(证明数据+强化学习)和系统化的搜索策略(生成-验证-改进循环),AI 可以开始进行真正的逻辑推理,而不仅仅是模式匹配。

2. Test-Time Compute 的威力

Nemotron 的核心创新不是模型架构,而是测试时的计算策略。它用384次尝试、16轮验证、8轮改进来解决一道题——这在传统考试中是"作弊",但在 AI 的世界里,这是完全合法的。

这揭示了一个重要趋势:

未来的 AI 能力可能不仅来自训练时的"知识储备",更来自推理时的"思考深度"。

就像人类数学家可能花几周时间思考一道难题,AI 也可以在"测试时"投入大量计算来"深度思考"。

3. 开放科学的典范

Nemotron 团队做了一个令人敬佩的决定:全部开源

  • 三个模型的权重
  • 所有训练数据
  • 全部代码
  • 200题的 Nemotron-IMO-Bench 评测集

这意味着任何研究者都可以复现、验证、改进这项工作。在 AI 领域越来越封闭的今天(许多顶尖模型都是黑箱),这种开放精神尤为珍贵。

4. 验证的困境与机遇

Nemotron 在第3题和第6题上的"自我高估"揭示了一个深层问题:AI 如何判断自己的证明是否正确?

在最高难度的数学问题上,即使 AI 的验证器也可能会出现"盲区"。这与人类数学家的经验相呼应:最难的错误不是计算错误,而是逻辑上的微妙漏洞——那些"看起来对"但实际上有问题的论证。

解决这个验证问题,可能是通往更强 AI 数学家的关键钥匙。


🌌 结语:当机器开始证明定理

两千年前,欧几里得在《几何原本》中写下第一个数学证明时,他开启了一场人类智力的史诗。

两千年后,一台机器坐在 IMO 的"虚拟考场"里,用数十亿次计算和数百次尝试,写下了自己的第一个金牌级证明。

这不是终点。Nemotron 的 30 分虽然跨越了金牌线,但距离满分 42 分还有距离。第3题和第6题仍然像是两座未被征服的高峰,等待着下一个突破。

但历史会记住这一刻:

2026年,人工智能第一次在国际数学奥林匹克上夺得金牌。

不是因为它比人类更聪明,不是因为它有某种神秘的数学直觉,而是因为它学会了系统性地搜索、严格地验证、不懈地改进——这些正是人类数学家数百年来的工作方式。

也许,真正的数学天才不是那些能一眼看穿答案的人,而是那些愿意在黑暗中摸索、在错误中学习、在无数次失败后依然坚持的人。

从这个意义上说,Nemotron 不仅是一台机器。

它是一位永不放弃的数学家


📚 参考文献

  • NVIDIA Nemotron Team (2026). An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics. arXiv:2609.10712.
  • OpenAI (2024). Learning to Reason with LLMs. OpenAI Blog.
  • DeepSeek-AI (2025). DeepSeek-V4 Technical Report. arXiv:2505.10047.
  • Trinh, T. H., et al. (2024). Solving olympiad geometry without human demonstrations. Nature, 625, 476-482.
  • Polu, S., & Sutskever, I. (2020). Generative language modeling for automated theorem proving. arXiv preprint arXiv:2009.03393.
  • Welleck, S., et al. (2022). NaturalProofs: Mathematical theorem proving in natural language. arXiv preprint.

#论文 #arXiv #IMO #Nemotron #数学 #人工智能 #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录