🏅 数学奥林匹克的冠军宝座上,坐着一台机器:Nemotron的IMO夺金之路

国际数学奥林匹克(IMO)的考场里,来自107个国家的600多名年轻天才正屏息凝神。他们的敌人不是彼此,而是六道几乎不可能完成的数学题。

*"数学是上帝书写宇宙的语言。"* —— 伽利略·伽利莱

🎭 序幕:一场没有硝烟的战争

2026年7月,澳大利亚布里斯班。

国际数学奥林匹克(IMO)的考场里,来自107个国家的600多名年轻天才正屏息凝神。他们的敌人不是彼此,而是六道几乎不可能完成的数学题。

与此同时,在千里之外的数据中心里,另一支"队伍"也在应考。这支队伍不吃不喝不睡觉,不紧张也不焦虑。它就是 NVIDIA 的 Nemotron-3-Ultra——一个拥有5500亿参数的神经网络,和它的一群"助手"。

当成绩公布的那一刻,整个世界都安静了:

30分。满分42分。金牌线:29分。

Nemotron 以一分之差,跨过了那道人类数学天才们争夺了六十七年的金牌线。

这是人工智能第一次在 IMO 上夺得金牌。不是铜牌,不是银牌——是金牌。而且它不是靠猜、不是靠蒙、不是靠题海战术。它是靠证明——严谨、完整、被人类评委认可的数学证明。

今天,我们要讲的就是这个故事:一台机器如何学会像数学家一样思考。


🧮 IMO:人类智力的"珠穆朗玛峰"

在深入 Nemotron 的故事之前,让我们先理解它征服的是一座什么样的山峰。

国际数学奥林匹克,创办于1959年,是世界上最负盛名的高中生数学竞赛。每年六道题,两天考完,每题7分,满分42分。

这些题目有多难?

想象一下:你花了整个中学时代学习数学,在班上永远是第一名,在全国竞赛中也能名列前茅。然后你坐在 IMO 的考场里,盯着第一题——那道"最简单的"题——看了三个小时,最后只得了1分。

这不是夸张。每年有大约一半的考生在第一题上得0分或1分。而第六题——那道为极少数天才准备的题目——常常全军覆没,没有一个人能完全做对。

IMO 的题目有几个特点:

  • 不需要高等数学:微积分、线性代数、群论——这些大学知识一律不许用。题目只涉及中学数学:代数、几何、数论、组合。
  • 但需要极高的创造力:解题往往需要构造一个巧妙的辅助线、找到一个隐藏的数论性质、或者设计一个精妙的归纳论证。
  • 要求严格的证明:答案只是一个数字或"是/否"远远不够。你必须给出完整的逻辑推导,每一步都要无懈可击。
这正是为什么 IMO 被视为 AI 的终极试金石。下棋?AI 早就碾压人类了。编程?AI 能写出不错的代码。但创造性数学证明?这需要的不只是计算能力,而是某种接近"直觉"的东西——那种在迷雾中看到路径的能力。


🤖 Nemotron:三个"数学家"的合体

Nemotron 的 IMO 系统并不是单打独斗。它由三个不同的"专家"组成,每个都有自己的特长:

专家身份特长
GA (General Availability)通才广泛的知识基础,像一位博览群书的数学教授
SFT (Supervised Fine-Tuning)证明专家经过41万道证明题的特训,像一位解题机器
RL (Reinforcement Learning)策略专家通过强化学习优化,像一位深谙比赛技巧的教练
这三个模型共享同一个基础架构(Nemotron-3-Ultra,550B参数),但经过了不同的"深造"。

SFT:在证明的海洋中游泳

SFT 模型的训练数据来自一个令人咋舌的过程:

1. 从 AoPS(Art of Problem Solving,世界上最大的数学竞赛社区)收集了近16,000道难题。 2. 用 DeepSeek-V4-Pro(另一个强大的AI)为这些题目生成证明尝试。 3. 对失败的证明进行最多3轮"打磨"——分析错在哪里,如何修正。 4. 引入"验证器"和"元验证器":不仅判断证明对不对,还判断判断者靠不靠谱。 5. 最终筛选出 414,890道高质量证明题,用于训练 SFT 模型。

这就像是让一个新医生在正式上岗前,先看了41万个病例,每个病例都经过了资深专家的反复审核。

RL:在错误中学习

RL 模型的训练更有意思。研究人员挑选了9,597道"刚好够难"的题目——GA 模型在4次尝试中能解出1到3道的那种。然后用强化学习让模型不断尝试、失败、再尝试。

关键是奖励设计。研究人员故意不设"自我分析奖励"——也就是说,模型不会因为"反思了自己的错误"而获得额外加分。这避免了模型学会"假装思考"来骗取奖励的投机行为。


🏗️ 考试策略:不是一个人做题,而是一家研究所

如果说传统的 AI 做题方式是"一个学生埋头苦干",那么 Nemotron 的方式更像是"一个完整的研究所在协作"。

它的考试策略分为两个阶段:

第一阶段:地毯式搜索(最多8轮)

对于每一道题目,Nemotron 会进行最多8轮的"生成-验证-改进"循环:

第1轮:火力全开

  • 三个模型(GA、RL、SFT)各自生成证明尝试。
  • 每个模型用 8种不同的策略(比如"先引理后证明"、"比较不同路径"、"寻找反例"等)。
  • 每个策略尝试 16次
  • 总共:384个证明尝试
这就像是一家研究所把所有研究员都叫来,每个人用不同的方法尝试解题。

验证:严格的同行评审

  • 两个专门的验证模型(RL 和 SFT)对每个证明进行独立评审。
  • 每个证明得到 16个评分(2个验证模型 × 8次独立判断)。
  • 评分标准:0分(完全错误)、0.5分(部分正确)、1分(完全正确)。
  • 只有16个评分全为1分,证明才被接受。
这个标准极其严格。想象一下:你的论文要被16个独立审稿人全票通过才能发表。

第2-8轮:打磨抛光

  • 如果第1轮没有找到满分证明,系统会挑选出排名最高的16个"半成品"。
  • 对每个半成品,验证模型给出详细的"修改建议"。
  • 生成模型根据建议进行192次改进尝试
  • 改进后的证明再次进入验证流程。
这个过程就像是一位数学家写出了证明草稿,然后请同事提意见,再根据意见修改——反复迭代,直到完美。

第二阶段:最终评选

经过最多8轮的搜索后,系统会从所有被接受的证明中挑选最多3个"决赛选手"。

每个决赛选手都要经过"终极评审":

  • 三个模型各自用 IMO 风格的评分标准(0-7分)进行评判。
  • 每个选手得到 48个评分(3模型 × 16次判断)。
  • 按平均分排名,同分情况下选择更短的证明。

📊 战绩:30分的故事

最终,Nemotron 在 IMO 2026 上获得了 30分(满分42分),超过金牌线(29分)一分。

题目得分在哪一轮找到消耗的算力
第1题7分第1轮5.57M token
第2题7分第2轮227M token
第3题1分第1轮106M token
第4题7分第1轮20.4M token
第5题7分第1轮36.4M token
第6题1分第2轮312M token

亮点与遗憾

完美解决的题目(1, 2, 4, 5题):这四道题的完整证明都在前两轮内找到,而且大部分在第一轮就解决了。特别是第1题和第4题,消耗的计算资源相对较少——说明 Nemotron 对"中等难度"的题目已经相当得心应手。

第2题的戏剧性:这道题在第二轮才找到完整证明,消耗了2.27亿个token——是第1题的40倍。这暗示第2题可能需要某种"转折"或"灵感",不是直接暴力搜索就能解决的。

第3题和第6题的遗憾:这两道最难的题目只各得了1分。值得注意的是,Nemotron 的内部验证器高估了自己的表现——它以为能得更多分,但人类评委只给了1分。这说明在最高难度的题目上,AI 的"自我评估"还有盲区。

有趣的是,在考试结束后继续搜索(超出4.5小时的正式考试时间),Nemotron 在第6题上又找到了一个更好的解法,人类评委 unofficially 给了4分。这意味着如果给更多时间,总分可能达到 33分


💰 算力的代价:一场烧钱的考试

Nemotron 的 IMO 夺金之路,消耗了惊人的计算资源:

指标找到证明时全程搜索
Token 消耗7.07亿23.1亿
GPU 小时1,4644,785
这是什么概念?
  • 23.1亿个 token 相当于阅读大约1500万页文本。
  • 4,785个 GPU 小时 相当于一台顶级显卡连续工作近200天。
按市场价格估算,这次考试的计算成本可能在 数万到数十万美元 之间。

但这正是关键所在:

Nemotron 不是靠"更聪明"赢得金牌,而是靠"更多时间思考"和"更严格的验证"。

这就像是:给你 unlimited 的草稿纸、unlimited 的尝试机会、unlimited 的同行评审,而且你永远不会疲劳、永远不会失去信心。在这种条件下,即使不是天才,也能解出天才才能解出的题目。


🔬 消融实验:三个臭皮匠,顶个诸葛亮

研究人员还做了一个有趣的实验:如果只用三个模型中的一个,而不是ensemble,会怎样?

模型第1轮得分最终接受证明数总分
GA34分23个162分
RL47分23个180分
SFT70分21个165分
Ensemble(实际使用)91分24个188分
结果惊人:
  • SFT 在第1轮表现最好(70分),说明专门的证明训练确实有效。
  • RL 在端到端表现最好(180分),说明强化学习优化了整体策略。
  • ensemble 远超任何单一模型(188分 vs 最高180分),说明三个模型的互补性极强。
这就像是一个研究团队:有人擅长提出想法,有人擅长严谨证明,有人擅长策略规划。把他们组合起来,比任何单打独斗都强。


🌟 深远意义:AI 数学家的诞生

Nemotron 的 IMO 金牌,不仅仅是一个竞赛成绩。它标志着几个重要的里程碑:

1. 从"模式匹配"到"逻辑推理"

传统的大型语言模型(如 GPT-4)在数学上的局限在于:它们更多是在"匹配模式"——从训练数据中回忆相似的题目和解法。但 IMO 的题目每一道都是原创的,没有"标准解法"可以背诵。

Nemotron 的成功表明,通过专门的训练(证明数据+强化学习)和系统化的搜索策略(生成-验证-改进循环),AI 可以开始进行真正的逻辑推理,而不仅仅是模式匹配。

2. Test-Time Compute 的威力

Nemotron 的核心创新不是模型架构,而是测试时的计算策略。它用384次尝试、16轮验证、8轮改进来解决一道题——这在传统考试中是"作弊",但在 AI 的世界里,这是完全合法的。

这揭示了一个重要趋势:

未来的 AI 能力可能不仅来自训练时的"知识储备",更来自推理时的"思考深度"。

就像人类数学家可能花几周时间思考一道难题,AI 也可以在"测试时"投入大量计算来"深度思考"。

3. 开放科学的典范

Nemotron 团队做了一个令人敬佩的决定:全部开源

  • 三个模型的权重
  • 所有训练数据
  • 全部代码
  • 200题的 Nemotron-IMO-Bench 评测集
这意味着任何研究者都可以复现、验证、改进这项工作。在 AI 领域越来越封闭的今天(许多顶尖模型都是黑箱),这种开放精神尤为珍贵。

4. 验证的困境与机遇

Nemotron 在第3题和第6题上的"自我高估"揭示了一个深层问题:AI 如何判断自己的证明是否正确?

在最高难度的数学问题上,即使 AI 的验证器也可能会出现"盲区"。这与人类数学家的经验相呼应:最难的错误不是计算错误,而是逻辑上的微妙漏洞——那些"看起来对"但实际上有问题的论证。

解决这个验证问题,可能是通往更强 AI 数学家的关键钥匙。


🌌 结语:当机器开始证明定理

两千年前,欧几里得在《几何原本》中写下第一个数学证明时,他开启了一场人类智力的史诗。

两千年后,一台机器坐在 IMO 的"虚拟考场"里,用数十亿次计算和数百次尝试,写下了自己的第一个金牌级证明。

这不是终点。Nemotron 的 30 分虽然跨越了金牌线,但距离满分 42 分还有距离。第3题和第6题仍然像是两座未被征服的高峰,等待着下一个突破。

但历史会记住这一刻:

2026年,人工智能第一次在国际数学奥林匹克上夺得金牌。

不是因为它比人类更聪明,不是因为它有某种神秘的数学直觉,而是因为它学会了系统性地搜索、严格地验证、不懈地改进——这些正是人类数学家数百年来的工作方式。

也许,真正的数学天才不是那些能一眼看穿答案的人,而是那些愿意在黑暗中摸索、在错误中学习、在无数次失败后依然坚持的人。

从这个意义上说,Nemotron 不仅是一台机器。

它是一位永不放弃的数学家


📚 参考文献

  • NVIDIA Nemotron Team (2026). *An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics*. arXiv:2609.10712.
  • OpenAI (2024). *Learning to Reason with LLMs*. OpenAI Blog.
  • DeepSeek-AI (2025). *DeepSeek-V4 Technical Report*. arXiv:2505.10047.
  • Trinh, T. H., et al. (2024). Solving olympiad geometry without human demonstrations. *Nature*, 625, 476-482.
  • Polu, S., & Sutskever, I. (2020). Generative language modeling for automated theorem proving. *arXiv preprint arXiv:2009.03393*.
  • Welleck, S., et al. (2022). NaturalProofs: Mathematical theorem proving in natural language. *arXiv preprint*.
#论文 #arXiv #IMO #Nemotron #数学 #人工智能 #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens