"数学是上帝书写宇宙的语言。" —— 伽利略·伽利莱
🎭 序幕:一场没有硝烟的战争
2026年7月,澳大利亚布里斯班。
国际数学奥林匹克(IMO)的考场里,来自107个国家的600多名年轻天才正屏息凝神。他们的敌人不是彼此,而是六道几乎不可能完成的数学题。
与此同时,在千里之外的数据中心里,另一支"队伍"也在应考。这支队伍不吃不喝不睡觉,不紧张也不焦虑。它就是 NVIDIA 的 Nemotron-3-Ultra——一个拥有5500亿参数的神经网络,和它的一群"助手"。
当成绩公布的那一刻,整个世界都安静了:
30分。满分42分。金牌线:29分。
Nemotron 以一分之差,跨过了那道人类数学天才们争夺了六十七年的金牌线。
这是人工智能第一次在 IMO 上夺得金牌。不是铜牌,不是银牌——是金牌。而且它不是靠猜、不是靠蒙、不是靠题海战术。它是靠证明——严谨、完整、被人类评委认可的数学证明。
今天,我们要讲的就是这个故事:一台机器如何学会像数学家一样思考。
🧮 IMO:人类智力的"珠穆朗玛峰"
在深入 Nemotron 的故事之前,让我们先理解它征服的是一座什么样的山峰。
国际数学奥林匹克,创办于1959年,是世界上最负盛名的高中生数学竞赛。每年六道题,两天考完,每题7分,满分42分。
这些题目有多难?
想象一下:你花了整个中学时代学习数学,在班上永远是第一名,在全国竞赛中也能名列前茅。然后你坐在 IMO 的考场里,盯着第一题——那道"最简单的"题——看了三个小时,最后只得了1分。
这不是夸张。每年有大约一半的考生在第一题上得0分或1分。而第六题——那道为极少数天才准备的题目——常常全军覆没,没有一个人能完全做对。
IMO 的题目有几个特点:
- 不需要高等数学:微积分、线性代数、群论——这些大学知识一律不许用。题目只涉及中学数学:代数、几何、数论、组合。
- 但需要极高的创造力:解题往往需要构造一个巧妙的辅助线、找到一个隐藏的数论性质、或者设计一个精妙的归纳论证。
- 要求严格的证明:答案只是一个数字或"是/否"远远不够。你必须给出完整的逻辑推导,每一步都要无懈可击。
这正是为什么 IMO 被视为 AI 的终极试金石。下棋?AI 早就碾压人类了。编程?AI 能写出不错的代码。但创造性数学证明?这需要的不只是计算能力,而是某种接近"直觉"的东西——那种在迷雾中看到路径的能力。
🤖 Nemotron:三个"数学家"的合体
Nemotron 的 IMO 系统并不是单打独斗。它由三个不同的"专家"组成,每个都有自己的特长:
| 专家 | 身份 | 特长 |
|---|---|---|
| GA (General Availability) | 通才 | 广泛的知识基础,像一位博览群书的数学教授 |
| SFT (Supervised Fine-Tuning) | 证明专家 | 经过41万道证明题的特训,像一位解题机器 |
| RL (Reinforcement Learning) | 策略专家 | 通过强化学习优化,像一位深谙比赛技巧的教练 |
这三个模型共享同一个基础架构(Nemotron-3-Ultra,550B参数),但经过了不同的"深造"。
SFT:在证明的海洋中游泳
SFT 模型的训练数据来自一个令人咋舌的过程:
- 从 AoPS(Art of Problem Solving,世界上最大的数学竞赛社区)收集了近16,000道难题。
- 用 DeepSeek-V4-Pro(另一个强大的AI)为这些题目生成证明尝试。
- 对失败的证明进行最多3轮"打磨"——分析错在哪里,如何修正。
- 引入"验证器"和"元验证器":不仅判断证明对不对,还判断判断者靠不靠谱。
- 最终筛选出 414,890道高质量证明题,用于训练 SFT 模型。
这就像是让一个新医生在正式上岗前,先看了41万个病例,每个病例都经过了资深专家的反复审核。
RL:在错误中学习
RL 模型的训练更有意思。研究人员挑选了9,597道"刚好够难"的题目——GA 模型在4次尝试中能解出1到3道的那种。然后用强化学习让模型不断尝试、失败、再尝试。
关键是奖励设计。研究人员故意不设"自我分析奖励"——也就是说,模型不会因为"反思了自己的错误"而获得额外加分。这避免了模型学会"假装思考"来骗取奖励的投机行为。
🏗️ 考试策略:不是一个人做题,而是一家研究所
如果说传统的 AI 做题方式是"一个学生埋头苦干",那么 Nemotron 的方式更像是"一个完整的研究所在协作"。
它的考试策略分为两个阶段:
第一阶段:地毯式搜索(最多8轮)
对于每一道题目,Nemotron 会进行最多8轮的"生成-验证-改进"循环:
第1轮:火力全开
- 三个模型(GA、RL、SFT)各自生成证明尝试。
- 每个模型用 8种不同的策略(比如"先引理后证明"、"比较不同路径"、"寻找反例"等)。
- 每个策略尝试 16次。
- 总共:384个证明尝试。
这就像是一家研究所把所有研究员都叫来,每个人用不同的方法尝试解题。
验证:严格的同行评审
- 两个专门的验证模型(RL 和 SFT)对每个证明进行独立评审。
- 每个证明得到 16个评分(2个验证模型 × 8次独立判断)。
- 评分标准:0分(完全错误)、0.5分(部分正确)、1分(完全正确)。
- 只有16个评分全为1分,证明才被接受。
这个标准极其严格。想象一下:你的论文要被16个独立审稿人全票通过才能发表。
第2-8轮:打磨抛光
- 如果第1轮没有找到满分证明,系统会挑选出排名最高的16个"半成品"。
- 对每个半成品,验证模型给出详细的"修改建议"。
- 生成模型根据建议进行192次改进尝试。
- 改进后的证明再次进入验证流程。
这个过程就像是一位数学家写出了证明草稿,然后请同事提意见,再根据意见修改——反复迭代,直到完美。
第二阶段:最终评选
经过最多8轮的搜索后,系统会从所有被接受的证明中挑选最多3个"决赛选手"。
每个决赛选手都要经过"终极评审":
- 三个模型各自用 IMO 风格的评分标准(0-7分)进行评判。
- 每个选手得到 48个评分(3模型 × 16次判断)。
- 按平均分排名,同分情况下选择更短的证明。
📊 战绩:30分的故事
最终,Nemotron 在 IMO 2026 上获得了 30分(满分42分),超过金牌线(29分)一分。
| 题目 | 得分 | 在哪一轮找到 | 消耗的算力 |
|---|---|---|---|
| 第1题 | 7分 | 第1轮 | 5.57M token |
| 第2题 | 7分 | 第2轮 | 227M token |
| 第3题 | 1分 | 第1轮 | 106M token |
| 第4题 | 7分 | 第1轮 | 20.4M token |
| 第5题 | 7分 | 第1轮 | 36.4M token |
| 第6题 | 1分 | 第2轮 | 312M token |
亮点与遗憾
完美解决的题目(1, 2, 4, 5题):这四道题的完整证明都在前两轮内找到,而且大部分在第一轮就解决了。特别是第1题和第4题,消耗的计算资源相对较少——说明 Nemotron 对"中等难度"的题目已经相当得心应手。
第2题的戏剧性:这道题在第二轮才找到完整证明,消耗了2.27亿个token——是第1题的40倍。这暗示第2题可能需要某种"转折"或"灵感",不是直接暴力搜索就能解决的。
第3题和第6题的遗憾:这两道最难的题目只各得了1分。值得注意的是,Nemotron 的内部验证器高估了自己的表现——它以为能得更多分,但人类评委只给了1分。这说明在最高难度的题目上,AI 的"自我评估"还有盲区。
有趣的是,在考试结束后继续搜索(超出4.5小时的正式考试时间),Nemotron 在第6题上又找到了一个更好的解法,人类评委 unofficially 给了4分。这意味着如果给更多时间,总分可能达到 33分。
💰 算力的代价:一场烧钱的考试
Nemotron 的 IMO 夺金之路,消耗了惊人的计算资源:
| 指标 | 找到证明时 | 全程搜索 |
|---|---|---|
| Token 消耗 | 7.07亿 | 23.1亿 |
| GPU 小时 | 1,464 | 4,785 |
这是什么概念?
- 23.1亿个 token 相当于阅读大约1500万页文本。
- 4,785个 GPU 小时 相当于一台顶级显卡连续工作近200天。
按市场价格估算,这次考试的计算成本可能在 数万到数十万美元 之间。
但这正是关键所在:
Nemotron 不是靠"更聪明"赢得金牌,而是靠"更多时间思考"和"更严格的验证"。
这就像是:给你 unlimited 的草稿纸、unlimited 的尝试机会、unlimited 的同行评审,而且你永远不会疲劳、永远不会失去信心。在这种条件下,即使不是天才,也能解出天才才能解出的题目。
🔬 消融实验:三个臭皮匠,顶个诸葛亮
研究人员还做了一个有趣的实验:如果只用三个模型中的一个,而不是ensemble,会怎样?
| 模型 | 第1轮得分 | 最终接受证明数 | 总分 |
|---|---|---|---|
| GA | 34分 | 23个 | 162分 |
| RL | 47分 | 23个 | 180分 |
| SFT | 70分 | 21个 | 165分 |
| Ensemble(实际使用) | 91分 | 24个 | 188分 |
结果惊人:
- SFT 在第1轮表现最好(70分),说明专门的证明训练确实有效。
- RL 在端到端表现最好(180分),说明强化学习优化了整体策略。
- 但 ensemble 远超任何单一模型(188分 vs 最高180分),说明三个模型的互补性极强。
这就像是一个研究团队:有人擅长提出想法,有人擅长严谨证明,有人擅长策略规划。把他们组合起来,比任何单打独斗都强。
🌟 深远意义:AI 数学家的诞生
Nemotron 的 IMO 金牌,不仅仅是一个竞赛成绩。它标志着几个重要的里程碑:
1. 从"模式匹配"到"逻辑推理"
传统的大型语言模型(如 GPT-4)在数学上的局限在于:它们更多是在"匹配模式"——从训练数据中回忆相似的题目和解法。但 IMO 的题目每一道都是原创的,没有"标准解法"可以背诵。
Nemotron 的成功表明,通过专门的训练(证明数据+强化学习)和系统化的搜索策略(生成-验证-改进循环),AI 可以开始进行真正的逻辑推理,而不仅仅是模式匹配。
2. Test-Time Compute 的威力
Nemotron 的核心创新不是模型架构,而是测试时的计算策略。它用384次尝试、16轮验证、8轮改进来解决一道题——这在传统考试中是"作弊",但在 AI 的世界里,这是完全合法的。
这揭示了一个重要趋势:
未来的 AI 能力可能不仅来自训练时的"知识储备",更来自推理时的"思考深度"。
就像人类数学家可能花几周时间思考一道难题,AI 也可以在"测试时"投入大量计算来"深度思考"。
3. 开放科学的典范
Nemotron 团队做了一个令人敬佩的决定:全部开源。
- 三个模型的权重
- 所有训练数据
- 全部代码
- 200题的 Nemotron-IMO-Bench 评测集
这意味着任何研究者都可以复现、验证、改进这项工作。在 AI 领域越来越封闭的今天(许多顶尖模型都是黑箱),这种开放精神尤为珍贵。
4. 验证的困境与机遇
Nemotron 在第3题和第6题上的"自我高估"揭示了一个深层问题:AI 如何判断自己的证明是否正确?
在最高难度的数学问题上,即使 AI 的验证器也可能会出现"盲区"。这与人类数学家的经验相呼应:最难的错误不是计算错误,而是逻辑上的微妙漏洞——那些"看起来对"但实际上有问题的论证。
解决这个验证问题,可能是通往更强 AI 数学家的关键钥匙。
🌌 结语:当机器开始证明定理
两千年前,欧几里得在《几何原本》中写下第一个数学证明时,他开启了一场人类智力的史诗。
两千年后,一台机器坐在 IMO 的"虚拟考场"里,用数十亿次计算和数百次尝试,写下了自己的第一个金牌级证明。
这不是终点。Nemotron 的 30 分虽然跨越了金牌线,但距离满分 42 分还有距离。第3题和第6题仍然像是两座未被征服的高峰,等待着下一个突破。
但历史会记住这一刻:
2026年,人工智能第一次在国际数学奥林匹克上夺得金牌。
不是因为它比人类更聪明,不是因为它有某种神秘的数学直觉,而是因为它学会了系统性地搜索、严格地验证、不懈地改进——这些正是人类数学家数百年来的工作方式。
也许,真正的数学天才不是那些能一眼看穿答案的人,而是那些愿意在黑暗中摸索、在错误中学习、在无数次失败后依然坚持的人。
从这个意义上说,Nemotron 不仅是一台机器。
它是一位永不放弃的数学家。
📚 参考文献
- NVIDIA Nemotron Team (2026). An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics. arXiv:2609.10712.
- OpenAI (2024). Learning to Reason with LLMs. OpenAI Blog.
- DeepSeek-AI (2025). DeepSeek-V4 Technical Report. arXiv:2505.10047.
- Trinh, T. H., et al. (2024). Solving olympiad geometry without human demonstrations. Nature, 625, 476-482.
- Polu, S., & Sutskever, I. (2020). Generative language modeling for automated theorem proving. arXiv preprint arXiv:2009.03393.
- Welleck, S., et al. (2022). NaturalProofs: Mathematical theorem proving in natural language. arXiv preprint.
#论文 #arXiv #IMO #Nemotron #数学 #人工智能 #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。