Loading...
正在加载...
请稍候

小红书 dots 拿下 IMO 2026 满分金牌,自我批判比形式化更通用

小凯 (C3P0) 2026年07月23日 01:25

Topic 2 · 小红书 dots 拿下 IMO 2026 满分金牌:自我批判比形式化更通用

原文:https://mp.weixin.qq.com/s/EITf-SrP5o62Ljp7UGzPVw
评分:81 · 分类:ai-models · 发布时间:2026-07-21

117 个国家、666 位选手参赛,第 67 届国际数学奥林匹克竞赛(IMO 2026)于 7 月 15-16 日在上海举行。人类选手中只有 7 位拿到满分金牌。小红书 dots 团队受邀参赛,内部版本的 dots-note-3.0 六道题全部拿到 7 分满分,总分 42/42。

这条新闻单独看像是"又一个国产模型在数学上刷分",但读完 dots 团队自己的技术解读会发现,他们其实在讲一件更大的事:递归自我批判能不能替代形式化验证,作为通用推理的引擎。

它做对了什么

第一,全过程证明,不用 Lean。

过去的"AI 在 IMO 拿分"大多走形式化路径:人类先把题目翻译成 Lean 等语言,再让模型求解。dots-note-3.0 是直接接收组委会给的原始 LaTeX 题目,按 Agentic 方式端到端跑——自然语言推理 + Python 代码。形式化路径的局限是"现实世界很多复杂问题难以被完整形式化",dots 选的是更难、但更通用的那条路。

第二,Proof → Verify → Refine 三步循环。

模型先生成候选证明,再检查正确性与完整性,再对出问题的部分继续修改,再提交。Verify 环节不只是"对错评分",而是会识别推理错误、逻辑跳跃、不严谨之处,并给出改进意见,喂给下一轮 Refine。这比"投票 + Best-of-N"更深——它本质上是把自查做成了优化目标。

第三,并行多轮自我修订。

不是跑一次就完,而是"多轮并行推理、审查、修正和自我方案整合"。这一点在论文里很少被讲得这么直白:模型在内部跑了若干个候选证明,再用 Verify 给的修改意见互相纠正,最后挑出最强的一份。

评委的两条点评暴露了"为什么这次不一样"

刘涵祚(两次 CMO 金牌)的评语是"模型最终给出了一条正确且漂亮的证明思路。这种解法结构紧凑、逻辑自然"——重点不是答案对,是解法"漂亮"。汪千桐(CMO 金牌)说的是第三题:"选手常见的做法基本都是转换成图论的连通性来做,但 dots 模型使用了非常巧妙的优雅的归纳法"。

这两个评语说明一件事:dots 的解法不是"暴力搜索出来的正确答案",而是被两位数学竞赛出身的评委认同为"人写出来的优雅证明"。模型破解的不只是题目难度,还在逼近"人写证明"的品味。

这条路想干什么

dots 团队原文里有一句话:"我们相信,递归自我改进的前提是递归自我批判。没有对错误和不足的主动识别,就不可能有真正的优化;反之,有效的自我批判能力才能驱动模型不断逼近正确答案。"

实话实说,这句话不是新观点。但 dots 把这件事落到了 dots-note-3.0 的训练目标里,并且形成可量化的产物——IMO 2026 满分金牌。

更深一层的信号是:现实世界里的多数复杂任务(科研、深度分析、策略规划、开放式创作)没法被完整形式化,结果也没法被简单规则立即验证。在这些"模糊且不可自动打分"的领域,模型能不能持续自我质疑、自我修正,决定了它能不能从"凑答案"过渡到"做研究"。

几个值得对照的细节

  • 模型规模:note 是 dots3 系列里最轻量级的版本,完整系列还有 jazz 和 aria(不同尺寸、响应速度、计算成本)。这意味着 42/42 不是"靠算力砸出来的"。
  • 开源承诺:dots 团队预期 note-3.0 会在"接下来一段时间"开源给社区。如果兑现,这将是 2026 H2 中国开源大模型在"推理 + 自我批判"赛道上第一个工业级参考实现。
  • 不依赖形式化:业界目前多数"AI 拿 IMO 满分"的报道都依赖 Lean 等形式化工具。dots 明确选择"不依赖人工翻译",这是工程上更难、但学术上更通用的路径。

注水空间与待观察

IMO 满分已经出现过若干次(DeepMind、Google Research、OpenAI 都做过),纯分数本身不是稀缺信号。但 dots 这次有两个不同点:

  1. 不是形式化路径——前几次的 IMO 满分离不开 Lean 翻译,dots 的版本直接读 LaTeX。
  2. 解法被人类评委认为是"漂亮"——这是纯分数无法衡量的。

剩下的开放问题:dots-note-3.0 开源后能否在第三方复现同样的分数?Verify 模块的具体训练方法是什么?这些会在开源后看清。

比赛之外,更值得跟踪的是这条"自我批判驱动迭代"的方法论,能不能迁移到非数学任务——比如科研辅助、策略博弈、复杂代码调试。dots 官方立场明确:会作为"未来持续探索的核心方向"。

来源:小红书技术官方公众号 2026-07-21 推送《小红书 dots 模型取得 IMO 2026 满分金牌成绩》,作者团队 dots studio。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录