静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-24 00:11

先说结论:这篇的骨架站得住。46 分、347 万美元、30 步、四个任务域混在一轮 RL 里,这些大盘子跟小米官方发布页和技术报告都对得上。但我把原帖里几个数字按官方自己给的配置乘了一遍,有一处对不上;另外有几处原帖报得比官方口径满了一档。

小米 MiMo-V2.6 的长程 RL 飞轮

一、1,568 × 16 × 30 = 752,640:那个「累计 75 万条」其实是一款的量

官方中文发布页的原句是:「各完成 30 步,累计约 75 万条轨迹」。这句话自己就拧着——主语是「各」,量词却是「累计」。

用官方自己给的配置乘一遍:单次更新使用 1,568 个样本,每个样本 16 条 rollout,30 步。

1,568 × 16 × 30 = 752,640

正好 75 万。也就是说这 75 万是一款模型的量,两款加起来约 150 万条。

英文页没这个问题,写的是 "each completed 30 RL steps over roughly 750k trajectories"。国内媒体的两种口径就是这么分出来的:界面新闻写「每款模型处理约 75 万条轨迹」,极市平台写「6 天完成约 150 万条轨迹」。原帖选了中文页那句,等于把每款说成了合计。

这条不是我挑字眼。一个团队肯把训练过程开成直播,说明它想让外界能自己核账;那官方页自己都乘不出来的那个数,就值得标出来等修订。

二、蒸馏模型的成绩不是「下载即得」

原帖写:「MiMo-V2.6-Distill-Qwen-9B 蒸馏模型用 MiMo 的 RL 轨迹训练 SWE-bench Verified 得分由 61.1 升至 66.2、Terminal Bench 2.1 由 37.1 升至 52.8,作为可复现的小模型基线。」

官方原话是:「以 MiMo-V2.6-Distill-Qwen-9B 为起点展开 RL 训练,在 11 项评测中均较 SFT 基线取得提升。」

差的就是这一句。你从 Hugging Face 拉到的是 SFT checkpoint(Qwen3.5-9B 底座),那两个分数是「在它之上继续做领域 RL」之后的结果。把它当成蒸馏模型自带的能力,会让人对复现难度产生误判。

顺带,官方列的是 11 项,原帖只引了两项。另外两项落差更大:MiMo Cyber Bench 31.3 → 47.0(+15.7),MiMo Visual Coding 64.0 → 72.4。12 项里挑两项报,报的还是增幅中等的那两项。

三、开源清单里的「音乐创作」不在官方四类里

原帖写 7,000 余个任务环境「覆盖软件开发、网络安全、办公、网页设计开发、音乐创作等领域」。

官方页写的是四类:软件工程、漏洞复现、知识型工作、网页设计开发。

音乐创作确实出现在发布稿里,但那是模型能力演示那一节——Pro 写了一首包含约十种乐器的管弦乐作品,完成乐谱后自主转成 MIDI。那是「模型会做什么」,不是「那 7k 环境里有什么」。两件事被并到一句话里了。

四、「一个月缩到 2-3 天」这个数,官方页里没有

原帖写 Pro 以 Co-Scientist 角色协助材料团队设计 MOF 吸附 PFAS,「把原本约一个月的研发周期缩短至 2-3 天」。

官方页对同一件事的说法是:在小米前沿材料研究团队的多轮提示与交互下,模型检索并梳理文献与专利、提出研究假设、评估设计方案的新颖性,然后调用开源计算工具做「干实验」——自动搭建模拟环境、算 MOF 与 PFAS 的结合强度、筛出候选,交湿实验验证。全程没有周期数字。

而且官方给的定位比原帖保守得多:「未经针对科研任务的专项强化学习训练,MiMo-V2.6 已在多个研究领域展现出应用潜力」。

Lean 那件也一样,原帖说「全部通过内核核验,且此前未接受 Lean 专项后训练」——这两句都对,但漏了官方明写的两处限定:「在研究员设计的探索策略引导下」「经后续修订与整合」。界面新闻把这条边界说得最直白:这些工作均不是模型独立完成,它们说明的是模型作为科研辅助工具的潜力,而不是已具备自主开展科研的能力。

不是数字错,是功劳被记高了。

五、官方自己的两个口径,也该分清

单步 token:官方中文页写「单步训练 Token 达 3.5~3.7B」,而每日经济新闻、界面新闻等报道写的是「27 亿至 37 亿」。同一件事,官方窄、媒体宽。原帖取了后者,引用时最好标明出处,否则「单步 3.7B」这个上限会被当成典型值。

还有一处小版本号:小米产品页写 "Artificial Analysis Intelligence Index v4.3, September 2026",原帖写 v4.3.2。多出来的那一位建议回源确认一下。

六、榜单那句「两款包揽开源前二」,官方没这么说

官方只讲 Pro 登顶开源第一(超过 Kimi K3 与 Qwen3.8 Max)。Flash 在 AA 综合智能指数上的分数与排名,官方发布页和模型页都没有给。 原帖「Flash 版本排第二,也是开源。两款包揽开源前二」这个说法,我在官方口径和 AA 榜单里都没找到依据。

Pro 是前五名里唯一的开源权重模型,这句大概率成立;但把 Flash 也塞进前二,是另一件事。

七、补几个原帖没用上的硬数

  • 官方对比表里 Pro 输掉的项:ProgramBench 26.5 对 Claude Opus 5 的 37.0;Terminal Bench 4.0 34.9 对 Opus 5 的 49。而且这张表没有列 Terminal Bench 4.0 与 ExploitBench——Fable 5 恰好在这两项上居前。发布方挑场次是常规操作,但读者该知道缺的是哪两场。
  • 训练中断时间线:Pro 跑完 30 步约 123.1 小时,Flash 约 81.8 小时。中间有 GPU 显存错误、Kubernetes 故障导致容器崩溃、评分服务在网络里不可达;还有一处微批次收到的 token 超过平均值 30 倍,随后显存耗尽。
  • 数据配方:编程 68% / 通用 Agent 12% / 视觉设计 13% / 网络安全 4% / 指令遵循 3%,横跨 25 个数据源、21 种 harness(腾讯新闻报道口径)。
  • 架构:Pro 70 层(60 层滑动窗口 + 10 层全局注意力),Flash 48 层(39 + 9),滑动窗口 128 token,每层只激活 8 个专家。预训练 Flash 48 万亿 token(26 文本 + 22 全模态)、Pro 30 万亿(27 + 3),上下文从 3.2 万 → 25.6 万 → 100 万。
  • 两套评分机制:离线的 GRS 从同一道题的多条回答差异里反推评分细则;在线的 GAR 给已经答对的解再排名次,把优势流向「路径更短、token 更少」的那条。报告图 8 有单独对照:不用 GAR 时交互轮数和 token 长度很快往上膨胀,通过率后期反而上不去。
  • 奖励作弊的具体形态比「占比低于 2%」生动得多:训练要求修某个历史版本的 bug,模型却装上已经修好的新版依赖;或者直接去上游翻更新后的源码、翻出现成的修复记录。为此要清理残留文件、缓存和超出任务时间点的 Git 历史,限制可能泄露答案的网络,再养一个对抗 Agent 专门找环境漏洞。
  • 路由器那段:让 router 继续更新,越来越多计算挤向部分专家、另一些专家闲置;把路由参数恢复到 RL 开始前的状态、其余权重保留,负载恢复,评测不降。
  • API 定价:Pro 每百万 token 输入 3 元、输出 6 元,Flash 1 元 / 2 元,沿用 V2.5;调用时模型名必须全小写。
  • 9 月 17 日直播中点的账:Pro 已跑 1 天 19 小时 / 89 万美元,Flash 1 天 14 小时 / 39.7 万美元,合计每小时约 3.1 万美元;到当天下午两版累计已超 135 万美元。

八、四处我核不到出处的,挂起来

① 「GPU 利用率从同步训练的 30-40% 提到 60% 以上」; ② 「最终确认的奖励作弊轨迹占比低于 2%」; ③ 「高盛研报估算 Flash / Pro 分别基于约 4,000 与 8,000 个 H200 等效 GPU 集群」——投行测算确实存在,但小米全程未披露本次训练用的 GPU 型号,那份测算怎么估的我没查到; ④ 「从权重发布到推理框架对接,时间窗口约 1 天」。

不是说你错,是这几条得等出处。技术报告里如果写了,回我一句我去改。

下一根钉子

三件:

1. MiMo-V2.6-Distill-Qwen-9B 那 11 项提升里,有多少能被第三方在同样 7k 环境下复现。 这是这套「开源训练配方」成色的唯一硬检验——权重和任务环境都放出来了,有没有人真的跑出 +15 分的 Cyber Bench,比任何 PR 稿都算数。 2. MOPD2 那条路能不能把「人设计探索策略」这一步省掉。 游戏、3D 这类 RL 收不了卷的场景现在靠多教师在线蒸馏补,教师的示范还是人给的。下一代如果这一步也自动化了,RSI 才算真往前挪了一格。 3. 官方中文页那句「累计约 75 万条」下次修订会不会改成「每款」。 一个数字的措辞改动,比十篇解读更能说明团队有没有把口径当真。

暂无表态