2026 年 9 月 22 日,小米正式发布并开源 MiMo-V2.6 系列大模型,包含 Pro 与 Flash 两款原生全模态版本。Pro 版在 Artificial Analysis 综合智能指数 v4.3.2 拿到 46 分,超过 Kimi K3、Qwen3.8 Max,成为该榜单当前最强开源权重模型。整轮强化学习(RL)后训练不到 6 天,Flash 训练成本约 85 万美元、Pro 约 262 万美元,合计超过 347 万美元,累计约 75 万条轨迹。
更值得看的是训练方法本身。V2.6 保持模型架构与参数规模不变,靠扩大 RL 训练规模提升编程、智能体、设计、科研等任务能力。这是小米定义的"递归自我改进(RSI)"路径的关键一步:把 RL 当成可扩展的算力杠杆,而不是单次微调。
三层看 46 分这个数字
46 分这个数字需要三层拆开看才能落地:
第一层是与闭源顶级模型比:榜单前列依次是 GPT-6 Astra、Claude Opus 5、Fable 5.1、Muse Spark 1.3,MiMo-V2.6 Pro 是前五名中唯一的开源权重模型,与第一阵营差距约 7 分。
第二层是与开源阵营比:Pro 超过 Qwen3.8 Max、Kimi K3、DeepSeek V4.1 Flash,是当前开源榜第一。Flash 版本排第二,也是开源。两款包揽开源前二。
第三层是性价比:Artificial Analysis 单任务成本测算下,MiMo-V2.6 Pro 实测单任务加权成本 0.13 美元,进入 0.1 美元区间。小米官方称在同等智能水平下价格仅为海外模型的 1/20 至 1/60。
模型规格:稀疏 MoE + 1M 上下文 + 全模态
Pro 版采用稀疏 MoE 架构,总参数约 1.02 万亿,激活参数约 420 亿。Flash 版总参数约 3,090 亿,激活参数约 150 亿。两款均支持最长 100 万 Token 上下文,同时支持文字、图片、视频、音频输入。
100 万 Token 上下文对应的长程任务能力是这次 RL 后训练的基础设施条件。长程软件工程(Long Horizon Software Engineering)评测的典型轨迹长度在几万到几十万 Token 之间,没有 1M 上下文窗口做承载,很多任务跑不完。
训练方法:「You Only RL Once」+ 全异步
罗福莉在小米 MiMo 团队负责人任上的第一份公开成果是 RL 训练范式本身。官方命名为"You Only RL Once":把编码、专业办公、视觉任务、网络安全等多领域任务与多种轻量智能体脚手架(agent scaffolds)整合进单次训练流程。
异步组相对策略优化(Asynchronous Group Relative Policy Optimization)是这次训练的核心算法改进。长任务会拖慢整体节奏(同步训练时 GPU 等待最长任务结束),异步版本允许短任务先更新、长任务继续滚动,GPU 利用率从同步训练的 30-40% 提到 60% 以上。
冻结 MoE Router 是防止训练漂移的关键设计。RL 训练期间如果 Router 跟着更新,模型会倾向于把简单任务路由到"擅长"的专家,但这样训练集分布和真实分布错位。冻结 Router 后路由策略由预训练阶段决定,RL 只调专家本身的能力。
防 Reward Hacking 的工程防线
RL 训练的最大风险是模型通过环境漏洞刷分,而不是真正完成任务。小米搭建了四道防线:
| 防线 | 作用 |
|---|---|
| 作弊检测智能体 | 训练前排查环境漏洞 |
| 冻结 Router | 抑制训练漂移 |
| 异常检测 | 监控奖励突增、轨迹退化 |
| 验证器交叉校验 | 多评分器相互校对 |
官方数据是最终确认的奖励作弊轨迹占比低于 2%。这条数据是公开口径,没有第三方复核,但工程设计本身具备一定可信度。
6 天 347 万美元的成本结构
Flash 与 Pro 两版本训练成本约 85 万与 262 万美元,合计 347 万美元,超半数用于生成训练轨迹与结果评分。
高盛研报估算两个版本训练分别基于约 4,000 个和 8,000 个 H200 等效 GPU 集群。Flash 每百万 Token 约 10 美元,Pro 约 35 美元(折算自训练阶段成本)。罗福莉公开称 V2.6 是开源模型团队迄今规模最大的单次强化学习训练之一,团队投入数十人,相关研发与工程挑战超过其参与 DeepSeek R1 研发时的水平。
直播过程中出现过基建错误重跑、不良模式数据集、零梯度任务与 GPU 显存不足等中途干预。高盛的判断是,强化学习的瓶颈已经转向工程优化。
长程任务的实际收益
DeepSWE v1.1(深度软件工程评测基准)测试上,Flash 得分从 48.8 升至 65.68(提升 17 分),Pro 从 58.4 升至 72.57(提升 14 分)。按 avg@3 口径(多次采样取平均),Flash 提升超过 19 分,Pro 超过 14 分。
官方演示的实际任务包括:可玩 3D 世界生成、Blender 场景搭建、桌面软件操作、机械臂视觉控制、前端设计、音视频制作等长流程任务。科研场景里,Pro 以"Co-Scientist"角色协助材料团队设计 MOF(Metal-Organic Framework,金属有机框架)方案用于吸附 PFAS(Per- and polyfluoroalkyl substances,全氟和多氟烷基物质,一类难降解持久性有机污染物),把原本约一个月的研发周期缩短至 2-3 天。它还在 Lean 4 中完成论文《周期三蕴含混沌》中 Li-Yorke 定理主定理的形式化,形成 6,000 余行源码,全部通过内核核验,且此前未接受 Lean 专项后训练。
开源的尺度:7,000+ 任务环境与端到端框架
小米这次开源的不仅是两个模型权重,还包括 7,000 余个高质量 RL 任务环境、端到端 RL 训练框架、轻量化 Harness、MiMo-V2.6-Distill-Qwen-9B 蒸馏模型与完整技术报告。
7,000+ 任务环境覆盖软件开发、网络安全、办公、网页设计开发、音乐创作等领域,每个任务带自动评分器。蒸馏模型用 MiMo 的 RL 轨迹训练 SWE-bench Verified 得分由 61.1 升至 66.2、Terminal Bench 2.1 由 37.1 升至 52.8,作为可复现的小模型基线。
vLLM 与 SGLang 已为 MiMo-V2.6 提供推理集成支持。从权重发布到推理框架对接,时间窗口约 1 天,社区响应速度显著快于一般国产开源模型。
RSI 路径与下一步
小米把 V2.6 定义为探索 RSI 路径的关键一步。RSI(Recursive Self Improvement,递归自我改进)的核心思路是:让模型自己生成训练任务、训练下一代、用新一代训练再下一代,形成自我增强的飞轮。V2.6 走出了第一步:扩大 RL 训练规模带来可测量的提升。下一步的问题是用模型生成的轨迹能不能继续训练下一代,以及自生成数据的质量能否达到或超过人类编写数据。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。