小米 MiMo 团队 9 月 22 日发布并开源了 CodeMidas。这个名字把 Midas 国王点石成金的典故反过来用,代码里的金子需要被挖出来。整套管线把 GitHub 开源仓库里已经被实现的功能,转成可执行的强化学习训练环境。MiMo-V2.5 用这些环境训练之后,在 DeepSWE、ProgramBench、Terminal-Bench v2.1 三套编码评测上分别提升 11.7%、17%、8.5%。
这条路为什么走通了
写代码的 RL 训练卡在两件事上:任务从哪儿来,谁来判定对错。
之前的工作多数从 issue 或 commit 出发。问题在于,仓库里已经实现的功能远比发出去的工单多。一段 parse_url、一个排序算法、一组配置解析逻辑,都是开发时写下来、之后很少被改动的行为。这些行为对模型来说就是天然的任务:从输入到输出,能写测试,能跑通。
CodeMidas 的核心思路是闭路迭代。
每一步的判断标准很硬:测试要能跑出来、随机走捷径过不了、几轮 rollout 的解里能找到正确答案。整套管线不需要预存的 issue 数据库,也不需要人工写 prompt。
数据到底有多大
最终落地的训练集覆盖 3,185 个开源仓库、23 种编程语言、15 个技术领域,共 5,545 个任务。
单看 ProgramBench 的 17%,从基线到 RL 后是这个评测自发布以来提升最大的一次单点跨越。Terminal-Bench v2.1 的 8.5% 出现在"终端环境里操作"这一档,这种场景历来对模型训练数据稀疏。
Ablation 的结论也很直白:高质量任务越多,性能越好。曲线没有明显饱和。
为什么这条路线比"刷 issue"走得远
从 issue 出发训练 coding agent 的天花板被两层卡住:
- 任务覆盖率:开源仓库里已实现的功能比被报告过的 bug 多几个数量级。
- 验证可信度:测试是从 issue 描述反推的,往往依赖人工维护;CodeMidas 直接用原始代码运行生成测试,能在多轮 rollout 里挑出偶然通过的任务。
这套范式把仓库当成训练材料库,而不是把它当成要修的项目。任务来源的边界被推到了所有写过的代码,不只是报上来的问题。
行为上发生了什么变化
轨迹分析显示,RL 训练后的 MiMo-V2.5 在两件事上明显改观:
- 探索更彻底:从仓库入口往里走的步数更长,会调进子目录看实现细节,而不是停在 README 与接口签名。
- 自验证策略更多样:跑测试、对照预期输出、比对多种解的差异,不再只看一处。
这跟 RL 任务设计是闭环的,任务定义里就要求 agent 走出更深的轨迹,行为又被数据"教"得更彻底。
几个绕不开的限制
- 已实现行为 ≠ 完整规范:自动测试可能漏边界情况,比如异常分支、并发竞态。
- 重复 rollout ≠ 严格质检:再多次运行也不能替代人工抽检。
- 任务分布偏真实代码:少数教学型小练习库被筛掉,剩下的多数是工程实现,对模型的工程能力更友好,对竞赛编程帮助较小。
CodeMidas 解决的是训练任务的供给侧问题,不是测试正确性问题。下一步如果要把这条路线推到严肃基准,验证侧还得加人手。
MiMo 团队同步开源的"训练直播"
小米同时放出 MiMo-V2.6 全模态模型权重(含 Pro/Flash/Distill-Qwen-9B),以及端到端 RL 训练框架和 7,000+ 高质量 RL 任务环境。罗福莉(前 DeepSeek 研究员、2025 年 11 月加入小米带队 MiMo)主导的这场"训练直播"已在 Hacker News 上冲到 500+ 讨论分。MIT 许可证,可商用可微调。
训练过程披露得很彻底:30 步 RL,每步 1,568 prompt × 16 rollout = 25,088 次采样,每步消耗 35-37 亿 token,6 天完成。DeepSWE v1.1 上 Flash 从 48.8 升到 65.68,Pro 从 58.4 升到 72.57。
资料来源:Hugging Face Daily Papers、Xiaomi MiMo 公开页、网易/AGI HUNT 9-22 报道、CCTest 总结稿。
参考信源
- Xiaomi MiMo CodeMidas 项目页与开源仓库(9-22,Hugging Face Daily Papers):3,185 仓库 / 5,545 任务 / 23 语言 / 15 领域、+11.7% / +17% / +8.5%。
- 网易科技《小米 MiMo-V2.6 把大模型训练变成了"公开实验"》(9-22):6 天 30 步 RL、每步 25,088 次采样、Pro Flash 评测曲线、罗福莉背景。
- CCTest《CodeMidas Builds Coding RL Environments from Source Code》(9-22):四阶段管线、行为规范 + 测试构建 + 多轮 rollout 过滤的具体定义。
- AGI HUNT 9-22 Daily:CodeMidas 与同期 Xiaomi MiMo-V2.6 开源消息汇总。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。