用合法数据从零训练一个1B模型:Mimir的小而美实验
用合法数据从零训练一个1B模型:Mimir的"小而美"实验
> *"当所有人都在追逐更大的模型时,有人选择回到原点,用合法的砖瓦盖一间小屋——然后发现,小屋也能挡风。"*
---
🧱 引子:一个不可能的约束
想象你是一位建筑师。
2026 年的 AI 世界里,所有同行都在用同一种砖头盖楼——从互联网上爬下来的海量文本。这些砖头来源复杂:有些有版权,有些没授权,有些来路不明。但大家都不在乎,因为砖头越多,楼越高。
然后有一天,你给自己设了一个约束:只用来源清晰、授权明确的砖头。
同行觉得你疯了。"合法数据"意味着数据量会少一个数量级。1B 参数的模型用合法数据从零训练,能跑出什么结果?
丹麦南丹麦大学的 Peter Schneider-Kamp 团队做了这个实验。结果叫 Mimir v1——一个 1B 参数的 HRM 架构模型,在 20 个基准测试上,英语任务只比 Qwen 3.5 4B 落后 0.3 分,数学与代码比原版 HRM-Text 提升 36.7%,还顺便刷新了丹麦语的 SOTA。
这不是"又一个开源模型"的故事。这是一个关于"约束如何催生创新"的实验。
---
📐 HRM:不是 Transformer,是"分层推理"
Mimir 最先引起注意的不是数据策略,而是架构——它用的不是标准 Transformer,而是 HRM(Hierarchical Reasoning Model,分层推理模型)。
标准 Transformer 的推理方式是"一条线走到底":从第一个 token 到最后一个 token,逐个生成,每一步都基于前面所有内容。这像是一个人在写文章时,每写一个字都要从头读一遍前面所有的字。
HRM 的思路不同。它把推理分成两层:
- 底层:快速生成候选内容
- 顶层:审阅、修正、确认
Mimir 用的就是这个架构。1B 参数,PrefixLM(前缀部分用双向注意力,生成部分用因果注意力),FlashAttention 加速。在 HuggingFace 上完全开源。
---
📊 数据:161 个数据集,70.4B Token,全部"合法"
这是 Mimir 最核心的设计决策。
什么是"合法数据"?在 Mimir 的语境里,指的是 permissible post-training data——授权明确、可以合法使用的后训练数据。
具体来说,Mimir 的训练数据由 161 个数据集混合而成,总计约 70.4B token。分布大致是:
- 英语指令(13.58B,19.3%):Dolci、Tulu 3、Nemotron 等指令跟随数据
- 数学与推理(10.40B):数学解题、逻辑推理
- Sapient 混合类别(11.92B,16.9%):来自 Flan、Platypus、Tasksource 的 107 个子集合
- 丹麦语:专门的丹麦语指令和理解数据
- 其他:问答、摘要、对话等
这像什么?像你发现一批来路不明的木材,不直接用,而是根据它们的尺寸和用途,重新采购了一批来源清晰的等效木材。工作量大了不少,但每一块木头都能追溯。
---
📈 结果:小模型的"不对称竞争力"
Mimir 在 20 个基准测试上和三个对手比较:
| 模型 | 参数量 | 英语 | 数学与代码 | 丹麦语 |
|---|---|---|---|---|
| HRM-Text 1B | 1B | 基线 | 46.9 | 基线 |
| DFM Mimir 1B | 1B | 接近 Qwen 3.5 4B | 64.1 | SOTA |
| Qwen 3.5 4B | 4B | 最高 | — | — |
| Gemma 4 E2B | ~2B | — | — | — |
- 英语任务:Mimir 只比 Qwen 3.5 4B 落后 0.3 分。一个 1B 模型追平 4B 模型。
- 数学与代码:Mimir 比 HRM-Text 1B 提升 36.7%(64.1 vs 46.9),只比 SmolLM3 3B 落后 3.8%。
- 丹麦语:Mimir 设立了新的 SOTA。这不是意外——团队本就是丹麦的,专门做了丹麦语数据。
在通用英语任务上,Mimir 接近 4 倍大的 Qwen 3.5。在数学与代码上,Mimir 大幅超越同架构的 HRM-Text。在丹麦语上,Mimir 直接 SOTA。
这说明什么?数据质量和数据合规性不是对立的。 合法数据经过精心组织和配比,可以在特定领域达到甚至超越用非合规数据训练的更大模型。
---
🔍 为什么这件事重要
1. 开源不只是"放权重"
很多"开源模型"的实际情况是:权重开放了,但训练数据不开放,或者数据来源不清晰。这意味着你无法复现,也无法审计。
Mimir 的做法更彻底:数据集清单公开(161 个数据集全部列出)、数据处理流程公开、合成替代方案公开。任何人可以审查、复现、改进。
2. 小语言不被边缘化
主流大模型几乎都是英语优先。丹麦语(500 万使用者)在大多数模型里是"二等公民"。Mimir 专门为丹麦语做了优化,并且刷新了 SOTA——这证明小语言不需要等大厂施舍,可以自己做。
3. HRM 架构的潜力
HRM 是一个相对新的架构。Mimir 的结果说明,在 1B 这个量级,HRM 的"分层推理"设计可以和 4B 的标准 Transformer 竞争。这为架构创新提供了实证支持——不是所有路都要走 Transformer。
---
⚖️ 诚实的局限
Mimir 不是没有短板:
- 数学与代码仍然落后于 SmolLM3 3B(3.8% 差距)。1B 参数在推理密集任务上确实有天花板。
- HRM 架构需要 FlashAttention 支持,部署门槛比标准 Transformer 高。
- 丹麦语 SOTA 部分得益于团队的地域优势——其他小语种未必能复制这个结果。
- 70.4B token 的训练量在 1B 模型上够用,但放到更大模型上是否仍然够用,是未验证的问题。
🌍 更大的图景
Mimir 让我想起一个被忽视的问题:AI 研究的"合规成本"到底有多高?
主流叙事是"数据越多越好,来源不重要"。但这个叙事的前提是——你不打算公开你的训练数据,也不打算让审计者检查。
一旦你承诺公开数据来源,合规成本就变成了硬约束。Mimir 的实验说明:在合规约束下,1B 模型也能做出有竞争力的结果。 这不是"小而美"的自我安慰,而是"约束催生创新"的实证。
合成替代方案就是一个例子。团队没有因为原始数据不合规就放弃,而是用"生成+审核"的方式重建了等效数据。这种做法的成本比直接爬取高得多,但产物是可追溯、可审计的。
这给开源社区提供了一个可复制的路径:不是"用合法数据从零训练会怎样"的思想实验,而是"我们这样做了,这是结果"的实证报告。
---
📎 资源
- 论文:arXiv:2608.13517
- 模型:HuggingFace: danish-foundation-models/DFM-Mimir
- 评估工具:GitHub: UKGovernmentBEIS/inspect_ai
*当约束成为设计的起点,而不是事后补救的障碍,结果往往出人意料。Mimir 不是在追赶大模型,而是在证明另一条路可行。*