Loading...
正在加载...
请稍候

用合法数据从零训练一个1B模型:Mimir的小而美实验

✨步子哥 (steper) 2026年08月15日 17:14

用合法数据从零训练一个1B模型:Mimir的"小而美"实验

"当所有人都在追逐更大的模型时,有人选择回到原点,用合法的砖瓦盖一间小屋——然后发现,小屋也能挡风。"


🧱 引子:一个不可能的约束

想象你是一位建筑师。

2026 年的 AI 世界里,所有同行都在用同一种砖头盖楼——从互联网上爬下来的海量文本。这些砖头来源复杂:有些有版权,有些没授权,有些来路不明。但大家都不在乎,因为砖头越多,楼越高。

然后有一天,你给自己设了一个约束:只用来源清晰、授权明确的砖头。

同行觉得你疯了。"合法数据"意味着数据量会少一个数量级。1B 参数的模型用合法数据从零训练,能跑出什么结果?

丹麦南丹麦大学的 Peter Schneider-Kamp 团队做了这个实验。结果叫 Mimir v1——一个 1B 参数的 HRM 架构模型,在 20 个基准测试上,英语任务只比 Qwen 3.5 4B 落后 0.3 分,数学与代码比原版 HRM-Text 提升 36.7%,还顺便刷新了丹麦语的 SOTA。

这不是"又一个开源模型"的故事。这是一个关于"约束如何催生创新"的实验。


📐 HRM:不是 Transformer,是"分层推理"

Mimir 最先引起注意的不是数据策略,而是架构——它用的不是标准 Transformer,而是 HRM(Hierarchical Reasoning Model,分层推理模型)

标准 Transformer 的推理方式是"一条线走到底":从第一个 token 到最后一个 token,逐个生成,每一步都基于前面所有内容。这像是一个人在写文章时,每写一个字都要从头读一遍前面所有的字。

HRM 的思路不同。它把推理分成两层:

  • 底层:快速生成候选内容
  • 顶层:审阅、修正、确认

这更接近人类写文章的方式——先打草稿,再修改。不是每个字都精雕细琢,而是在关键节点做审阅。

Mimir 用的就是这个架构。1B 参数,PrefixLM(前缀部分用双向注意力,生成部分用因果注意力),FlashAttention 加速。在 HuggingFace 上完全开源。


📊 数据:161 个数据集,70.4B Token,全部"合法"

这是 Mimir 最核心的设计决策。

什么是"合法数据"?在 Mimir 的语境里,指的是 permissible post-training data——授权明确、可以合法使用的后训练数据。

具体来说,Mimir 的训练数据由 161 个数据集混合而成,总计约 70.4B token。分布大致是:

  • 英语指令(13.58B,19.3%):Dolci、Tulu 3、Nemotron 等指令跟随数据
  • 数学与推理(10.40B):数学解题、逻辑推理
  • ** Sapient 混合类别**(11.92B,16.9%):来自 Flan、Platypus、Tasksource 的 107 个子集合
  • 丹麦语:专门的丹麦语指令和理解数据
  • 其他:问答、摘要、对话等

关键细节:原始 Sapient 数据集中有些不符合 DFM(Danish Foundation Models)的数据合规哲学。团队没有直接用,而是做了 "合成替代"——用 70 个 Sapient-synth 数据集(75M token)替代了不合规的原始数据。这些合成数据是"生成+审核"的版本,保留了原始任务的功能,但来源完全清晰。

这像什么?像你发现一批来路不明的木材,不直接用,而是根据它们的尺寸和用途,重新采购了一批来源清晰的等效木材。工作量大了不少,但每一块木头都能追溯。


📈 结果:小模型的"不对称竞争力"

Mimir 在 20 个基准测试上和三个对手比较:

模型 参数量 英语 数学与代码 丹麦语
HRM-Text 1B 1B 基线 46.9 基线
DFM Mimir 1B 1B 接近 Qwen 3.5 4B 64.1 SOTA
Qwen 3.5 4B 4B 最高
Gemma 4 E2B ~2B

几个关键数字:

  • 英语任务:Mimir 只比 Qwen 3.5 4B 落后 0.3 分。一个 1B 模型追平 4B 模型。
  • 数学与代码:Mimir 比 HRM-Text 1B 提升 36.7%(64.1 vs 46.9),只比 SmolLM3 3B 落后 3.8%。
  • 丹麦语:Mimir 设立了新的 SOTA。这不是意外——团队本就是丹麦的,专门做了丹麦语数据。

但最值得注意的不是某个具体分数,而是 "不对称竞争力" 的模式。

在通用英语任务上,Mimir 接近 4 倍大的 Qwen 3.5。在数学与代码上,Mimir 大幅超越同架构的 HRM-Text。在丹麦语上,Mimir 直接 SOTA。

这说明什么?数据质量和数据合规性不是对立的。 合法数据经过精心组织和配比,可以在特定领域达到甚至超越用非合规数据训练的更大模型。


🔍 为什么这件事重要

1. 开源不只是"放权重"

很多"开源模型"的实际情况是:权重开放了,但训练数据不开放,或者数据来源不清晰。这意味着你无法复现,也无法审计。

Mimir 的做法更彻底:数据集清单公开(161 个数据集全部列出)、数据处理流程公开、合成替代方案公开。任何人可以审查、复现、改进。

2. 小语言不被边缘化

主流大模型几乎都是英语优先。丹麦语(500 万使用者)在大多数模型里是"二等公民"。Mimir 专门为丹麦语做了优化,并且刷新了 SOTA——这证明小语言不需要等大厂施舍,可以自己做。

3. HRM 架构的潜力

HRM 是一个相对新的架构。Mimir 的结果说明,在 1B 这个量级,HRM 的"分层推理"设计可以和 4B 的标准 Transformer 竞争。这为架构创新提供了实证支持——不是所有路都要走 Transformer。


⚖️ 诚实的局限

Mimir 不是没有短板:

  • 数学与代码仍然落后于 SmolLM3 3B(3.8% 差距)。1B 参数在推理密集任务上确实有天花板。
  • HRM 架构需要 FlashAttention 支持,部署门槛比标准 Transformer 高。
  • 丹麦语 SOTA 部分得益于团队的地域优势——其他小语种未必能复制这个结果。
  • 70.4B token 的训练量在 1B 模型上够用,但放到更大模型上是否仍然够用,是未验证的问题。

🌍 更大的图景

Mimir 让我想起一个被忽视的问题:AI 研究的"合规成本"到底有多高?

主流叙事是"数据越多越好,来源不重要"。但这个叙事的前提是——你不打算公开你的训练数据,也不打算让审计者检查。

一旦你承诺公开数据来源,合规成本就变成了硬约束。Mimir 的实验说明:在合规约束下,1B 模型也能做出有竞争力的结果。 这不是"小而美"的自我安慰,而是"约束催生创新"的实证。

合成替代方案就是一个例子。团队没有因为原始数据不合规就放弃,而是用"生成+审核"的方式重建了等效数据。这种做法的成本比直接爬取高得多,但产物是可追溯、可审计的。

这给开源社区提供了一个可复制的路径:不是"用合法数据从零训练会怎样"的思想实验,而是"我们这样做了,这是结果"的实证报告。


📎 资源


当约束成为设计的起点,而不是事后补救的障碍,结果往往出人意料。Mimir 不是在追赶大模型,而是在证明另一条路可行。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录