从头训练原生多模态:腾讯与港中文找到"双语大脑"的最优配方
论文:Scaling Native Multimodal Pre-Training From Scratch
作者:Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu
机构:香港中文大学、腾讯 LLM Department
arXiv:2607.22043(2025年7月24日)
一个反直觉的开场
假设你要培养一个精通中英双语的人才。方案 A:先让他在纯中文环境里长大到 18 岁,再送他去美国读四年本科。方案 B:从出生起就在中英混用的家庭里长大。
直觉上,方案 A 更稳妥——先把一门语言学扎实,再学第二门。但语言学的双语研究告诉我们,方案 B 培养出来的人,两种语言不是"翻译关系",而是共享一套概念系统。他们用英语思考时,中文的语义网络也在被激活,反之亦然。
大语言模型(LLM)的多模态训练,正面临同样的选择。
当前主流:后期融合的"翻译"范式
目前主流的多模态大模型(GPT-4V、LLaVA、Kimi 等)走的是方案 A 的路线。它们先训练一个纯文本 LLM,再外挂一个视觉编码器(CLIP、SigLIP),通过一个投影层把视觉特征"翻译"成 LLM 能理解的语言。
这种做法高效,但有一个根本性的不对称:视觉和语言表征是在不同的数据分布、不同的优化目标下各自学出来的。视觉编码器学的是对比学习,LLM 学的是自回归语言建模。它们像两个母语不同的人,靠一个翻译器(投影层)勉强沟通。
原生多模态:从出生起就"双语"
原生多模态预训练(Native Multimodal Pre-Training)走的是方案 B。它从一开始就在文本和图像混合的数据上训练,用同一个 Transformer、同一套参数、同一个优化目标,让视觉和语言表征在同一个表征空间里生长。
这个思路不新,但一直没人能回答一个工程问题:给定固定的算力预算,到底应该分配多少给模型参数、多少给训练 token、多少给多模态数据比例?
这篇论文第一次给出了系统的答案。
三条独立的 Scaling Law
作者用 MoE(Mixture of Experts)架构做了一组 IsoFLOP 实验:固定总计算量,调整模型大小和训练 token 数,找到每个计算预算下的最优配置。
关键发现是:语言目标和多模态目标遵循不同的 Scaling Law。
- 语言目标的分配律对数据组成几乎不敏感。 不管你往训练数据里掺多少图像,语言损失的最优模型大小和 token 数几乎不变。这意味着语言学习的能力是"刚性"的——它需要固定规模的参数和 token 才能学好,不会因为加了图像就变少。
- 多模odal 目标的分配律则强烈依赖于数据组成。 多模态数据比例越高,多模态损失的最优配置变化越大。
这就像学语言:中文的语法和词汇量需求是固定的,不会因为你同时学英语就变少;但英语的进步速度,取决于你花多少时间在英语环境里。
Pareto 前沿:算力的"三体问题"
更复杂的挑战在于:语言和多模态目标共享同一套参数。在固定的总算力预算下,你不能同时让两个目标都达到最优——必须做权衡。
作者用 Pareto 前沿刻画了这个权衡。给定总算力 \(C_{total}\),存在一组非支配配置:你无法在不损害一个目标的情况下改善另一个目标。这条前沿曲线就是工程上的"最优配方表"。
论文给出了具体的配置建议:对于给定的算力预算,应该用多大的模型、训练多少 token、多模态数据占多少比例。这是原生多模态预训练的第一份"施工蓝图"。
意外收获:多模态训练提升纯文本空间推理
最让人意外的发现来自下游评估。
作者发现,原生多模态预训练不仅让模型获得了多模态能力,还提升了纯文本的空间推理能力。也就是说,一个在图像+文本上训练的模型,在只给文字的空间推理题上,比纯文本训练的模型做得更好。
这挑战了一个直觉:多模态训练会"分走"语言学习的能力。事实正好相反——视觉空间信息似乎帮助模型建立了更扎实的空间概念表征,这些表征在纯文本任务中也能被激活。
这就像一个在双语环境长大的人,可能在纯中文的逻辑推理上也更强——因为英语的某些概念结构反过来强化了中文表达。
实验规模
论文的实验规模相当可观:
- 训练数据:250B 文本 token(网页、书籍、论文)+ 75B 多模态 token(图像-文本对、交错图文文档)
- 模型架构:MoE decoder-only Transformer,无辅助损失(auxiliary-loss-free),图像通过 patch embedding 直接投影为连续向量
- 不使用视觉编码器:这是和后期融合范式的根本区别——没有 CLIP,没有 SigLIP,只有一个 patch embedding 层
工程意义
这篇论文的工程价值在于:它把原生多模态预训练从"听起来不错但不知道怎么做"变成了"有蓝图可依的工程问题"。
对于正在训练多模态大模型的团队(Kimi、Qwen-VL、Emu、SenseNova),这份 Scaling Law 提供了三个直接可用的结论:
- 语言学习的能力是刚性的——不要指望加图像能省下语言训练的算力。
- 多模态学习的能力是弹性的——多模态数据比例直接决定多模态能力的天花板。
- 原生训练有正向迁移——多模态训练不仅不损害文本能力,还能提升空间推理。
诚实评价
这篇论文有几个局限:
- 验证指标只有训练损失。作者承认"由于缺乏可靠的多模态验证指标",他们只能用 smoothed training loss 作为代理。训练损失和下游性能之间的关系不是线性的,这个代理可能高估或低估了实际效果。
- 没有开源代码。论文来自腾讯 LLM Department,代码未公开。其他团队要复现需要自己搭建 MoE 训练框架。
- MoE 架构的结论可能不适用于 dense 模型。MoE 的路由机制可能影响多模态和语言目标的参数共享方式,dense 模型的 Scaling Law 可能不同。
一句话总结
原生多模态预训练的 Scaling Law 告诉我们:语言学习是刚性的,多模态学习是弹性的,而两者共享的参数空间里,视觉信息会反过来强化语言的空间推理——"双语大脑"不是简单加法,是乘法。
论文链接:https://arxiv.org/abs/2607.22043
HTML 版本:https://arxiv.org/html/2607.22043v1
开源代码:暂无
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。