多模态预训练的物理学:语言是通用货币,生成只需 5% 的 token(FAIR×Oxford / 知识流不对称 × vision laziness × L70-U25-G5 配方)

多模态预训练一直有股炼丹味:数据配比看玄学,架构选择看脚气,训完看天意。FAIR×Oxford 的《Towards Physics of Multimodal Pretraining》(arXiv:2608.05000,Junlin Han、Shengbang Tong、Mike Lewis 等,2026-08-05…

多模态预训练的物理学:语言是通用货币,生成只需 5% 的 token

多模态预训练一直有股炼丹味:数据配比看玄学,架构选择看脚气,训完看天意。FAIR×Oxford 的《Towards Physics of Multimodal Pretraining》(arXiv:2608.05000,Junlin Han、Shengbang Tong、Mike Lewis 等,2026-08-05)继承了 Allen-Zhu & Li《Physics of Language Models》的方法论——合成数据控制变量 + 真实规模验证——把「语言+视觉理解+视觉生成」统一训练的设计空间做成了力学。它是同团队《Beyond Language Modeling》(ICML 2026 spotlight)的机制深挖版:前作画地,这篇写物

一句话总纲:知识不对称流动,且流向可测。语言→一切是通用货币;理解→生成是结构化输血;生成→理解给的是隐性先验而非表面知识;而视觉生成本身,是极度数据高效的——5% 的生成 token 就够

一、知识流图:谁给谁供血

受控实验画出三向不对称:

  • 语言是通用 booster。语言先验提升一切下游,且与数据复杂度解耦。
  • 理解→生成:结构转移,内容不转移。CLEVR 概念消融最干净:color/shape 这类低层概念双向严格零转移;relation/size/count 这类结构概念能从理解零样本流向生成——模型没被告知如何画“左边”,但预训练里学会的「关系」直接可用。
  • 生成→理解:表面零,隐性强。生成分支对下游 VQA 的直接概念转移几乎为零,但作为预训练给低层理解任务留下强 latent priors(CLEVR 上 zero-shot 增益 ∆ 平均准确率 +0.133~+0.273)——生成学到的分布知识不直接可陈述,但一旦对齐到语言就高度可复用。反向则近乎零:判别特征太抽象稀疏,带不动像素级重建。
这张图有个工程直觉的翻译:生成数据自己给自己的边际贡献极低——它的价值早被语言和理解 token 预付了。

二、相图:复杂度决定协同还是竞争

数据「复杂度」大体决定两模态是互相成就还是抢容量:简单任务互为跨模态助推器,复杂任务诱发容量竞争且竞争压过协同。架构上有一个清晰的解:共享 attention 和 normalization(促进协同),分裂 FFN(缓解竞争),且该规律跨视觉 tokenizer 设计稳健。妙处在于这个结论天然向 MoE 演化——本文的 13.5B 验证模型(1.5B 激活、256 专家 top-16)把两个专家焊死为模态专属(一语言一视觉),其余 14 个动态路由:分裂 FFN 的规模化形态就是结构化 MoE。

三、Vision laziness:视觉懒政的四轴证据

最有传播力的发现。固定 1T 总预算,把统一训练开始前的纯语言 warm-up 从 0 扫到 800B:warm-up 越长,视觉表现越差。为什么?四条独立机制测量给出同一张诊断书——语言主干先硬化,视觉通路就不肯 commit:训练时 img_ffn 激活 L2 越来越小、视觉 wrapper 嵌入范数收缩、推理时逐层激活 RMS 下降、注意力中分给图像 token 的比例萎缩。视觉通路整体「躺平」,模型靠语言先验走捷径。

顺序训练同样全灭:六种模态顺序(U→L→G 等全排列)在 1T 预算、50/25/25 配比下全部输给联合训练,12.5% 数据 replay 只能部分缓解遗忘、补不回跨模态协同。「先训语言再对齐视觉」的主流实践(Qwen-VL 式 late alignment)在这里被机制级否定:不是效果略差,是每一层都在少看图。

四、配方与规模化验证

网格搜索导出极不对称配方 L70/U25/G5,在 13.5B MoE、2T token 上做三个单变量受控基线验证(vs 平衡配比 L50/U25/G25):

指标L70/U25/G5平衡配方备注
语言准确率54.31%52.86%语言反而更强
视觉理解均值43.08%41.42%
GenEval(文生图对齐)0.4820.467生成 token 少 5 倍
DPG0.6890.676
FID(5 万张)5.2345.131纯生成质量几乎不掉
三个受控基线(平衡配比 / Dense 3.5B / Late-Fusion)各自单变量地确认配方、MoE 架构、早期统一的贡献——预训练设计第一次有了「可反驳性」。

编辑观察:接主线

其一,数据价值的不对称物理学。 轴一(任务定义成本坍缩)讲的是采集侧:遥操作贵、仿真便宜、自举趋零。这篇补的是分配侧:token 不是等价的——语言是硬通货,生成 token 低产出(5% 到顶,因为它的知识已被上游预付)。两轴合起来才是完整的数据经济学:先问这个 token 的知识能否从别的通道流过来,再问它贵不贵。具身侧的对照问题已经存在:仿真数据对真机技能的边际贡献曲线,长得像不像这条?

其二,接口丢结构第十二验。 CLEVR 消融是「接口处幸存的结构决定下游能力」的又一样本:relation/size/count 经统一预训练接口幸存并零样本转移,color/shape 作为低层内容严格蒸发。和 Synapse(图结构对向量接口)、Cordis(状态归属对进程接口)同构——模态接口保关系、丢内容,这次是在预训练动力学里验的。

其三,捷径普遍律的第三个样本。 Vision laziness 本质是优化动力学走捷径:有语言先验可用,视觉通路就不自发走难路。它和 ARS 的 M4(AI 科学家走捷径、bug 包装成发现)、Wayfinder 的「agent 回答自己的质询=实现坏了」构成跨层同构——训练动力学、agent 工作流、科研流程,有捷径时系统一律躺平。 antidote 也同构:ARS 用强制门打断捷径,这里用早期统一让捷径不存在(从头就 jointly train,语言先验来不及硬化成捷径)。

其四,Physics of X 是验证带宽经济学的预训练版。 合成数据控制变量=把「为什么这样配」压缩成单变量可反驳命题;13.5B 三基线=设计选择接受审计。预训练从叙事科学变成实验科学,每一份算力都在购买「可反驳性」——这在生成免费、验证稀缺的时代,是唯一保值的学术资产。

观察点:① 该配方在更大规模(>13.5B)是否保持单调;② 模态专属专家比例(2/16)有没有最优点;③ 「生成 token 低产出」在具身数据上是否复现(仿真 token 对真机技能的边际曲线)——第三点是具身圈最值得抄的实验。


信源:arXiv:2608.05000 v2(FAIR, Meta + Reality Labs + University of Oxford;PDF 全文精读,全部数字经原文核对);前作 Beyond Language Modeling(ICML 2026 spotlight);Allen-Zhu & Li Physics of Language Models 系列。作者主页 junlinhan.github.io。转载请注明出处。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens