大模型闭眼能看见什么?爱因斯坦世界模型 EWM 深度解读
伯尔尼专利局那个小职员,下午没事干,在脑子里追了一束光。他没用公式,没进实验室,就靠"放电影"——想象自己跑到光速,旁边那束光会不会悬住不动?麦克斯韦方程组说不会。这一个画面,撬开了经典物理学的缝。爱因斯坦后来自己讲:我思考时,先有图像,词是后来才找的。
今天的大模型,恰好反过来。它们妙语连珠,Chain-of-Thought 写得比高中生还工整,可一碰到"球抛起来多久落地"这种题,常栽跟头——不是不会算,是不会"想画面"。
2026 年 6 月,MBZUAI 和 RIKEN 的几位研究者(Munachiso Nwadike、Zangir Iklassov、Ali Mekky、Zayd Zuhri、Kentaro Inui)甩出一篇 arXiv:2606.26969,名叫 *Einstein World Models*(爱因斯坦世界模型,下称 EWM)。他们想干一件事:让 LLM 学会在推理途中"做白日梦"——调用一个外置的视觉模拟器,生成一小段视频,当作可检视的假设,再看答案。
这篇不是训好的模型,是一张蓝图。下面我从架构师的视角,把它拆开看个明白。
一、先破题:EWM 是蓝图,不是成品
论文开篇就讲,EWM 是 "a blueprint for LLM-based reasoning systems"。注意"蓝图"二字——它定义的是一种推理系统的形状,不是某个 weights 落地的模型。你拿不到一个叫 "EWM-7B" 的权重去下载。
它干的事很明确:把 visual-temporal rollout(视觉-时间回放,说白了就是一小段视频)塞进 LLM 的推理迹(reasoning trace)里。生成的视频不当答案,只当"关于场景如何展开的一个假设",放回推理链,供后面接着推。
为什么非得是视频,而不是多写几句文字?论文的直觉来自常识题里有一类变量,文本链表示得很差:物体身份、包含关系、接触、冷热、运动、材质状态。人遇到这类题,脑子里"放一遍电影"就懂了。EWM 想给语言模型也配这么个能力。
二、一句话类比:给 LLM 配了个随叫随到的动画师
把 EWM 想成这样一个办公室。
坐在主位的是一位物理学家(Einstein Reasoner,记作 πθ)。他负责拆题、下结论。隔壁工位坐着动画师(World-Module,记作 𝒲),手里是台 text-to-video 生成器,随叫随到。
题目来了:"杂技演员把蓝球抛一米、紫球抛两米,再爬梯子顶气球,紫球在哪?" 物理学家不硬算,写张便条:"画一下这俩球抛起来后几秒的位置。" 动画师放一段一两秒的小电影回来。物理学家看明白了——球在空中就不到一秒,等爬完梯子早落地了,俩球都在地上,同一高度。下结论:选 A。
关键在"便条+电影"这段,被原原本本记进了推理迹,谁都能回头翻看、挑刺。这叫 inspectable hypothesis(可检视假设)。它不像传统 CoT 那样,把"想象"藏在自己脑袋里(权重里)看不见。
三、骨架拆解:πθ、𝒲,与那条推理迹
形式化长这样。设推理迹为 T,文本自回归步数为 N。标准 CoT 只用这 N 步写文字。EWM 也写文字,但在稀疏的 M 个中间步去喊动画师,满足 0 < M ≪ N-1 —— 回放不替代理性思考,只在"有助于后续推理"的少数时刻外置一下视觉场景。
迹的更新规则(论文 Eq.1):
- 不喊人时:T_{t+1} = T_t ⊕ {s_t}(普通文本段追加)
- 喊人时:T_{t+1} = T_t ⊕ [q_t, v_t](追加"查询 + 返回的 rollout"二元组)
写语言推理, 发 world-module 查询, 接回的视频, 给最终答案。World-Module(𝒲)分三类形态(论文 §3.1):
- Renderers(渲染器):出图或短视频,是 EWM 的默认选择(text-to-video 生成器)。
- Simulators(模拟器):可干预的交互式世界模型(Genie 那种)。但论文点破:反复调渲染器,看一次后果、改前提、再要一段,基本就能当模拟器用,所以渲染器才是主力。
- Planners(规划器):规划仍然归 LLM 自己,因为 EWM 的目标是思想实验,不是真去操控机器人。
四、训练两阶段:先教语法,再教"该不该摇人"
训练分两段(论文 §2.4)。
Stage 1 · SFT(监督微调):教 reasoner "怎么跟动画师对话"的语法。数据集 𝒟_SFT 是专家轨迹,含"何时调用"和"怎么写查询"。论文特别叮嘱:数据里必须同时有调用和不调用的样本,否则模型会学成"遇事就摇人"。返回的 rollout 是观察值,不是策略动作,训练时从损失里 mask 掉。
Stage 2 · RLVR(基于验证器奖励的强化学习):这一步教"该不该摇人、为何摇"。任务有可验证的最终答案,哪怕中间那段视频没标签也能训。奖励函数: $$ r_M(T, y*) = r(ŷ, y*) + r_W(T) $$ 前一项是答案对不对,后一项管调用开销。论文给的可选惩罚: $$ r_W(T) = -λ M(T)/B $$ M 是调用次数,B 是调用预算,λ ≥ 0 是惩罚强度。λ 越大,模型越惜力——这正是"正确率 vs API 算力"的旋钮。优化用 GRPO 风格,无用的调用拿到更低优势,有用的才值回票价。
这里得点破一句你视频稿里的词:"lazy loading(懒加载)"是咱们自己的归纳,论文原话是 *sparse invocation* 和 *selective thought experiments*(选择性思想实验)。意思通,但术语得对齐,免得同行挑刺。
五、把镜头拉远:三层 AI 架构栈(学 · 曝 · 推)
把 EWM 放进更大的图景,能拉出一条清晰的三层栈。这是我的合成,论文没这么排,但三个工作都是真的:
| 层 | 代表 | 动词 | 关键节点 |
|---|---|---|---|
| 学世界 | LeCun 的 JEPA(联合嵌入预测架构) | 学 | LeCun 2022 立场论文;I-JEPA(2023)、V-JEPA(2024) 落地。在表征空间预测未来,不逐像素生成 |
| 曝世界 | 李飞飞 World Labs | 曝 | 2024 创立,"空间智能";单图生成可交互 3D 世界,让人能"走进图像" |
| 与世界共推理 | EWM | 推 | Nwadike 等 2026。LLM 在推理途中主动调 world-module 做视觉思想实验 |
六、一线工程:账单怎么算,日志怎么看
落到生产,EWM 的卖点恰恰是"外置带来可观测"。
脑内日志可视化:把那条带四个标签的迹当作一等公民,按 OpenTelemetry 的 span 模型流式落盘(Langfuse / Arize Phoenix 都吃得下)。 的视频帧作为附件,人能在 UI 里逐步回放推理、点开某段 rollout 看模型"想象"的轨迹是否合理——比纯文本 CoT 好调试太多,因为假设是 concrete 的产物,能直接挑错。
非具身物理推理解耦:默认走纯文本 CoT;只有题目带物理/空间/时间味(fall、collide、trajectory、balance)、或自洽投票分歧大时,才升级去调 world-module。触发权可以交给 RLVR 学出的选择性,也可以外加个轻量 router。
算力账单速算(价格取自 2026-07 公开 API,多为估算):单题成本 ≈ LLM 文本成本 + M × 单次视频成本。设纯文本 CoT 文本约 $0.02,rollout 1–2 秒:
| 配置 | M | 单价/次 | 视频成本 | 单题总成本 | 倍数 |
|---|---|---|---|---|---|
| 纯文本 CoT | 0 | — | $0 | ~$0.02 | 1× |
| EWM 便宜档(Wan/Lite) | 2 | ~$0.05 | $0.10 | ~$0.12 | ~6× |
| EWM 中档(Runway Turbo) | 2 | ~$0.10 | $0.20 | ~$0.22 | ~11× |
| EWM 高档(Veo Std) | 2 | ~$0.80 | $1.60 | ~$1.62 | ~80× |
| M 失控(高档) | 10 | ~$0.80 | $8.00 | ~$8.02 | ~400× |
七、致命短板:别被"白日梦"骗了
蓝图很美,落地有几道硬伤,列清楚:
1. 视频模型物理不可靠(GIGO)。rollout 的天花板就是底层视频模型的物理直觉。论文引 VideoPhy(Bansal 2025):最好的模型也只有约 39.6% 的实例符合文本与物理定律;Morpheus(2025)、Physics-IQ(2026) 同样佐证"视觉真实 ≠ 物理理解"。垃圾进,垃圾出。 2. 数据瓶颈。核心学习问题缺合适 benchmark。SimpleBench 全库才 200+ 题,公开仅 10 题,只能当示例,当不了训练语料。论文干脆发了个"call for datasets"的呼吁。 3. 忠实度难验证。外置的 rollout 未必反映模型真用了什么来算答案(CoT 不忠实的老毛病,Turpin 2023、Lanham 2023)。论文主张"别弃用,去评估并改进忠实度"。 4. 无标准基准、非具身、成本高——前文已述。
严重度排个序:数据瓶颈与忠实度属"高",是拦路虎;成本属"中",靠稀疏调用能压;非具身是特性也是边界。
八、两点纠偏(建筑师良心话)
你视频脚本里有两句,我得掰直,免得传播错了:
- "缝合了世界模型与具身智能" —— 不对。EWM 恰恰是非具身的(disembodied)。它把思想实验从"经验"和"干预"里解耦出来:正如爱因斯坦不必真骑上光速就能想象追光,LLM 不必真在物理世界里动作,就能想象场景展开。它的创新正在于"不具身也能做视觉思想实验",不是去缝具身智能。
- "lazy loading / 算力账本" —— 是咱们的好归纳,但论文原术语是 *sparse invocation* / *selective thought experiments*,惩罚项写作 r_W = -λ·M/B。用咱们的词讲故事无妨,引用时请对齐原文。
九、结语
EWM 是一张图纸,不是一栋盖好的楼。它的真正价值,不在于"让模型会做梦"这种浪漫说法,而在于三点实在:
- 把"想象"外置成可检视、可调试、可对比的产物;
- 用 RLVR 的 −λM/B 把"该不该摇人"变成可学习的权衡;
- 在 JEPA(学)、World Labs(曝)之后,补上"推"这一层。
#EWM #爱因斯坦世界模型 #世界模型 #AI架构 #智柴系统实验室🎙️
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens