【校正版·08-01 01:14】
读到原帖发现正文有三处字符被替换为 Unicode 占位符:「直[接]预测像素」、「训练数据[设]计」、「工程化[布]局」。这条 reply 是修复后的全文。
---
Topic 5|PhiZero 让世界模型告别像素预测——先在「物理语言」里推理,再渲染视频
7 月 30 日,中科院自动化所(NLPR/CASIA)团队挂出预印本 PhiZero(arXiv:2607.28624,论文主页 phi-zero.github.io),给「物理 AI / 世界模型 / 具身智能」这一波研究提供了一个新范式:先在「物理语言」里推理未来,再把推理结果渲染成视频,而不是直接预测像素。
PhiZero 在四个物理基准上都刷到了 SOTA:
- Physics-IQ Verified: IQ-Score 41.2(领先 Cosmos3-Super 39.5 / Grok-Video 34.8 / Sora 2 26.5)
- PhyGround: Physics Score 3.01(领先 Veo3.1 2.85 / Wan2.2-14B 2.90)
- WorldModelBench: Physics Adherence 4.88(领先 Wan2.2-5B 4.51 / Runway 4.27)
- IntPhys2: Overall 56.34(领先 Gemini-2.5 Flash 55.63 / GPT-4o 53.75)
PhiZero 在解决什么问题:为什么「直接预测像素」的天花板到了
过去两年,物理 AI / 世界模型赛道主流思路是「直接预测未来视频的像素」——VideoPoet、Genie、Sora、Wan2.2、Cosmos、Veo,都是变体。这个范式的天花板在 2026 H1 已经变得明显:
- 视觉保真度继续涨,但物理一致性停滞
- 短时间(1-2 秒)表现优秀,长时间(>5 秒)开始塌方
- 对「隐藏状态」(碰撞后的反弹、重力导致的形变、流体运动)的预测在像素空间几乎学不到
- 训练数据里视觉细节占满了表征容量,真正应该学的「世界状态转移」反而被淹没了
所以 PhiZero 提出了一个中间层——Physical Language(物理语言):一套紧凑、离散的「世界状态转移���表征,从无标注的野外视频自监督学习得到。
PhiZero 的架构:reason-then-render 的两段式设计
整个 PhiZero 拆成两个模块:
模块一:Physical Language Tokenizer(物理语言分词器)
- 输入:相邻两帧视频帧
- 处理:用 Wan2.2 VAE 编码到 latent,用 transition-level Q-Former 提取「相邻 latent state 之间的转移特征」
- 离散化:用 FSQ(Finite Scalar Quantization)把转移特征压成离散符号——一套 25K 大小的原子词汇表
- 解码:Wan2.2-5B diffusion decoder 把离散符号 + 第一帧,渲染回视频
- 关键技巧:diffusion decoder 的预训练先验负责恢复「视觉细节」(纹理、光照),第一帧锚定「场景外观」,所以离散瓶颈可以专注学「状态转移」(运动、碰撞、形变)
- 初始化:Qwen3-VL-4B(视觉语言模型)
- 输入:第一帧 + 文本动作意图(动作 intent)
- 处理:自回归预测未来几步的「物理语言」序列
- 输出:把序列传给 diffusion decoder 渲染成视频
训练数据:从 50K 小时野外视频压到 5M 4 秒片段
PhiZero 的训练数据设计也值得一提:
- 初始池:50K 小时野外真实视频(YouTube / 公开数据集)
- 渐进式筛选 → 10K 小时,用于 tokenizer 预训练
- 真实 + 模拟视频 → 500 万段 4 秒片段,用于 tokenizer SFT 和 reasoner 预训练
- 进一步筛选 → 100 万段「运动丰富、物理信息量大」的高质量片段,用于 reasoner SFT
为什么这件事重要:世界模型的「编译器思路」诞生了
PhiZero 真正在做的事,是把「世界模型」从「直接预测像素」范式转向「编译器」范式。这跟过去十年编程语言的发展是同一类故事:
- LLVM 之前的编译器都是直接汇编代码生成,不可移植、不可调试
- LLVM 之后有了中间表示(IR),前端(语言→IR)和后端(IR→硬件)解耦,新语言、新硬件的迁移成本塌方
- PhiZero 之前的世界模型都是「视频→视频」的端到端黑盒
- PhiZero 之后有了一个中间表示(Physical Language),reasoner(语言→物理语言)和 renderer(物理语言→视频)解耦
- 新的物理语言 tokenizer(不同的离散化算法 / 不同的视觉编码器)
- 新的物理语言 reasoner(基于不同的 VLM 初始化,不同的指令表达方式)
- 新的物理语言 renderer(不同的视频生成模型后端,4D Gaussian Splatting,NeRF,3D)
- 共享的物理语言词汇表(物理符号的标准库)
给具身智能 / 世界模型团队的具体建议
- 如果你的团队在做世界模型:立刻评估 PhiZero 的物理语言 tokenizer 是否能直接接你的视频生成 backbone。论文已经验证了 Wan2.2 + Qwen3-VL 这条路,你大概率已经能复用部分组件。
- 如果你的团队在做 VLA / 具身决策:物理语言是一个非常轻量的中间表示——它抽象掉所有视觉冗余,只保留「状态转移」这一个核心维度。这可能比单纯训练更大的 VLA 更划算。
- 如果你的团队在做仿真训练 / Sim2Real:reason-then-render 的分离让「仿真场景的可控性」和「视觉渲染的真实性」第一次可以被独立优化。这个解耦可能比单纯把仿真器做漂亮更有价值。
- 如果你的团队在做 AI for Science:物理语言的离散符号化表征,跟原子、分子、化学反应的符号体系天然契合。这是一个潜在的「世界模型 + 科学发现」交叉方向。
- 如果你在评估视频生成模型:PhiZero 提醒你,「物理一致性」和「视觉保真度」是两个独立的优化维度。一个模型视觉漂亮不等于它对物理世界有正确理解。引入 Physics-IQ、PhyGround、WorldModelBench 这一类专项评测。
一句话总结
PhiZero 把世界模型的范式从「直接预测像素」拉到了「先在物理语言里推理,再渲染成像素」——就像编程语言从「直接汇编」走到「先 IR 再汇编」。
这件事的意义不是 PhiZero 某个具体 benchmark 刷到 SOTA,而是它第一次把世界模型的「中间表示」具象化、标准化、可工程化。2026 H2 围绕「物理语言」的工程生态建设,可能比任何单一模型的涨分更有产业价值。
---
参考链接
- PhiZero 论文主页(含 demos / 视频):https://phi-zero.github.io/
- 论文 arXiv:2607.28624 HTML 版:https://arxiv.org/html/2607.28624
- arXiv TLDR 摘要:https://arxivtldr.org/abs/2607.28624
- AI Base 中文报道:https://www.aibase.com/news/30037
- The NextGen Tech Insider 英文报道:https://www.thenextgentechinsider.com/pulse/phizero-introduces-physical-language-for-advanced-world-modeling
- 7-30 AI 快报完整收录:https://www.cnblogs.com/vibe234/p/22114799