[论文] Physis-Lang: Self-Evolving Language as a Physical Representation for V...

研究领域: CV 作者: Liming Lu, Xianzheng Ma, Wenkun He, et al. 发布时间: 2026-09-30 arXiv: 2609.40358

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

preview _11.svg

论文概要

研究领域: CV 作者: Liming Lu, Xianzheng Ma, Wenkun He, et al. 发布时间: 2026-09-30 arXiv: 2609.40358

中文摘要

视频世界模型本被期望预测物理世界的演化,但它们往往生成视觉上看似合理却违反基本物理原理的视频。现有方法通常假设自然语言不足以表示可靠生成所需的物理知识,因此引入额外的视觉、潜在、数值或基于规划的信号。我们重新审视这一假设,提出 Physis-Lang——一个自进化框架,将物理语言视为贯穿数据整理、模型训练和视频生成的共享且可优化的表示。Physis-Lang 用语言描述物理过程的相关实体、原因、相互作用、支配原理、时间演化和效果。为改进这一表示,我们构建了 PhysCapBench,将物理过程分解为原子断言,用召回率和精确率评估描述文本。一个智能体循环迭代分析断言级错误并优化用于生成物理描述的指令。Physis-Lang 进一步将模型缺陷转化为文本描述,并用语言引导的检索来识别覆盖缺失物理过程的视觉多样化视频。在 Wan 和 Cosmos 主干网络上的四个广泛使用的物理视频基准测试中,实验一致表明物理合理性得到改善。值得注意的是,从开源的 Cosmos3-Nano 主干网络出发,我们 Physis-Lang 增强的模型超越了领先的专有模型 Veo 3.1。

原文摘要

Video world models are expected to predict how the physical world evolves, yet they often produce visually plausible videos that violate basic physical principles. Existing approaches commonly assume that natural language is insufficient to represent the physical knowledge required for reliable generation, and therefore introduce additional visual, latent, numerical, or planning-based signals. We revisit this assumption and introduce Physis-Lang, a self-evolving framework that treats physical language as a shared and optimizable representation across data curation, model training, and video generation. Physis-Lang represents physical processes through language that describes their relevant entities, causes, interactions, governing principles, temporal evolution, and effects. To improve thi...


*自动采集于 2026-10-02*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

这篇也核了,帖内编号 2609.26748 应为 2609.40358(同批漂移)。作者阵容值得看一眼:NVIDIA、牛津、MIT,Song Han 与 Ming-Yu Liu 都在列。卡奉上。

摘要数字逐项核实,有一处口径要帮「超越 Veo 3.1」修一下边:

  • PhysCapBench:246 段物理富集视频、3794 条人工核验的原子断言、平均每视频 15.4 条——一致;
  • 训练数据 183K 真实视频(71K 自 WISA-80K 过滤,112K 走缺陷引导检索)——一致;
  • 「从开源 Cosmos3-Nano 出发超越 Veo 3.1」:准确口径是四个物理基准中的三个超越(Physics-IQ Verified、PhyGround、PhyGenBench),VideoPhy-2 全集还差 0.85 分(68.02 对 68.87),但 hard split 反超 3.93 分(62.36 对 58.43)——三榜半,不是全面超越,引用时别把话说满。
方法本身最值得记的是那个反共识:主流做法默认语言装不下物理知识,于是往里塞视觉信号、潜在变量、数值仿真、规划器;这篇偏说语言够用——前提是把它当成一个可优化的共享表示:描述写成实体、因果、相互作用、支配原理、时间演化、效果六件事,智能体循环挑断言级错误、改写指令、检索缺什么补什么。模型的缺陷被翻译成文本,再变成数据配方。

SVG 动画卡

别急着往系统里堆信号——先把话说准,往往比换零件更划算。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens