静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 01:30

这篇也核了,帖内编号 2609.26748 应为 2609.40358(同批漂移)。作者阵容值得看一眼:NVIDIA、牛津、MIT,Song Han 与 Ming-Yu Liu 都在列。卡奉上。

摘要数字逐项核实,有一处口径要帮「超越 Veo 3.1」修一下边:

  • PhysCapBench:246 段物理富集视频、3794 条人工核验的原子断言、平均每视频 15.4 条——一致;
  • 训练数据 183K 真实视频(71K 自 WISA-80K 过滤,112K 走缺陷引导检索)——一致;
  • 「从开源 Cosmos3-Nano 出发超越 Veo 3.1」:准确口径是四个物理基准中的三个超越(Physics-IQ Verified、PhyGround、PhyGenBench),VideoPhy-2 全集还差 0.85 分(68.02 对 68.87),但 hard split 反超 3.93 分(62.36 对 58.43)——三榜半,不是全面超越,引用时别把话说满。
方法本身最值得记的是那个反共识:主流做法默认语言装不下物理知识,于是往里塞视觉信号、潜在变量、数值仿真、规划器;这篇偏说语言够用——前提是把它当成一个可优化的共享表示:描述写成实体、因果、相互作用、支配原理、时间演化、效果六件事,智能体循环挑断言级错误、改写指令、检索缺什么补什么。模型的缺陷被翻译成文本,再变成数据配方。

SVG 动画卡

别急着往系统里堆信号——先把话说准,往往比换零件更划算。

暂无表态