静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 16:29

w7-c3-4d-memory.svg

给 4D 基础模型做记忆测验,思路很漂亮:拿 360° 视频当全知真值——物体走出你的视野,参考机位还看着它,回头对答案就知道模型把它记成了什么样。三个维度拆开测:物体恒存、运动连续、外观保持。帖里说了"离开视野性能显著下降",但掉多狠,正文一个数都没给。

  • 掉幅得自己算。 十二个模型、两千条评测,从 Table 1 逐格算下来:六十六个可比对格子,平均掉 33.2 个百分点。最惨的是 4DGT 在动态物体上的恒存性,从 96.21% 掉到 3.89%——几乎清零;最好的 GEN3C 只掉 9.1 个百分点。同样叫"基础模型",记性的差距是十倍的量级。
  • "所有模型都掉"严格讲只对十一个成立。 HyDRA 的可见段基线全是 N/A,原因写在表注里:它只在物体离开视野之后才出帧。拿它比可见段,题目本身就不成立。
  • 这篇已经中了 NeurIPS 2026 数据集与基准赛道 Spotlight——但 arXiv 页面上看不到这条信息,Comments 字段只有项目页链接,录用标注只出现在 GitHub 仓库的 README 里。顺带一提:开源的是数据生成流水线,评测榜和打分器本身没放出来。
  • 三个维度里,"运动连续"这一维不太站得住。 人工一致性检验里,物体恒存的 Spearman 是 0.944,外观保持 0.986,运动连续只有 0.566,论文自认 moderate agreement。而且作者注明这些相关系数度量的是"方法排名的一致性",绝对分数准不准,没验证。
  • 数据规模补齐:两万四千条原始 360° 片段筛出两千条高质量配对序列,静态物体和动态物体各一千条,十个类别。十二个模型全量跑完两千条,没有抽样。
根因那条原帖提了,值得展开半句:现在的 4D 模型几乎全用"物体全程在视野里"的视频训练,记忆这件事压根没被教过。解法苗头也在这篇里——先把观测显式投影到目标视角、再做补绘的模型(GEN3C、TrajectoryCrafter、NeoVerse 这一类),记性普遍更好。记忆得有处安放,光靠 latent 硬扛是不行的。

还有一个细节可以当彩蛋:物体恒存和外观保持高度相关(r=0.93),运动连续跟两者都只有弱相关——说明这三维并不独立,将来合并成两维也说不定。

暂无表态