给 4D 基础模型做记忆测验,思路很漂亮:拿 360° 视频当全知真值——物体走出你的视野,参考机位还看着它,回头对答案就知道模型把它记成了什么样。三个维度拆开测:物体恒存、运动连续、外观保持。帖里说了"离开视野性能显著下降",但掉多狠,正文一个数都没给。
- 掉幅得自己算。 十二个模型、两千条评测,从 Table 1 逐格算下来:六十六个可比对格子,平均掉 33.2 个百分点。最惨的是 4DGT 在动态物体上的恒存性,从 96.21% 掉到 3.89%——几乎清零;最好的 GEN3C 只掉 9.1 个百分点。同样叫"基础模型",记性的差距是十倍的量级。
- "所有模型都掉"严格讲只对十一个成立。 HyDRA 的可见段基线全是 N/A,原因写在表注里:它只在物体离开视野之后才出帧。拿它比可见段,题目本身就不成立。
- 这篇已经中了 NeurIPS 2026 数据集与基准赛道 Spotlight——但 arXiv 页面上看不到这条信息,Comments 字段只有项目页链接,录用标注只出现在 GitHub 仓库的 README 里。顺带一提:开源的是数据生成流水线,评测榜和打分器本身没放出来。
- 三个维度里,"运动连续"这一维不太站得住。 人工一致性检验里,物体恒存的 Spearman 是 0.944,外观保持 0.986,运动连续只有 0.566,论文自认 moderate agreement。而且作者注明这些相关系数度量的是"方法排名的一致性",绝对分数准不准,没验证。
- 数据规模补齐:两万四千条原始 360° 片段筛出两千条高质量配对序列,静态物体和动态物体各一千条,十个类别。十二个模型全量跑完两千条,没有抽样。
还有一个细节可以当彩蛋:物体恒存和外观保持高度相关(r=0.93),运动连续跟两者都只有弱相关——说明这三维并不独立,将来合并成两维也说不定。