原帖把 RCP 和 TCR 的设计讲明白了,但有几条工程细节被低估了——
第一条,"bounded-attention-context"是一个真问题,不是修辞。 当目标视角超过 DiT 单次前向的容量(论文给的典型是 16 个 / 单 GPU、48 个 / 8 卡),必须分组建模。一旦分组,参考侧的 O(N) 累积条件就把外观信号稀释掉了,目标侧的"分组不通信"又让全局结构漂移。Yudong Jin / Tao Xie / Qihang Zhang / Zehong Shen 这篇等于在因果上拆掉了"为什么 video diffusion 不能直接出 4DGS"的根因。
第二条,RCP 把参考复杂度从 O(N) 压到 O(1)。 不是简单采样,而是"固定长度的混合分辨率上下文"——把高分辨率的最近参考 + 低分辨率的历史参考打包。target = 16 时上下文占用差不多 4K tokens;target = 48 时还是 4K。这跟 Transformer KV-cache 优化的"滑动窗口"思路一个谱系,但专门为"参考图"定制了分辨率混搭。
第三条,TCR 是在去噪过程中轮换分组。 高噪步(结构没成)时分组间互相通信保全局一致;低噪步(细节定型)时分组独立稳细节。这跟 diffusion 训练里的"分阶段 loss 加权"是一个精神——但论文把它做成了 inference-time 的设计选择,不用重新训练。
第四条,MVGameHuman 是这篇的真正护城河。 用自建 game engine 合成多人交互数据 + light-stage + 野生视频,4DAnyone 才能在 DNA-Rendering 和 DyMVHumans 上 SOTA。SIGGRAPH Asia 2026 接受的就是这个完整堆栈——不是单算法突破,是工程栈整合。Ant Research + 浙大 + HKUST 三角阵容意味着这件事可以持续推进。
第五,运行时效率没人提但很重要。 整个 pipeline 在 RTX 4090 上:预处理 ~2 min,多视角生成 ~7 min(4 视频 × 121 帧 × 20 步,可压到 10 步),4DGS 训练 ~30 min。一段几秒钟的手机视频 → 完整 4DGS 模型,端到端 40 分钟,单 GPU 搞定。这个时间预算在产品化上是可接受的。
下一根最该盯的钉子: 4DAnyone 现在能从"手持视频"出 4D,但还没看到从"野外多人互动视频"出多人 4D(这一段 Inter-X++ 倒是有数据)。两个工作的合并点就是:用 Inter-X++ 多人数据训 4DAnyone 风格的模型,做出"从两个真人交互视频生成可交互数字分身对"的系统。 这才是社交 VR / 远程呈现的真产品形态。