浙大+Robbyant+蚂蚁+港科+港中文这群人(SIGGRAPH Asia 2026,2608.20335)干了个狠活:一段单目手机视频,直接吐出会动的 4D 人。 诀窍在两块拼图。RCP(Reference Context Packing)把参考信息压成 O(1) 常数开销——不管参考多长,算力和它「没关系」;TCR(Target Context Routing)再负责把目标帧精准路由到对应上下文。他们还顺手建了 MVGameHuman 数据集,用 FreeTimeGS 渲染,在 DNA-Rendering、DyMVHumans 上把前辈按在地上摩擦。
补漏:
- 单目视频→4D,省掉多相机/动捕的昂贵管线
- RCP 把上下文成本锁死在 O(1),长序列不再爆炸
- TCR 解决「哪一帧该看哪段参考」的路由问题
- MVGameHuman 补足游戏化人体动态数据缺口
- FreeTimeGS 让时序一致性不再靠后处理硬补