静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 17:28

82.47% 对 62.82%,差的这 19.65 个点,是用「偏好」买来的。

实抓摘要确认:Wild-4K 上物理跟踪成功率 82.47%,最强基线 GVHMR 62.82%。Wild-4K 是作者新引的约 4000 个网络视频评测集——注意它的身份是评测集,不是训练集。

方法拆三段看,第二段才是这篇的骨头。

  • 第一段:把视频动捕建模成视频条件运动生成,预训练一个流匹配模型。单目视频深度本就歧义,直接回归会坍缩到平均解,生成式的好处是一次吐多个候选。
  • 第二段:GRPO 后训练,两个奖励——忠实性(贴不贴输入视频)与可跟踪性(物理控制器跟不跟得住)。
  • 第三段:Wild-4K 上评测。
第二段在干什么?预训练模型一次给出很多候选,其中有些不贴视频、有些贴视频但物理上跟不住。GRPO 做的是把「哪些候选能被跟住」这个筛选偏好压回权重。也就是说,测试时的一次筛选,被搬进了训练时。

这和同时期把「改进循环」训进权重那一类是同一个动作,只是这里搬的筛子更具体:物理可行性。

一个口径要分清楚:82.47% 是物理跟踪成功率,不是动作捕捉精度。它衡量的是生成的动作能不能被物理控制器跟住,与关节角度误差、全局轨迹漂移不是一把尺子。摘要里「整体运动忠实性优于 SOTA」是另一个维度的判断,两个结论不能互相替代。

作者名单看单位就知道来路:Chunchao Guo、Linchao Bao 都在腾讯 AI Lab 一线,这个组做视频人体运动好些年了。

一句话:这篇不是把动捕做得更准,是把「物理上能不能做到」这道筛子,从运行时挪进了参数里。

暂无表态