##📐 那个 71 其实是71 个百分点,不是 71%
先把元数据核完:arXiv:2610.12470v1,11 位作者(Jusuk Lee / Sungha Kim / Yeonsoo Park / Jonguk Cheon / Yoonkyo Jung / Yongjun You / H. Jin Kim / Jia-Bin Huang / Furong Huang / Youngseok Jang / Seungjae Lee),2026-10-08,无 v2 修订——标题、作者、日期全对。中文摘要的转述也忠实,五个任务、real-to-sim-to-real、场景图作生成式约束、纯仿真训练零样本迁移,全对。
但摘要里那个最抢眼的数,量级差了近 18 倍。
一、71% 还是 71 percentage points
摘要写:
> "Dex-One2Many exceeds baselines by 6.5% in seen configurations, while its robust generalization widens this gap to 71% in unseen scenarios."
论文 Introduction 的贡献列表里,同一件事是这么写的:
> "Across five real-world tasks, policies learned from a single human video achieve 75% mean success on configurations not shown in the input video, exceeding the next-best baseline by 71 percentage points."
同一个 gap,两处写法不一样:一处是 71%,一处是 71 个百分点。
差在哪?把分母找出来就清楚了:75% 是本文的成功率,"next-best baseline"低 71 个百分点,反推基线大约是 4%。
- 按"71%"读(本号 75%,基线是 75% × (1 − 0.71) ≈ 22%)
- 按"71 pp"读(本号 75%,基线约 4%)
这类错有个固定解法:"71" 同时是合法百分数和合法百分点,必须回正文找分母。这次回正文,分母是 75%,一减就出来了。
二、同一个数,同一个坑:6.5% 也在嫌疑名单里
摘要同一句里的前半个数——"exceeds baselines by 6.5% in seen configurations"——我在正文里没找到对应的 pp 标记。
按 71 pp 这个已经坐实的口径推断,6.5 大概率也是 pp:若基线在已见配置上约 93.5%,本文约 100%。这个数在摘要里没写实数,所以推不出来,只能存疑。
两个数大概率都是百分点,但摘要里都写成了百分号。 这不像是翻译失误——中文译文忠实照抄了英文摘要,说明问题出在英文摘要本身,而英文摘要是作者写的。所以严格讲,中文译者是忠实的,是原文摘要在这个地方不够严谨。
这一条值得写进回复是因为:论文的正文自相矛盾(摘要% / 正文 pp),而下游所有读摘要的人都会拿到错的那个。 一篇讲"从单个人类视频学出泛化灵巧操作"的论文,最该被准确引用的就是这两个数。
三、顺带:两个数放在一起,才看得见这篇论文真正在证明什么
把两个数并排看:已见配置 +6.5 pp,未见场景 +71 pp。 相对口径下这是 10.9 倍的差距。
这个比值才是论文的核心主张——"从一段人类视频里抽出任务结构、而不是抽出动作轨迹"。如果方法只是把演示动作迁移过去,在已见配置上就该拿满,泛化不可能更好。恰恰相反:在见过的地方它跟基线差不多(都是 90+),差距全在没见过的地方拉开。
这个形态本身就是"学到的是关系、不是位姿"的证据。论文的机制描述也一致:场景图约束的是 relations 而非 exact poses,所以 reset 状态能覆盖视频之外的物体位姿与抓取;而严格的动作匹配做不到这个。
换句话说,如果只有 6.5 pp 那个数,这篇论文的价值要打折;正是因为有 71 pp 那个数,它才立得住。 所以那个 pp/%的混淆不是小数点问题——它让最强的那个证据被读成了次强的那个。
四、附录里一个更实用的账:VLM 查询成本
论文 Appendix B.3 有一张帖子完全没提的表——从单个人类视频里提取任务所需的 VLM 查询成本:
| 任务 | 视频秒数 | 延迟(秒) | 成本(美元) |
|---|---|---|---|
| Doll | 7.07 | 21.2 | 0.045 |
| Can | 5.30 | 11.5 | 0.024 |
| Stamp | 4.97 | 12.0 | 0.026 |
| Hammer | 4.00 | 18.7 | 0.039 |
| Sweep | 5.77 | 18.5 | 0.037 |
| 合计 | 27.11 | 81.9 | 0.171 |
对比一下它替代的东西:论文 Introduction 说替代的是"costly robot demonstrations"——遥操作采一条 7秒的多指手部演示,人工成本大约在几十美元量级,而且是不可复用的(采一次只能给一条轨迹)。 17 美分是一张可以无限次重新查询的许可证。
还有个细节值得记:"the full video is used only by the VLM query",物体的视觉短语来自 VLM 输出,然后作为 SAM 3.1 的文本提示去重建物体网格。 也就是说 VLM 的职责被压缩到"命名"这一件事上,形状重建交给 SAM。把难的部分外包、把最容易错的部分(物体是什么)交给模型,这是一个很干净的分工设计,也是整套流程只花 82 秒的原因。
收口:下一根钉子
最该盯的是 6.5 到底是 % 还是 pp——正文里那一段的表格能一句话解决。【判断】若也是 pp(基线 93.5% → 本文接近满分),那么已见/未见两格都用 pp,全文口径统一;若 6.5 真是相对百分比,那基线约 99.3%,本文 105.7%——那不可能,所以它几乎肯定是 pp。
真正有意思的下一步是:71 pp 的那个 4% 基线是谁。 next-best 在未见场景里只有约 4% 成功率,意味着所有基于动作匹配的基线在未见位姿/抓取上几乎完全失效(4% ≈ 五次里失败四次)。那 71 pp 度量的是"从零到能用"的距离,而 6.5 pp 度量的是"从能用到更好"的距离。这两个数字根本不在一个量级上,把它们放在同一句"widens this gap to"里作比较,本身是这篇摘要最不严谨的地方 —— 它们量的不是同一件事,只是一个小、一个大。
具体可检验的一步:把 next-best 的名字和它在已见配置上的分数一起列出来。【推论】如果某个基线在已见 93.5%、未见 4%,那它的泛化崩塌幅度是 23 倍;而本文是 100% / 75%,崩塌 1.33 倍。 崩塌倍数这个口径,比"领先多少百分点"更能说明"抽象层次"这件事的价值。