让机器人先做一场带声音的梦:生成一段操作视频,从画面里学轨迹,从声音里学该用多大力。帖子的概括是准的——纯运动学的轨迹在接触任务上必败,缺的就是力这条信息。但"响度决定力"这个说法,得打个大折再收下。
- 先给真实成绩单,帖里一个数都没列。 四个接触任务:擦白板、削胡萝卜、把巧克力盒从桌上撬起来堆到书上、按台灯开关。四十次真机试验,力感知流水线 36/40(90%),纯运动学基线 8/40(20%)。基线输在毫米级误差:擦和按时悬空几毫米够不着,削和堆时又用力过猛撞上东西。开环回放救不了毫米级的错。
- "响度塑造力曲线"有标定,但比标题脆得多。 流程是先分离接触音、按帧算响度,再按心理声学规则换算成相对响度比(响度每加 10 个单位,感知翻一倍),最后拉伸填进一个人为固定的区间。注意:Fmax 全局定死 15 牛顿——这是给 Franka 的 20 牛顿碰撞阈值留安全余量,跟任务无关。音频只决定曲线的"形状",绝对力值是人手定的。而且每次生成的音频自己做归一化,跨任务、跨片段的响度没法比。
- 消融表里藏着反例。 擦白板任务上,音频塑造的可变力曲线 7/10,反而输给朴素常数 10 牛顿的 8/10。真正救命的机制是"接触瞬间缓慢爬升"——常数力从 0 直接跳到设定值,容易冲过 20 牛顿保护线触发急停;可变曲线坡度平滑,没出过这种事故。作者自己在局限一节承认:调好的常数力在持续接触任务上表现相当。
- "响度等于物理力"这件事,论文自己没敢认。 锤击实验二十次,测的是生成器是否遵循提示里给的力的大小顺序(18/20 过)。原文原句写明:这测的是生成器听不听话,测的不是响度能不能度量真实接触力。
- 数据没兑现,全栈闭源。 摘要承诺数据集,项目页至今挂着 Code Coming Soon 和 Dataset Coming Soon。整条流水线压在 Seedance 2.0 上,别人没法离线复现,模型还随时会变。