SAPS 共享自主:机器人自己跑 8.3%,人机各出一半力气跑 77.4%
2026 年 10 月 6 日,CMU 的一篇 arXiv 预印本更新到 v2。论文标题里的关键词是「共享自主」,方法名 SAPS。核心结论一句话能说完:机器人自己跑成功率 8.3%,人全程遥控 34.5%,人和机器人各出一半力气 77.4%。
2026 年 10 月 6 日,CMU 的一篇 arXiv 预印本更新到 v2。论文标题里的关键词是「共享自主」,方法名 SAPS。核心结论一句话能说完:机器人自己跑成功率 8.3%,人全程遥控 34.5%,人和机器人各出一半力气 77.4%。
这是「人机协作」这个老话题里,少见的把三个数摆在同一张表上还做了显著性检验的论文。
🎛 三种把权交给谁的方式
VLA 模型的问题是脆弱。物体位置一变、外观一变、指令一变,策略就可能做错任务或卡在无效恢复动作上。以前的做法要么给策略外挂一个动力学模型,要么改扩散采样器,要么加一个显式推理模块。SAPS 什么都不加,它只在动作层面仲裁。
三种仲裁方式,区别只在 α 怎么算:
- Takeover(接管):人一动,α 直接归零;人一停,α 回到 1。纯开关。
- Blending(混合):人一动,α 固定 0.5,人机各半;人一停,回 1.0。
- Cosine(余弦):先算人与策略动作的余弦相似度 c,再过一层 sigmoid,γ = 1/(1+e^(−6c)),α = γ。两人方向越一致,模型权重越高。
夹爪是单独一路:用户可以从当前夹爪状态切换过来,而策略在仿真里要连续切两次、或在真机上等 5 秒超时,才能改回用户发起的状态。论文说这个锁存设计是为了给用户更多抓取控制权,同时减少意外掉落。
📋 三个数摆在一张表上
14 名能正常操作的用户(18 至 37 岁,9 男 5 女,伦理审批通过)跑 LIBERO-PRO 仿真,真机部分 13 人(1 人硬件搭建遇到困难)。每个任务每种方法重复 3 次,每任务 12 个 episode。
| 指标 | 全自主 | 纯遥控 | Cosine | Blending | Takeover |
|---|---|---|---|---|---|
| 仿真成功率(%) | 8.3 | 44.0 | 75.0 | 44.0 | 65.5 |
| 真机成功率(%) | 8.3 | 34.5 | 67.2 | 64.3 | 77.4 |
| 仿真完成时间(秒) | 13.3 | 23.2 ± 3.1 | 20.3 ± 5.2 | 17.8 ± 4.2 | 21.4 ± 5.3 |
| 真机完成时间(秒) | 44.8 | 42.4 ± 4.5 | 36.1 ± 7.9 | 34.4 ± 6.9 | 37.8 ± 7.3 |
| 仿真人工介入(%) | 0.0 | 100.0 | 42.9 ± 14.2 | 46.5 ± 20.6 | 32.2 ± 10.3 |
| 真机人工介入(%) | 0.0 | 100.0 | 43.0 ± 12.4 | 45.4 ± 13.8 | 44.3 ± 10.2 |
真机成功率最高的是 Takeover 的 77.4%,而介入率最低的却是仿真里的 Takeover 32.2%。真机上三种方法的介入率挤在 43% 到 45% 之间,差别很小。摘要里那句「介入只需 45% 的时间」是个中间值。
显著性检验的口径值得留意:与全自主比用 Fisher 精确检验(因为全自主没法跟具体的人配对),六次两两比较 Holm 校正后全部 p < 0.005。与遥操作比用 Wilcoxon 符号秩检验,真机上三种方法都显著(p ≤ 0.017),仿真里只有 Cosine 显著(p = 0.015),Takeover 数值更高但没到显著(p = 0.067),Blending 与遥操作成功率完全相同(p = 0.92)。
Blending 在仿真里等于白干这一条,比平均值更值得记住:固定 50/50 的混合在仿真任务上带来的增益是零。
仲裁只发生在动作层面,策略推理那一段一个字节都没改。
🦾 NASA-TLX 与一个反直觉的排序
| 方法 | 仿真 TLX(n=14) | 真机 TLX(n=13) |
|---|---|---|
| 纯遥控 | 49.0(18.6) | 53.8(18.7) |
| Takeover | 32.2(13.6) | 36.2(18.6) |
| Blending | 53.1(18.0) | 38.5(18.4) |
| Cosine | 31.1(18.2) | 41.2(11.7) |
Blending 在仿真里的 TLX 是 53.1,比纯遥控的 49.0 还高。固定五五分在负担感上没有帮助。
🪑 那位四肢瘫痪的参与者
论文最有分量的一段不是数据,是一个案例。参与者 40 岁男性,ASIA C5 完全性四肢瘫痪,损伤发生在 20 年前,用 Xbox 自适应控制器,靠残余肩部动作驱动大摇杆和按钮,7 分量表上对摇杆和控制机器人的经验都打满分。
结果有点拧巴:他在 LIBERO 里成功率提高 8.3%、完成时间缩短 16.9%;真机上时间缩短 15.5%,但成功率与遥操作持平。
负担感上,他在 LIBERO 里报 Takeover 25.0、Cosine 28.3,都低于遥操作的 39.2。可到了真机,他给遥操作打 27.5,Takeover 36.7、Blending 44.2、Cosine 40.0,全部高于遥操作。
然后他做强制排序,把遥操作排在第一位。论文的解释援引了先前的辅助型共享自主研究:使用者可能偏好保留更多控制权,哪怕这并不优化客观任务表现。
这条数据的分布也很特殊:他自报的遥操作负担比其他用户均值低 49%,而仲裁方法的均值比用户研究组高 4%。
⚠️ 论文自己列的限制
作者写得很直接:SAPS 需要测试时有人在环,性能取决于操作者的时机、技巧和遥操作界面。由于它用的是与策略的混合,而不是显式的任务进度、意图、不确定性、接触或安全估计,当策略「自信地错」时它会失效。Cosine 与 Blending 都可能让物体撞上障碍物,因为策略想绕左边走、用户想垂直往右走。用户可以把摇杆反向推让机器人原路退回,但作者认为部分分歧的场景还需要更动态的仲裁。
评测范围也有限:有限几个仿真与真机任务,更广的 LIBERO 覆盖、更多操作者、更多本体、更多策略底座都会有帮助。
🧭 为什么这件事值得看
过去两年具身智能的主线故事是让模型自己跑得更久。这篇论文给出的是另一条路:模型跑不完的时候,人回来扶一把,而人扶的那几秒不叫失败,叫接管。
成本也低:π0.5 是开源的预训练 VLA,SAPS 在它输出的动作上做仲裁,不改架构、不重训、不加辅助模型。按 12B 激活 2.5B 这类小底座算,部署门槛并不高。
论文仍是预印本,未通过同行评审。作者顺序由掷硬币决定,Crystal Zhou 与 Jehan Yang 同为第一作者,Douglas J. Weber 与 Zackory Erickson 同为指导作者。项目页 shared-autonomy-policy.github.io。
信源:arXiv:2606.15568v2《SAPS: Shared Autonomy for Policy Steering by Blending Teleoperation with a Pretrained VLA》,v1 2026-06-14 提交、v2 2026-10-06 修订,cs.RO,CMU,NSF Grant No. 2341352 资助。表中全部数字与显著性检验取自论文 Table I、Table II 与第四章正文,n 值分别为 14 与 13(1 人因硬件搭建困难退出真机部分)。案例研究为单人单次,非群体统计。预印本未评审。
#具身智能 #VLA #共享自主 #人机协作 #机器人