SAPS 共享自主:机器人自己跑 8.3%,人机各出一半力气跑 77.4%

2026 年 10 月 6 日,CMU 的一篇 arXiv 预印本更新到 v2。论文标题里的关键词是「共享自主」,方法名 SAPS。核心结论一句话能说完:机器人自己跑成功率 8.3%,人全程遥控 34.5%,人和机器人各出一半力气 77.4%。

目录
  1. 🎛 三种把权交给谁的方式
  2. 📋 三个数摆在一张表上
  3. 🦾 NASA-TLX 与一个反直觉的排序
  4. 🪑 那位四肢瘫痪的参与者
  5. ⚠️ 论文自己列的限制
  6. 🧭 为什么这件事值得看

2026 年 10 月 6 日,CMU 的一篇 arXiv 预印本更新到 v2。论文标题里的关键词是「共享自主」,方法名 SAPS。核心结论一句话能说完:机器人自己跑成功率 8.3%,人全程遥控 34.5%,人和机器人各出一半力气 77.4%。

这是「人机协作」这个老话题里,少见的把三个数摆在同一张表上还做了显著性检验的论文。

🎛 三种把权交给谁的方式

VLA 模型的问题是脆弱。物体位置一变、外观一变、指令一变,策略就可能做错任务或卡在无效恢复动作上。以前的做法要么给策略外挂一个动力学模型,要么改扩散采样器,要么加一个显式推理模块。SAPS 什么都不加,它只在动作层面仲裁。

三种仲裁方式,区别只在 α 怎么算:

  • Takeover(接管):人一动,α 直接归零;人一停,α 回到 1。纯开关。
  • Blending(混合):人一动,α 固定 0.5,人机各半;人一停,回 1.0。
  • Cosine(余弦):先算人与策略动作的余弦相似度 c,再过一层 sigmoid,γ = 1/(1+e^(−6c)),α = γ。两人方向越一致,模型权重越高。
「人动没动」用同一个阈值 ε = 10⁻³ 判定,即人类指令的 L2 范数。

夹爪是单独一路:用户可以从当前夹爪状态切换过来,而策略在仿真里要连续切两次、或在真机上等 5 秒超时,才能改回用户发起的状态。论文说这个锁存设计是为了给用户更多抓取控制权,同时减少意外掉落。

📋 三个数摆在一张表上

14 名能正常操作的用户(18 至 37 岁,9 男 5 女,伦理审批通过)跑 LIBERO-PRO 仿真,真机部分 13 人(1 人硬件搭建遇到困难)。每个任务每种方法重复 3 次,每任务 12 个 episode。

指标全自主纯遥控CosineBlendingTakeover
仿真成功率(%)8.344.075.044.065.5
真机成功率(%)8.334.567.264.377.4
仿真完成时间(秒)13.323.2 ± 3.120.3 ± 5.217.8 ± 4.221.4 ± 5.3
真机完成时间(秒)44.842.4 ± 4.536.1 ± 7.934.4 ± 6.937.8 ± 7.3
仿真人工介入(%)0.0100.042.9 ± 14.246.5 ± 20.632.2 ± 10.3
真机人工介入(%)0.0100.043.0 ± 12.445.4 ± 13.844.3 ± 10.2
对照组的两个数要这么读:全自主那列的 0.0 介入率是定义使然,它本来就没有人。遥操作的 100.0 同理。这两列是参照,不是战绩。

真机成功率最高的是 Takeover 的 77.4%,而介入率最低的却是仿真里的 Takeover 32.2%。真机上三种方法的介入率挤在 43% 到 45% 之间,差别很小。摘要里那句「介入只需 45% 的时间」是个中间值。

显著性检验的口径值得留意:与全自主比用 Fisher 精确检验(因为全自主没法跟具体的人配对),六次两两比较 Holm 校正后全部 p < 0.005。与遥操作比用 Wilcoxon 符号秩检验,真机上三种方法都显著(p ≤ 0.017),仿真里只有 Cosine 显著(p = 0.015),Takeover 数值更高但没到显著(p = 0.067),Blending 与遥操作成功率完全相同(p = 0.92)。

Blending 在仿真里等于白干这一条,比平均值更值得记住:固定 50/50 的混合在仿真任务上带来的增益是零。

仲裁只发生在动作层面,策略推理那一段一个字节都没改。

🦾 NASA-TLX 与一个反直觉的排序

方法仿真 TLX(n=14)真机 TLX(n=13)
纯遥控49.0(18.6)53.8(18.7)
Takeover32.2(13.6)36.2(18.6)
Blending53.1(18.0)38.5(18.4)
Cosine31.1(18.2)41.2(11.7)
仿真的平均最优是 Cosine 的 31.1,遥操作 49.0 降了约 37%。真机的最优却是 Takeover 的 36.2,对遥操作 53.8 降约 33%。摘要说的 20.8% 与 28.2%,是论文自己取的另一组对照算法。

Blending 在仿真里的 TLX 是 53.1,比纯遥控的 49.0 还高。固定五五分在负担感上没有帮助。

🪑 那位四肢瘫痪的参与者

论文最有分量的一段不是数据,是一个案例。参与者 40 岁男性,ASIA C5 完全性四肢瘫痪,损伤发生在 20 年前,用 Xbox 自适应控制器,靠残余肩部动作驱动大摇杆和按钮,7 分量表上对摇杆和控制机器人的经验都打满分。

结果有点拧巴:他在 LIBERO 里成功率提高 8.3%、完成时间缩短 16.9%;真机上时间缩短 15.5%,但成功率与遥操作持平。

负担感上,他在 LIBERO 里报 Takeover 25.0、Cosine 28.3,都低于遥操作的 39.2。可到了真机,他给遥操作打 27.5,Takeover 36.7、Blending 44.2、Cosine 40.0,全部高于遥操作。

然后他做强制排序,把遥操作排在第一位。论文的解释援引了先前的辅助型共享自主研究:使用者可能偏好保留更多控制权,哪怕这并不优化客观任务表现。

这条数据的分布也很特殊:他自报的遥操作负担比其他用户均值低 49%,而仲裁方法的均值比用户研究组高 4%。

⚠️ 论文自己列的限制

作者写得很直接:SAPS 需要测试时有人在环,性能取决于操作者的时机、技巧和遥操作界面。由于它用的是与策略的混合,而不是显式的任务进度、意图、不确定性、接触或安全估计,当策略「自信地错」时它会失效。Cosine 与 Blending 都可能让物体撞上障碍物,因为策略想绕左边走、用户想垂直往右走。用户可以把摇杆反向推让机器人原路退回,但作者认为部分分歧的场景还需要更动态的仲裁。

评测范围也有限:有限几个仿真与真机任务,更广的 LIBERO 覆盖、更多操作者、更多本体、更多策略底座都会有帮助。

🧭 为什么这件事值得看

过去两年具身智能的主线故事是让模型自己跑得更久。这篇论文给出的是另一条路:模型跑不完的时候,人回来扶一把,而人扶的那几秒不叫失败,叫接管。

成本也低:π0.5 是开源的预训练 VLA,SAPS 在它输出的动作上做仲裁,不改架构、不重训、不加辅助模型。按 12B 激活 2.5B 这类小底座算,部署门槛并不高。

论文仍是预印本,未通过同行评审。作者顺序由掷硬币决定,Crystal Zhou 与 Jehan Yang 同为第一作者,Douglas J. Weber 与 Zackory Erickson 同为指导作者。项目页 shared-autonomy-policy.github.io。


信源:arXiv:2606.15568v2《SAPS: Shared Autonomy for Policy Steering by Blending Teleoperation with a Pretrained VLA》,v1 2026-06-14 提交、v2 2026-10-06 修订,cs.RO,CMU,NSF Grant No. 2341352 资助。表中全部数字与显著性检验取自论文 Table I、Table II 与第四章正文,n 值分别为 14 与 13(1 人因硬件搭建困难退出真机部分)。案例研究为单人单次,非群体统计。预印本未评审。

#具身智能 #VLA #共享自主 #人机协作 #机器人

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens