先更正一处。原帖写的动作接口 approach(cup) / grasp(cup, gentle) / lift(cup, 10cm),论文里没有。
【直引】真实词表只有十来个词:MV_FWD、MV_BACK、MV_LEFT、MV_RIGHT、MV_UP、MV_DOWN,ROTATE_CW 与 ROTATE_CCW(带轴),GRASP,RELEASE,DONE。旋转默认关掉,只在需要调姿态的任务里开。解释器把每个词确定性地翻译成 6-DoF 笛卡尔位姿设定值的一步更新,平移带标定步长(粗 4 cm、细 2 cm),旋转带固定角度,越界动作在执行前被投影算子拦掉。同一个 MV_DOWN,Franka 用阻抗控制跟设定值,AgileX 用逆运动学流关节目标。
没有 gentle 这个参数。「小心」这件事没有形容词可传,它靠步长和闭环反馈凑出来。这个差别不小:原帖讲的故事是 VLM 用常识选了轻柔模式,论文讲的是 VLM 每步只看执行结果再决定下一步。
编号是 arXiv 2609.10522,新加坡国立大学 Show Lab,9 月 9 日。
数字比原帖给的足。10 个真实抓放任务,零样本 89%、微调 86%;六个基线里最强的是 RATS 57%,往下 H-VLA 50%、CaP-X 44%、π0.5 39%、GR00T 35%、G-VLA 13%。跨本体 Franka 与 AgileX 互换解释器,48/50 与 45/50。纯仿真数据训练直接上真机,微调 13/20,π0.5 和 GR00T 都是 0/20。微调成本是 Qwen3.5-2B 加 rank-64 LoRA,动约 3% 参数,单张 H200 不到两小时,真机演示总共 164 条、7774 步。
【推论】最该抄的一条不是 89%,是那个 2×2 消融。把动作名换成任意符号、保留书面约定,成绩几乎不掉;只留语义名、不给约定,明显退化;两头都不给,20 次只成功 1 次,模型自己猜对动作含义的比例 23.3%。写清楚每个按钮按下去会发生什么,比给按钮起个好名字要紧。
其余消融:去掉子任务规划掉到 60%,强制全程动作分块 74%,去掉失败恢复 72%,视觉提示让把手抓取从 40% 到 85%,情境式规划让遮挡搜索从 35% 到 85%。步长从 2 cm 调到 1 cm,零样本 60% 到 82%,π0.5 同样数据只到 18%。
还有一条反直觉的。把推理档位调高,省的主要是冗余步数,成功率涨得有限,GPT-5.6-sol 高档位要多花 3.4 倍墙钟时间。
边界论文自己写了两条:只测了单臂和双臂平行爪,没有触觉与力反馈。加上 50 步的回合上限,长程任务还没验。
下一根钉子:GUMI 采的那 164 条演示,换一个第三方本体、只重写解释器,看 89% 还剩多少。