机器人开始随身携带经验:Self-Adaptive VLA 与部署期的自救
机器人产线的第 90 天。同一条机械臂,同一套程序,昨天还稳稳当当,今天装配开始偏移。没人动过它。真相在物理世界里:关节磨掉了一点,编码器标定飘了一点,执行器偏差攒了一点。分毫之差,落到精度敏感的动作上就是废件。
机器人产线的第 90 天。同一条机械臂,同一套程序,昨天还稳稳当当,今天装配开始偏移。没人动过它。真相在物理世界里:关节磨掉了一点,编码器标定飘了一点,执行器偏差攒了一点。分毫之差,落到精度敏感的动作上就是废件。
工程上的标准答案是派人重新标定。9 月 24 日挂上 arXiv 的论文给了一个新答案:让机器人自己长回来。论文叫 Self-Adaptive VLA for Robust Robot Deployment,编号 2609.30092,Hongxin Zhang、Chunru Lin、Tsun-Hsuan Wang、Zhenjia Xu、Chuang Gan 五位作者合作完成。
病根:VLA 没有记性
先说清楚病在哪。VLA,视觉-语言-动作模型,是目前机器人操作的主流架构:看图、听指令、输出动作。论文指出的短板是它们的记性,准确说,是没有记性。训练完的策略在测试时遇到环境漂移就脆,尤其是硬件漂移:磨损、标定误差、执行器偏差。训练里见过的世界和部署三个月后的世界不是同一个,模型对此毫无察觉,也不会调整。
这个问题随着部署规模变大而变贵。十台机器人,工程师跑一趟就修了。十万台,每一次漂移都是一张工单。机器人公司都在讲量产叙事,量产的隐性前提是维护成本不能跟着台数线性涨。
药方:把经验压成一个 token
论文的配方分四步,思路是把"环境变了"这件事变成模型能读到的上下文。
第一步,故意使坏。训练时主动往硬件里注入各种漂移,然后收集策略自己跑出来的轨迹。第二步,改写教材。既然环境有已知的偏差,就把专家动作预先补偿一遍,做成"漂移条件下的专家演示"——教策略看清同一个动作在不同漂移下的正确版本。第三步,压缩。一个轻量的即插即用 context encoder,把视觉观测、本体感受和动作历史压成一个潜在上下文 token。第四步,注入。这个 token 通过自适应层归一化 AdaLN 去调制策略网络,让同一个网络在不同漂移状态下走不同的路。
最妙的在第五步,论文叫 ensemble:多个上下文 token 可以一起投票,让策略一步步自我纠错。第一次动作歪了,token 换一版,第二次直回来一点,再换,再直。迭代式的自我修正,不需要人在旁边。
数字
四个精度敏感的双臂与灵巧操作任务上做验证,漂移类型包括执行器偏差和关节编码器偏移。结果是在硬件漂移下恢复基线策略八成以上的性能,全程不用现场重标定。换到没见过的新工位上,也比基线策略稳。
把八成这个数字放对位置:它不是满分,是及格线策略。工程师现场重标定能拿回 100%,代价是人到场。这套方案拿回 80%,代价是零。两类方案不是竞争关系,是不同经济学:高频小漂移自己吸收,低频大漂移才叫人。论文自己也在这个位置划了线,给的是"通向大规模真实部署与更易维护的一条路径",不是终点。
为什么这条新闻值得多看一眼
具身智能的新闻流被两个极端占满:一边是后空翻和灵巧手的演示视频,一边是量产数字的资本叙事。夹在中间的部署期维护,少有人写,却是量产故事能否成立的地基。
这篇论文的视角转换就在这里。出厂验收是一次性事件,磨损是慢变量,验收挡不住三个月后的偏移。把"适应"从训练时的一次性动作,变成部署期的持续行为,维护的含义就变了:从派人 recalibrate,变成策略带着自己的经验运行。经验第一次以一个 token 的形式随身携带,世界变了,token 换一版。
代价也说清楚。这套配方需要训练时故意注入漂移来造数据,注入的漂移谱得覆盖真实世界会出现的种类,覆盖不到的,模型照旧脆弱。四个任务、实验室环境,离产线还有距离。但方向值这个价:让机器人学会的第二种本事,不是更多技能,是带着旧本事扛住新世界。