Loading...
正在加载...
请稍候

榜单第一,出门就摔:给机器人的动作头装上树突

QianXun • 2026年09月29日 22:49

一个会叠毛巾的机器人,成功率 97%。往它的动作里撒十步高斯噪声,再翻转一次夹爪指令,成功率掉到 39%。这两件事发生在同一个模型身上。

这不是罕见的个别案例。arXiv 2609.32253《DS-VLA: A Dendritic-inspired Vision-Language-Action Model for Robust Action Control》把这件事做成了对照实验,2026 年 9 月 26 日提交。它测的不是"谁在标准评测里分数高",而是"谁在被打断之后还能把活干完"。【直引】

📉 一张倒置的排名表

先看标准评测(nominal)下五个模型的 LIBERO 平均分:

模型 名义成功率 扰动后成功率 保持率
OpenVLA-OFT 97.10 39.45 40.6%
FAST 95.20 23.90 25.1%
π0 94.20 28.55 30.3%
DS-VLA 91.60 87.35 95.4%
GR00T 86.50 30.75 35.5%

【直引:论文 Table 1 / Table 2,LIBERO 四个套件平均;保持率为本文按 87.35/91.60 等比值算出】

名义榜上 DS-VLA 排第四。加上扰动,它排第一,而且第二名和它差 47.90 个百分点。

分套件看更极端。Long 套件(长程任务)里,DS-VLA 从 83.4 掉到 77.8,四个基线的扰动成绩是 1.2、0.0、1.0、0.0。也就是说长程任务在被扰动后,基线基本全部归零,DS-VLA 还留着四分之三。【直引:论文 Table 2】

难度再往上加,DS-VLA 平均成功率是:难度一 87.35,难度二 71.65,难度三 46.00。它在衰减,不是不衰减。【直引:论文 Figure 5】

🔧 扰动是怎么加的

协议加在执行的 7 自由度动作上(平移、旋转、夹爪),并且不给任何扰动指示器,也不给手工设计的恢复信号。

难度 噪声标准差 作用步数 额外破坏
1 0.1 / 0.002 第 10 到 19 步 夹爪指令翻转
2 0.010 / 0.004 25 步 10 次平移被覆写成固定向量,夹爪强闭 18 步
3 0.015 / 0.008 35 步 12 次平移被覆写,夹爪强闭 25 步

难度一的作用窗口只有十步,占一条 145 步轨迹的不到 7%。十步的噪声把 OpenVLA-OFT 从 97.1 打到 39.45,这个比例本身就是结论。【推论】

有意思的是恢复方式。难度从一到三,DS-VLA 成功轨迹的平均长度从 145.4 步涨到 155.2、175.4 步,而动作频率(约 6.5 Hz)、推理延迟(约 120 毫秒)、闭环延迟(约 150 毫秒)基本不动,归一化动作幅度也没变大。它是靠多绕几步把活补回来,不是靠更猛地动作。【直引:论文正文统计】

🧠 树突脉冲动作头

DS-VLA 的动作头换成了一个脉冲神经元结构,论文叫 DH-LIF。

具体参数:三层,每层 1536 个胞体神经元,每个神经元挂两个树突分支。分支通过固定的二值掩码接收互补的输入子集,各自带可学习衰减因子,于是不同分支有不同时间尺度。胞体是可学习阈值的 LIF,膜衰减初始化在 0.95 到 0.99 之间。训练损失是 L1 动作回归,没加门损失、发放率损失或树突正则项。【直引】

小贴士:为什么是脉冲? 脉冲神经元天然带状态。上一时刻的膜电位还留着,等于给控制回路内置了一小段记忆。Transformer 类的动作头每一帧重新看一遍,脉冲头是接着上一帧往下走。机器人被推歪一下,需要记住"刚才我在干什么",这段记忆就是恢复的基础。【推论】

🚪 那道门才是关键

真正拉开差距的是抑制门。每个神经元根据整层输入算出一个系数 g,取值在 0 到 1 之间,同一神经元的两个分支共用它。它只缩放入射电流:g 越大,新证据越进不来。

关键在于它不清空已经存下的树突状态。换句话说,门管的是"这条新信息值不值得写进来",不是"把记忆擦掉"。噪声来了,门关小,异常值进不去;噪声过去,门开大,正常信息继续写。【直引:论文 §3 机制描述】

消融数据把这件事量化了。去掉门之后:

指标 变化
平均名义成功率 −18.0 个百分点
平均扰动成功率 −20.9 个百分点
Long 套件名义 −48.4 个百分点
Long 套件扰动 −42.2 个百分点
Object 套件扰动 +0.8 个百分点(唯一反向)

【直引:论文消融章节】

Long 上掉了四五十个点,说明长程任务几乎全靠这道门维持。Object 在扰动下的 +0.8 是个例外,幅度小到可以当作噪声。

🧭 为什么值得盯

第一,评测口径的洞被指出来了。名义成功率和闭环鲁棒性在现有 VLA 上几乎是两套能力,只报 nominal 分数等于没报。LIBERO 上 97 分的模型,扰动后剩 39 分,这个落差对真机部署是致命的。【判断】

第二,它给了一个便宜的方向。堆视觉语言骨干、换更强的生成式动作解码器都治不了这个问题,因为在扰动下崩的不是感知,是时间整合。一个带衰减记忆和准入门的动作头成本很低。【推论】

第三,抑制门这个结构可以移植。它不依赖特定的 VLA 骨干,是动作头上的一层。任何"观测偶尔会坏"的控制场景都能试。【判断】

⚠️ 要打折的地方

这是预印本,没有同行评审,四位作者(Yaxing Lyu、Jingyi Li、Mingkun Xu、Yujie Wu)的机构信息在摘要页上没有列出。

实验只在 LIBERO 仿真里做,没有真机。扰动是人工注入的合成噪声,和真实的机械打滑、线缆拉扯、视觉丢帧不完全一样。基线数字是论文自己复现的,不是原作者的公布值。DS-VLA 的名义成功率仍然低于三个基线,这个代价没有被消除,只是被换了个方向。【判断】

还有一个更基础的疑问:难度三的 46.00 也是衰减曲线上的一点,多难会把 DS-VLA 也打到零,论文没给。


参考

  • Yaxing Lyu, Jingyi Li, Mingkun Xu, Yujie Wu,《DS-VLA: A Dendritic-inspired Vision-Language-Action Model for Robust Action Control》,arXiv:2609.32253,2026-09-26
  • LIBERO 基准(四个套件:Goal / Object / Spatial / Long)
  • 对照方法:OpenVLA-OFT、FAST、π0、GR00T

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录