榜单第一,出门就摔:给机器人的动作头装上树突
一个会叠毛巾的机器人,成功率 97%。往它的动作里撒十步高斯噪声,再翻转一次夹爪指令,成功率掉到 39%。这两件事发生在同一个模型身上。
一个会叠毛巾的机器人,成功率 97%。往它的动作里撒十步高斯噪声,再翻转一次夹爪指令,成功率掉到 39%。这两件事发生在同一个模型身上。
这不是罕见的个别案例。arXiv 2609.32253《DS-VLA: A Dendritic-inspired Vision-Language-Action Model for Robust Action Control》把这件事做成了对照实验,2026 年 9 月 26 日提交。它测的不是"谁在标准评测里分数高",而是"谁在被打断之后还能把活干完"。【直引】
📉 一张倒置的排名表
先看标准评测(nominal)下五个模型的 LIBERO 平均分:
| 模型 | 名义成功率 | 扰动后成功率 | 保持率 |
|---|---|---|---|
| OpenVLA-OFT | 97.10 | 39.45 | 40.6% |
| FAST | 95.20 | 23.90 | 25.1% |
| π0 | 94.20 | 28.55 | 30.3% |
| DS-VLA | 91.60 | 87.35 | 95.4% |
| GR00T | 86.50 | 30.75 | 35.5% |
名义榜上 DS-VLA 排第四。加上扰动,它排第一,而且第二名和它差 47.90 个百分点。
分套件看更极端。Long 套件(长程任务)里,DS-VLA 从 83.4 掉到 77.8,四个基线的扰动成绩是 1.2、0.0、1.0、0.0。也就是说长程任务在被扰动后,基线基本全部归零,DS-VLA 还留着四分之三。【直引:论文 Table 2】
难度再往上加,DS-VLA 平均成功率是:难度一 87.35,难度二 71.65,难度三 46.00。它在衰减,不是不衰减。【直引:论文 Figure 5】
🔧 扰动是怎么加的
协议加在执行的 7 自由度动作上(平移、旋转、夹爪),并且不给任何扰动指示器,也不给手工设计的恢复信号。
| 难度 | 噪声标准差 | 作用步数 | 额外破坏 |
|---|---|---|---|
| 1 | 0.1 / 0.002 | 第 10 到 19 步 | 夹爪指令翻转 |
| 2 | 0.010 / 0.004 | 25 步 | 10 次平移被覆写成固定向量,夹爪强闭 18 步 |
| 3 | 0.015 / 0.008 | 35 步 | 12 次平移被覆写,夹爪强闭 25 步 |
有意思的是恢复方式。难度从一到三,DS-VLA 成功轨迹的平均长度从 145.4 步涨到 155.2、175.4 步,而动作频率(约 6.5 Hz)、推理延迟(约 120 毫秒)、闭环延迟(约 150 毫秒)基本不动,归一化动作幅度也没变大。它是靠多绕几步把活补回来,不是靠更猛地动作。【直引:论文正文统计】
🧠 树突脉冲动作头
DS-VLA 的动作头换成了一个脉冲神经元结构,论文叫 DH-LIF。
具体参数:三层,每层 1536 个胞体神经元,每个神经元挂两个树突分支。分支通过固定的二值掩码接收互补的输入子集,各自带可学习衰减因子,于是不同分支有不同时间尺度。胞体是可学习阈值的 LIF,膜衰减初始化在 0.95 到 0.99 之间。训练损失是 L1 动作回归,没加门损失、发放率损失或树突正则项。【直引】
小贴士:为什么是脉冲? 脉冲神经元天然带状态。上一时刻的膜电位还留着,等于给控制回路内置了一小段记忆。Transformer 类的动作头每一帧重新看一遍,脉冲头是接着上一帧往下走。机器人被推歪一下,需要记住"刚才我在干什么",这段记忆就是恢复的基础。【推论】
🚪 那道门才是关键
真正拉开差距的是抑制门。每个神经元根据整层输入算出一个系数 g,取值在 0 到 1 之间,同一神经元的两个分支共用它。它只缩放入射电流:g 越大,新证据越进不来。
关键在于它不清空已经存下的树突状态。换句话说,门管的是"这条新信息值不值得写进来",不是"把记忆擦掉"。噪声来了,门关小,异常值进不去;噪声过去,门开大,正常信息继续写。【直引:论文 §3 机制描述】
消融数据把这件事量化了。去掉门之后:
| 指标 | 变化 |
|---|---|
| 平均名义成功率 | −18.0 个百分点 |
| 平均扰动成功率 | −20.9 个百分点 |
| Long 套件名义 | −48.4 个百分点 |
| Long 套件扰动 | −42.2 个百分点 |
| Object 套件扰动 | +0.8 个百分点(唯一反向) |
Long 上掉了四五十个点,说明长程任务几乎全靠这道门维持。Object 在扰动下的 +0.8 是个例外,幅度小到可以当作噪声。
🧭 为什么值得盯
第一,评测口径的洞被指出来了。名义成功率和闭环鲁棒性在现有 VLA 上几乎是两套能力,只报 nominal 分数等于没报。LIBERO 上 97 分的模型,扰动后剩 39 分,这个落差对真机部署是致命的。【判断】
第二,它给了一个便宜的方向。堆视觉语言骨干、换更强的生成式动作解码器都治不了这个问题,因为在扰动下崩的不是感知,是时间整合。一个带衰减记忆和准入门的动作头成本很低。【推论】
第三,抑制门这个结构可以移植。它不依赖特定的 VLA 骨干,是动作头上的一层。任何"观测偶尔会坏"的控制场景都能试。【判断】
⚠️ 要打折的地方
这是预印本,没有同行评审,四位作者(Yaxing Lyu、Jingyi Li、Mingkun Xu、Yujie Wu)的机构信息在摘要页上没有列出。
实验只在 LIBERO 仿真里做,没有真机。扰动是人工注入的合成噪声,和真实的机械打滑、线缆拉扯、视觉丢帧不完全一样。基线数字是论文自己复现的,不是原作者的公布值。DS-VLA 的名义成功率仍然低于三个基线,这个代价没有被消除,只是被换了个方向。【判断】
还有一个更基础的疑问:难度三的 46.00 也是衰减曲线上的一点,多难会把 DS-VLA 也打到零,论文没给。
参考
- Yaxing Lyu, Jingyi Li, Mingkun Xu, Yujie Wu,《DS-VLA: A Dendritic-inspired Vision-Language-Action Model for Robust Action Control》,arXiv:2609.32253,2026-09-26
- LIBERO 基准(四个套件:Goal / Object / Spatial / Long)
- 对照方法:OpenVLA-OFT、FAST、π0、GR00T