榜单第一,出门就摔:给机器人的动作头装上树突

一个会叠毛巾的机器人,成功率 97%。往它的动作里撒十步高斯噪声,再翻转一次夹爪指令,成功率掉到 39%。这两件事发生在同一个模型身上。

一个会叠毛巾的机器人,成功率 97%。往它的动作里撒十步高斯噪声,再翻转一次夹爪指令,成功率掉到 39%。这两件事发生在同一个模型身上。

这不是罕见的个别案例。arXiv 2609.32253《DS-VLA: A Dendritic-inspired Vision-Language-Action Model for Robust Action Control》把这件事做成了对照实验,2026 年 9 月 26 日提交。它测的不是"谁在标准评测里分数高",而是"谁在被打断之后还能把活干完"。【直引】

📉 一张倒置的排名表

先看标准评测(nominal)下五个模型的 LIBERO 平均分:

模型名义成功率扰动后成功率保持率
OpenVLA-OFT97.1039.4540.6%
FAST95.2023.9025.1%
π094.2028.5530.3%
DS-VLA91.6087.3595.4%
GR00T86.5030.7535.5%
【直引:论文 Table 1 / Table 2,LIBERO 四个套件平均;保持率为本文按 87.35/91.60 等比值算出】

名义榜上 DS-VLA 排第四。加上扰动,它排第一,而且第二名和它差 47.90 个百分点。

分套件看更极端。Long 套件(长程任务)里,DS-VLA 从 83.4 掉到 77.8,四个基线的扰动成绩是 1.2、0.0、1.0、0.0。也就是说长程任务在被扰动后,基线基本全部归零,DS-VLA 还留着四分之三。【直引:论文 Table 2】

难度再往上加,DS-VLA 平均成功率是:难度一 87.35,难度二 71.65,难度三 46.00。它在衰减,不是不衰减。【直引:论文 Figure 5】

🔧 扰动是怎么加的

协议加在执行的 7 自由度动作上(平移、旋转、夹爪),并且不给任何扰动指示器,也不给手工设计的恢复信号。

难度噪声标准差作用步数额外破坏
10.1 / 0.002第 10 到 19 步夹爪指令翻转
20.010 / 0.00425 步10 次平移被覆写成固定向量,夹爪强闭 18 步
30.015 / 0.00835 步12 次平移被覆写,夹爪强闭 25 步
难度一的作用窗口只有十步,占一条 145 步轨迹的不到 7%。十步的噪声把 OpenVLA-OFT 从 97.1 打到 39.45,这个比例本身就是结论。【推论】

有意思的是恢复方式。难度从一到三,DS-VLA 成功轨迹的平均长度从 145.4 步涨到 155.2、175.4 步,而动作频率(约 6.5 Hz)、推理延迟(约 120 毫秒)、闭环延迟(约 150 毫秒)基本不动,归一化动作幅度也没变大。它是靠多绕几步把活补回来,不是靠更猛地动作。【直引:论文正文统计】

🧠 树突脉冲动作头

DS-VLA 的动作头换成了一个脉冲神经元结构,论文叫 DH-LIF。

具体参数:三层,每层 1536 个胞体神经元,每个神经元挂两个树突分支。分支通过固定的二值掩码接收互补的输入子集,各自带可学习衰减因子,于是不同分支有不同时间尺度。胞体是可学习阈值的 LIF,膜衰减初始化在 0.95 到 0.99 之间。训练损失是 L1 动作回归,没加门损失、发放率损失或树突正则项。【直引】

小贴士:为什么是脉冲? 脉冲神经元天然带状态。上一时刻的膜电位还留着,等于给控制回路内置了一小段记忆。Transformer 类的动作头每一帧重新看一遍,脉冲头是接着上一帧往下走。机器人被推歪一下,需要记住"刚才我在干什么",这段记忆就是恢复的基础。【推论】

🚪 那道门才是关键

真正拉开差距的是抑制门。每个神经元根据整层输入算出一个系数 g,取值在 0 到 1 之间,同一神经元的两个分支共用它。它只缩放入射电流:g 越大,新证据越进不来。

关键在于它不清空已经存下的树突状态。换句话说,门管的是"这条新信息值不值得写进来",不是"把记忆擦掉"。噪声来了,门关小,异常值进不去;噪声过去,门开大,正常信息继续写。【直引:论文 §3 机制描述】

消融数据把这件事量化了。去掉门之后:

指标变化
平均名义成功率−18.0 个百分点
平均扰动成功率−20.9 个百分点
Long 套件名义−48.4 个百分点
Long 套件扰动−42.2 个百分点
Object 套件扰动+0.8 个百分点(唯一反向)
【直引:论文消融章节】

Long 上掉了四五十个点,说明长程任务几乎全靠这道门维持。Object 在扰动下的 +0.8 是个例外,幅度小到可以当作噪声。

🧭 为什么值得盯

第一,评测口径的洞被指出来了。名义成功率和闭环鲁棒性在现有 VLA 上几乎是两套能力,只报 nominal 分数等于没报。LIBERO 上 97 分的模型,扰动后剩 39 分,这个落差对真机部署是致命的。【判断】

第二,它给了一个便宜的方向。堆视觉语言骨干、换更强的生成式动作解码器都治不了这个问题,因为在扰动下崩的不是感知,是时间整合。一个带衰减记忆和准入门的动作头成本很低。【推论】

第三,抑制门这个结构可以移植。它不依赖特定的 VLA 骨干,是动作头上的一层。任何"观测偶尔会坏"的控制场景都能试。【判断】

⚠️ 要打折的地方

这是预印本,没有同行评审,四位作者(Yaxing Lyu、Jingyi Li、Mingkun Xu、Yujie Wu)的机构信息在摘要页上没有列出。

实验只在 LIBERO 仿真里做,没有真机。扰动是人工注入的合成噪声,和真实的机械打滑、线缆拉扯、视觉丢帧不完全一样。基线数字是论文自己复现的,不是原作者的公布值。DS-VLA 的名义成功率仍然低于三个基线,这个代价没有被消除,只是被换了个方向。【判断】

还有一个更基础的疑问:难度三的 46.00 也是衰减曲线上的一点,多难会把 DS-VLA 也打到零,论文没给。


参考

  • Yaxing Lyu, Jingyi Li, Mingkun Xu, Yujie Wu,《DS-VLA: A Dendritic-inspired Vision-Language-Action Model for Robust Action Control》,arXiv:2609.32253,2026-09-26
  • LIBERO 基准(四个套件:Goal / Object / Spatial / Long)
  • 对照方法:OpenVLA-OFT、FAST、π0、GR00T
暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens