Loading...
正在加载...
请稍候

让大模型闭嘴,让小模型动手

QianXun • 2026年10月03日 05:17

让大模型闭嘴,让小模型动手

具身智能圈最近有个共同的敌人:延迟。

VLA 模型的推理延迟是物理世界里最讨厌的东西。论文的诊断很直白,因为模型规模大,推理延迟高,用来选动作的观测在动作真正执行时往往已经过期,于是形成一个分布偏移,把可靠性拉下去。真实机器人不会为了等推理而暂停。

这几个月大家的解法都朝着同一个方向:把慢模型变快,或者绕开它。斯坦福 Perry Dong 与 Kuo-Han Hung、Dorsa Sadigh、Chelsea Finn 四人这条线选了一个此前少有人走的角度:慢模型照旧慢,让它只负责提建议,另配一个飞快的小模型负责动手。

论文是 9 月 16 日挂上 arXiv 的(2609.18207),10 月 2 日在机器人圈子里传开。它叫 Reinforcement Learning for Real-Time Vision-Language-Action Policies。

提议,然后修改

架构上分成两个时间尺度。

慢的那层是异步的,冻结的预训练 VLA 在后台提出候选动作块,用的是它强行为先验。快的那层是同步的,一个轻量编辑策略拿到最新观测,对动作做有界修改。中间还有一个 Q 值环节,当场从候选块里挑一个。

这个安排里有一处反直觉的地方。以往的做法是让慢的大模型去审查快的小策略,这篇反过来,快的小策略去编辑慢的大模型。Perry Dong 的表述是,与其优化 VLA 本身的推理延迟,不如异步地微调并执行策略,同时维持一个固定的实时控制频率。

奖励信号的边界同样关键。Q 值只作用于编辑,不回传到 VLA 主干。这意味着大模型的先验被当成只读资产保存,RL 训的是一个附加在上面的编辑层。

参数 论文的设定
基座策略 π0.5(Physical Intelligence)
训练框架 建在 EXPO-FT 之上
奖励 稀疏二值,只区分任务成功与否
真机在线数据上限 10 分钟
人工干预 全程没有

42% 到 97%

四个真机任务:机器人传球、平衡球、桌上足球踢球,外加动态抓取物体。在把在线机器人数据卡在 10 分钟的条件下,平均策略表现从 42% 提到 97%。

仿真侧的对照是 Kinetix 基准:10 个环境里,让一个带延迟的策略在延迟组与非延迟组中表现最好,10 个环境全部做到。

需要说清楚的是这 42% 与 97% 是什么口径。它是四个任务上的平均策略表现,基线是同一个 π0.5 在延迟条件下不做实时修正的表现,不是与完全无延迟的基线比。论文摘要里没有给出无延迟上界。

10 分钟这个数字的分量也要掂量。四个任务每个 10 分钟,合计不到一个小时的在线交互,配合预训练模型的先验。这个样本效率确实高,但与需要几百小时数据的从头训练不是一个量级的任务设定。

【直引】论文明确写了这是 RL 微调,Q 信号从不回传到 VLA 主干。在线数据封顶 10 分钟,全程无人工干预。

既有工作与它错开的位置

论文自己划清了与前作的边界。以往的异步策略执行方法大多建立在模仿学习上,缺少一条走出训练分布去提高可靠性的机制。这篇补的是这个。

同期 arXiv 上还有几篇同类思路的。Divide-and-Remember(2610.00982)把记忆选择当成优化问题,从模仿学习的 POMDP 表述推出最优记忆最大化动作与记忆之间的条件互信息,写成 I(a_t; m_t | o_t),在 RoboMME 的 16 个长程操作任务上用 64 token 预算拿到最好平均成功率。UniWAM(2610.02054)把物理推理器、世界生成器与动作预测器捏进一个架构,报告了人机共同训练的对数线性标度律。

这三篇的共同点是把某一段拆出来专门做,EXPO-FT 拆的是时间。

FlashRT 是工程侧对应的例子。Scale AI 与 Hugging Face 的 FineART 论文致谢里点名了 Liang Su 与 FlashRT,那是为机器人 VLA 实时推理做的开源引擎,核心动机与 3 到 5 Hz 的原生推理速度有关。EXPO-FT 走的是不改模型本身的另一条路。

【判断】两条路不冲突,量级估算也说明问题。VLA 原生速度在 3 到 5 Hz,也就是 200 到 333 毫秒一个动作。把策略本身加速十倍到 30 到 50 Hz,仍然落在人手指和双臂协调的延迟预算边缘。编辑层方案对模型零改动,是工程上更短的路。

论文要核的四处

  • arXiv v1 为预印本,未经同行评审
  • 42% 与 97% 是四任务平均,基线是延迟条件下的同一策略
  • 真机数据 10 分钟的上限是每个任务还是合计,摘要未明确
  • π0.5 是闭源模型,第三方无法直接复现

【推论】这篇真正可迁移的是那条奖励边界。把大模型当只读先验、把改动量交给小网络、用稀疏二值奖励训练,这个组合在任何有昂贵先验的实时系统上都成立。自动驾驶、推荐实时决策,都在这条线上。

参考来源

  • arXiv:2609.18207,Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn
  • 项目页 pd-perry.github.io/real-time-expo-ft
  • LeoKharon 在 X 上的传播,2026-10-02
  • arXiv:2610.00982 Divide-and-Remember
  • arXiv:2610.02054 UniWAM

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录