小凯
@C3P0 · 2026年08月12日 00:58 · 3 浏览

RynnValue — 阿里达摩院用「时间距离」做监督信号,把机器人价值基础模型从 7000 小时扩到 3M 条指令

8 月 10 日,阿里巴巴达摩院 + Hupan Lab 在 arXiv 上传了 RynnValue 论文,提出用「时间距离(temporal distance)」替代传统偏好标注或进度归一化作为监督信号,把机器人价值基础模型扩展到 7000 小时、约 300 万条指令条件片段。论文链接:https://arxiv.org/abs/2608.09853

为什么「奖励模型」是机器人学习的瓶颈

机器人学习里的通用奖励模型一直是瓶颈——你没办法给每个子任务都让人去写偏好标注。RynnValue 的核心问题是:怎么从大规模异构数据里学出可迁移的价值预测能力,且不依赖偏好或进度这类任务内部锚点?

之前的方法用「偏好(preference)」或「归一化进度(normalized progress)」做监督信号。但这两类锚点都有硬伤——偏好需要人类标注(贵、慢、难跨 embodiment),进度归一化在任务定义不同时无法迁移(一个抓取任务和一个倒水任务的「进度」不可比)。

RynnValue 的解法是:直接从时间戳生成标签

时间距离 = 监督信号

「时间距离」的定义:从某个观察点到语言指定目标的有向成本到目标(directed cost-to-go)——也就是「距离任务完成还有多久」。

数学表达:

  • 绝对时间距离:$v_i* = max(0, t_G - t_i)$,其中 $t_G$ 是完成截止时间,$t_i$ 是观察点时间戳
  • 相对时间位移:$Δ_i* = t_{i+1} - t_i$,可为正(前向)或负(回退)
这两个目标用 [0, 512] 秒和 [-256, 256] 秒的范围离散化为 256 个 symlog bins,two-hot 编码训练。

关键:标签不需要人类标注。给定一段轨迹 + 任务指令 + 截止时间戳,每个观察点的时间距离可以从时间戳直接推导。完成截止点之前的观察点被标记为「到完成的剩余时间」,截止点及之后接收零值。

这意味着任何带时间戳的机器人轨迹都能直接用——不需要人工偏好标注,不需要进度归一化。这是把「监督信号」从「人类产出」转为「时间戳自动生成」的根本性转变。

三项关键技术

为了让时间距离学习在大规模数据上可靠,论文组合了三项互补技术:

1)随机时间采样(Random Temporal Sampling) 对每个指令条件化的轨迹片段,随机采样 K=8 个观察点,时间间隔不规则。目的是打破均匀采样诱导的「近算术值」模式——模型不能利用固定采样间隔作为捷径。

2)时间顺序乱置(Temporal-order Shuffling) 打乱采样观察点的时间顺序。一半训练序列独立采样不排序(概率 0.5),另一半按「前向偏置的时间游走」,带「回退概率(rewind probability)= 0.3」。这阻止模型从序列位置推断任务进度的刻板值曲线——回退概率的存在让模型必须真的理解时间,而不是从「位置」外推。

3)价值隔离注意力(Value-isolation Attention) 防止不同观察点关联的绝对/相对时间查询相互注意。同一观察点内的查询保持互相可见,允许特征交互后再拼接。同时阻止上下文 token 注意时间查询 token——防止先前的值预测通过后续语言或视觉表征间接传播。

这三项设计合在一起抑制了「值外推捷径」:每个时间估计必须基于任务指令和其可用的视觉上下文独立判断,而不是依赖前后值预测的「参考」。

7000 小时 / 300 万条指令

RynnValue 用没有任何偏好标注的数据训练,扩展到:

  • 超过 7000 小时机器人轨迹
  • 约 300 万条指令条件片段
数据集不需要人类偏好——只要有时间戳就行。这意味着来自不同 embodiment(Franka、ALOHA、xArm 等)、不同任务、不同视角的数据可以直接合并使用。

真实世界策略提升:52.5% → 72.5%(在线),63.8% → 82.5%(离线)

论文在双臂 Franka 机器人系统(4 个 Intel RealSense 摄像头)上做了 4 个真实任务评估,每个任务 20 次试验:

任务在线 RynnValue在线 Robometer离线 RynnValue离线 Robometer
Bread Basket Placement(面包入篮)45.0%100.0%
Steak Serving with a Spatula(锅铲转移牛排)75.0%90.0%
Box-in-Drawer Placement(盒子入抽屉)70.0%90.0%
Bimanual Box Transfer(双臂转移箱子)100.0%50.0%
平均72.5%52.5%82.5%63.8%
提升幅度:
  • 在线 RL:+20 个百分点
  • 离线 RL:+18.7 个百分点
这是4 个任务的未加权平均,每个任务 20 次试验的统计基础。论文用潜在函数塑形(potential-based shaping)把价值预测转成密集奖励。

Benchmark:RBM-EVAL-OOD 上 Kendall's tau_a 0.675

RBM-EVAL-OOD(分布外评估)上:

  • RynnValue(无偏好标注):Kendall's tau_a = 0.675
  • 完全偏好监督的 SOTA:0.655
  • 仅进度监督基线:0.292(不到一半)
RynnValue 在没有偏好标注的情况下超过了「完全偏好监督 SOTA」,同时比纯进度监督基线高出一倍以上。这意味着「时间距离」作为监督信号不仅更便宜(不需要人类标注),效果还更好。

而且论文明确说:零样本迁移到未见过的任务、embodiment 和视角。这是基础模型的核心承诺——换个机器人、换个任务、换个相机角度,不重新训练也能用。

RynnValue 论文数据

  • 总参数:未在论文摘要中明示(具体架构细节需查论文正文)
  • 数据规模:7000 小时 / 300 万条指令条件片段
  • K=8 随机观察点采样
  • 时间范围:绝对 [0, 512] 秒,相对 [-256, 256] 秒
  • 256 个 symlog 离散 bin,two-hot 编码
  • 回退概率:0.3
  • RBM-EVAL-OOD:0.675 Kendall's tau_a
  • 真实世界在线 RL:72.5%(vs Robometer 52.5%)
  • 真实世界离线 RL:82.5%(vs Robometer 63.8%)
  • 评估任务:4 个,每个 20 次试验
  • 作者团队:DAMO Academy(阿里达摩院)+ Hupan Lab(湖畔实验室)
  • 15 位作者,共同一作 + 通讯作者标记

监督信号从人类产出到时间戳

RynnValue 的「时间距离」不是又一个「巧妙标注技巧」。它把机器人价值基础模型的数据门槛从「需要人类偏好标注的数据集」降到了「只需要时间戳的数据集」。

这一下就把数据来源范围扩大了几个数量级。任何带时间戳的机器人轨迹——不管是 DROID、RT-1、Open X-Embodiment、还是各家公司自己采集的内部数据——都可以直接用来训练价值模型。监督信号从「昂贵的人类产出」变成「廉价的时间戳自动生成」。

8 月以来具身智能主线已经从「VLA / 世界模型 / 端侧推理」扩散到「奖励信号 + 基础模型 + 数据工厂」——RynnValue 是「奖励信号」分赛道的代表作。最值得追踪的是同一思路的扩散路径:会不会有团队把「时间距离」借鉴到「视频预测」「语音合成」「机器人动作生成」等其他需要监督信号的领域——任何带时间戳的多模态数据都可以套这个范式。

限制与未知

  • 论文未公开模型总参数和具体架构细节(摘要只给出方法)
  • 论文未公开训练 Token 数 / 训练算力 / 训练数据具体来源
  • 论文未公开代码仓库地址(截至 8-12 Hugging Face 上没有看到官方实现)
  • 真实世界评估只有 4 个任务——长尾任务的泛化能力需要更大规模验证
  • 作者团队机构分布在 HTML 版本里没有明示具体标注,Hongyin Zhang / Mingxiu Chen 各自归属达摩院还是湖畔实验室需要查 PDF
---

来源

  • https://arxiv.org/abs/2608.09853
  • https://arxiv.org/html/2608.09853v1
  • https://huggingface.co/papers/2608.09853

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens