RynnValue — 阿里达摩院用「时间距离」做监督信号,把机器人价值基础模型从 7000 小时扩到 3M 条指令
8 月 10 日,阿里巴巴达摩院 + Hupan Lab 在 arXiv 上传了 RynnValue 论文,提出用「时间距离(temporal distance)」替代传统偏好标注或进度归一化作为监督信号,把机器人价值基础模型扩展到 7000 小时、约 300 万条指令条件片段。论文链接:https://arxiv.org/abs/2608.09853
为什么「奖励模型」是机器人学习的瓶颈
机器人学习里的通用奖励模型一直是瓶颈——你没办法给每个子任务都让人去写偏好标注。RynnValue 的核心问题是:怎么从大规模异构数据里学出可迁移的价值预测能力,且不依赖偏好或进度这类任务内部锚点?
之前的方法用「偏好(preference)」或「归一化进度(normalized progress)」做监督信号。但这两类锚点都有硬伤——偏好需要人类标注(贵、慢、难跨 embodiment),进度归一化在任务定义不同时无法迁移(一个抓取任务和一个倒水任务的「进度」不可比)。
RynnValue 的解法是:直接从时间戳生成标签。
时间距离 = 监督信号
「时间距离」的定义:从某个观察点到语言指定目标的有向成本到目标(directed cost-to-go)——也就是「距离任务完成还有多久」。
数学表达:
- 绝对时间距离:$v_i* = max(0, t_G - t_i)$,其中 $t_G$ 是完成截止时间,$t_i$ 是观察点时间戳
- 相对时间位移:$Δ_i* = t_{i+1} - t_i$,可为正(前向)或负(回退)
关键:标签不需要人类标注。给定一段轨迹 + 任务指令 + 截止时间戳,每个观察点的时间距离可以从时间戳直接推导。完成截止点之前的观察点被标记为「到完成的剩余时间」,截止点及之后接收零值。
这意味着任何带时间戳的机器人轨迹都能直接用——不需要人工偏好标注,不需要进度归一化。这是把「监督信号」从「人类产出」转为「时间戳自动生成」的根本性转变。
三项关键技术
为了让时间距离学习在大规模数据上可靠,论文组合了三项互补技术:
1)随机时间采样(Random Temporal Sampling) 对每个指令条件化的轨迹片段,随机采样 K=8 个观察点,时间间隔不规则。目的是打破均匀采样诱导的「近算术值」模式——模型不能利用固定采样间隔作为捷径。
2)时间顺序乱置(Temporal-order Shuffling) 打乱采样观察点的时间顺序。一半训练序列独立采样不排序(概率 0.5),另一半按「前向偏置的时间游走」,带「回退概率(rewind probability)= 0.3」。这阻止模型从序列位置推断任务进度的刻板值曲线——回退概率的存在让模型必须真的理解时间,而不是从「位置」外推。
3)价值隔离注意力(Value-isolation Attention) 防止不同观察点关联的绝对/相对时间查询相互注意。同一观察点内的查询保持互相可见,允许特征交互后再拼接。同时阻止上下文 token 注意时间查询 token——防止先前的值预测通过后续语言或视觉表征间接传播。
这三项设计合在一起抑制了「值外推捷径」:每个时间估计必须基于任务指令和其可用的视觉上下文独立判断,而不是依赖前后值预测的「参考」。
7000 小时 / 300 万条指令
RynnValue 用没有任何偏好标注的数据训练,扩展到:
- 超过 7000 小时机器人轨迹
- 约 300 万条指令条件片段
真实世界策略提升:52.5% → 72.5%(在线),63.8% → 82.5%(离线)
论文在双臂 Franka 机器人系统(4 个 Intel RealSense 摄像头)上做了 4 个真实任务评估,每个任务 20 次试验:
| 任务 | 在线 RynnValue | 在线 Robometer | 离线 RynnValue | 离线 Robometer |
|---|---|---|---|---|
| Bread Basket Placement(面包入篮) | 45.0% | — | 100.0% | — |
| Steak Serving with a Spatula(锅铲转移牛排) | 75.0% | — | 90.0% | — |
| Box-in-Drawer Placement(盒子入抽屉) | 70.0% | — | 90.0% | — |
| Bimanual Box Transfer(双臂转移箱子) | 100.0% | — | 50.0% | — |
| 平均 | 72.5% | 52.5% | 82.5% | 63.8% |
- 在线 RL:+20 个百分点
- 离线 RL:+18.7 个百分点
Benchmark:RBM-EVAL-OOD 上 Kendall's tau_a 0.675
RBM-EVAL-OOD(分布外评估)上:
- RynnValue(无偏好标注):Kendall's tau_a = 0.675
- 完全偏好监督的 SOTA:0.655
- 仅进度监督基线:0.292(不到一半)
而且论文明确说:零样本迁移到未见过的任务、embodiment 和视角。这是基础模型的核心承诺——换个机器人、换个任务、换个相机角度,不重新训练也能用。
RynnValue 论文数据
- 总参数:未在论文摘要中明示(具体架构细节需查论文正文)
- 数据规模:7000 小时 / 300 万条指令条件片段
- K=8 随机观察点采样
- 时间范围:绝对 [0, 512] 秒,相对 [-256, 256] 秒
- 256 个 symlog 离散 bin,two-hot 编码
- 回退概率:0.3
- RBM-EVAL-OOD:0.675 Kendall's tau_a
- 真实世界在线 RL:72.5%(vs Robometer 52.5%)
- 真实世界离线 RL:82.5%(vs Robometer 63.8%)
- 评估任务:4 个,每个 20 次试验
- 作者团队:DAMO Academy(阿里达摩院)+ Hupan Lab(湖畔实验室)
- 15 位作者,共同一作 + 通讯作者标记
监督信号从人类产出到时间戳
RynnValue 的「时间距离」不是又一个「巧妙标注技巧」。它把机器人价值基础模型的数据门槛从「需要人类偏好标注的数据集」降到了「只需要时间戳的数据集」。
这一下就把数据来源范围扩大了几个数量级。任何带时间戳的机器人轨迹——不管是 DROID、RT-1、Open X-Embodiment、还是各家公司自己采集的内部数据——都可以直接用来训练价值模型。监督信号从「昂贵的人类产出」变成「廉价的时间戳自动生成」。
8 月以来具身智能主线已经从「VLA / 世界模型 / 端侧推理」扩散到「奖励信号 + 基础模型 + 数据工厂」——RynnValue 是「奖励信号」分赛道的代表作。最值得追踪的是同一思路的扩散路径:会不会有团队把「时间距离」借鉴到「视频预测」「语音合成」「机器人动作生成」等其他需要监督信号的领域——任何带时间戳的多模态数据都可以套这个范式。
限制与未知
- 论文未公开模型总参数和具体架构细节(摘要只给出方法)
- 论文未公开训练 Token 数 / 训练算力 / 训练数据具体来源
- 论文未公开代码仓库地址(截至 8-12 Hugging Face 上没有看到官方实现)
- 真实世界评估只有 4 个任务——长尾任务的泛化能力需要更大规模验证
- 作者团队机构分布在 HTML 版本里没有明示具体标注,Hongyin Zhang / Mingxiu Chen 各自归属达摩院还是湖畔实验室需要查 PDF
来源
- https://arxiv.org/abs/2608.09853
- https://arxiv.org/html/2608.09853v1
- https://huggingface.co/papers/2608.09853