[论文] A Balanced Data Diet: Addressing the Exploration Bottleneck in Mega-Sc...

研究领域: ML 作者: Octi Zhang, Mateo Guaman Castro, Patrick Yin, Ignacio Dagnino, Abhishek Gupta, Rosario Scalise, Byron Boots 发布时间: 2026-10-08 arXiv: 2610.12465

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: ML 作者: Octi Zhang, Mateo Guaman Castro, Patrick Yin, Ignacio Dagnino, Abhishek Gupta, Rosario Scalise, Byron Boots 发布时间: 2026-10-08 arXiv: 2610.12465

中文摘要

通用机器人须完成从敏捷运动到灵巧操作的广泛任务。Sim-to-real 强化学习虽已证明有效,但当前流程依赖繁重的逐任务工程先验(塑形奖励、演示)。近期工作表明,多样化仿真器重置采样结合大规模并行仿真可大幅减轻这种工程负担。然而朴素地将此范式扩展到更精确或更具动态性的问题时仍非易事:在重置分布上均匀采样,会将越来越多的经验浪费在策略已掌握或尚无法尝试的任务配置上,导致大规模并行扩展的收益被稀释。我们提出成功引导采样(SGS),一种简单的自适应采样器,将训练集中在策略能力边界附近的任务配置上,使大规模仿真 RL 充分利用批次经验。在使用多达 2^20(超百万)个并行环境的实验中,SGS 使 RL 解决了此前方法无法解决的多地形四足运动和富接触装配任务。我们还将学到的操作策略蒸馏为 RGB 策略,在真实硬件上实现了多个高难度装配任务的零样本迁移。

原文摘要

General-purpose robots must perform a wide range of tasks from agile locomotion to dexterous manipulation. While sim-to-real reinforcement learning (RL) has proven to be a useful tool for this goal, current RL pipelines depend on engineering-heavy, per-task structural priors such as shaped rewards and demonstrations. Recent work has shown that diverse simulator resets, combined with massively parallel simulation, can alleviate much of this engineering burden on several manipulation problems. However, we find that naively scaling this paradigm to more precise or dynamic problems remains non-trivial. While simulator resets can help with exploration, uniformly sampling over this distribution wastes a growing fraction of learning experience on task configurations the policy has already mastere...


*自动采集于 2026-10-10*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

🎯 这个采样器的账,论文只报了一半

核账:arXiv:2610.12465v1,7 位作者(Octi Zhang / Mateo Guaman Castro / Patrick Yin / Ignacio Dagnino / Abhishek Gupta / Rosario Scalise / Byron Boots),2026-10-08,仅 v1。标题、作者、日期全对。中文摘要转述忠实,2^20 并行环境、多地形四足、富接触装配、蒸馏成 RGB 策略零样本真机迁移,全对。

但摘要里有一处限定词掉了,而掉了之后那句话的意思正好反转。

一、"近期工作表明……可大幅减轻这种工程负担"——少了"在若干个操作类任务上"

论文摘要原文:

"Recent work has shown that diverse simulator resets, combined with massively parallel simulation, can alleviate much of this engineering burden on several manipulation problems"

中文译文:

"近期工作表明,多样化仿真器重置采样结合大规模并行仿真可大幅减轻这种工程负担。"

on several manipulation problems 没了。

这一删不只是"少了个限定词"。紧接的下一句是转折句——"然而朴素地将此范式扩展到更精确或更具动态性的问题时仍非易事"。这半句存在的意义就是给前半句划边界:在若干个操作类任务上成功了,扩到更难的问题就不行。删掉边界,读起来就成了"这条路已经解决了工程负担",而下一句的转折突然失去着力点。

这也是本篇最值得学的一处摘要写法:它用"however"把上一句的适用范围当场的收回去了。中文译者删掉了"on several manipulation problems",把一个带护栏的陈述变成了裸陈述。

二、这篇真正在解决的不是"探索",是"浪费"

标题把问题说成 exploration bottleneck。但摘要中间那句给出了更准确的描述:

"uniformly sampling over this distribution wastes a growing fraction of learning experience on task configurations the policy has already mastered or cannot yet attempt"

这句话把浪费拆成了两半,而两半的量级完全不同:

  • 已经掌握的任务配置 —— 学习价值为零,纯浪费
  • 尚不能尝试的任务配置 —— 经验浪费之外还有梯度浪费:这些任务的奖励对当前策略没有信息量,但它们仍占据着 batch 的名额
第二半比第一半更值得说,因为它是探索问题的另一面。传统探索的叙事是"没见过的状态太多",而这篇说的是"够不到的太多,而且和够得到的混在同一个采样器里"。SGS 的做法(把采样集中在策略能力边界附近)本质上是一个按能力分层的采样器——它要解决的不是"怎么发现新状态",是"怎么不把已经会的东西和压根做不到的东西一起采进来"。

这个视角换过来看更清楚:uniformly sampling 的问题不是探索能力不足,是探索预算的分配没有分层。 100 万个并行环境听着很多,但如果按均匀分布铺开,其中相当一部分落在"早就会了"和"完全不可能"这两头——并行度买到的是样本数,不是有效信息量。

三、2^20 这个数换算一下

摘要写"up to 2^20 (over one million) parallel environments"。2^20 = 1,048,576,"over one million" 属实,但严格说是"刚过一百万",不是"百万级"——两者差 4.9%,不算错,但up to 这个词要留着:论文说的是最多用到这么多,不是每个实验都用这么多。

这一点在摘要里被up to 管住了,中文译文写"多达 2^20(超百万)个并行环境","多达"把up to 也带过来了,这一处译得准。

真正值得注意的是:摘要没说多少个实验用了满配。四个通用机器人基线里,四足运动和装配任务的并行度需求通常差几个数量级——如果只有某一个装配实验跑到了 2^20,那"规模化"这个卖点的适用范围就该按那个实验来读。 摘要在这个地方给了上限但没给分布。

收口:下一根钉子

SGS 的采样器需要一个"能力边界"的信号——问题是这个信号从哪来、从什么时候开始可信。

具体一步:在 2^20 全配规模下画一条采样分布随训练步数的演化曲线。【推论】(策略边界占batch 的百分比)。我的猜测是可证伪的:这个比例应该在前 10% 的训练步里快速上升,然后稳定在某个小于 1 的常数上。如果它一路爬到接近 1,说明 SGS 退化成均匀采样(那"wastes a growing fraction"的诊断就没被解决);如果它稳在很低的水平,说明学习后期的经验确实大部分有用,收益主要来自早期。

更小但更硬的一步:把 SGS 拿���"另一个模态上验一次。它现在只报了四足运动 + 装配两类任务,而两类的"能力边界"形态完全不同——运动是连续控制、装配是接触丰富的稀疏奖励。如果采样器对两种任务的最优比例差很多,那"Success Guided"里的 Success 就有更精确的定义空间(该用成功率、该用探索新颖度、还是该用两者混合),而现在这个定义只由运动任务形状。

第三件事,也是最容易被略过的:论文把策略蒸馏成RGB 策略并零样本迁移真机,这是整篇里唯一一条离开仿真的证据。但蒸馏本身会继承 teacher 的分布偏好——SGS 的采样分布是窄的(集中在边界附近),所以 RGB 策略可能没见过"远超出能力边界"的输入。那么真机上遇到一个完全没见过的局面时,它会输出什么? 这一格论文没测,而这是所有 sim-to-real 论文的共同盲区。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens