你递给一个孩子一个密封的纸盒。他不会盯着盒子看很久才回答。他会拿起来掂一掂,会摇一摇听里面有没有东西响,会捏一下试试软不硬。整个过程里没有一个问题是他事先准备好的,问题是被手感逼出来的。信息不够就去找,找到够用就停。
机器人的多模态系统过去一直在做另一件事:把摄像头、麦克风和力传感器的读数拼在一起,送进模型,输出一个答案。这条路的问题是,当答案所需要的证据根本不在任何一路传感器里时,模型只能猜。
2026 年 10 月 8 日,中国人民大学高瓴人工智能学院 GeWu-Lab、智源研究院与燧行 AresoX 等机构在 arXiv 上放出 ROMA(Real-World Object-Centric Multi-Sensory Active Perception,arXiv:2610.06955,10 月 3 日首发,10 月 8 日修订 v2)。这套系统换了个问题设定:不给定答案,让机器自己决定该去碰哪个物体、该怎么碰、该听还是该摸,以及什么时候证据已经够了。
🧠 换掉预测目标,而不是换掉数据源
拆 ROMA 的技术路线,最快的办法是看它预测什么。人形机器人的通用策略通常预测关节指令,也就是每个电机转多少角度。这个预测目标的毛病有两个。腿与手臂与手指必须同时动,还要同时保持平衡,关节空间的维度因此很高,学起来很难。更棘手的是数据:人形机器人的遥操作演示极稀缺,于是通用策略发布后要先在每个任务上单独微调一遍才能用。
VioLA 这条路线(arXiv:2610.12435,同样是 10 月 8 日发布)采取了相反的思路:让策略预测身体的运动隐变量,而不是关节指令,一个预训练的身体与手部控制器去执行这些隐变量。人类动作与机器人动作各自映射到同一个隐空间,于是一段人类录像天然就在策略的动作空间里。训练演示池因此达到 1.406 亿帧,其中 93.2% 来自人类。
ROMA 走的是相邻的另一条缝。它要解决的不是动作接口,而是感知的信息来源。
左边那条链只做加法,右边那条链带一个环。环的存在让机器人有了「信息不足」这个状态,从而有了继续探索的理由。
📦 ROMI-2K:近两千个物体,六种动作
要让模型学会「不同的交互带来不同的信息」,得先有覆盖足够广的真实交互数据。ROMA 团队构建的数据集 ROMI-2K 覆盖近 2000 个日常物体与内含物组合,围绕六种基础物理交互采集:
- 举起
- 按压
- 碰撞
- 捏紧
- 摇晃
- 旋转
采集分手持设备与真实桌面机械臂两种场景,每次交互同步采集视觉、听觉、触觉与力四路观测。数据同时标注了材质、硬度、粗糙度、纹理与内容物这些物理属性。这个选择值得注意:属性标注是主动感知任务能成立的前提,因为任务本身就是「判断某个属性」,没有真值就没法训练。
六种交互不是随意挑的。它们覆盖了材质(按压)、重量(举起)、内容物(摇晃、碰撞)、间隙(捏紧)等不同物理量的探针。
🔗 感知链:为什么一次交互不够
这篇工作里最有意思的概念是感知链(perception chain)。它由一个很朴素的场景逼出来。
任务是「帮我找个空杯子」。机器人看到三个杯子。摇了第一个,里面响,说明有东西,不用再掂。摇了第二个,不响。此时不能断定它是空的,内含物也可能把内部填满了,装得很紧实,于是听不到响。于是需要再掂一掂重量来确认。
这一次交互的观测结果,直接决定了下一次交互选什么。这就是感知链的定义:已获取的证据引导后续的交互与推理。
这个场景解释了为什么「一次交互」不够。第二次交互选什么,完全由第一次的观测决定。
在这条链上,主动感知已经脱离了「做一次交互然后回答问题」的范式,它需要完成一整套连续决策:先选目标,再选动作,接着选模态,最后还要判断「什么时候停下来」。最后这一项最难,因为停早了会答错,停晚了是浪费。
基于 ROMI-2K 的真实桌面子集,团队构建了 ROMA Bench,含 2100 个场景级主动感知任务,分三类:Single-Chain 单属性推理、Multi-Chain 多属性长链推理、Intent-Driven 按用户隐含意图确定需要获取哪些属性。涉及硬度、粗糙度、纹理、内容物、材质与重量等属性。
🤖 ROMA-7B:七亿参数打平旗舰闭源
驱动机器人的模型是 ROMA-7B,基于 Qwen 2.5-Omni 训练,经过多传感器联合对齐与主动感知场景微调。物理接口侧,ROMA 把抓取与 ROMI-2K 的六种动作程序化,基于 AnyGrasp 抓取策略,配合点云补全与抓取筛选机制提升真实世界的稳定抓取。
ROMA Bench 上 2100 道多选题、判断题与排序题的成绩:
| 模型 | 总体任务成功率 |
|---|---|
| ROMA-7B | 72.9% |
| GPT-6 Astra | 基本持平 |
| GPT-5.4 | 明显低于前述两者 |
| Gemini 3.5 Flash | 明显低于前述两者 |
| Qwen 2.5-Omni(未微调) | 明显不足 |
| Qwen 3-Omni(未微调) | 明显不足 |
原始报道未给出 ROMA-7B 与 GPT-6 Astra 之间的具体百分点差距,只说「基本持平」并给出上述相对位置,同时指出两个模型各自的长处:GPT-6 Astra 凭借更强的视觉理解与通用推理,在单步、视觉可推断的属性上表现突出;ROMA-7B 的优势集中在 Multi-Chain 任务,也就是需要连续交互、综合多路反馈(尤其是音频)的场景,报道说这里明显超过 GPT-6 Astra。
参数规模相近、未经 ROMI-2K 微调的 Qwen 2.5-Omni 与 Qwen 3-Omni 表现明显不足。这一条对照说明增益来自数据集,不只是来自模型。
真实世界实验里,8 个多物体场景、132 道开放问答题上,ROMA-7B 总体成功率 61.4%,接近 GPT-6 Astra 且大幅领先其他前沿模型。61.4% 与基准上的 72.9% 之间的差距,说明真机上的开放题比基准里的固定题型更难。
⚠️ 读这份报告时该保留的分寸
- 论文是 arXiv 预印本,同行评审未完成
- 2100 道任务的基准是项目自建,其他团队的模型成绩来自项目方在统一流程下的评测,非独立复现
- 成功率指标的口径(什么叫一次任务成功)由团队定义,报道未展开
- 真实世界实验只有 8 个场景、132 道题,样本不大
- ROMA目前只围绕六种基础物理交互展开,团队自己也把更丰富的交互技能列为未来方向
论文展示的那个闭环是真实的,推理与交互与反馈首尾相接。它也诚实地留了一个更大的问题。主动感知解决的是「怎么获取证据」,而获取证据之后要动手操作物体,那又是另一套决策。团队在展望里把「主动感知与操纵策略的统一」列为待解问题。摸清一个杯子有多重,与把它拿起来倒水,中间隔着的正是具身智能最难的那一段。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。