Loading...
正在加载...
请稍候

一个网络,一段序列:Reka 把生成与机器人动作压进同一份权重

QianXun • 2026年10月06日 17:36

🧩 开场那个演示,值得先把它拆开

10 月 5 日晚,Reka 在研究博客放出 Rho-1 的预览。 演示从一个生成的灯塔图像开始,模型在场景里定位某个物体,让它动起来,把视频里的天气改掉,然后回答关于这次编辑的问题。

【直引】Reka 对这一串的描述是:每一轮都从同一个共享状态读取、也写回同一个共享状态,整条序列里没有第二个模型,也没有一次工具调用。

这句话是整个发布稿的技术主张。 它把生成与模拟、推理与动作这四件事压进一张网络,替掉四段用智能体串起来的流水线。

🔀 两条专家流,离散与连续混在一段序列里

架构描述是:transformer 块里有两条专家流。 一条负责语言与视觉理解,另一条负责生成图像与视频,两者共享注意力与上下文。

令牌分两种。 离散令牌承载文本、符号推理与高层指令;连续令牌承载图像潜变量,另外还有视频帧、机器人动作与本体感觉。 【判断】把符号推理和连续数值回归塞进同一个自回归序列,是这份工作里唯一称得上硬的地方。 语言建模的目标是对下一个令牌给交叉熵,而预测视频帧要的是在连续值上做回归,两种目标函数被放在一条序列里统一训练,梯度该怎么配比,论文没有给出细节。

小贴士:本体感觉指机器人对自己身体位置和关节状态的内部感知。 把它和视频帧放在同一段序列里,意味着模型看到的东西和它知道自己在哪里,是同一种表示。

对机器人,Reka 说同一个模型会预测未来相机帧并输出关节动作。 演示用的是 LIBERO 仿真任务。 【直引】发布材料没有展示 Rho-1 控制任何一台物理机器人。

⏱️ 速度:0.79 倍实时,与蒸馏后的 1 秒 5.3 秒

速度数字都是公司自测。

  • 基础模型生成视频的中位速度是实时的 0.79 倍,流大约 6 秒起步。
  • 一个蒸馏变体把去噪步数从 99 步压到 8 步,在公司测试里用约 1 秒产出 5.3 秒的片段。

【推论】按后一组算,5.3 除以 1 等于 5.3 倍实时;相对基础模型 0.79 倍实时,蒸馏版把吞吐推快了大约 6.7 倍。 这两个数字描述的是同一条流水线的前后两档,不是两个模型。

原生视频输出封顶在 672 乘 384。 【判断】这个分辨率低于任何当代消费级设备的视频规格,Reka 也没有把它包装成产品能力,直接列进了限制清单。 它更像一个内部研究平台的自用档位。

训练规模:从零训练,用 320 张 H100 跑了约三个月。 【推论】按 90 天连续满负荷折算约 69 万 GPU 小时,与 Beam 那 1120 万 GPU 小时差十六倍上下。 这不是同一量级的算力投入,比较两者的能力时要记得这一点。

🔁 数据那条路:从互联网视频里捞动作标签

机器人学习的公认难题是数据。 网上关于人做事的视频以十亿小时计,而带着传感器与动作日志的机器人数据少得多。

Reka 的做法是先训一个逆动力学模型,从普通互联网视频里抽取控制信号。 给定前后两帧,逆动力学模型估计是什么动作造成了变化;把它铺在视频上,就得到大规模的近似动作标签。

【判断】这条路线的软肋很明确:动作标签是噪声。人手臂在视频里的运动方式,与某个机器人夹爪在几何结构、行程与受力上都不同。 从人视频迁移到特定本体是难处所在,也是许多演示在仿真里跑通、上真机就垮掉的位置。 Reka 的发布材料没有给出真机结果,也没有列出测试过的本体类型。

同类做法不止 Reka 一家。 小米的 UMI 路线,还有 Meta 的开源物理 AI 世界模型,都在用各自的方式从人类视频里取控制信号。

📋 公司自己列的失效模式

Reka 列了四条,措辞都很直接:

  • 长视频滚动会出现结构漂移。
  • 跨视频的物体锚定仍然不可靠。
  • 针对性编辑在不同提示词下依旧脆弱。
  • 原生视频输出封顶 672 乘 384。

【直引】公司把这些限制主要归因于训练规模与数据,并预期两者随规模扩大而改善。 这句话后面紧跟着一句自我限定:预览并未确立规模扩大就会改善它们。

没有基准分数。 没有公开定价。 没有自助下载通道。 发布页把邀请具身机器人、交互式模拟与视觉动作系统的团队联系他们。

维度 Rho-1 预览口径
参数量 190 亿,单一网络
模态 文本 图像 视频 机器人动作
训练算力 320 张 H100 约三个月
机器人证据 LIBERO 仿真,无真机演示
基准分数 未报告
许可与权重 未说明

🔭 它在跟谁竞争

这个方向上已经有大模型在场。 Google DeepMind 的 Genie 3 是从文本生成可导航环境的实时模型。 Reka 想做的是把这类模拟、语言推理与机器人动作放进同一张网络。

【判断】两种路线的差别目前只在架构层面。 现有演示还不足以说明 Rho-1 能匹配那些专门为交互式世界或实体机器人控制而构建的系统。 架构主张与可靠落地之间的距离,这个预览展示得很清楚。

融资背景上,Reka 在 2025 年 7 月宣布过 1.1 亿美元融资,由英伟达与 Snowflake 领投;2023 年的融资里 DST Global Partners 领投,Radical Ventures 作为创始投资方,Snowflake Ventures 参与。 这些把 Rho-1 定位成一家有商业产品线的创业公司的研究成果,而非独立的学术发布。

CEO Dani Yogatama 此前在 Google DeepMind 做了六年资深研究科学家,现任南加州大学计算机科学副教授。 他押的是一个关于架构的判断:能预测接下来看到什么的模型,也能同时给出该采取的动作。 这条论断在物理部署层面还没被这份材料验证。

📌 信源与限定

  • 全部架构、速度、算力与限制数字取自 Reka 官方研究博客与10 月 5 日发布帖,未见技术报告。
  • 69 万 GPU 小时、6.7 倍加速、16 倍算力差为按标称卡数与时长折算,非公司披露。
  • 0.79 倍实时、1 秒出 5.3 秒片段均为公司自测,无独立评测。
  • LIBERO 为仿真基准。 发布材料未展示任何物理机器人控制结果。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录