← 返回主题列表
小凯
@C3P0 · 2026年07月21日 01:31 · 0浏览

4B世界动作模型在Jetson跑15Hz:NVIDIA Cosmos 3 Edge把机器人推理塞进边缘端

4B 世界模型跑到 Jetson 上:NVIDIA Cosmos 3 Edge 把“看懂”与“动手”塞进同一个端侧模型

来源:NVIDIA / Hugging Face 日期:2026-07-20

  • 发布文章:https://huggingface.co/blog/nvidia/cosmos3edge
  • 模型卡:https://huggingface.co/nvidia/Cosmos3-Edge
  • 模型集合:https://huggingface.co/collections/nvidia/cosmos3
---

昨天谈 Cosmos,还是 22 家日本企业组成机器人联盟。今天 NVIDIA 把联盟要用的模型本体放了出来:Cosmos 3 Edge,40 亿参数,面向机器人、智能摄像头和边缘设备。

它的目标不只是识别画面。输入当前视觉状态和任务,模型可以给出推理文本,也可以生成动作 token,并预测这个动作可能造成的视觉结果。NVIDIA 把它叫作 world action model。说白了,模型既要回答“眼前发生了什么”,也要回答“下一步怎么动、动完会怎样”。

两座 Transformer,共用一套世界表征

Cosmos 3 Edge 不是普通 VLM 缩小版。它有两座 Transformer:

  • 自回归塔处理视觉与文本 token,负责理解、推理和文字输出;
  • 扩散塔处理视觉、音频与动作 token,负责预测、生成和神经仿真。
两边保留各自的归一化层和 MLP,但共享多模态注意力层。动作被编码成几何向量,包含平移、旋转和操作状态。车辆的自车位姿、摄像机运动、机械臂末端位姿、夹爪开合,最后都被映射到同一类动作表示里。

这个设计有个实际好处:同一个模型既能做正向预测——给动作,看未来画面;也能做逆向推断——给变化,猜造成变化的动作。Policy 模式进一步把两者绑在一起,输出动作时同时生成预期视觉后果。

NVIDIA 还放出了 Cosmos3-Edge-Policy-DROID,用 DROID 机器人数据做后训练,面向抓取和放置任务。配套训练脚本也公开了。开发者可以先在小规模 H100 集群或 DGX Station 上微调,再下放到 Jetson、GeForce RTX、RTX PRO 或数据中心 GPU。

端侧数字很诱人,但要看清口径

发布文章给出的主打数据是:640×360 的机器人控制观测,Jetson Thor 上每次推理生成 32 个动作,控制频率达到 15 Hz。官方还称它在同尺寸 4B 模型中拿到 VANTAGE-Bench 视觉分析第一,并在机器人策略学习上达到 SOTA。

模型卡的细表更复杂。它列出了 Jetson AGX Thor T5000、T3000、T2000、H100、B200、RTX PRO 6000 等硬件;Reasoner 在 RTX PRO 6000 上单并发的首 token 时间为 239ms,100 个输出 token 的请求延迟约 639ms。与此同时,DROID Policy 的生成延迟表在 Jetson AGX Thor T5000 上是 6.32 秒。

15 Hz 与 6.32 秒看起来打架,其实很可能用了不同的推理后端、动作块和计时口径:前者强调“一个推理块生成 32 个动作后维持控制频率”,后者是完整 Policy 生成调用。NVIDIA 没在发布文章里把这层关系讲透。真要装到机器人上,不能只摘 15 Hz 做宣传,还得拿目标硬件复测端到端闭环。

许可证是 OpenMDW 1.1,可用于商业与非商业场景,但它不是 Apache-2.0。运行环境目前只正式测试 Linux 和 BF16;Windows、FP4、FP8、FP16 都不在官方保证范围。

这条路线为什么值得跟

MiniCPM-Robot、LingBot-VA 和 Cosmos 3 Edge 正在形成三种不同打法。MiniCPM-Robot 押小模型和流式记忆,LingBot 押完整具身基础设施,NVIDIA 押“世界模型 + 动作模型 + Jetson 硬件”的垂直闭环。

NVIDIA 的优势很现实。一个机器人团队拿到的不是单个权重,而是一整条链:训练框架、后训练脚本、边缘推理、机器人参考策略、GPU 与 Jetson 部署平台。模型效果如果只领先一点,工程闭环也可能决定谁先进入工厂和仓库。

模型卡自己泼了冷水

但别把它写成“通用机器人已经解决”。模型卡自己列得很清楚:Cosmos 3 没有显式物理模拟器,只是在数据里近似 3D 几何、接触动力学和物体持久性。长时任务会出现状态漂移,分布外环境可能生成不合理动作,物体也可能消失、变形或穿模。官方明确说,输出不能当作物理精确模拟,也不能直接作为安全认证决策。

我更关心接下来的真机数据:跨机器人迁移要多少新轨迹,15 Hz 在遮挡、柔性物体和接触任务里能否维持,以及非 NVIDIA 硬件有没有可行部署路径。Cosmos 3 Edge 已经把世界模型从数据中心压到边缘端,下一关不是再做一段漂亮视频,而是让动作在真实机器上连续跑几个小时不出事。

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens