FLUX 3 Action 用 70 亿参数,超过 Cosmos 3 Nano 的 160 亿:开源机器人模型的分水岭

【图形学 × 机器人学习 · WAM】 2026 年 9 月 23 日,Black Forest Labs(BFL)发布 FLUX 3 Action,开放权重的 7B 世界动作模型(World Action Model, WAM)。它在 NVIDIA RoboLab-120 仿真基准上达到 42.92% 任务成功率…

【图形学 × 机器人学习 · WAM】 2026 年 9 月 23 日,Black Forest Labs(BFL)发布 FLUX 3 Action,开放权重的 7B 世界动作模型(World Action Model, WAM)。它在 NVIDIA RoboLab-120 仿真基准上达到 42.92% 任务成功率,超过 Cosmos 3 Nano 的 36.8%(参数 16B)和 π0.5 的 28.0%(参数 3.3B)。代码、权重、训练配方同步在 Hugging Face 与 GitHub 上放出;同步发布 DROID 与 SO-101 两种本体微调版,并集成进 LeRobot 框架。

一句话结论

FLUX 3 Action 把「视频预测 = 世界建模」这个论点在机器人真机上跑通了。它用不到 Cosmos 3 Nano 一半的参数做出更高的任务成功率,速度也快 1.52-3.95 倍。它最大的工程意义是证明了:当 backbone 已经在视频预训练中学到了世界动力学,机器人策略不需要从头学动作。

WAM 与 VLA 是什么关系

机器人策略模型当下分成两大学派:

流派代表模型核心论点关键能力
VLA(视觉-语言-动作)π0 / π0.5 / GR00T N1.6视觉-语言预训练是机器人策略的桥梁自然语言任务描述
WAM(世界动作模型)Cosmos 3 / FLUX 3 Action / DreamZero视频预测是机器人策略的桥梁同时预测未来帧与动作
WAM 派的假设更激进:模型如果在大量视频上学到了「物体会怎么动」,那它已经隐式掌握了物理规则,只需要少量机器人数据微调就能学会把这种知识翻译成关节命令。FLUX 3 Action 是这条路线当前最强的开源样本。

数字怎么看

模型类型参数RoboLab-120 SR%备注
FLUX 3 Action(基线 FP8)WAM7B42.92%开源第一
FLUX 3 Action(引导蒸馏 FP8)WAM7B42.24%速度 1.8x-2x
FLUX 3 Action(步数蒸馏)WAM7B37.92%单步速度 3.15x-4x
Cosmos 3 NanoWAM16B36.8%NVIDIA 开源
OASISVLM+WAM闭源39.0%闭源
PhoenixTAMP+FM闭源34.4%闭源
BiMind v0.1VLA闭源33.3%闭源
π0.5VLA3.3B28.0%物理智能 开源
DreamZeroWAM14B25.7%开源
GR00T N1.6VLA3B7.2%NVIDIA 开源
关键观察:7B 参数的 FLUX 3 Action 超过 16B 的 Cosmos 3 Nano 6 个点。这条差距在 WAM 路线里属于大差距,相当于「更小的模型 + 更好的视频预训练 > 更大的模型 + 一般的策略训练」这个假设在 RoboLab 上的实证。

BFL 同时披露的 30 次真机测试(Frank 机械臂、第三方 Positronic Robotics 执行):FLUX 3 Action 完成 28/30(93.3%),Cosmos 3 Nano 27/30(90.0%),DreamZero 20/30(66.7%),π0.5 13/30(43.3%)。

控制循环长什么样

FLUX 3 Action 一次预测 32 个动作(约 2.13 秒的运动、15Hz),输入是:

  • 一或多张相机图像(按本体组成画布:DROID 三个 544×736 相机,SO-101 两个并排相机,或游戏 512×512 帧)
  • 状态向量(关节位置或最后执行的动作)
  • 语言任务描述(Qwen3-VL-4B 编码器冻结)
输出是:
  • 32 个动作(关节命令)
  • 未来视频帧(与动作同噪声级别联合去噪)
控制循环是「看 → 想 → 动 → 再看」:

1. 模型接收当前相机帧、状态、任务描述 2. 联合预测 32 个动作与未来视频 3. 机器人执行部分动作 4. 重新观察,重复循环

「再观察」这一步是 WAM 的关键差异化能力。它能在动作执行中途捕获偏差,并基于新观察调整后续动作;纯 VLA 模型通常在 32 个动作执行完后才重新观察,犯错纠正代价更高。

训练配方的三个工程创新

BFL 在技术报告里披露了三个非显然的工程决策:

第一,动作与视频的噪声曲线匹配。 联合预测时视频与动作需在同一个噪声级别上去噪,但二者天然有不同的信号强度(动作信号通常晚于视频饱和)。BFL 用最小包络损失分析,发现动作信号过渡晚于视频,于是采用 logit-logistic 分布(scale=0.75, shift α=42)+ 动作缩放因子 s=2,让联合去噪的轨迹最优。

第二,DROID 微调的前 1k 步冻结 backbone。 随机初始化动作头后,先用 1k 步让动作头适应 backbone 特征空间,再线性解锁学习率到 2e-4,最后用 2k 步一起训练。这是「先暖头、再全身」的稳定启动配方。

第三,分裂引导(Split Guidance)。 视频与动作分开做 classifier-free guidance,最优组合是视频 CFG=4.0、动作 CFG=1.0。这个不对称设置说明:视频生成需要更强引导保证逼真度,动作生成只需要轻度引导保证反应速度。

蒸馏与部署

BFL 同时放出两种蒸馏:

  • 引导蒸馏:把需两次前向传播的引导预测蒸馏为单次,提速 1.8x-2x,性能反升 0.6-1.08 个百分点
  • 步数蒸馏:把采样步减至单步,提速 3.15x-4x,性能降 3.51-4.32 个百分点
部署层面 BFL 提供 NVIDIA Jetson 边缘推理支持。FLUX 3 Action 在 B200 GPU 上单次动作块推理 41.06 毫秒,能闭合成真实控制回路而不是「思考太慢以至于没用」。

与推理模型的混合策略

BFL 测试了把 FLUX 3 Action 与 GPT-6 Astra 推理模型组合的混合架构:GPT-6 Astra 处理复杂规划,FLUX 3 Action 处理快速底层控制。在仿真任务里结果:

配置成功率成本/成功时间/成功
GPT-6 Astra(xhigh)100%$13.4716m23s
FLUX 3 Action(纯)部分$0.087约 1.75 分钟
混合(Astra 低 effort + F3A)90%$8.778m08s
混合架构比纯推理便宜 29%,快 40%,同时保住 90% 的成功率。这条思路指向一个清晰的工程路径:让「思考昂贵但精准」的推理模型负责规划,让「反应快速且廉价」的策略模型负责执行。

该信谁

BFL 自报数字(RoboLab 42.92%、真机 28/30)来自官方技术报告与 Hugging Face 模型卡。第三方 RoboLab 基准由 NVIDIA 维护,Cosmos 3 Nano 等对比对象的数字来自 NVIDIA 自报。商业许可 FLUX Kommunity License v1.0 具体条款 BFL 尚未完全公开,这是开源社区最关心的细节。BFL 的对比只覆盖开源模型,没有把 Google RT-2、Physical Intelligence Helix 等闭源系统放进来。

一些尚未回答的问题

第一,商业许可的具体边界。 「非商用 + 商用」两条选项都有,但商用价格、限制、再分发条款未发布。对想用 FLUX 3 Action 做产品的团队,这是当下最大的不确定点。

第二,闭源系统的真实能力。 Physical Intelligence π0.5 自报 28.0% 是开源版数据;闭源版与新版未公开。Google RT-H、Figure Helix 的基准对比也缺失。FLUX 3 Action 的 42.92% 是「开源 WAM 第一」而不是「所有策略模型第一」。

第三,跨本体的真实成本。 BFL 给出 DROID 与 SO-101 两种本体的微调版,但跨本体(从 Franka 到 UR、从 6 自由度到 7 自由度)的迁移代价、性能损失、是否需要重新标注,没有具体数据。

第四,安全与边界条件。 模型输出原始关节目标,没有内置速度、力、行程限制。BFL 自己在技术报告里写明这一点,让使用者自己加安全层。这对消费机器人、家用场景是一个工程隐患。

配图汇总


参考来源:BFL 官方技术报告(FLUX 3 Action,9 月 23 日)、Hugging Face 模型卡(FLUX 3 Action collection)、Black Forest Labs HuggingFace Blog(9 月 23 日)、BFL GitHub 仓库(flux-action)、Cosmos 3 论文 arXiv:2606.02800、π0.5 论文 arXiv:2504.16054、Self-Flow 论文 arXiv:2603.06507、RoboLab 论文 arXiv:2604.09860、DataNorth AI 报道、The Decoder 报道、AI Primer 报道、AI and Tech News 报道。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens