FLUX 3 Action 用 70 亿参数,超过 Cosmos 3 Nano 的 160 亿:开源机器人模型的分水岭
【图形学 × 机器人学习 · WAM】 2026 年 9 月 23 日,Black Forest Labs(BFL)发布 FLUX 3 Action,开放权重的 7B 世界动作模型(World Action Model, WAM)。它在 NVIDIA RoboLab-120 仿真基准上达到 42.92% 任务成功率…
【图形学 × 机器人学习 · WAM】 2026 年 9 月 23 日,Black Forest Labs(BFL)发布 FLUX 3 Action,开放权重的 7B 世界动作模型(World Action Model, WAM)。它在 NVIDIA RoboLab-120 仿真基准上达到 42.92% 任务成功率,超过 Cosmos 3 Nano 的 36.8%(参数 16B)和 π0.5 的 28.0%(参数 3.3B)。代码、权重、训练配方同步在 Hugging Face 与 GitHub 上放出;同步发布 DROID 与 SO-101 两种本体微调版,并集成进 LeRobot 框架。
一句话结论
FLUX 3 Action 把「视频预测 = 世界建模」这个论点在机器人真机上跑通了。它用不到 Cosmos 3 Nano 一半的参数做出更高的任务成功率,速度也快 1.52-3.95 倍。它最大的工程意义是证明了:当 backbone 已经在视频预训练中学到了世界动力学,机器人策略不需要从头学动作。
WAM 与 VLA 是什么关系
机器人策略模型当下分成两大学派:
| 流派 | 代表模型 | 核心论点 | 关键能力 |
|---|---|---|---|
| VLA(视觉-语言-动作) | π0 / π0.5 / GR00T N1.6 | 视觉-语言预训练是机器人策略的桥梁 | 自然语言任务描述 |
| WAM(世界动作模型) | Cosmos 3 / FLUX 3 Action / DreamZero | 视频预测是机器人策略的桥梁 | 同时预测未来帧与动作 |
数字怎么看
| 模型 | 类型 | 参数 | RoboLab-120 SR% | 备注 |
|---|---|---|---|---|
| FLUX 3 Action(基线 FP8) | WAM | 7B | 42.92% | 开源第一 |
| FLUX 3 Action(引导蒸馏 FP8) | WAM | 7B | 42.24% | 速度 1.8x-2x |
| FLUX 3 Action(步数蒸馏) | WAM | 7B | 37.92% | 单步速度 3.15x-4x |
| Cosmos 3 Nano | WAM | 16B | 36.8% | NVIDIA 开源 |
| OASIS | VLM+WAM | 闭源 | 39.0% | 闭源 |
| Phoenix | TAMP+FM | 闭源 | 34.4% | 闭源 |
| BiMind v0.1 | VLA | 闭源 | 33.3% | 闭源 |
| π0.5 | VLA | 3.3B | 28.0% | 物理智能 开源 |
| DreamZero | WAM | 14B | 25.7% | 开源 |
| GR00T N1.6 | VLA | 3B | 7.2% | NVIDIA 开源 |
BFL 同时披露的 30 次真机测试(Frank 机械臂、第三方 Positronic Robotics 执行):FLUX 3 Action 完成 28/30(93.3%),Cosmos 3 Nano 27/30(90.0%),DreamZero 20/30(66.7%),π0.5 13/30(43.3%)。
控制循环长什么样
FLUX 3 Action 一次预测 32 个动作(约 2.13 秒的运动、15Hz),输入是:
- 一或多张相机图像(按本体组成画布:DROID 三个 544×736 相机,SO-101 两个并排相机,或游戏 512×512 帧)
- 状态向量(关节位置或最后执行的动作)
- 语言任务描述(Qwen3-VL-4B 编码器冻结)
- 32 个动作(关节命令)
- 未来视频帧(与动作同噪声级别联合去噪)
1. 模型接收当前相机帧、状态、任务描述 2. 联合预测 32 个动作与未来视频 3. 机器人执行部分动作 4. 重新观察,重复循环
「再观察」这一步是 WAM 的关键差异化能力。它能在动作执行中途捕获偏差,并基于新观察调整后续动作;纯 VLA 模型通常在 32 个动作执行完后才重新观察,犯错纠正代价更高。
训练配方的三个工程创新
BFL 在技术报告里披露了三个非显然的工程决策:
第一,动作与视频的噪声曲线匹配。 联合预测时视频与动作需在同一个噪声级别上去噪,但二者天然有不同的信号强度(动作信号通常晚于视频饱和)。BFL 用最小包络损失分析,发现动作信号过渡晚于视频,于是采用 logit-logistic 分布(scale=0.75, shift α=42)+ 动作缩放因子 s=2,让联合去噪的轨迹最优。
第二,DROID 微调的前 1k 步冻结 backbone。 随机初始化动作头后,先用 1k 步让动作头适应 backbone 特征空间,再线性解锁学习率到 2e-4,最后用 2k 步一起训练。这是「先暖头、再全身」的稳定启动配方。
第三,分裂引导(Split Guidance)。 视频与动作分开做 classifier-free guidance,最优组合是视频 CFG=4.0、动作 CFG=1.0。这个不对称设置说明:视频生成需要更强引导保证逼真度,动作生成只需要轻度引导保证反应速度。
蒸馏与部署
BFL 同时放出两种蒸馏:
- 引导蒸馏:把需两次前向传播的引导预测蒸馏为单次,提速 1.8x-2x,性能反升 0.6-1.08 个百分点
- 步数蒸馏:把采样步减至单步,提速 3.15x-4x,性能降 3.51-4.32 个百分点
与推理模型的混合策略
BFL 测试了把 FLUX 3 Action 与 GPT-6 Astra 推理模型组合的混合架构:GPT-6 Astra 处理复杂规划,FLUX 3 Action 处理快速底层控制。在仿真任务里结果:
| 配置 | 成功率 | 成本/成功 | 时间/成功 |
|---|---|---|---|
| GPT-6 Astra(xhigh) | 100% | $13.47 | 16m23s |
| FLUX 3 Action(纯) | 部分 | $0.087 | 约 1.75 分钟 |
| 混合(Astra 低 effort + F3A) | 90% | $8.77 | 8m08s |
该信谁
BFL 自报数字(RoboLab 42.92%、真机 28/30)来自官方技术报告与 Hugging Face 模型卡。第三方 RoboLab 基准由 NVIDIA 维护,Cosmos 3 Nano 等对比对象的数字来自 NVIDIA 自报。商业许可 FLUX Kommunity License v1.0 具体条款 BFL 尚未完全公开,这是开源社区最关心的细节。BFL 的对比只覆盖开源模型,没有把 Google RT-2、Physical Intelligence Helix 等闭源系统放进来。
一些尚未回答的问题
第一,商业许可的具体边界。 「非商用 + 商用」两条选项都有,但商用价格、限制、再分发条款未发布。对想用 FLUX 3 Action 做产品的团队,这是当下最大的不确定点。
第二,闭源系统的真实能力。 Physical Intelligence π0.5 自报 28.0% 是开源版数据;闭源版与新版未公开。Google RT-H、Figure Helix 的基准对比也缺失。FLUX 3 Action 的 42.92% 是「开源 WAM 第一」而不是「所有策略模型第一」。
第三,跨本体的真实成本。 BFL 给出 DROID 与 SO-101 两种本体的微调版,但跨本体(从 Franka 到 UR、从 6 自由度到 7 自由度)的迁移代价、性能损失、是否需要重新标注,没有具体数据。
第四,安全与边界条件。 模型输出原始关节目标,没有内置速度、力、行程限制。BFL 自己在技术报告里写明这一点,让使用者自己加安全层。这对消费机器人、家用场景是一个工程隐患。
配图汇总
参考来源:BFL 官方技术报告(FLUX 3 Action,9 月 23 日)、Hugging Face 模型卡(FLUX 3 Action collection)、Black Forest Labs HuggingFace Blog(9 月 23 日)、BFL GitHub 仓库(flux-action)、Cosmos 3 论文 arXiv:2606.02800、π0.5 论文 arXiv:2504.16054、Self-Flow 论文 arXiv:2603.06507、RoboLab 论文 arXiv:2604.09860、DataNorth AI 报道、The Decoder 报道、AI Primer 报道、AI and Tech News 报道。