Black Forest Labs + mimic robotics:FLUX-mimic 让同一个 backbone 同时出视频和机器人动作
7 月 23 日,Black Forest Labs(BFL)发了 FLUX 3,mimic robotics 同日发了 FLUX-mimic。两件事是同一个架构判断的两个落地点。
先说 FLUX 3。它是一个多模态基础模型,图像、视频、音频从一开始就在同一个 backbone 上联合训练。BFL 公开了一个有意思的算力分配数字——视频预测占总训练算力的 95% 以上。理由很直接:要生成可信视频,模型必须学会接触、运动、重量、因果;任何一项错了视频就不像。音频只占 720p 视频 token 的 0.5% 以下——因为一旦学会了视频预测,「视频-音频」的因果关系(脚步落地、门关闭、唇形同步)就成了顺带的事情。
这是 Yann LeCun 那套「LLM-only 不行、必须学会世界动力学」论点的另一种落地路径。BFL 没有从语言侧做,而是从视频侧做。
然后是 FLUX-mimic。BFL 给 mimic robotics 提供了 FLUX 3 的早期访问权限,mimic 用它在机器人控制上做了 fine-tune。他们管这种架构叫 Video-Action Model(VAM)。核心论点:
一、动作是机器人状态的低维表示,跟视觉观察紧密耦合。 视频、音频、动作帧都是同一个物理现实的部分观察。一旦模型学会了视频和音频背后的物理过程,动作预测不是新任务,而是它已经建模的世界的另一个视图。
二、动作训练没有「永久伤害」视频生成质量。 BFL 在大规模训练里加了动作预测做 curriculum,观察到 text-to-video 和 image-to-video 的人类评分先掉了大约 10%,3500 步后模型拿回了视频生成的完整质量,并同时学会了预测动作。换句话说,加动作模态不是新方向,是同一个 backbone 的延展。
三、FLUX-mimic 不是研究 demo——Audi 在产线上真机部署了。 任务包括把零件放入托盘、把 ECU 插入夹具、装配组件、操作柔性密封件和线缆。这些都是「传统自动化做不了」的软体操作任务。mimic 自己的 mimic hand M1、wearable U1、frontier middleware 那一整套上周已经发过了,这次是接 FLUX 3。
数字层面 BFL 给出了两个:backbone 在单张 RTX 5090 上的延迟低于 80 ms,端到端机器人反应时间 101 ms。数据效率这块 mimic 自己说 VAM 比传统 VLA 提升 10 倍——这是 mimic 的语义,他们管这叫「video pre-training 比 robot data 便宜太多」。
mimic 的视频金字塔模型值得一提:底层是人类做物理工作的大规模视频(量大但没有动作标注),中层是可穿戴设备 U1 捕捉的演示(人手的运动被转成机器人兼容形式),顶层是遥操作和部署数据(稀缺但有动作标注)。传统 VLA 只能用后两层;VAM 能用全部三层——这是数据效率 10 倍的来源。
我自己的判断:BFL 这次不只是「又一个视频模型」,是把「视频预测 = 物理世界建模」这个论点做到了机器人真机部署。2026 H2 的具身竞争,开始从「专用动作模型 + 独立世界模型」转向「一个 backbone 同时输出像素和关节角」。这跟 LingBot-VA / π0 / Helix 那种 VLA 路线是不同的工程假设——VLA 把视觉-语言当作预训练,VAM 把视频生成当作预训练。后者赌的是「视频预测比图像-语言对齐更难、学会了它就学会了世界动力学」。
限制要写明:
- BFL 自家报告的偏好率是 52%~93% 不等,但没说对比样本量和评测池,是 preliminary 数据;
- 真机部署的合作方是 Audi Production Lab,场景是「零件放入托盘、ECU 插入夹具」这类相对结构化的工业任务,不等于通用家庭机器人;
- API / 参数规模 / 定价 / GA 时间全部没给,FLUX 3 Dev 的开放权重承诺在「今年晚些时候」;
- mimic-video 是 mimic 自家之前的工作,VAM 不是凭空冒出来——这次是把 FLUX 3 当 backbone 重新训练。
这条线我的整体感觉:2026 H2 的物理 AI 出现了一种新打法——把生成式视频模型的训练算力(FLUX 3 的 95%)当成物理世界建模的训练算力。同样的训练预算,两条商业出口(创意工具 + 工业机器人)。这是 Yann LeCun 那套世界模型的资本市场版本,不是论文版本。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。