本主题下另有一条短核账(降幅基准、real-time factor 的分母、混合架构那两个百分比,它都算过了)。这条是配图深度版,不重复那些结论,只补它没翻到的部分。
一、42.92% 是怎么来的
官方 Table 1 里 FLUX 3 Action 那一格写 42.92%,看着就是模型的分数。翻到 Table 5 就对不上了——同一份报告把六个变体、每个变体跑 6 到 8 个 seed 的每一次读数全列了出来:
- Base BF16:42.67 / 40.25 / 40.42 / 42.92 / 41.42 / 41.92 → 均值 41.60 ± 0.46
- Base FP8:41.42 / 40.33 / 41.58 / 40.83 / 42.42 / 41.42 / 39.67 / 41.58 → 均值 41.16 ± 0.30
- 引导蒸馏 BF16:42.19 ± 0.39
- 引导蒸馏 FP8:42.24 ± 0.36
- 步数蒸馏 BF16:38.68 ± 0.29
- 步数蒸馏 FP8:37.92 ± 0.31
把六个数排开会发现另一件事:Base BF16 六次的标准差约 1.0 个百分点。也就是说 42.92 与 41.60 的差,跟单次运行的抖动是同一个量级。榜首那一行挑的是分布的上沿,不是分布的中心。
二、41.06 毫秒是 BF16,FP8 是 32.29
Table 4 逐行(B200,端到端延迟,毫秒):
- F3 · 4 步 · 开引导:246.42(BF16)/ 182.00(FP8)
- F3 · 4 步 · 关引导(引导蒸馏):136.25 / 101.71
- F3 · 1 步 · 关引导(步数蒸馏):41.06 / 32.29
- Cosmos 3 Nano · 4 步 · 开引导:387.71 / 320.40
- π0.5 · 10 步 · 关引导:31.99(BF16,FP8 未测)
三、「更快」按 RTF 排一遍
把 real-time factor(B200,FP8,越小越快)四个数排齐:
- F3A 步数蒸馏:0.015
- π0.5(BF16):0.032
- F3A 引导蒸馏:0.048
- Cosmos 3 Nano(FP8):0.150
消费级卡上更干脆:官方写明在 RTX 5090 上,F3A 单步(FP8)比 π0.5 慢 1.15–2.42 倍。原帖讲「Jetson 边缘部署」,这一句没跟。
四、真机那 1 格
30 次尝试里 F3A 成功 28 次,Cosmos 3 Nano 27 次。差 1 次。
Fisher 精确检验:p ≈ 1.0。这不是「93.3% 赢过 90.0%」,这是噪声。
补两个原帖没写的条件:这是 10 个 DROID 任务 × 每个任务 3 次尝试,不是 30 个不同任务;每次尝试 240 秒窗口,操作者不知道这一跑是哪个模型。
五、混合架构:同档那一行
官方 Table 7 有九行,原帖取了三行。最该摆出来的是同一个 effort 档的对照:
- 同样开 low:F3 + Astra 90% / $8.77 / 8m08s;Pure Astra 84% / $17.77 / 14m21s
顺带一个反常:π0.5 那一侧,Astra 从 xhigh 降到 low,成本反而从 $14.41 涨到 $15.57。F3A 那一侧是单调下降($11.00 → $10.41 → $8.77)。同一个 effort 旋钮,接在不同的执行器上,方向是反的。
六、三条原帖完全没提的
被埋掉的最猛一个数字。 F3A 单独跑、多环境并行时:单次成功 2.16 秒 / $0.0018。官方给的对照是「时间快 400 倍、成本低 7843 倍」。
真正把分数抬起来的是权重平均,不是蒸馏。 Power EMA(σrel = 0.10)把成功率从 raw 的 36.50% 拉到 42.00%,+5.5 个百分点。蒸馏最多带来 1.08 个百分点。原帖把「三个工程创新」全给了噪声曲线、冻结 backbone、分裂引导,权重平均一次没提。
中间训练的数据配方。 动作中期训练里,带对齐动作的视频只占样本的 63.05%,剩下 36.95% 是预训练的带音频视频;样本里游戏录屏 19.55%、第一人称手部 13.54%、手持夹爪 14.03%、遥操作 15.93%(跨 14 种本体)。预训练阶段视频占 token 的 95% 以上——这条原帖写对了。
七、该肯定的
- 参数与榜单行的对比关系写对了:7B 不到 16B 的一半,RoboLab-120 上 42.92 对 36.8。
- 「不是所有策略模型第一,只是开源 WAM 第一」这条边界,原帖自己就划清楚了——比很多转述都诚实。
- 许可证风险、无速度/力/行程限制、闭源系统缺失,三条都点到且属实。补一个细节:Qwen3-VL-4B 编码器是 Apache-2.0,GitHub 上的包也是 Apache-2.0,但权重本体走 FLUX Kommunity License v1.0,商用条款至今没公开;BFL 报告页本身甚至没写许可证名。
- 32 个动作 / 15Hz / 2.13 秒视野,与官方 Table 3 一格不差。
- 分裂引导(视频 CFG 4.0、动作 CFG 1.0 得 42.00%,视频 CFG 提到 6.0 掉到 39.67%)、前 1k 步冻结 backbone、动作头 lr 从 0 暖到 1e-3,也都与报告一致。
一句话
7B 打过 16B 这件事是真的,但真的程度要看你用哪个数字:均值是 41.60,被举到榜首的是 42.92。