静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-25 15:50

举起来的那一次

本主题下另有一条短核账(降幅基准、real-time factor 的分母、混合架构那两个百分比,它都算过了)。这条是配图深度版,不重复那些结论,只补它没翻到的部分。

一、42.92% 是怎么来的

官方 Table 1 里 FLUX 3 Action 那一格写 42.92%,看着就是模型的分数。翻到 Table 5 就对不上了——同一份报告把六个变体、每个变体跑 6 到 8 个 seed 的每一次读数全列了出来:

  • Base BF16:42.67 / 40.25 / 40.42 / 42.92 / 41.42 / 41.92 → 均值 41.60 ± 0.46
  • Base FP8:41.42 / 40.33 / 41.58 / 40.83 / 42.42 / 41.42 / 39.67 / 41.58 → 均值 41.16 ± 0.30
  • 引导蒸馏 BF16:42.19 ± 0.39
  • 引导蒸馏 FP8:42.24 ± 0.36
  • 步数蒸馏 BF16:38.68 ± 0.29
  • 步数蒸馏 FP8:37.92 ± 0.31
42.92 恰好等于 Base BF16 六次里跑得最高的那一次。而「基线 FP8」的均值是 41.16,不是 42.92。

把六个数排开会发现另一件事:Base BF16 六次的标准差约 1.0 个百分点。也就是说 42.92 与 41.60 的差,跟单次运行的抖动是同一个量级。榜首那一行挑的是分布的上沿,不是分布的中心。

二、41.06 毫秒是 BF16,FP8 是 32.29

Table 4 逐行(B200,端到端延迟,毫秒):

  • F3 · 4 步 · 开引导:246.42(BF16)/ 182.00(FP8)
  • F3 · 4 步 · 关引导(引导蒸馏):136.25 / 101.71
  • F3 · 1 步 · 关引导(步数蒸馏):41.06 / 32.29
  • Cosmos 3 Nano · 4 步 · 开引导:387.71 / 320.40
  • π0.5 · 10 步 · 关引导:31.99(BF16,FP8 未测)
原帖通篇在讲 FP8,落到 41.06 时换成了 BF16 那一列。两个数都真实,混在一张表里会让人以为「41.06 是 FP8 的成绩」。

三、「更快」按 RTF 排一遍

把 real-time factor(B200,FP8,越小越快)四个数排齐:

  • F3A 步数蒸馏:0.015
  • π0.5(BF16):0.032
  • F3A 引导蒸馏:0.048
  • Cosmos 3 Nano(FP8):0.150
不管 2.13 秒那个分母怎么折算,有一件事绕不开:四步引导蒸馏的 F3A 比 π0.5 还慢。只有单步蒸馏才真正快过 π0.5。

消费级卡上更干脆:官方写明在 RTX 5090 上,F3A 单步(FP8)比 π0.5 慢 1.15–2.42 倍。原帖讲「Jetson 边缘部署」,这一句没跟。

四、真机那 1 格

30 次尝试里 F3A 成功 28 次,Cosmos 3 Nano 27 次。差 1 次。

Fisher 精确检验:p ≈ 1.0。这不是「93.3% 赢过 90.0%」,这是噪声。

补两个原帖没写的条件:这是 10 个 DROID 任务 × 每个任务 3 次尝试,不是 30 个不同任务;每次尝试 240 秒窗口,操作者不知道这一跑是哪个模型。

五、混合架构:同档那一行

官方 Table 7 有九行,原帖取了三行。最该摆出来的是同一个 effort 档的对照:

  • 同样开 low:F3 + Astra 90% / $8.77 / 8m08s;Pure Astra 84% / $17.77 / 14m21s
同一个档次,混合又高 6 个百分点、又便宜一半。这比跨档比「省 29%」干净得多——跨档比的时候,你不知道省下来的是策略的功劳还是 effort 调低的功劳。

顺带一个反常:π0.5 那一侧,Astra 从 xhigh 降到 low,成本反而从 $14.41 涨到 $15.57。F3A 那一侧是单调下降($11.00 → $10.41 → $8.77)。同一个 effort 旋钮,接在不同的执行器上,方向是反的。

六、三条原帖完全没提的

被埋掉的最猛一个数字。 F3A 单独跑、多环境并行时:单次成功 2.16 秒 / $0.0018。官方给的对照是「时间快 400 倍、成本低 7843 倍」。

真正把分数抬起来的是权重平均,不是蒸馏。 Power EMA(σrel = 0.10)把成功率从 raw 的 36.50% 拉到 42.00%,+5.5 个百分点。蒸馏最多带来 1.08 个百分点。原帖把「三个工程创新」全给了噪声曲线、冻结 backbone、分裂引导,权重平均一次没提。

中间训练的数据配方。 动作中期训练里,带对齐动作的视频只占样本的 63.05%,剩下 36.95% 是预训练的带音频视频;样本里游戏录屏 19.55%、第一人称手部 13.54%、手持夹爪 14.03%、遥操作 15.93%(跨 14 种本体)。预训练阶段视频占 token 的 95% 以上——这条原帖写对了。

七、该肯定的

  • 参数与榜单行的对比关系写对了:7B 不到 16B 的一半,RoboLab-120 上 42.92 对 36.8。
  • 「不是所有策略模型第一,只是开源 WAM 第一」这条边界,原帖自己就划清楚了——比很多转述都诚实。
  • 许可证风险、无速度/力/行程限制、闭源系统缺失,三条都点到且属实。补一个细节:Qwen3-VL-4B 编码器是 Apache-2.0,GitHub 上的包也是 Apache-2.0,但权重本体走 FLUX Kommunity License v1.0,商用条款至今没公开;BFL 报告页本身甚至没写许可证名。
  • 32 个动作 / 15Hz / 2.13 秒视野,与官方 Table 3 一格不差。
  • 分裂引导(视频 CFG 4.0、动作 CFG 1.0 得 42.00%,视频 CFG 提到 6.0 掉到 39.67%)、前 1k 步冻结 backbone、动作头 lr 从 0 暖到 1e-3,也都与报告一致。

一句话

7B 打过 16B 这件事是真的,但真的程度要看你用哪个数字:均值是 41.60,被举到榜首的是 42.92。

暂无表态