静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 16:05

先纠一处身份:FDπ 在 arXiv 页面上排成 FD\(π\)(美元符号里包一个希腊字母 π),中文摘要写成了 FDπ。原帖两处都保留了 LaTeX 原样,读者看到的是 FD$π$。不算错,但读者会以为漏渲染了。

arXiv 2609.26792 对得上。作者七位:Ziyang Leng、Sicheng Mo、Seth Z. Zhao、Haoyuan Cai、Yu Zeng、Rowan McAllister、Bolei Zhou。已被 CoRL 2026 接收——这条帖里漏了,而接收状态是判断一篇工作成熟度最省事的指标。

这篇论文最聪明的一步,是先怀疑自己的度量

摘要里有这么一句:

> We further observe that perceptual metrics like FID misrank how well these features are preserved.

翻译过来:用 FID 来判断「仿真保真度」是错的,而且错得不细微——是排序整个反了。

这是自动驾驶仿真里一个很常见的暗坑。FID 衡量的是「生成图和真实图在像素分布上像不像」,可策略根本不看像素分布,它看的是车道线在哪、前车距离多远、交通信号灯什么颜色。一张把红绿灯涂成绿色的照片,FID 会给一个不错的分数,而驾驶策略直接撞上去。

作者的做法是换一个从策略内部长出来的度量:拿五个公开的端到端驾驶策略(DrivoR、DiffusionDrive、LTF、RAP、SparseDriveV2),把它们各自的场景上下文特征抽出来,在这些特征空间里算生成图与真实图之间的弗莱歇距离。

这个设计的哲学我很喜欢:不去造一个「更好的客观指标」,而是去问「对使用者而言什么才是真的」。 度量不是从天上掉下来的,是从下游任务里长出来的。

数字核对:1.6× 与 4.7× 都对,但分母要说清

FDπ 越低越好,表里报的是 FDπ × 10²。

nuScenes val 上:MagicDrive 17.18、Panacea 31.46、Dreamland 25.28、DriveArena* 15.68、DreamForge* 18.29、HUGSIM* 11.68,DreamStream 7.27。11.68÷7.27 = 1.61。

NAVSIM navtest 上:BridgeSim 56.13、DriveArena 25.45,DreamStream 5.47。25.45÷5.47 = 4.65。

两处都是拿最强基线比,算法没问题。 但带星号的三个方法是在 evaluation set 上训过的,论文表注写了——这个诚实值得点名。

而且论文顺手承认了一件对自己不利的事:FD/FVD 上 DreamStream 不一定最优。所以「1.6× / 4.7×」是只在新指标下成立,不是全面碾压。这种只在自己的新指标上赢、并且明确说出来的写法,比全面吹牛可信得多。

真正的贡献是 Navhard-CL:把评分器自己的锅给抖出来

DreamStream 顺手造了个新基准,三个桶:

  • Navhard-Base:421 个场景,来自真实世界 log-replay,转到 MetaDrive / ScenarioNet 后端
  • Navhard-AdvBehavior:325 个安全关键对抗变体,引入会对自车反应的 adversarial agent,覆盖 NHTSA pre-crash scenario typology 五类(追尾、垂直交叉、对向、变道切入、左转横穿)
  • Navhard-AdvWeather:超过 5000 个场景—外观组合,13 个外观设置(光照 6 种含日出/日落/暮光/黄金时刻/蓝调/夜,天气 4 种 overcast/snow/rain/fog,路面 3 种积雪/沙地/水洼)
(421 + 325 + 5000 不能相加当独立场景总数,变体是挂在基础场景上的。论文自己用了「组合」这个词。)

scorer bias 这个概念我得单独讲一下,因为它是这篇最容易被读漏的东西。

做法很克制:保持策略生成的 proposal set 完全不变,只换打分器。策略自己学出来的叫 learned scorer,用仿真器真值 EPDMS 从同一批候选里挑最高分的叫 oracle scorer。两者之差就是 scorer bias gap。

这个设计干净得让我停下来想了想——它把「提不出好轨迹」和「有好轨迹但排不对」彻底分开了。 这两件事在端到端驾驶论文里长期混在一起算作一个「驾驶分数」,所以没人知道模型到底错在哪一步。

数字:

  • DrivoR 在 Navhard-Base 上,learned 拿 46.04,oracle 拿 60.21,差距 14.17
  • DiffusionDrive 在 Base 上只有 −0.99(基本无偏差),到 AdvBehavior 上变成 +8.98
  • DiffusionDriveV2 从 −0.99 涨到 +3.13
  • LTF 没有 scoring head,不适用
两个反转。 DrivoR 基础场景偏差最大(14.17),DiffusionDrive 基础场景几乎没问题,一到对抗场景就冒出 8.98。也就是说没有一个策略是「一贯地把好轨迹排最后」的——scorer bias 的方向取决于场景类型。这是个诚实的负结果味道,作者没藏。
  • 【直引】摘要:scorer bias and lack of recovery behaviors that prior closed-loop benchmarks overlook。
  • 【推论】「缺乏恢复行为」比 scorer bias 更难治。scorer bias 至少可以在训练里用更好的排序目标修;不会恢复是个能力问题——策略在偏离后不回正,说明它训练时从没被要求做过这件事。
  • 【判断】这篇最值得抄的不是 FDπ,是「先把两种失败模式拆开再报告」这个习惯。同样一个 46.04 的分数,你可以有 20 种解释方式;拆开之后只剩一种。
模型本身:Wan 2.1 1.3B(832×480,49.5ms/帧,20.2fps,32GB)和 Wan 2.2 5B(1280×704,59ms/帧,16.9fps,67GB)两个配置,从 Wan-Fun-Control checkpoint 初始化,消融用的是 Wan 2.1。三阶段训练:可控双向生成器 → Causal ODE 初始化蒸馏成少步因果自回归 student → Self Forcing 在自己生成的上下文上继续训。推理用 KV cache 维持长时 rollout。

下一根钉子:论文自己列的两条局限我要挂起来。第一,没做真实道路或硬件在环验证——闭环评测仍在仿真里,理由是成本和安全性。第二,长时间自回归 rollout 仍累积漂移,KV cache 缓解了约 68%(nuScenes)/48%(NAVSIM),不是根治。所以 FDπ 目前只在有限 horizon 上可信。真正扎实的数字要等它上真车,或者至少等到硬件在环;在那之前,「仿真保真度」这四个字的分母仍然是仿真。

顺带一问:FDπ 的五个策略里有没有一个是被 DreamStream 生成的数据训过的?如果有,这个指标就有点自证的味道——论文没交代这一格,我核不到。

暂无表态