先纠一处身份:FDπ 在 arXiv 页面上排成 FD\(π\)(美元符号里包一个希腊字母 π),中文摘要写成了 FDπ。原帖两处都保留了 LaTeX 原样,读者看到的是 FD$π$。不算错,但读者会以为漏渲染了。
arXiv 2609.26792 对得上。作者七位:Ziyang Leng、Sicheng Mo、Seth Z. Zhao、Haoyuan Cai、Yu Zeng、Rowan McAllister、Bolei Zhou。已被 CoRL 2026 接收——这条帖里漏了,而接收状态是判断一篇工作成熟度最省事的指标。
这篇论文最聪明的一步,是先怀疑自己的度量
摘要里有这么一句:
> We further observe that perceptual metrics like FID misrank how well these features are preserved.
翻译过来:用 FID 来判断「仿真保真度」是错的,而且错得不细微——是排序整个反了。
这是自动驾驶仿真里一个很常见的暗坑。FID 衡量的是「生成图和真实图在像素分布上像不像」,可策略根本不看像素分布,它看的是车道线在哪、前车距离多远、交通信号灯什么颜色。一张把红绿灯涂成绿色的照片,FID 会给一个不错的分数,而驾驶策略直接撞上去。
作者的做法是换一个从策略内部长出来的度量:拿五个公开的端到端驾驶策略(DrivoR、DiffusionDrive、LTF、RAP、SparseDriveV2),把它们各自的场景上下文特征抽出来,在这些特征空间里算生成图与真实图之间的弗莱歇距离。
这个设计的哲学我很喜欢:不去造一个「更好的客观指标」,而是去问「对使用者而言什么才是真的」。 度量不是从天上掉下来的,是从下游任务里长出来的。
数字核对:1.6× 与 4.7× 都对,但分母要说清
FDπ 越低越好,表里报的是 FDπ × 10²。
nuScenes val 上:MagicDrive 17.18、Panacea 31.46、Dreamland 25.28、DriveArena* 15.68、DreamForge* 18.29、HUGSIM* 11.68,DreamStream 7.27。11.68÷7.27 = 1.61。
NAVSIM navtest 上:BridgeSim 56.13、DriveArena 25.45,DreamStream 5.47。25.45÷5.47 = 4.65。
两处都是拿最强基线比,算法没问题。 但带星号的三个方法是在 evaluation set 上训过的,论文表注写了——这个诚实值得点名。
而且论文顺手承认了一件对自己不利的事:FD/FVD 上 DreamStream 不一定最优。所以「1.6× / 4.7×」是只在新指标下成立,不是全面碾压。这种只在自己的新指标上赢、并且明确说出来的写法,比全面吹牛可信得多。
真正的贡献是 Navhard-CL:把评分器自己的锅给抖出来
DreamStream 顺手造了个新基准,三个桶:
- Navhard-Base:421 个场景,来自真实世界 log-replay,转到 MetaDrive / ScenarioNet 后端
- Navhard-AdvBehavior:325 个安全关键对抗变体,引入会对自车反应的 adversarial agent,覆盖 NHTSA pre-crash scenario typology 五类(追尾、垂直交叉、对向、变道切入、左转横穿)
- Navhard-AdvWeather:超过 5000 个场景—外观组合,13 个外观设置(光照 6 种含日出/日落/暮光/黄金时刻/蓝调/夜,天气 4 种 overcast/snow/rain/fog,路面 3 种积雪/沙地/水洼)
scorer bias 这个概念我得单独讲一下,因为它是这篇最容易被读漏的东西。
做法很克制:保持策略生成的 proposal set 完全不变,只换打分器。策略自己学出来的叫 learned scorer,用仿真器真值 EPDMS 从同一批候选里挑最高分的叫 oracle scorer。两者之差就是 scorer bias gap。
这个设计干净得让我停下来想了想——它把「提不出好轨迹」和「有好轨迹但排不对」彻底分开了。 这两件事在端到端驾驶论文里长期混在一起算作一个「驾驶分数」,所以没人知道模型到底错在哪一步。
数字:
- DrivoR 在 Navhard-Base 上,learned 拿 46.04,oracle 拿 60.21,差距 14.17
- DiffusionDrive 在 Base 上只有 −0.99(基本无偏差),到 AdvBehavior 上变成 +8.98
- DiffusionDriveV2 从 −0.99 涨到 +3.13
- LTF 没有 scoring head,不适用
- 【直引】摘要:scorer bias and lack of recovery behaviors that prior closed-loop benchmarks overlook。
- 【推论】「缺乏恢复行为」比 scorer bias 更难治。scorer bias 至少可以在训练里用更好的排序目标修;不会恢复是个能力问题——策略在偏离后不回正,说明它训练时从没被要求做过这件事。
- 【判断】这篇最值得抄的不是 FDπ,是「先把两种失败模式拆开再报告」这个习惯。同样一个 46.04 的分数,你可以有 20 种解释方式;拆开之后只剩一种。
下一根钉子:论文自己列的两条局限我要挂起来。第一,没做真实道路或硬件在环验证——闭环评测仍在仿真里,理由是成本和安全性。第二,长时间自回归 rollout 仍累积漂移,KV cache 缓解了约 68%(nuScenes)/48%(NAVSIM),不是根治。所以 FDπ 目前只在有限 horizon 上可信。真正扎实的数字要等它上真车,或者至少等到硬件在环;在那之前,「仿真保真度」这四个字的分母仍然是仿真。
顺带一问:FDπ 的五个策略里有没有一个是被 DreamStream 生成的数据训过的?如果有,这个指标就有点自证的味道——论文没交代这一格,我核不到。