自动驾驶的安全账单里有一项最贵:闭环仿真。一套策略要拿到罕见的、危险到真实路上采不到的场景里去反复试,试出几十万种走法,然后看它撞不撞。传统做法是把每段驾驶日志逐场景优化成一个神经仿真器,单段要跑 75 分钟,还要人工调参。
2026 年 7 月 15 日,NVIDIA 空间智能实验室放出一个反方向的答案:一次前向传播,1.5 秒。
- 论文:Instant NuRec: Feed-Forward 3D Gaussian Reconstruction for Driving Scene Simulation,arXiv:2607.14203v1,2026-07-15
- 分类:cs.GR 主,cs.AI 与 cs.CV
- 作者机构:NVIDIA;项目页 research.nvidia.com/labs/sil/projects/instant-nurec,代码与模型已放出
🚧 慢在哪里
神经仿真这条路上,NuRec 一类的逐场景优化方法(论文提到 OmniRe 作为代表)能把一段真实驾驶日志还原得很忠实。问题在成本结构。
- 每段新片段要几小时计算,外加仔细调超参
- 还需要一堆辅助输入:LiDAR 扫掠、拟合的位姿、语义掩码
- 现代车队每天收集的片段数以百万计。这个成本结构下,逐场景优化铺不开
Instant NuRec 的输入是 1 到 5 个已标定相机拍的 10 到 20 秒片段,输出是一个可以自由重放、自由挪动自车视角、可以重新计时的分层 3D 高斯世界。1.5 秒。
🧱 分层这件事为什么关键
闭环仿真需要的不只是好看。场景必须拆成静态背景与可以单独编辑的动态个体,两者分开才能做反事实 rollout。
Instant NuRec 的输出是四层加两路校正。
| 层 | 内容 | 属性 |
|---|---|---|
| 静态 3DGS | 路面、建筑、刚性背景 | 位置、尺度、旋转四元数、不透明度、颜色、法向量、语义类别 |
| 动态 3DGS | 车辆与易受伤害的道路使用者 | 属性同上,位置换成三关键帧的分段线性轨迹 |
| 天空 | 六面 cubemap | 可表达云与太阳的高频纹理 |
| 每相机 ISP 校正 | 每相机 3×4 的 RGB 仿射变换 | 初始化为单位阵,补偿白平衡、gamma 与暗角差异 |
结果可以导出成 USDZ,直接喂给 NuRec 与 AlpaSim。渲染器用 3DGUT,所以原生支持非针孔相机模型。
架构是一个复用 DINOv2 的交替注意力 ViT 编码器。每张图切成 14×14 的不重叠 patch,另加一个 per-image class token,这个 token 由相机的 6 位位姿与视场角做正弦编码生成,把相机位姿直接注入注意力。Transformer 里 intra-image 与 cross-image 注意力交替堆叠,DPT 头融合多层特征。
解码端有五个头。深度头出稠密深度图;语义头出四类 logits(road、movable、sky、ego-car);运动头从深度 lift 出的同一组 query points 出发,回归 6 维位移并构造三个轨迹点;天空头对 cubemap 每个像素的世界空间射线方向做正弦编码并 cross-attend 编码器特征;3DGS 头从预测深度 lift 出 3D query points 再 cross-attend 编码器特征,产出高斯的尺度、旋转与不透明度,颜色、法向量、语义由它补全。此外还有一个法向头与一个 ISP 解码头。
📈 Waymo Open Dataset 上的差距
| 方法 | 全图 PSNR | 全图 SSIM | AbsRel | δ₁ | 动态 PSNR | 动态 δ₁ |
|---|---|---|---|---|---|---|
| DepthSplat | 22.48 | 0.645 | 0.295 | 0.592 | 18.59 | 0.512 |
| STORM | 21.88 | 0.752 | 0.123 | 0.870 | 19.89 | 0.789 |
| Depth-Anything-3 | 20.30 | 0.557 | 0.434 | 0.313 | 17.59 | 0.354 |
| DGGT | 26.25 | 0.805 | 0.135 | 0.841 | 21.76 | 0.689 |
| Instant NuRec | 28.26 | 0.859 | 0.076 | 0.937 | 24.93 | 0.922 |
- 相对最强基线 DGGT 高 2.01 dB,动态区域的提升更大(24.93 对 21.76)
- 评估协议:每样本 2 秒窗口、20 帧连续图像,输入 4 个 context frame,帧间隔 0.5 秒,RGB 预测与真值都缩放到 240×160
- 相对逐场景优化的计算量降低 10³ 到 10⁴ 倍(论文摘要表述)
🔬 消融:每个模块在干什么
内部验证集上的数字很能说明问题。
| 变体 | PSNR | SSIM | AbsRel | δ₁ |
|---|---|---|---|---|
| Instant NuRec(完整) | 29.93 | 0.793 | 0.069 | 0.950 |
| 改成单阶段训练 | 27.65 | 0.751 | 0.077 | 0.955 |
| 天空用 MLP 替 cubemap | 26.73 | 0.692 | 0.068 | 0.950 |
| 去掉 LPIPS 损失 | 26.81 | 0.705 | 0.073 | 0.934 |
| 去掉深度损失 | 28.92 | 0.782 | 0.103 | 0.862 |
| 去掉 frustum-ownership 合并 | 26.10 | 0.648 | 0.098 | 0.891 |
- 去掉深度损失,图像指标几乎不掉(28.92 对 29.93)但 δ₁ 从 0.950 掉到 0.862。模型会过拟合外观,几何跟着崩
- 去掉 frustum-ownership 合并是全表最狠的一击(26.10)。这个模块用视锥归属测试让每个高斯由观测距离最近的 chunk 拥有,减少相邻 chunk 之间的重复高斯与 floater。不做这件事,长片段重建的质量就掉
- 天空从 cubemap 退成 MLP 掉 3.2 dB,cubemap 是为了能表达高频天空纹理
🚘 闭环里排出来的名次
评估在 AlpaSim 的同一套闭环栈上做,只换重建结果。140 个场景,每个场景 rollout 20 秒,每 500 毫秒重规划一次,每个场景 6 次独立试验,按 140 场景乘 6 次取平均。看的两个指标是碰撞率(前方、侧方、后方合计)与越界率。
- 论文的核心结论是一句话:在 Instant NuRec 下的策略排序,与昂贵的逐场景优化 NuRec 下完全一致
- 测的五个配置是 Alpamayo 1.5 的 1 相机、2 相机、4 相机三个变体,加上 VaVAM 与 Alpamayo R1
五种策略各自的碰撞率与越界率具体数值,只存在于论文 Figure 8 的柱状图里,HTML 版本没有转录这些数字。NVIDIA 项目页给出的数字是碰撞率 14%、23%、20%、27%、28%、37%、40%、51%、37%、42%,越界率 7%、9%、11%、10%、10%、12%、12%、10%、35%、33%,两行数值与五个策略的对应关系无法从页面可靠读出,这里不强行配对。要引用具体数字请以论文 PDF 的 Figure 8 为准。
可复算的部分是重建时间:NuRec 约 75 分钟,Instant NuRec 在 Dense 与 Selective 两种 query 策略下都约 1.5 秒。Dense 每个 context view 约 351K 个高斯,Selective 约 120K;18 帧场景里 Dense 约 6.3M,Selective 约 2.2M,高斯预算降了约 3 倍。
📡 LiDAR 分支
模型保留训练好的相机 backbone,加一个轻量 LiDAR 分支。每个 sweep 表示成含逐束 range 与 intensity 的 range map,range-map encoder 出 token,decoder 为每条有效输入射线预测 M 个高斯,放置在测量位置附近并施加有界三维偏移,同时预测尺度、朝向、不透明度与 intensity。
这里有个不能省的技术决定。论文对高斯施加了受 Mip-Splatting 启发的各向异性尺度下限,使 footprint 不小于水平与垂直角分辨率产生的 beam spacing。
| 方法 | Chamfer distance | 精度 | 覆盖 | 强度 MAE | 重建时间 |
|---|---|---|---|---|---|
| NuRec | 0.204 | 0.080 | 0.124 | 0.028 | 约 75 分钟 |
| Instant NuRec LiDAR | 0.286 | 0.113 | 0.173 | 0.027 | 约 20 秒 |
| 去掉尺度下限 | 0.936 | 0.195 | 0.741 | 0.036 | — |
- 速度约 225 倍。几何指标比 NuRec 差(Chamfer 0.286 对 0.204),论文解释为几何覆盖不够完整,不是定位错
- 去掉尺度下限后 Chamfer 崩到 0.936,覆盖率 0.741。没有这个下限,高斯会塌到观测射线附近去
- 上下文 LiDAR 帧加到约 20 windows 每片段后,重建时间从约 11 秒涨到约 20 秒
⚖️ 论文自陈的限制
- 高斯数量与重建质量之间存在内在矛盾。要匹配逐场景优化的质量,可能需要大量高斯;用小预算则欠采样杆件与交通灯这类细薄结构
- 传感器配置未知的场景,泛化能力受训练语料限制。明显不同的 rig,比如安装高度很低或只用鱼眼的配置,目前需要额外微调
- 三关键帧的分段线性轨迹表达不了亚秒级非刚性运动,比如行人的关节动作
- 长驾驶日志目前靠 chunk 处理。论文提的演进方向是让历史重建结果条件化当前的 forward pass
- 三个训练阶段共约 6 天,8 个节点,每 GPU batch 为 1 到 2 个片段,完整训练后 encoder 被冻结
- 内部数据评估最长支持 30 秒
📌 值得关注的地方
把重建从"优化问题"改成"前向传播",这一改的成本结构变化比任何单项指标都大。传统路线的单段 75 分钟决定了车队每天收集的百万级片段里,没有一个比例是能被逐场景优化吃下来的。
- 一处是排序保真度。闭环仿真的用途本来是排策略名次,名次对了就够用,逐策略的碰撞率精确到多少不重要
- 尺度下限那个消融(0.936 对 0.286)是个容易在换数据集时丢掉的经验:神经重建里高斯必须有个几何下限,否则会塌向射线
- 单相机 V=1 的配置可用,意味着成本还能再压。杆件与交通灯这类细薄结构在 Selective 策略下的欠采样,是这套方法眼下最实际的短板
信源:arXiv:2607.14203v1 的 HTML 全文(Table 1、Table 2、Table 3、Figure 1 至 Figure 8 及对应章节)与 NVIDIA 项目页 research.nvidia.com/labs/sil/projects/instant-nurec。Table 1、2、3 数值逐项取自论文;Figure 8 的五种策略碰撞率与越界率在 HTML 中未转录,页面所给数值与策略的配对关系无法可靠确定,已在正文说明。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。