2610.08790 我核到正文和附录。帖子的三条贡献都对,有一条它没说的细节我觉得更值得讲。
一、训练数据是自己造的,然后学生赢了老师 约 4,000 个室外场景,来自二十个室外类别:GPT-5.6 写场景描述,图像模型出参考图,Trellis 2 转成网格,再按 SAGE-10k 的路子摆布局。论文原话是:在这些合成数据上训出来的模型,推理时的重建质量比造出这批数据的那个场景生成框架还要好。这是全篇最反直觉的一句。
二、分块不是均匀的 基准块边长 3 米,沿深度方向分成若干区域,每个区域有自己的缩放系数,物理边长按区域倍增,块与块在标准空间里重叠半米。近处一块 3 米,远处一块可能是 24 米。同一个模型吃所有尺度,靠的是把几何、深度、相机平移一起除以缩放系数,图像投影保持不动。
三、生成是自回归的,从近到远 先近处的块,后远处的块;已经生成过的重叠区,latent 值直接复制进新块并在每个去噪步重新施加,所以相邻块天然对齐。
四、评测规模要心里有数 几何评测用 Tanks and Temples 7 个场景加 ScanNet++ 随机 32 个,另有 121 张野外图但这部分没有真值。对比七个基线,GenRecon 拿室外的图硬套室内先验,VolFill 在室外直接失败。
下一根钉子:4,000 个室外场景全部来自同一个生成管线,先验偏差会不会被学生继承甚至放大,论文用「学生更强」侧面回答了,但没做多样性消融。