[论文] Zero-Shot Novel Depth Synthesis Using 3D Foundation Models Scene Repre...

研究领域: CV 作者: Denis M. Akola, David F. Fouhey 发布时间: 2026-09-06 arXiv: 2509.04284

论文概要

研究领域: CV 作者: Denis M. Akola, David F. Fouhey 发布时间: 2026-09-06 arXiv: 2509.04284

中文摘要

3D基础模型(3DFM)如VGGT最近通过前馈Transformer预测丰富的统一表示,推动了3D视觉的边界。这些模型学到的场景表示使其在多个3D视觉任务上表现优异。本文研究如何利用其内部表示从新视角推断场景中的3D信息。我们的假设是:为了解决3D重建任务,这些模型需要学习一种包含大量关于3D场景通用知识的表示。在展示了可以从3DFM内部表示解码隐藏表面后,我们提出了一种名为Z3D的方法,通过对3DFM表示进行潜在扩散来估计未见过视角的点图。我们证明Z3D能够在多个数据集上为新视角预测逼真的深度图。

原文摘要

3D Foundation Models (3DFMs) such as VGGT have recently pushed the boundaries of 3D vision by predicting rich unified representations with feed-foward transformers. The scene representations learned by these models enable strong performance on multiple 3D vision tasks. In this paper, we investigate using their internal representations to infer 3D in the scene from new views. Our hypothesis is that in order to solve the task of 3D reconstruction, these models need to learn a representation that includes a large amount of general knowledge about 3D scenes. After showing that it is possible to decode hidden surfaces from internal 3DFM representations, we propose a method, Z3D, that estimates pointmaps in unseen views by doing latent diffusion on 3DFM representation. We show that Z3D can predi...


*自动采集于 2026-09-07*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

从"看见"到"想象":3D基础模型如何凭空补全看不见的深度

一个关于"脑补"的故事

想象你站在一间房间里,面前是一面墙,墙上挂着一幅画。你拍了一张照片。现在问你:画后面是什么?

人类会"脑补"——画后面是墙,墙后面可能是走廊或另一个房间。但计算机视觉系统传统上做不到这件事。给它一张照片,它只能告诉你"看得见的部分"的深度。至于看不见的地方——它沉默了。

2026年9月,纽约大学的 Denis Akola 和 David Fouhey 发表了一篇论文,教 AI 做"脑补"。论文的名字叫 Z3D,核心思想极其优雅:既然 3D 基础模型(3DFM)已经学会了"理解"三维场景,那它的内部表示里,应该藏着关于看不见部分的信息。我们只需要把这个信息"解码"出来。

3D基础模型:从"拍照"到"建模"

要理解 Z3D,先得理解它的地基——3D Foundation Models(3DFM)。

传统 3D 重建像拼图:给你几十张从不同角度拍的照片,用 SfM(Structure from Motion)算法慢慢匹配特征点,稀疏重建,再稠密重建,最后得到一个点云。这个过程慢、需要大量图片、对纹理稀少的区域无能为力。

2025年,VGGT(Visual Geometry Grounded Transformer)改变了一切。它是一个前馈 Transformer,输入几张图片,直接输出场景的统一表示——深度图、点云、相机参数,一步到位。不需要迭代优化,不需要特征匹配。就像从"手工拼图"跳到了"一键扫描"。

VGGT 内部做了什么?它把每张图片切成 patch(小块),通过交替的"帧内注意力"和"全局注意力"层,逐步提取从单帧几何到多帧几何的信息。最终,每张图片的每个 patch 都对应一个高维向量——这些向量构成了场景的"潜在表示"。

关键问题是:这个表示里到底编码了什么?

核心假设:为了重建,必须"理解"

Z3D 的核心假设是一个哲学命题:

为了解决 3D 重建任务,模型必须学习一种包含大量关于 3D 场景通用知识的表示。

换句话说,VGGT 能从几张图片重建 3D,不是因为它记住了这几张图片的像素,而是因为它学到了"3D 场景一般长什么样"——房间有地板和天花板,物体有正面和背面,遮挡的部分不会凭空消失。

如果这个假设成立,那 VGGT 的内部表示里,应该不仅有"看得见的信息",还有"看不见但可以推断的信息"。

论文的第一个实验验证了这一点:他们从 VGGT 的中间层(第17层)提取 patch token,发现即使这些 token 对应的是被遮挡的区域,也能解码出合理的深度值。模型内部已经"知道"被挡住的部分长什么样,只是没有专门的头把它输出出来。

Z3D 的架构:在潜在空间里"扩散想象"

既然 VGGT 的表示里藏着看不见部分的信息,怎么把它提取出来?

Z3D 的答案是:潜在扩散

整个架构由四个部分组成:

3DFM 骨干网络(冻结):用预训练好的 VGGT 处理输入的源视角图片,提取第17层的 patch token 作为场景表示。这个网络不训练,只当"特征提取器"。

位姿编码器:把目标视角的相对相机位姿编码成向量。每个位姿是一个12维向量(3×4的投影矩阵),经过傅里叶编码和 MLP,变成和 patch token 同维度的嵌入。

扩散模型(DiT):这是 Z3D 的核心。它在 VGGT 的 patch token 空间里做扩散——给目标视角的 token 加高斯噪声,然后让 DiT 学习去噪,条件是源视角的 token 和目标位姿。每个 DiT block 里,目标 token 通过交叉注意力"看"源视角的 token,通过自适应层归一化接收位姿和时间步信息。

DPT 头(冻结):去噪后的 token 直接送进 VGGT 原本的 DPT 深度预测头,输出深度图。这个头也是冻结的——Z3D 不改 VGGT 的任何输出头,只在表示空间做文章。

用类比来说:VGGT 是一个会画 3D 场景的画家,DPT 头是它的手。Z3D 不换手,也不教画家新技巧,它只是给画家一个"想象目标视角"的能力——通过在画家的"思维空间"(patch token 空间)里做扩散,让画家"想象"出没看过的角度,然后用同一双手画出来。

为什么不直接扩散深度图?

这是一个关键问题。已有方法(如 WM-DD、VGGT-DD)直接在深度图空间做扩散——给源视角深度图,扩散出目标视角深度图。Z3D 为什么多此一举,要先在 token 空间扩散,再解码?

论文给出了实验答案:直接扩散深度图的方法(WM-DD、VGGT-DD)在定量指标上和 Z3D 接近,但生成的点云明显更嘈杂、几何锐度更低。

原因在于:深度图只是场景的一个投影,不是场景本身。 深度值告诉你"这个像素离相机多远",但不告诉你"这个点属于什么物体""它和周围点的几何关系是什么"。直接在深度空间扩散,模型只能做像素级的插值,无法利用场景的全局结构。

而 VGGT 的 patch token 编码了更丰富的信息——不仅有深度,还有语义、几何关系、多视角一致性。在这个空间做扩散,模型是在"想象一个完整的 3D 场景",然后从中"投影"出深度图,而不是在"插值像素"。

这就像:你可以把一首交响乐降采样成 MIDI 再生成新乐章(深度空间扩散),也可以直接在作曲家的思维空间里让他想象新乐章再写出来(token 空间扩散)。后者更自然,因为思维空间比 MIDI 编码了更丰富的音乐结构。

实验结果:零样本泛化到未见数据集

Z3D 在多个数据集上测试了零样本深度预测能力——训练集没见过的场景类型。

在 1-to-1 设置(一张源图片预测一个目标视角)和 2-to-4 设置(两张源图片预测四个目标视角)下,Z3D 都能生成几何一致、细节清晰的深度图。特别是从单张图片生成多视角深度图的能力,展示了模型确实"理解"了场景的 3D 结构,而不只是记忆了视角间的变换模式。

定性比较中,Z3D 生成的点云比直接扩散深度图的方法更干净、更锐利——墙壁是平的,边缘是锐利的,而不是像被涂抹过一样模糊。

更深层的洞察:表示比输出更重要

Z3D 给我的最大启发不是扩散模型本身,而是这个设计哲学:

一个好的表示,比一个好的输出更重要。

VGGT 在训练时只被要求输出看得见部分的深度。但为了做好这件事,它被迫学到了一个更丰富的表示——包括看不见部分的信息。Z3D 只是找到了一种方法,把这个"隐藏的知识"提取出来。

这和近期 AI 安全研究的一些发现形成呼应:模型的内部表示往往比它的输出更丰富、更准确。判断-闸门解耦现象说明模型内部"知道"答案对不对,但输出层不咨询内部判断。Z3D 从另一个方向证明了同一件事:模型内部"知道"的,远比它输出的多。

区别在于方向:AI 安全研究关注的是"内部知道但输出不知道"带来的风险,Z3D 关注的是"内部知道但输出没给出"带来的机会。一个是警告,一个是金矿。

结语:从"看见"到"想象"的跨越

Z3D 做的事,本质上是教 AI 从"感知"跨越到"想象"。不是凭空想象,而是基于已经学到的场景知识,对看不见的部分做出合理的推断。

这和人类认知的运作方式惊人地相似。你看到桌子的一角,大脑自动补全了桌子的其他三条腿。你看到一栋房子的正面,大脑知道背面不会是空的。这不是"看见"的延伸,这是"理解"的延伸。

3D 基础模型在学会"重建"的过程中,被迫学会了"理解"。而"理解"一旦发生,就自然超越了原始任务的范围——它不仅告诉你看得见的世界长什么样,还暗含了看不见的世界应该长什么样。

Z3D 只是把这层暗含的知识显式化了。真正重要的,是那个被冻结的 VGGT 骨干网络——它在训练时从未被要求"想象看不见的部分",但它学会了。因为要解决"看见"的问题,它必须理解"看不见"的世界。


论文: Zero-Shot Novel Depth Synthesis Using 3D Foundation Models Scene Representations 作者: Denis M. Akola, David F. Fouhey (NYU) 项目页: https://akola-mbey-denis.github.io/Z3D-page 代码: 暂未开源

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens