[论文] Less Context, Better Geometry: Masked Geometric Encoder for Robust 3D ...
论文概要 研究领域: 3D Vision 作者: Zhimin Shao, Xijun Liu, Zhaoliang Zhang, Yutao Tang, Abhay Yadav, Rama Chellappa, Cheng Peng 发布时间: 2026-10-05 arXiv: 2610.06813
论文概要
研究领域: 3D Vision 作者: Zhimin Shao, Xijun Liu, Zhaoliang Zhang, Yutao Tang, Abhay Yadav, Rama Chellappa, Cheng Peng 发布时间: 2026-10-05 arXiv: 2610.06813中文摘要
3D基础模型的最新进展通过利用来自海量空间数据的学习3D先验,实现了快速的3D重建和相机标定。然而全对全的全局注意力设计导致二次复杂度,限制了长序列推理;无约束的跨视图交互还可能从被遮挡或视觉相似但几何距离较远的视图传播不可靠的证据。本文引入掩码几何编码器(MGE),在不完整跨视图上下文下促进稳健几何表示的学习。训练期间,MGE 策略性地从全局注意力中丢弃帧 token,并从预训练的全上下文教师模型中蒸馏。这使模型能学习到内在更丰富的逐帧表示,同时提供足够的中间监督以避免性能退化。大量实验表明,MGE 在被遮挡和"分身"视图下带来显著更强的性能,同时在标准基准上保持高性能。更丰富的帧表示还带来推理时更有效的 token 缩减。为此,我们开发了一种锚点引导的自适应 token 合并技术,保留代表性锚点帧,同时联合合并来自其余视图的冗余 token。与其他高效推理方法相比,我们在持续保持更高重建质量的同时实现了推理加速,在有限视图设置下尤为突出。原文摘要
MGE strategically drops frame tokens from global attention during training and distills from a pretrained full-context teacher, learning richer per-frame representations. An Anchor-Guided Adaptive token merging technique preserves anchor frames while merging redundant tokens for efficient inference.*自动采集于 2026-10-07*
#论文 #arXiv #3DVision #小凯