遮挡不是丢帧,是 mask 帧间注意力
JHU + UVA 7 作者的 arXiv 2610.06813,把「全上下文教师」与「帧对注意力掩码」拆开当监督源。训练时给每帧对 (i, j) 一个 Bernoulli(1-ρ) mask,ρ ∈ [0.3, 0.5] 默认(§4.7 表 4 验证:stride=100 时 ρ=0.3 → CD=0.0150,ρ=0.7 → CD=0.0182);DINOv2 图像编码器冻结,编码器权重继承 π³——双轨监督:输出级伪监督 (λ_feat=0.1) + 特征级 + GT normal/camera 头。
ETH3D Large 遮挡量化:VGGT ATE 0.898 / π³ 0.361 / MGE 0.205(遮挡 clean → large 时,VGGT +119%、π³ +128%、MGE 仅 +4%)。视觉歧义评估 (All-pair AUC@30):MGE 58.68 vs VGGT 55.56 / π³ 51.23;Cross-pair (分身视图) AUC@30:MGE 42.72 vs π³ 39.10 (+3.62 AUC)。Sintel 位姿估计 ATE:MGE 0.071 vs π³ 0.074、RPE-t 0.033 vs 0.040、RPE-r 0.234 vs 0.282。
AGA (Anchor-Guided Adaptive) token merging:r_i = k·s_i + b,锚点保留、其余合并——但 k / b 未在可见部分公开,要看 Appendix 或代码才能反推。
三处要拦的:
① 帖子说「丢弃帧 token」——实际是 mask 帧间 attention pair (A_ij ~ Bernoulli(1-ρ)),不是删除 token,ρ 是可调超参。
② 帖子说「从全上下文教师蒸馏」是单一监督源——实际是蒸馏 + GT 双轨,纯蒸馏 + 无 GT 会失败(图 4 曲线最差)。
③ 帖子说「推理加速」但正文没给具体 FPS / 加速比——只 Figure 3 给出曲线对比;具体数字在 Appendix A.6,HTML 在此处截断。
训练配置:4×H200、6 天、AdamW lr=1e-6 峰值 (前 0.5 epoch 线性 warm-up → 余弦退火)、batch 24 frames/iter、518 px 输入、λ_normal=1.0 / λ_cam=0.1 / λ_feat=0.1 / λ_img=100 / λ_conf=0.05。训练集 ARKitScenes / BlendedMVS / Co3Dv2 / HyperSim / MegaDepth / MVS-Synth / OmniObject3D / PointOdyssey / ScanNet / Spring / Virtual KITTI / Waymo / WildRGB 共 13 个。
——丢帧训了比全帧训了学得多,因为每帧被迫自给自足。