手术台上的拓扑流变:EndoVGGT 如何让图注意力学会"绕过"手术钳
场景:一个被手术钳戳穿的画面
想象你正盯着一场腹腔镜手术的实时画面。屏幕上是一段跳动的软组织——可能是胆囊床,可能是肠壁。画面中央,一把手术钳伸进来,夹住一块组织向上提。组织被拉出褶皱,镜面反光在湿润的黏膜上跳动,钳身遮住了后方三分之一的视野。
你的任务是:从这段视频里重建出组织的三维形状,好让手术机器人知道"现在组织长什么样、我下一步该往哪儿切"。
这件事难在哪里?难在几何连续性被打破了。传统三维重建方法(无论是 NeRF、Gaussian Splatting 还是 LRM)都默认一个前提:相邻像素在几何上也是相邻的。这个前提在户外街景里成立——路面的像素连成片,建筑立面规则延展。但在手术视野里,这个前提被三件事同时撕碎:
1. 低纹理表面:软组织表面几乎没有可辨识的纹理特征,像素之间的视觉相似度极高,但几何深度可能差着几毫米 2. 镜面高光:湿润组织反射光源,同一块区域在不同帧里看起来完全不同 3. 器械遮挡:手术钳一伸进来,原本连续的组织表面被硬生生切断
传统方法的应对策略是"固定拓扑邻域"——在空间上取周围 k×k 的像素作为邻域,用卷积或注意力机制聚合信息。这个策略在组织表面平展、无遮挡时工作得不错。但一旦手术钳伸进来,拓扑就断了——钳子左边的像素和右边的像素在空间上仍然相邻,但在几何上已经不属于同一个连续表面了。
EndoVGGT 的核心洞察是:不要在像素空间里建图,要在特征空间里建图。
DeGAT:让图注意力学会"跳过"手术钳
EndoVGGT 的全名是 EndoVGGT(Endoscopic VGGT),VGGT 是 2025 年提出的 Geometry-Centric 3D Reconstruction 框架,原本是为刚性场景设计的。EndoVGGT 在它基础上加了一个关键模块:DeGAT(Deformation-aware Graph Attention,变形感知图注意力)。
DeGAT 做的事情用一句话概括:动态地在特征空间里构建语义图,而不是在像素空间里取固定邻域。
具体来说,给定一帧手术画面,EndoVGGT 先用 VGGT 的 backbone 提取每个像素(或 token)的特征向量。然后 DeGAT 做了一件反直觉的事——它不按空间位置连边,而是按特征相似度连边。两块组织哪怕在画面上隔着一把手术钳,只要它们的特征向量足够接近,DeGAT 就会在它们之间连一条边,让信息直接流通。
这相当于什么?相当于在手术钳遮住的区域下面挖了一条隧道。钳子左边的组织特征和右边的组织特征本来在空间上被切断了,但 DeGAT 通过特征空间的语义图,让它们重新建立了联系。这种联系不是基于"它们在画面上挨着",而是基于"它们看起来是同一种组织"。
这个设计有一个深层洞察:软组织的几何连续性不依赖于空间连续性。一块胆囊壁被手术钳遮住了一部分,但未被遮住的部分仍然属于同一个几何表面。固定拓扑邻域假设"空间相邻=几何相邻",这在软组织变形和器械遮挡下是错的。DeGAT 放弃了这个假设,转而用特征相似度作为几何连续性的代理信号。
三层 DeGAT:从 Token 到 Attention 到 Feature
论文里有一个很精彩的消融实验。作者把 DeGAT 分成三个层级来测试:
Token-Level DeGAT:在 token 层面引入可学习的 bias(类似位置编码但语义化)。这一层的效果最好——PSNR 达到 34.019,比 baseline 提升 1.092。这说明让模型自己学会"哪些 token 应该互相注意"比硬编码空间邻域有效。
Attention-Level DeGAT:在注意力矩阵层面做调整,用连续 MLP 生成 bias。效果次之——PSNR 32.894。
Feature-Level DeGAT:在 transformer 之前做特征空间的图构建。效果最好——PSNR 达到 34.348,SSIM 0.939,LPIPS 0.240。Pre-Transformer DeGAT 是最优配置。
这个消融结果揭示了一个规律:越早介入特征空间建模,效果越好。Pre-Transformer DeGAT 在特征进入 transformer 之前就完成了图构建,让后续的注意力计算直接在语义图上进行,避免了被空间位置信息"污染"。
数据说话:PSNR +24.6%,SSIM +9.1%
在 SCARED 数据集(da Vinci Xi 手术机器人采集的真实手术数据)上,EndoVGGT 的表现:
| 方法 | PSNR ↑ | SSIM ↑ | LPIPS ↓ |
|---|---|---|---|
| EndoSurf | 24.395 | 0.769 | 0.319 |
| EndoLRMGS | 27.561 | 0.861 | 0.323 |
| EndoVGGT-base | 32.927 | 0.918 | 0.285 |
| EndoVGGT (Pre-Transformer DeGAT) | 34.348 | 0.939 | 0.240 |
但更让人印象深刻的是零样本跨数据集泛化能力。EndoVGGT 在 SCARED 上训练,然后直接在 EndoNeRF 的"cutting"和"pulling"子集上测试——这两个场景涉及极端的软组织变形和拓扑变化(切割、拉扯)。结果是:
- EndoNeRF pulling: SSIM 0.907
- EndoNeRF cutting: SSIM 0.915
概念提炼:拓扑刚性陷阱
EndoVGGT 揭示了一个我称之为"拓扑刚性陷阱"的问题。
传统三维重建方法的底层假设是:空间邻域=几何邻域。这个假设在刚性场景(街景、室内、建筑)里是成立的——墙面的像素相邻,墙面的几何也相邻。但在软组织场景里,这个假设失效了——组织被拉扯、被切割、被遮挡,空间上相邻的像素可能在几何上属于完全不同的表面。
固定拓扑邻域是"拓扑刚性"的体现——它假设场景的拓扑结构是固定的、不会变形的。一旦组织变形或器械遮挡改变了实际拓扑,固定邻域就会把不属于同一个表面的像素强行聚合在一起,产生几何错误。
DeGAT 的解法是放弃拓扑刚性,让拓扑随特征流动。特征空间里的语义图是动态构建的——每一帧画面都有自己的图结构,由当前帧的特征分布决定。这个图可以"绕过"手术钳(因为钳子两侧的组织特征相似,会被连边),可以"跨越"镜面高光(因为高光区域的特征会被识别为异常值,不会被强行聚合),可以"适应"组织变形(因为变形后的组织特征会重新分布,图结构会相应调整)。
这个洞察可以推广到其他领域:任何涉及变形、遮挡、拓扑变化的场景,都应该考虑放弃固定拓扑邻域,转而用特征空间的动态图来建模几何连续性。比如:
- 自动驾驶中的动态物体遮挡:被前车遮住的路标,可以通过特征空间的语义图和后方路标建立联系
- 医学影像中的器官变形:呼吸运动导致的肝脏变形,可以通过特征空间图建模来保持几何一致性
- 机器人抓取中的柔性物体:被手指遮住的布料、绳索,可以通过特征空间图恢复完整几何
置信度学习:让模型自己说"这块我不确定"
EndoVGGT 还有一个值得注意的设计:隐式置信度学习。模型在输出深度图的同时,输出一个逐像素的置信度图 Ĉ ∈ R^{H×W}。这个置信度图没有显式标签,而是通过损失函数隐式学习:
L_unc = γ‖D̂ − D‖²₂ ⊙ Ĉ − α log(Ĉ)
这个损失函数有一个漂亮的数学性质:它在 (0, ∞) 上是凸的,唯一最小值在 Ĉ = α/(γ‖D̂(u) − D(u)‖²₂)。
这意味着什么?意味着模型预测越准的地方,置信度越高;预测越差的地方,置信度越低。这不是什么新发现——但 EndoVGGT 用一种无标签的方式实现了这一点,让模型自己学会"哪里该自信、哪里该谦虚"。
这个设计在手术场景里特别重要。外科医生不需要模型在所有地方都给出确定的答案——他们需要模型在不确定的地方诚实地说"这块我不确定"。置信度图提供了这种诚实性,让外科医生可以把注意力集中在模型不确定的区域,人工复核。
局限与未来
论文在结论里坦率承认了局限:时间一致性还没做。EndoVGGT 目前是逐帧重建,没有利用时序信息来约束连续帧之间的几何一致性。这是下一步的方向——把 DeGAT 从空间图扩展到时空图,让信息不仅在同一帧的特征空间里流动,还在相邻帧之间流动。
另一个值得探索的方向是和机器人控制的闭环。EndoVGGT 的输出(深度图 + 置信度图)可以直接喂给手术机器人的运动规划模块,形成"感知-规划-执行"的闭环。置信度图可以用来做风险感知的运动规划——在模型不确定的区域,机器人应该更保守、更谨慎。
结语:从"空间相邻"到"语义相邻"
EndoVGGT 的核心贡献,不是某个具体的网络结构或损失函数,而是一个认知升级:在变形世界里,几何连续性住在特征空间里,不住在像素空间里。
固定拓扑邻域是像素空间的产物——它假设空间相邻就是几何相邻。这个假设在刚性世界里成立,在软组织世界里失效。DeGAT 放弃了这个假设,转而在特征空间里寻找几何连续性——用语义相似度作为几何连续性的代理信号。
这个认知升级和近年来的一系列工作形成呼应:从 NeRF 的"空间坐标→密度"映射,到 3D Gaussian Splatting 的"高斯椭球→颜色"映射,再到 DeGAT 的"特征相似度→几何连续性"——三维重建正在从"空间先验驱动"转向"语义先验驱动"。
手术台上的拓扑流变,正在被特征空间里的语义图重新捕获。
---
论文: EndoVGGT: GNN-Enhanced Depth Estimation for Surgical 3D Reconstruction 作者: Falong Fan, Yi Xie, Arnis Lektauers, Bo Liu, Jerzy Rozenblit (University of Arizona) arXiv: 2603.24577 代码: 未开源