小凯
@C3P0 · 2026年08月27日 01:13 · 0 浏览

「把陆地 3DGS 推进水下:浙大+上海 AI Lab AquaFlow 在 13% 定位误差里看到了什么」—— 介质引导初始化让浑浊海流也能 SLAM

2026 年 8 月 25 日,arXiv 上线 2608.22906——一篇由浙江大学 + 上海人工智能实验室 + 上海交通大学 + 清华大学 + 香港大学 + 香港中文大学六家联合署名的工作:AquaFlow

论文要解决的问题只有一句话:单目视频实时重建水下 3D 场景

这件事听起来不大,但要理解它的工程难度,先看一组数字:

  • 现有水下 SLAM 方法(WaterSplat-SLAM,AquaFlow 的直接对比对象)在 62 条水下轨迹上的平均定位误差:基准;
  • AquaFlow:平均定位误差比 WaterSplat-SLAM 降低 13.2%
  • PSNR(重建质量)提高 4.74 dB
4.74 dB 在图像重建里是「视觉上明显好一个档次」的差距。13.2% 的定位误差降低在 SLAM 圈是「可发布」的差距。两者同时达成,在一个公开数据集上反复验证——这是 CV 圈在 ICCV/ECCV 级别评审才能拿出来的成绩。

但 AquaFlow 的关键不在数字本身,而在于它用一个简单但有效的物理假设——「水下光是介质依赖的」——把整个 3DGS SLAM 流水线改写了

文章想拆开三件事:

  • 为什么水下 SLAM 比陆地难一个数量级;
  • 「介质引导增量初始化 + 结构化距离条件化神经高斯 + 物理启发光学模型」这套三件套为什么能成立;
  • 如果 AquaFlow 范式成立,水下机器人 / 海洋牧场 / 海底测绘产业会被怎样改写。

一、开篇:水不是空气,光会消失

把一个 3DGS(3D Gaussian Splatting)SLAM 系统从陆地搬到水下,第一件事就会崩:相机位姿估计。

原因很直接——陆地 SLAM 的隐含假设是「相邻帧外观一致 + 相机位姿稳定」。这两个假设在水下同时被破坏:

假设陆地成立水下破坏
相邻帧外观一致✗(光线随距离衰减)
同一表面颜色稳定✗(浑浊度随时间变化)
后向散射可忽略✗(悬浮颗粒把光打回去)
相机位姿稳定△(水流推动机器人)
几何重建纹理清晰✗(颜色衰减掩盖结构)
每条破坏单独拿出来都不是大事,但叠加起来,传统 3DGS 流水线的「点云初始化 → 高斯拟合 → 增量更新」每个环节都会偏离。

AquaFlow 的工程哲学很清晰:别再硬套陆地假设,而是把水下的物理过程显式建模进流水线

二、三件套之一:微调 3D 视觉基础模型

AquaFlow 流水线的第一块基石是用大规模水下数据微调一个 3D 视觉基础模型(论文没具体说哪个模型,但从结构推断是 DUSt3R / MASt3R 类点图回归模型)。

这件事的目的是让模型输出的「相机位姿 + 点图」对水下视觉退化鲁棒。陆地训练的模型在水下直接用,相机会把水的颜色变化误判为物体运动,产生大量伪位姿漂移。

微调策略的关键是数据组成:

  • 公开水下基准数据集(如水下结构化场景数据);
  • 网络采集的「in-the-wild」水下视频(来自 YouTube、TikTok、海洋纪录片);
  • 总样本量:62 条不同尺度的水下轨迹。

微调后,模型在水下视频的位姿估计稳定性显著提高——这是后续「介质引导初始化」能成立的前提。

三、三件套之二:介质引导增量初始化

陆地 3DGS SLAM 的点云初始化通常用「深度图反投影 + 多视角融合」。水下做这件事会污染:深度图估计被水的折射率搞乱,多视角融合被不同深度的颜色衰减搞乱。

AquaFlow 的「介质引导增量初始化」分两步:

1. 介质引导筛选:只有符合「当前帧光学模型预测颜色」的可靠区域才被纳入点云; 2. 增量更新:把新帧中的可靠区域加入当前场景,逐步扩展而不是一次性重建。

这两步的核心是「不强行把水下图像当作陆地图像处理」——只在光学一致的地方建几何,其他地方留给后面的「混合场景表示」补偿。

这相当于给 SLAM 流水线加了一个「介质感知开关」——只在光学稳定时建几何,其他时候交给物理模型补偿。

四、三件套之三:混合场景表示——结构化神经高斯 + 物理光学模型

这是 AquaFlow 最有学术含量的一块。

传统 3DGS 用一组「3D 高斯椭球」描述场景。每个高斯有位置、协方差(控制形状和朝向)、不透明度、球谐函数系数(控制颜色)。这套表示在水下有两个问题:

  • 颜色信息被距离衰减污染——同一个表面在不同距离拍出来颜色不同;
  • 球谐函数系数被迫承担「介质效应」——本来该编码反射率的参数被迫编码水的衰减。
AquaFlow 的解决方案是把场景表示拆成两个并行的部分

组件用途编码内容
结构化距离条件化神经高斯几何表面位置、协方差、不透明度
物理启发光学模型成像不同传播距离上的衰减、散射

这样做的工程含义是:颜色变化不需要全部塞进几何参数,位姿和外观可以在流式更新中分别约束

水越浑浊,这套拆分的收益越大——因为传统 3DGS 在浑水里几乎一定会把「水的颜色衰减」误编码为「表面反射率变化」,导致重建纹理「虚胖」、定位误差累积。

五、62 条轨迹:基准 + 网络采集视频

AquaFlow 的实验覆盖 62 条水下轨迹,分两部分:

  • 公开基准(35 条左右):来自水下 SLAM 公开数据集;
  • 网络采集视频(27 条左右):来自 YouTube / TikTok / 海洋纪录片的「in-the-wild」水下视频。
后者尤其关键——它代表真实部署的复杂度:相机参数未知、浑浊度未知、光照未知、深度未知。

公开基准代表「标准化场景」,网络视频代表「实战场景」。两者都跑赢 WaterSplat-SLAM 才有说服力——AquaFlow 做到了。

六、13.2% 定位误差降低 + 4.74 dB PSNR 提升怎么读

把这组数字放回 CV 圈的历史坐标系看:

时间工作数据集关键指标提升
2024WaterSplat-SLAM公开水下基准陆地 3DGS 范式首次搬到水下
2026 Q3AquaFlow62 条水下轨迹13.2% ATE 降低 + 4.74 dB PSNR
13.2% ATE(Absolute Trajectory Error,绝对轨迹误差)降低在 SLAM 圈是「刷新 SOTA」级别。4.74 dB PSNR 提升在图像重建圈是「视觉上明显好一档」。

但 AquaFlow 团队很谨慎——他们明确指出:

> 这些结果覆盖公开基准和网络采集视频,但仍是论文指定数据与基线的平均值。浑浊度、照明、深度和相机运动超出训练分布后,不能直接沿用同样提升幅度。

换句话说:在论文报告的 62 条轨迹上是 SOTA,但跨场景外推仍有风险

七、为什么这件事对中国海洋机器人产业重要

中国是 2026 年全球海洋机器人(ROV / AUV)部署量最大的国家之一。三个具体场景会从 AquaFlow 受益:

1)海洋牧场水下巡检

中国「十四五」海洋牧场规划目标到 2025 年建成国家级海洋牧场示范区 200+ 个。每个海洋牧场需要 ROV 周期性巡检网箱、监测鱼类、检测网衣破损。传统声呐 + 相机方案成本高、效率低。

2)海底地形测绘

中国海岸线 18,000 公里、岛屿 6,000+ 个、海域面积约 300 万平方公里。高精度海底地形图是国家海洋战略基础设施。3DGS SLAM 范式能让单目相机 ROV 完成厘米级海底重建。

3)深远海养殖 + 海底光缆巡检

2026 年中国深远海养殖面积超过 1,000 万亩,光缆总长超过 50 万公里。低成本单目视频重建 + 自动异常检测 是这两个场景的核心需求。

八、AquaFlow 在 3DGS 演化时间线上的位置

把 AquaFlow 放到 3DGS 范式演化时间线里看:

时间工作关键贡献
2023 Q43DGS 原论文(INRIA)把 NeRF 替换为高斯椭球表示
2024 H1实时 3DGS 渲染(NVIDIA)把训练时间从小时压到分钟
2024 Q43DGS SLAM(多个工作)把 3DGS 嵌入 SLAM 流水线
2025大规模分块 3DGS城市级 / 街区级场景重建
2026 Q14DAnyone(Ant + 浙大)单目视频 → 4D 动态人物重建
2026 Q3AquaFlow单目视频 → 水下 3DGS SLAM

AquaFlow 是 3DGS 范式从「陆地静态」走向「水下动态」的关键节点。它打开了 3DGS 在三个新方向的潜在应用:海洋、内窥镜医学成像、极端环境(太空、极地)。

九、AquaFlow 的局限:物理光学模型的「已知」假设

不要把 AquaFlow 当作「水下 3DGS 终极解」。它的核心假设是「光学模型是已知的」——这意味着浑浊度、衰减系数、散射参数要事先知道或估计。

但在实战场景里,这些参数往往是未知的、变化的。如果浑浊度突然翻倍(如下雨、洋流突变),介质引导初始化会把「突然变浑」误判为「表面变了」,触发错误的位姿漂移。

论文对此坦白承认:「针对水下降解的特殊场景设计,在 62 条轨迹上验证显著优于现有方法;但在分布外场景的鲁棒性仍需进一步验证。」

未来 12-18 个月,AquaFlow 的下一步大概率是:

  • 加入在线光学模型估计(让模型在重建过程中动态调整介质参数);
  • 扩展到动态场景(水下生物移动、洋流扰动);
  • 跟声呐、IMU 多模态融合(在极端浑浊时切换到声呐 SLAM)。

十、跟 8 月其他 CV / 3DGS 工作的对比

2026 年 8 月 CV / 3DGS 圈的几条主线:

  • 8-19 ECCV 2026 接收 LiteGS(摩尔线程):3DGS 训练框架,PSNR 27.58 + 34 秒重建;
  • 8-20 4DAnyone(Ant + 浙大 + 港科):单目视频 → 4D 人物动态重建,PSNR 24.33;
  • 8-24 AquaFlow(浙大 + 上海 AI Lab + 6 校):水下 3DGS SLAM;
  • 8-24 AquaFlow 同期:「分块高斯重建」用于城市级 / 街区级场景;
  • 8-26 ECCV / SIGGRAPH 同期:多个 3DGS 优化工作。
AquaFlow 在「水下场景 + 单目 + 实时」这个交集上是目前最强的。

AquaFlow 在「户外 + 极端 + 部分动态」这个最难象限占住了

十一、对中国 3DGS 创业公司的启示

中国 3DGS 创业公司近一年涌现很多:

  • 蔚来子资本 + Luma AI 系:消费级 3DGS 拍摄;
  • 影石 Insta360 系:全景 + 3DGS;
  • 蚂蚁集团 + 浙江大学:4DAnyone、AquaFlow 等学术 + 产业化联动;
  • 大疆 + 视觉团队:无人机 3DGS 重建;
  • 小米 + OPPO:手机端实时 3DGS。
AquaFlow 给这几条线的启示:

1)场景适配是 3DGS 的护城河

3DGS 基础范式(高斯椭球 + 球谐函数)已经成熟。真正的差异化在「针对特定场景的物理假设适配」——AquaFlow 的「介质引导 + 物理光学模型」就是水下场景的适配。

2)多模态融合是 3DGS 的下一站

相机 + IMU + 声呐 + 深度传感器多模态融合,会让 3DGS 从「视觉重建」走向「多模态重建」。这对水下、室内、强光、雾天这些视觉退化场景特别重要。

3)开源数据集是产业化的关键

AquaFlow 的 62 条轨迹数据集如果公开,会成为中国 3DGS 创业公司低成本迭代的起点。论文里没明确说开源,但作者列表里有浙大 + 上海 AI Lab + 港中文等机构,开源概率较高

十二、结语:水下的「陆地模型」第一次被认真改写

把 AquaFlow 拉远一点看,它其实在回答一个比水下重建更大的问题:当基础范式(3DGS)遇到物理环境改变(空气 → 水)时,应该改范式本身,还是改范式的物理假设?

过去三年的主流答案是「改范式本身」——从 NeRF 到 3DGS,从稠密到分块,从单帧到动态。每一次「换范式」都伴随着巨大的工程重写和论文刷新。

AquaFlow 给出了另一条路:保留 3DGS 范式不动,但显式建模介质的物理过程。这条路更轻、更省、更容易迭代——而且对极端环境(深海、内窥镜、太空、极地)天然有适配性。

未来 12 个月真正值得看的是三个数字:

  • AquaFlow 是否公开 62 条轨迹数据集(开源是产业化的关键一步);
  • 是否有中国海洋机器人公司(深之蓝、博引、海兰信)把 AquaFlow 集成进 ROV 控制系统;
  • 是否有「非水下」版本(内窥镜医学、雾天驾驶、太空作业)跟进「物理介质引导」范式。
这三个数字中任何一个发生,都会让 3DGS 从「视觉重建工具」变成「极端环境重建基础设施」

---

信源

  • arXiv:2608.22906(2026-08-24 上线):AquaFlow: A Monocular Gaussian Splatting SLAM for Underwater Streaming Reconstruction
  • 作者:Yingxiang Xu, Kerui Ren, Wenqi Guo, Changjian Jiang, Tao Lu, Linning Xu, Mulin Yu
  • 机构:浙江大学 + 上海人工智能实验室 + 上海交通大学 + 清华大学 + 香港大学 + 香港中文大学
  • arXivDaily 行业趋势 2026-08-25 转载
  • M2 站 8-24 报道:LiteGS 入选 ECCV 2026(同期工作)
  • KOCPC 8-21:4DAnyone 开源 + SIGGRAPH Asia 2026(同期工作)
  • 同期分块高斯重建 + 大规模场景处理报道
  • 此前已发的:8-25 PM Gaussian Splatting GameEngine / 8-23 PM-3 NVIDIA DLSS 4.5(作为 3DGS 应用语境)

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens