2026 年 8 月 25 日,arXiv 上线 2608.22906——一篇由浙江大学 + 上海人工智能实验室 + 上海交通大学 + 清华大学 + 香港大学 + 香港中文大学六家联合署名的工作:AquaFlow。
论文要解决的问题只有一句话:单目视频实时重建水下 3D 场景。
这件事听起来不大,但要理解它的工程难度,先看一组数字:
- 现有水下 SLAM 方法(WaterSplat-SLAM,AquaFlow 的直接对比对象)在 62 条水下轨迹上的平均定位误差:基准;
- AquaFlow:平均定位误差比 WaterSplat-SLAM 降低 13.2%;
- PSNR(重建质量)提高 4.74 dB。
4.74 dB 在图像重建里是「视觉上明显好一个档次」的差距。13.2% 的定位误差降低在 SLAM 圈是「可发布」的差距。两者同时达成,在一个公开数据集上反复验证——这是 CV 圈在 ICCV/ECCV 级别评审才能拿出来的成绩。
但 AquaFlow 的关键不在数字本身,而在于它用一个简单但有效的物理假设——「水下光是介质依赖的」——把整个 3DGS SLAM 流水线改写了。
文章想拆开三件事:
- 为什么水下 SLAM 比陆地难一个数量级;
- 「介质引导增量初始化 + 结构化距离条件化神经高斯 + 物理启发光学模型」这套三件套为什么能成立;
- 如果 AquaFlow 范式成立,水下机器人 / 海洋牧场 / 海底测绘产业会被怎样改写。
一、开篇:水不是空气,光会消失
把一个 3DGS(3D Gaussian Splatting)SLAM 系统从陆地搬到水下,第一件事就会崩:相机位姿估计。
原因很直接——陆地 SLAM 的隐含假设是「相邻帧外观一致 + 相机位姿稳定」。这两个假设在水下同时被破坏:
| 假设 | 陆地成立 | 水下破坏 |
|---|---|---|
| 相邻帧外观一致 | ✓ | ✗(光线随距离衰减) |
| 同一表面颜色稳定 | ✓ | ✗(浑浊度随时间变化) |
| 后向散射可忽略 | ✓ | ✗(悬浮颗粒把光打回去) |
| 相机位姿稳定 | ✓ | △(水流推动机器人) |
| 几何重建纹理清晰 | ✓ | ✗(颜色衰减掩盖结构) |
每条破坏单独拿出来都不是大事,但叠加起来,传统 3DGS 流水线的「点云初始化 → 高斯拟合 → 增量更新」每个环节都会偏离。
AquaFlow 的工程哲学很清晰:别再硬套陆地假设,而是把水下的物理过程显式建模进流水线。
二、三件套之一:微调 3D 视觉基础模型
AquaFlow 流水线的第一块基石是用大规模水下数据微调一个 3D 视觉基础模型(论文没具体说哪个模型,但从结构推断是 DUSt3R / MASt3R 类点图回归模型)。
这件事的目的是让模型输出的「相机位姿 + 点图」对水下视觉退化鲁棒。陆地训练的模型在水下直接用,相机会把水的颜色变化误判为物体运动,产生大量伪位姿漂移。
微调策略的关键是数据组成:
- 公开水下基准数据集(如水下结构化场景数据);
- 网络采集的「in-the-wild」水下视频(来自 YouTube、TikTok、海洋纪录片);
- 总样本量:62 条不同尺度的水下轨迹。
微调后,模型在水下视频的位姿估计稳定性显著提高——这是后续「介质引导初始化」能成立的前提。
三、三件套之二:介质引导增量初始化
陆地 3DGS SLAM 的点云初始化通常用「深度图反投影 + 多视角融合」。水下做这件事会污染:深度图估计被水的折射率搞乱,多视角融合被不同深度的颜色衰减搞乱。
AquaFlow 的「介质引导增量初始化」分两步:
- 介质引导筛选:只有符合「当前帧光学模型预测颜色」的可靠区域才被纳入点云;
- 增量更新:把新帧中的可靠区域加入当前场景,逐步扩展而不是一次性重建。
这两步的核心是**「不强行把水下图像当作陆地图像处理」**——只在光学一致的地方建几何,其他地方留给后面的「混合场景表示」补偿。
这相当于给 SLAM 流水线加了一个「介质感知开关」——只在光学稳定时建几何,其他时候交给物理模型补偿。
四、三件套之三:混合场景表示——结构化神经高斯 + 物理光学模型
这是 AquaFlow 最有学术含量的一块。
传统 3DGS 用一组「3D 高斯椭球」描述场景。每个高斯有位置、协方差(控制形状和朝向)、不透明度、球谐函数系数(控制颜色)。这套表示在水下有两个问题:
- 颜色信息被距离衰减污染——同一个表面在不同距离拍出来颜色不同;
- 球谐函数系数被迫承担「介质效应」——本来该编码反射率的参数被迫编码水的衰减。
AquaFlow 的解决方案是把场景表示拆成两个并行的部分:
| 组件 | 用途 | 编码内容 |
|---|---|---|
| 结构化距离条件化神经高斯 | 几何 | 表面位置、协方差、不透明度 |
| 物理启发光学模型 | 成像 | 不同传播距离上的衰减、散射 |
这样做的工程含义是:颜色变化不需要全部塞进几何参数,位姿和外观可以在流式更新中分别约束。
水越浑浊,这套拆分的收益越大——因为传统 3DGS 在浑水里几乎一定会把「水的颜色衰减」误编码为「表面反射率变化」,导致重建纹理「虚胖」、定位误差累积。
五、62 条轨迹:基准 + 网络采集视频
AquaFlow 的实验覆盖 62 条水下轨迹,分两部分:
- 公开基准(35 条左右):来自水下 SLAM 公开数据集;
- 网络采集视频(27 条左右):来自 YouTube / TikTok / 海洋纪录片的「in-the-wild」水下视频。
后者尤其关键——它代表真实部署的复杂度:相机参数未知、浑浊度未知、光照未知、深度未知。
公开基准代表「标准化场景」,网络视频代表「实战场景」。两者都跑赢 WaterSplat-SLAM 才有说服力——AquaFlow 做到了。
六、13.2% 定位误差降低 + 4.74 dB PSNR 提升怎么读
把这组数字放回 CV 圈的历史坐标系看:
| 时间 | 工作 | 数据集 | 关键指标提升 |
|---|---|---|---|
| 2024 | WaterSplat-SLAM | 公开水下基准 | 陆地 3DGS 范式首次搬到水下 |
| 2026 Q3 | AquaFlow | 62 条水下轨迹 | 13.2% ATE 降低 + 4.74 dB PSNR |
13.2% ATE(Absolute Trajectory Error,绝对轨迹误差)降低在 SLAM 圈是「刷新 SOTA」级别。4.74 dB PSNR 提升在图像重建圈是「视觉上明显好一档」。
但 AquaFlow 团队很谨慎——他们明确指出:
这些结果覆盖公开基准和网络采集视频,但仍是论文指定数据与基线的平均值。浑浊度、照明、深度和相机运动超出训练分布后,不能直接沿用同样提升幅度。
换句话说:在论文报告的 62 条轨迹上是 SOTA,但跨场景外推仍有风险。
七、为什么这件事对中国海洋机器人产业重要
中国是 2026 年全球海洋机器人(ROV / AUV)部署量最大的国家之一。三个具体场景会从 AquaFlow 受益:
1)海洋牧场水下巡检
中国「十四五」海洋牧场规划目标到 2025 年建成国家级海洋牧场示范区 200+ 个。每个海洋牧场需要 ROV 周期性巡检网箱、监测鱼类、检测网衣破损。传统声呐 + 相机方案成本高、效率低。
2)海底地形测绘
中国海岸线 18,000 公里、岛屿 6,000+ 个、海域面积约 300 万平方公里。高精度海底地形图是国家海洋战略基础设施。3DGS SLAM 范式能让单目相机 ROV 完成厘米级海底重建。
3)深远海养殖 + 海底光缆巡检
2026 年中国深远海养殖面积超过 1,000 万亩,光缆总长超过 50 万公里。低成本单目视频重建 + 自动异常检测 是这两个场景的核心需求。
八、AquaFlow 在 3DGS 演化时间线上的位置
把 AquaFlow 放到 3DGS 范式演化时间线里看:
| 时间 | 工作 | 关键贡献 |
|---|---|---|
| 2023 Q4 | 3DGS 原论文(INRIA) | 把 NeRF 替换为高斯椭球表示 |
| 2024 H1 | 实时 3DGS 渲染(NVIDIA) | 把训练时间从小时压到分钟 |
| 2024 Q4 | 3DGS SLAM(多个工作) | 把 3DGS 嵌入 SLAM 流水线 |
| 2025 | 大规模分块 3DGS | 城市级 / 街区级场景重建 |
| 2026 Q1 | 4DAnyone(Ant + 浙大) | 单目视频 → 4D 动态人物重建 |
| 2026 Q3 | AquaFlow | 单目视频 → 水下 3DGS SLAM |
AquaFlow 是 3DGS 范式从「陆地静态」走向「水下动态」的关键节点。它打开了 3DGS 在三个新方向的潜在应用:海洋、内窥镜医学成像、极端环境(太空、极地)。
九、AquaFlow 的局限:物理光学模型的「已知」假设
不要把 AquaFlow 当作「水下 3DGS 终极解」。它的核心假设是「光学模型是已知的」——这意味着浑浊度、衰减系数、散射参数要事先知道或估计。
但在实战场景里,这些参数往往是未知的、变化的。如果浑浊度突然翻倍(如下雨、洋流突变),介质引导初始化会把「突然变浑」误判为「表面变了」,触发错误的位姿漂移。
论文对此坦白承认:「针对水下降解的特殊场景设计,在 62 条轨迹上验证显著优于现有方法;但在分布外场景的鲁棒性仍需进一步验证。」
未来 12-18 个月,AquaFlow 的下一步大概率是:
- 加入在线光学模型估计(让模型在重建过程中动态调整介质参数);
- 扩展到动态场景(水下生物移动、洋流扰动);
- 跟声呐、IMU 多模态融合(在极端浑浊时切换到声呐 SLAM)。
十、跟 8 月其他 CV / 3DGS 工作的对比
2026 年 8 月 CV / 3DGS 圈的几条主线:
- 8-19 ECCV 2026 接收 LiteGS(摩尔线程):3DGS 训练框架,PSNR 27.58 + 34 秒重建;
- 8-20 4DAnyone(Ant + 浙大 + 港科):单目视频 → 4D 人物动态重建,PSNR 24.33;
- 8-24 AquaFlow(浙大 + 上海 AI Lab + 6 校):水下 3DGS SLAM;
- 8-24 AquaFlow 同期:「分块高斯重建」用于城市级 / 街区级场景;
- 8-26 ECCV / SIGGRAPH 同期:多个 3DGS 优化工作。
AquaFlow 在「水下场景 + 单目 + 实时」这个交集上是目前最强的。
AquaFlow 在「户外 + 极端 + 部分动态」这个最难象限占住了。
十一、对中国 3DGS 创业公司的启示
中国 3DGS 创业公司近一年涌现很多:
- 蔚来子资本 + Luma AI 系:消费级 3DGS 拍摄;
- 影石 Insta360 系:全景 + 3DGS;
- 蚂蚁集团 + 浙江大学:4DAnyone、AquaFlow 等学术 + 产业化联动;
- 大疆 + 视觉团队:无人机 3DGS 重建;
- 小米 + OPPO:手机端实时 3DGS。
AquaFlow 给这几条线的启示:
1)场景适配是 3DGS 的护城河
3DGS 基础范式(高斯椭球 + 球谐函数)已经成熟。真正的差异化在「针对特定场景的物理假设适配」——AquaFlow 的「介质引导 + 物理光学模型」就是水下场景的适配。
2)多模态融合是 3DGS 的下一站
相机 + IMU + 声呐 + 深度传感器多模态融合,会让 3DGS 从「视觉重建」走向「多模态重建」。这对水下、室内、强光、雾天这些视觉退化场景特别重要。
3)开源数据集是产业化的关键
AquaFlow 的 62 条轨迹数据集如果公开,会成为中国 3DGS 创业公司低成本迭代的起点。论文里没明确说开源,但作者列表里有浙大 + 上海 AI Lab + 港中文等机构,开源概率较高。
十二、结语:水下的「陆地模型」第一次被认真改写
把 AquaFlow 拉远一点看,它其实在回答一个比水下重建更大的问题:当基础范式(3DGS)遇到物理环境改变(空气 → 水)时,应该改范式本身,还是改范式的物理假设?
过去三年的主流答案是「改范式本身」——从 NeRF 到 3DGS,从稠密到分块,从单帧到动态。每一次「换范式」都伴随着巨大的工程重写和论文刷新。
AquaFlow 给出了另一条路:保留 3DGS 范式不动,但显式建模介质的物理过程。这条路更轻、更省、更容易迭代——而且对极端环境(深海、内窥镜、太空、极地)天然有适配性。
未来 12 个月真正值得看的是三个数字:
- AquaFlow 是否公开 62 条轨迹数据集(开源是产业化的关键一步);
- 是否有中国海洋机器人公司(深之蓝、博引、海兰信)把 AquaFlow 集成进 ROV 控制系统;
- 是否有「非水下」版本(内窥镜医学、雾天驾驶、太空作业)跟进「物理介质引导」范式。
这三个数字中任何一个发生,都会让 3DGS 从「视觉重建工具」变成「极端环境重建基础设施」。
信源
- arXiv:2608.22906(2026-08-24 上线):AquaFlow: A Monocular Gaussian Splatting SLAM for Underwater Streaming Reconstruction
- 作者:Yingxiang Xu, Kerui Ren, Wenqi Guo, Changjian Jiang, Tao Lu, Linning Xu, Mulin Yu
- 机构:浙江大学 + 上海人工智能实验室 + 上海交通大学 + 清华大学 + 香港大学 + 香港中文大学
- arXivDaily 行业趋势 2026-08-25 转载
- M2 站 8-24 报道:LiteGS 入选 ECCV 2026(同期工作)
- KOCPC 8-21:4DAnyone 开源 + SIGGRAPH Asia 2026(同期工作)
- 同期分块高斯重建 + 大规模场景处理报道
- 此前已发的:8-25 PM Gaussian Splatting GameEngine / 8-23 PM-3 NVIDIA DLSS 4.5(作为 3DGS 应用语境)
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。