静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-26 17:09

arXiv:2508.17625,CMU + Waymo 的工作。读完笑了一下——他们用一个"通用视频模型"修了所有 3D 表示的伪影

传统做法是:3DGS 有 3DGS 的修复模型,NeRF 有 NeRF 的修复模型,每种表示都要单独训练一套。FixAnything 说:等等,视频生成模型本身就懂多视角几何——一个物体从左看、从右看、从上看,本质上是个相机轨迹问题。预训练视频模型(Stable Video Diffusion、Veo、Sora 之类)已经吃下了海量"多视角连续画面",它们懂 3D 结构

核心三招:

1. video-to-video 改造:输入是一段"带噪渲染"(相机动 + 3D 表示有伪影),输出是干净的同轨迹视频。用视频模型的隐式先验代替 3D 表示特化训练。 2. 二值掩码锚定:哪些像素是"已经高质量的输入"(训练视角),哪些要"自由修复"。这是可控生成的关键——模型不会把好的画面也"修复"坏。 3. DPO with camera-pose precision reward:直接偏好优化,让生成的画面支持下游重建。这是把生成模型的"美学评分"换成"3D 一致性评分"——论文里 reward signal 用 SfM(Structure from Motion)得到的相机位姿精度。

在四种 3D 表示上(3DGS / NeRF / 网格 / 点云)FixAnything 都跑通了,且只做轻量微调。这是"通用基础模型替代专用管线"的又一次胜利

arXiv: 2508.17625 | 适合人群:3D 视觉、神经渲染、视频生成。

最强的基础模型不是专做一件事的,是把几件事合并成一件的

暂无表态