✨步子哥
@steper · 2026年08月25日 09:48 · 1 浏览

高斯溅射与视频生成:显式表示驱动的汇流

高斯溅射与视频生成 · 交叉全景综述 深度研究 · 交叉全景综述(Deep Research, Cross-cutting Survey) 高斯溅射与视频生成:显式表示驱动的汇流 3D Gaussian Splatting 与视频生成之交叉全景综述 | 体例 APA 7.0 | 成稿 2026-08-25 源流分级(deep-research 铁律):Tier 1 同行评审 3DGS / 4D-GS / Deformable GS / Gaussian-Flow / Scaffold-GS / DreamGaussian / LightGaussian / GaussianVideo / TagSplat Tier 2 预印本 WorldWarp / D2GV / GenMOJO / Ground4D / World from Motion / GaussianDreamer / 4D 生成综述 / 4DRep-GMI / Splatwizard / 3DGS.zip。凡引皆经 WebSearch 核验编号、出处、数字。 摘要。三维高斯溅射(3DGS)以「显式原语 + 可微光栅化」将 NeRF 推入实时之境。然其本为静态表示,何以与视频生成交汇?本文循交叉全景方略,辨其汇流为三:一曰动态与 4D 表示(重建维度),二曰生成式 4D(扩散先验雕形),三曰GS 作视频与世界模型之画布。复以正反两造 PK,论其「显式/实时/可编辑」之长与「存储膨胀/拓扑难塑/物理与时间一致性薄弱」之短,终拍板曰:当下最优解,在条件化、混合表示——以几何为骨,以扩散为 flesh。 一、引言:两股潮流为何汇流 夫视频生成者,历来以「像素网格时序」为基,扩散模型擅造外观之连续,而苦于多视角与时间之不一致——盖其所生,每帧皆「似真」,未必同属一世界。另一边,3DGS 以数百万可学习高斯原语(位置 μ、协方差 Σ、不透明度 α、球谐 SH)承载场景,可微光栅化令其秒级训练、数百 FPS 渲染(Kerbl et al., 2023)。 二者之汇流,实因一共同痛点:一致性。视频生成缺几何约束而漂,3DGS 缺生成先验而匮于未见之域。故近三年(2023–2026)研究,渐由「各擅其场」走向「以 GS 为画布、以扩散为笔」之合流。此即本综述之「和」字本意。 二、技术基座:3D Gaussian Splatting 是什么 3DGS 之核心,在以显式、可微、可编辑之高斯原语替 NeRF 之隐式体场。每原语参数为:位置 μ∈ℝ³、各向异性协方差 Σ=R S Sᵀ Rᵀ(旋转 R、缩放 S)、不透明度 α、视角相关色彩(球谐 SH)。渲染时投影为 2D 椭圆「splat」,按深度排序 alpha 混合并反传。 其优有三:一训速以分钟计(NeRF 以时计),二渲速达 100–300 FPS,三原语显式,便于剪枝、编辑、稠密化。然其弊亦萌于此:原语数随场景复杂度线性膨胀,存储与显存俱受其累;且静态框架本不言「时间」。 三、第一汇流点:动态与 4D 表示(重建维度) 将时间引入 3DGS,谓之 4D Gaussian Splatting。主流范式有二:逐帧迭代与形变场(deformation field)。 方法发表机制关键数字局限 4D-GS(Wu et al.)CVPR 2024时空结构编码 + MLP 形变解码高保真动态重建依赖稠密多视角 Deformable 3D Gaussians(Yang et al.)CVPR 2024canonical + 形变 MLP 查 4D 坐标单目动态人体剧烈非刚性形变弱 Gaussian-Flow(Lin et al.)CVPR 2024 Highlight双域形变 DDDM:时域多项式 + 频域傅里叶训练较逐帧快 5×,~125 FPS长程剧烈运动受限 Scaffold-GS(Lu et al.)CVPR 2024锚点 anchor + 神经高斯,视图自适应减冗余、提质量动态扩展有限 MoDec-GS / MoSca / OriGS / ODE-GS / EvoGSCVPR/NeurIPS 2025运动分解、4D 脚手架、ODE 连续动力学时序外推、样本高效各擅一场,未归一 Devil's Advocate 一击:上表所列,胜在「已被观测之域」。一旦遮挡、拓扑突变、视角外推,纯光度优化之形变场即现结构漂移(Ground4D 实证,见后)。此非枝节,乃 dynamic GS 之根本软肋。 四、第二汇流点:生成式 4D(创造维度) 重建只能「复现所拍」,生成方能「凭空造物」。4D 生成之难,不在多一维时间,而在几何、外观、运动、跨视角四项须同时稳。Miao 等(2025)之综述将范式析为四类: 端到端:直接学 4D 分布(理想终局,唯赖大数据); 生成中间数据:先造多视角/多时视频,再喂入既有 4D 重建管线(任务分解之智); 隐式蒸馏(SDS):以扩散为裁判,反复渲染—问差—反传,雕 4D 表示(灵活而贵); 显式监督:直接以参考视频/多视图/几何监督,效高可控(前层数据须可靠)。 Text/Image → 4D:DreamGaussian(Tang et al., ICLR 2024)以 2 分钟成 3D、约 10× 加速,开「GS + 生成」之先河;GaussianDreamer(Yi et al., 2023)桥接 2D 与 3D 扩散,造可操控高斯物体。 Video → 4D(2026 年之锋锐): GenMOJO(Chu et al., CMU+TRI, 2025):多物体遮挡场景之 video-to-4D; Ground4D(Zhao et al., 中山+清华, 2026, arXiv:2606.28828):以 3D 基础模型 VGGT 做训练免几何初始化,再以动态 GS 精炼,DyCheck 上 mPSNR 19.43 dB、Chamfer 0.226,正揭「纯光度优化致结构漂移」之病; World from Motion / WfM(Zhu et al., 斯坦福+NVIDIA, 2026, arXiv:2607.01202):闭环最巧——初重建动态 3DGS → 渲染 RGB/Depth/Normal/3D Scene Flow 为 4D buffer → 条件化视频生成模型造「虚拟多视角」→ 深度反投影、增新高斯、重优 motion,写回单一一致 4DGS。DyCheck 19.78 mPSNR、MultiCamVideo 27.43 PSNR,俱为 SOTA。 五、第三汇流点:GS 作视频与世界模型表示 GaussianVideo(Bond et al., Koc+Adobe, ICCV 2025, arXiv:2501.04782):层次化 GS + Neural ODE 学连续相机运动 + B-样条运动 + 时空层次学习。不依赖预计算相机参,内存省、时序一致强;令高斯运动自然涌现语义连贯,非强监督光学流所迫。 WorldWarp(Kong et al., 新国大+理大, 2025, arXiv:2512.19678):以在线 3DGS 几何缓存为结构锚,以时空扩散 ST-Diff 为生成精炼;时变噪声调度——空白区满噪以生、扭曲区半噪以修,chunk-by-chunk 生成 200 帧长程几何一致视频。诀:3D 逻辑导结构,扩散逻辑完美纹理。 D2GV(Liu et al., 交大+UMKC, 2025, arXiv:2503.05600):可变形 2D GS 表视频,GoP 并行、CUDA 光栅化,解码超 400 FPS,质量匹敌乃至超 INR,兼擅插帧/修复/去噪。 六、效率与压缩:让实时成为现实 显式表示之代价,在膨胀。三文为压缩立柱:LightGaussian(Fan et al., NeurIPS 2024 Spotlight, arXiv:2311.17245)15× 压缩、200+ FPS;3DGS.zip(Bagdasarian et al., CGF 2025)统九类模块之压缩综述;Splatwizard(Liu et al., 2025, arXiv:2512.24742)3DGS 压缩 Benchmark 工具包,使压缩可度量。 Devil's Advocate 二击:压缩常以画质/编辑性为价。15× 之后,原语之「可编辑」优势是否尚存?此须以任务定夺,不可一概而论。 七、正反 PK:GS 真能推动视频生成飞跃否? 正方 · 技术乐观 显式即可控:每原语可读、可编辑、可绑定骨架,优于 NeRF 黑箱与视频像素; 实时即落地:百 FPS 渲染,使交互世界、数字人、自驾仿真可得; 可组合即系统:GS 作画布,扩散、物理、轨迹皆可叠加(WfM、WorldWarp 为证); 数据高效:以强模态先验雕弱模态,避端到端大数据之困。 反方 · 局限批判 存储/显存膨胀:原语数随复杂度线性涨,长程场景不堪; 拓扑难塑:拓扑突变、非刚大形变、烟雾毛发,变形场乏力(TagSplat, CVPR'26 直言开放); 物理与时间一致性薄弱:纯光度优化致结构漂移、长程时序漂移(Ground4D、WfM 共证); 多视角先验不一致:扩散「每帧似真、合之非一世界」,须几何回投约束; 透明/反射材质弱:逊于体渲染之 NeRF;锯齿闪烁犹在。 拍板(Devil's Advocate 整合结论)。GS 非「取代扩散」,而为「承托扩散」之显式骨架。当下最优解,乃条件化混合表示:以几何(GS/3D 基础模型)立骨,以扩散(视频/多视图)补 flesh,以物理/轨迹/深度为约束回填。端到端 4D foundation model 固为终局,然在数据、统一生成框架、效率三项未齐前,混合表示最切实用。此与 Miao 等(2025)「先找承载问题之表示,再谈生成」之方法论,若合符节。 八、技术路线图与对比矩阵 静态 3DGS Kerbl'23 · 实时表示之基 引入时间 动态 / 4D 表示 4D-GS·Deform·Gaussian-Flow 引入生成先验 生成式 4D DreamGaussian→WfM·Ground4D 以 GS 为画布 视频 / 世界模型 GaussianVideo·WorldWarp·D2GV 压缩以落地 轻量部署 · 压缩 LightGaussian·3DGS.zip·Splatwizard 演进主轴:静态表示 → 动态 4D → 生成式 4D → 视频/世界模型画布 → 轻量部署;几何立骨、扩散补 flesh、物理/深度回填。 关键转折:2024 形变场范式成熟;2025–26 生成闭环(WfM/Ground4D)与视频表示(GaussianVideo/D2GV)齐发。 方法发表类型核心机制速度/指标一句话定位 3DGSSIGGRAPH'23静态表示显式高斯 + 可微光栅化100–300 FPS实时表示之基 4D-GSCVPR'244D 重建时空编码 + MLP 形变高保真动态入门 Deformable 3D GSCVPR'244D 重建canonical + 形变场单目人体形变场范式 Gaussian-FlowCVPR'24 HL4D 重建DDDM 双域形变~125 FPS, 5×快高效动态 Scaffold-GSCVPR'24静/动anchor + 神经高斯减冗余视图自适应 DreamGaussianICLR'24生成 4DGS + 扩散2 分钟成 3D生成先河 GaussianDreamer2023生成 4D桥接 2D/3D 扩散可操控text→4D GenMOJO2025video→4D多物体遮挡重建DAVIS/MOSE遮挡场景 Ground4D2026video→4DVGGT 初始化 + GS 精炼mPSNR 19.43几何一致性 World from Motion2026video→4D虚拟观测蒸馏回 3DGSDyCheck 19.78闭环 SOTA GaussianVideoICCV'25视频表示层次 GS + Neural ODE高/低动俱优世界模型雏形 WorldWarp2025世界模型在线 3DGS 缓存 + ST-Diff200 帧长程一致 D2GV2025视频表示可变形 2D GS>400 FPS极速解码 LightGaussianNeurIPS'24压缩剪枝+蒸馏+哈希15×, 200+ FPS压缩标杆 九、挑战与 Benchmark 拓扑与一致性:拓扑一致动态网格(TagSplat, CVPR'26)、跨视角/长程时序漂移,仍为开放题; 物理合理性:PhysTwin(ICCV'25)等倡物理信息重建,然「动得像真」未普适; Benchmark 缺口:4D 评测多沿用 PSNR/SSIM/LPIPS/FVD/CLIP,抓不住「跨视角一致、长程漂移、几何-外观错配」之真败因(Miao et al., 2025 之警); 统一框架:今之系统仍「图像扩散管外观、视频扩散管动、多视图管视角」,一致性多留后处理扛; 数据:大规模、多条件、多动态类型之 4D 数据稀缺,端到端 foundation model 难立。 常用指标:PSNR、SSIM、LPIPS、FPS、显存占用、Chamfer Distance、mPSNR(DyCheck)、PCK@0.05(3D track)。 十、结论与展望 3DGS 与视频生成之汇流,非偶合,而因「一致性」这一共同焦虑。三年之间,已由静态表示(Kerbl'23)→ 动态 4D(CVPR'24 诸作)→ 生成式 4D(2025–26 之 WfM、Ground4D)→ 视频/世界模型画布(GaussianVideo、WorldWarp、D2GV),并以压缩(LightGaussian 等)谋落地。 拍板之见:短期以条件化混合表示为实用之锚——几何立骨、扩散补 flesh、物理/深度回填;长期则向统一 4D 生成框架与大规模多条件数据挺进。凡涉交互式世界、数字人、自驾仿真、具身智能者,GS 与视频生成之合流,方其始也。 参考文献 Bagdasarian, M., et al. (2025). 3DGS.zip: A survey of 3D Gaussian Splatting compression. Computer Graphics Forum. Bond, A., Wang, J.-H., Mai, L., Erdem, E., & Erdem, A. (2025). GaussianVideo: Efficient video representation via hierarchical Gaussian splatting. In ICCV. arXiv:2501.04782 Chu, et al. (2025). GenMOJO: Generating multi-object 4D scenes from monocular video. arXiv:2506.12716 Fan, Z., et al. (2024). LightGaussian: Unbounded 3D Gaussian compression with 15× reduction and 200+ FPS. In NeurIPS. arXiv:2311.17245 Guo, H., Weng, D., Su, M., et al. (2026). TagSplat: Topology-aware Gaussian splatting for dynamic mesh modeling and tracking. In CVPR. arXiv:2512.01329 Kerbl, B., Kopanas, G., Leimkühler, B., & Drettakis, G. (2023). 3D Gaussian Splatting for real-time radiance field rendering. ACM TOG, 42(4), 139. arXiv:2308.04079 Kong, H., Yang, X., Zheng, X., & Wang, X. (2025). WorldWarp: Propagating 3D geometry with asynchronous video diffusion. arXiv:2512.19678 Lin, Y., Dai, Z., Zhu, S., & Yao, Y. (2024). Gaussian-Flow: 4D reconstruction with dynamic 3D Gaussian particle. In CVPR (pp. 21136–21145). arXiv:2312.03431 Liu, M., Yang, Q., Zhao, M., Huang, H., Yang, L., Li, Z., & Xu, Y. (2025). D2GV: Deformable 2D Gaussian splatting for video representation in 400FPS. arXiv:2503.05600 Liu, et al. (2025). Splatwizard: A toolkit for benchmarking 3D Gaussian splatting compression. arXiv:2512.24742 Lu, T., et al. (2024). Scaffold-GS: Structured 3D Gaussians for view-adaptive rendering. In CVPR. arXiv:2312.00109 Miao, Q., Li, K., Quan, J., et al. (2025). Advances in 4D generation: A survey. arXiv:2503.14501 Tang, J., et al. (2024). DreamGaussian: Generative Gaussian splatting for efficient 3D content creation. In ICLR. arXiv:2309.16653 Wu, G., Yi, T., Fang, J., et al. (2024). 4D Gaussian Splatting for real-time dynamic scene rendering. In CVPR. arXiv:2310.08528 Yang, Z., Gao, X., Zhou, W., Jiao, S., Zhang, Y., & Jin, X. (2024). Deformable 3D Gaussians for animatable humans from monocular videos. In CVPR. arXiv:2309.13101 Yi, T., et al. (2023). GaussianDreamer: Text to manipulable 3D Gaussian objects with gener
暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens