「RoofGS:3D 高斯溅射在 4K 上跑出 10 倍速,61 帧飙到 616 帧」
8 月 16 日,哈工大团队在 arXiv 放出 RoofGS(Roofline-Guided End-to-End Acceleration of 3D Gaussian Splatting)。它在 RTX 4090 上把 3D 高斯溅射(3DGS)在 4K 分辨率的端到端吞吐从 61 FPS 拉到 616 FPS——10.1 倍加速,画质损失极小(PSNR 只掉 0.028 dB)。论文已被 ACM MM 26 接收。
费曼式拆解:为什么 3DGS 在 4K 上会卡
3D 高斯溅射是新视角合成的主流技术,渲染快、效果好。但一到 4K 高分辨率,GPU 就喘。
RoofGS 没上来就"换个更快的 kernel 硬刚",而是先用 Roofline 模型给整条渲染流水线做"硬件体检",发现两个完全不同的瓶颈:
- 前端(front end)是内存瓶颈:全局显存带宽吃满,卡在搬运数据。
- 光栅化(rasterizer)是指令瓶颈:算力吞吐受限,卡在计算本身。
针对内存瓶颈的前端:设计"分辨率自适应量化深度排序键",把每个排序键压到 32 位。深度排序本来要搬大量键值,压完显存流量直接下来。
针对指令瓶颈的光栅化:提出"范围感知的比特级快速指数近似"。高斯混合里的 exp 运算,用少量算术和位级操作近似,而且推导出了逐像素误差上界——不是拍脑袋近似,是带误差担保的近似。透明度融合里那个 transcendental 的 exp(P) 被替换成几十个算术/位操作。
再叠一层通用优化(kernel 融合、紧凑属性存储、剔除、双像素评估),把显存流量和指令级并行都薅出来。
为什么这件事比"又快了点"重要
- 高分辨率 3DGS 一直是落地卡点。VR/AR、数字孪生、机器人仿真都想要 4K 实时,但原版 3DGS 在 4K 只有 61 FPS,不够稳。RoofGS 拉到 616 FPS,把实时门槛远远甩在身后。
- 方法论比数字更值钱。RoofGS 的核心贡献不是某个 trick,而是"先用 Roofline 把瓶颈分清楚,再按瓶颈给药"的工程范式。这种" stage-wise 硬件刻画 → bottleneck-specific 优化"的思路,可迁移到训练管线、端侧部署等其他场景。
- 误差可控。位级近似带 per-pixel error bound,连续色彩空间里 |ΔC| ≤ 0.03,且与混合的高斯数量无关。这意味着加速不是以"画面糊了"为代价。
- 和具身/游戏引擎的联动。3DGS 是连接神经渲染和实时引擎的桥梁。渲染快 10 倍,意味着神经场景能在更弱硬件上跑,离"引擎管物理、生成模型管外观"的实时可玩世界更近一步。
值得盯的几个点
- RoofGS 是"系统 + 图形"交叉的干净样本:不训模型、不堆算力,纯靠对硬件瓶颈的理解挖性能。这种打法在 AI 算力受限时会越来越吃香。
- 同周图形学还有 AlayaRenderer-Flash(生成式世界渲染器实时化),两条线都在把"神经渲染"往实时推——图形学的重心正从"能渲染"转向"能实时渲染且便宜"。
- 对开发者:RoofGS 在 Mip-NeRF 360、Tanks & Temples、Deep Blending 三个基准都验证了 4K 10.1×,可复现性强。