静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-03 05:35

w9-c6-silsa.svg

高分辨率的三维生成,眼下走的是体素路线:先把形状剁成几十万个局部 token,再一块块补几何。

有效,但代价很直白。连续的曲面被切碎,token 数量暴涨,生成成本往上走,而那些细长的、高度连通的形状,最容易在这种碎片化里丢掉结构一致性——一根细杆、一个环、一处中空的连通,恰恰是拓扑最脆弱的地方。

这篇论文换了一套刀具:沿三条正交轴,各切一组固定的、相互重叠的滑窗。

384 个 token 装一个形状

机制可以说得很干净。

每条轴分 N 个 bin(论文取 N 等于 128),窗口宽度 w 取 8,三条轴加起来是 3N,也就是 384 个 token。每个 token 概括一个局部深度窗口,保住横截面的连续性,从而支持单阶段的整流流生成——不再是先预测结构、再补几何的两段式。

支撑它的是一个叫 Slice VAE 的编解码器:把定向表面样本编码进多轴切片隐空间,再用稀疏体解码器重建。另外有个 Volumetric Anchor Lattice,在一个共享的三维工作空间里,协调来自不同方向的切片流。

最关键的零件是切片级拓扑监督:匹配持续图,并对齐相邻切片之间的 Betti 数转移。Betti 数是拓扑学里数「有几个洞、几条连通分量」的量——一根细杆不能在中途断成两截,一个环不能糊成实心,靠的就是这道约束。

成绩单(基线是重建类最强方法 SparseFlex):

  • PSNR 从 30.12 抬到 32.74,相对提升 8.7%
  • 覆盖率从 73.12% 到 79.08%,绝对提升 5.96 个百分点
  • Betti 误差从 1.743 降到 1.582,相对下降 9.2%
  • token 用量 384,比次紧凑基线 Dora(1280)少 70%,比 Trellis、XCube、SparseFlex 少 超过 98%
  • 训练内存 14.6GB 降到 8.7GB,推理 0.82 秒每形状降到 0.34 秒

「均优于最强基线」这句话有反例

把表 1 逐格摊开,故事就复杂了。

CLIP 分这一格,SILSA 是输的:87.94 对 SparseFlex 的 88.22。论文自己写的是 "SparseFlex attains a slightly higher CLIP score"。另外,KD 距离两方都是 0.08、LPIPS 都是 0.05——那是持平,不是「优于」。所以摘要那句「均优于最强基线」,严格讲只在 PSNR、覆盖率、FD、MMD 这几格成立。

降幅的基线被混用了。内存的 40.4% 和推理时间的 58.5% 都只相对 Dora 计算;而 Dora 恰恰是基线里最省内存的那一个(14.6GB,对比 SparseFlex 的 55.4GB、Trellis 的 42.7GB)。同一段话里,token 的 −70% 又是相对 Dora、−98% 却是相对 Trellis/XCube/SparseFlex 这一批。两套基线混用,标题只写降幅不写基线,很容易被读成「对所有基线都这样」。

没有方差,没有显著性。主表两张全是单点数值,没有标准差、没有种子、没有检验。PSNR 的 8.7% 和 Betti 的 9.2% 这种相对增益,没有置信区间兜底。

评测是单数据集。训练用 Trellis-500K,定量结论来自 Toys4K 里随机 200 个资产加 50 张实拍图。跨数据集的泛化,没有验证。

代码开放状态不明。全文只给了一个项目页,检索不到任何 GitHub 仓库链接,也没有「代码将发布」的字样。

作者自己的局限写得很老实:结构模式远离训练分布的物体,重建保真度会下降;输入视图过于含糊或信息量太低时,三维结构也会跟着走样。

三把正交刀,切出拓扑骨架——它最漂亮的地方不是快,是终于有人把「洞」当成一等公民来监督。

暂无表态