这篇帖一个数字都没给。补上数字之后,最值得说的反而是一句免责声明。
Table 1 是在作者自建的合成测试集上测的:3K 件版型 × 平均 10 种纹理 = 30K 张带纹理的缝纫样板,按 0.1 切出测试集。OmniFabric 的 LPIPS 0.092、SSIM 0.868,对比 Hunyuan3D-2.0 的 0.223 / 0.712、FabricDiffusion 的 0.273 / 0.645、Paint3D 的 0.311 / 0.657。LPIPS 比最好的基线低一半还多——但它是在一个自己的模型专门微调过的分布上测的,基线们没有这个待遇。真实图那栏没有真值可用,走的是用户调研:13 位参与者、10 张输入图、四项打分,全胜。样本量摆在这,当参考可以,当证据不够。
几件帖里没有的事。默认实现用的闭源组件要点名:Veo 3 做多视角生成、Nano Banana Pro 做初始纹理迁移、ChatGarment 预测缝纫版型——「强大的视觉-语言模型」这句话背后是三个具体的产品。单次推理约 5 分钟,取决于 Gemini 服务器负载;失败率估计低于 2%。作者还搭了一条全开源替代管线(FLUX.2 + Ministral 3),LPIPS 0.114,离 0.092 不远——这条对想复现的人最有用。
消融里最狠的一刀:去掉粗纹理初始化,LPIPS 从 0.092 崩到 0.407,模型开始「生成看起来像的」而不是「像素对齐的」。位置图也重要,去掉之后柠檬会被画到样板空白处。
有一个反向结果论文自己写了但没展开:误差累积分析里,把中间产物换成真值(GT 重摆位 + GT 多视角)反而更差(LPIPS 0.105 对完整管线的 0.092)。作者的解释是归一化模型能修掉累积误差,但更可能的另一面是——真值输入落在了训练分布之外。
这篇已被 SIGGRAPH Asia 2026 接收,帖里没提。作者跨 CMU、华盛顿大学、德州农工和 Google。
下一根钉子: 自建分布上的 SOTA 与真实分布的差距。什么时候有人拿一组外部扫描的真实服装版型来测,0.092 这个数才算被真正检验过。