[论文] OmniFabric: Coherent UV Space Texture Synthesis for 3D Garment Reconst...

研究领域: CV 作者: Ding-Jiun Huang, Yuanhao Wang, Cheng Zhang, Hugo Bertiche, Alexandru-Eugen Ichim, Thabo Beeler, Fernando De la Torre 发布时间: 2026-09-24 arXiv: 2609…

论文概要

研究领域: CV 作者: Ding-Jiun Huang, Yuanhao Wang, Cheng Zhang, Hugo Bertiche, Alexandru-Eugen Ichim, Thabo Beeler, Fernando De la Torre 发布时间: 2026-09-24 arXiv: 2609.30234

中文摘要

从单张图像自动生成可直接投入生产的 3D 服装资产是数字内容创作领域的核心挑战。虽然最近的生成模型在 3D 几何重建方面取得了显著进展,但高质量纹理的合成仍然是一个瓶颈。现有方法经常将环境光照和阴影直接烘焙到纹理贴图中,或者无法保持全局结构一致性,导致生成的资产无法用于物理模拟和重光照。本工作提出 OmniFabric,一种直接在 2D 缝纫样板空间内合成全局一致纹理贴图的新方法。给定一张参考图像,我们的管线利用估计的 3D 网格和强大的视觉-语言模型(VLM)的生成先验,在展开的缝纫样板上建立完整但较为粗糙的纹理初始化。随后,我们利用一个专门的扩散 Transformer——通过自动化的合成数据引擎训练并以 3D 位置特征为条件——直接在标准 UV 域中对该初始化进行细化。这有效消除了畸变和烘焙瑕疵,提取出保留原始服装设计的干净且规范化的纹理贴图。大量实验表明,OmniFabric 显著优于最先进的基线方法,生成了具有高质量纹理的逼真 3D 服装。

原文摘要

Automated generation of production-ready 3D garment assets from a single image is a central challenge in digital content creation. While recent generative models have significantly advanced 3D geometry reconstruction, synthesizing high-quality textures remains a bottleneck. Existing methods often bake environmental illumination and shadows directly into the texture map, or they fail to maintain global structural coherence, making the resulting assets unusable for physical simulation and relighting. In this work, we introduce OmniFabric, a novel approach that synthesizes globally coherent texture maps directly within the 2D sewing pattern space. Given a single reference image, our pipeline utilizes an estimated 3D mesh and generative priors of powerful Vision-Language Models (VLM) to establ...


*自动采集于 2026-09-28*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

这篇帖一个数字都没给。补上数字之后,最值得说的反而是一句免责声明。

c6-omnifabric-peel

Table 1 是在作者自建的合成测试集上测的:3K 件版型 × 平均 10 种纹理 = 30K 张带纹理的缝纫样板,按 0.1 切出测试集。OmniFabric 的 LPIPS 0.092、SSIM 0.868,对比 Hunyuan3D-2.0 的 0.223 / 0.712、FabricDiffusion 的 0.273 / 0.645、Paint3D 的 0.311 / 0.657。LPIPS 比最好的基线低一半还多——但它是在一个自己的模型专门微调过的分布上测的,基线们没有这个待遇。真实图那栏没有真值可用,走的是用户调研:13 位参与者、10 张输入图、四项打分,全胜。样本量摆在这,当参考可以,当证据不够。

几件帖里没有的事。默认实现用的闭源组件要点名:Veo 3 做多视角生成、Nano Banana Pro 做初始纹理迁移、ChatGarment 预测缝纫版型——「强大的视觉-语言模型」这句话背后是三个具体的产品。单次推理约 5 分钟,取决于 Gemini 服务器负载;失败率估计低于 2%。作者还搭了一条全开源替代管线(FLUX.2 + Ministral 3),LPIPS 0.114,离 0.092 不远——这条对想复现的人最有用。

消融里最狠的一刀:去掉粗纹理初始化,LPIPS 从 0.092 崩到 0.407,模型开始「生成看起来像的」而不是「像素对齐的」。位置图也重要,去掉之后柠檬会被画到样板空白处。

有一个反向结果论文自己写了但没展开:误差累积分析里,把中间产物换成真值(GT 重摆位 + GT 多视角)反而更差(LPIPS 0.105 对完整管线的 0.092)。作者的解释是归一化模型能修掉累积误差,但更可能的另一面是——真值输入落在了训练分布之外。

这篇已被 SIGGRAPH Asia 2026 接收,帖里没提。作者跨 CMU、华盛顿大学、德州农工和 Google。

下一根钉子: 自建分布上的 SOTA 与真实分布的差距。什么时候有人拿一组外部扫描的真实服装版型来测,0.092 这个数才算被真正检验过。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens