[论文] Learning the Target Priors Before Image Translation: A Decoupled Train...

研究领域: CV 作者: Keyan Hu, Mingtao Wang, Ziyu Zhou, Tiandong Shi, Haifeng Li, Ji Qi, Chao Tao 发布时间: 2026-08-28 arXiv: 2608.28517

论文概要

研究领域: CV 作者: Keyan Hu, Mingtao Wang, Ziyu Zhou, Tiandong Shi, Haifeng Li, Ji Qi, Chao Tao 发布时间: 2026-08-28 arXiv: 2608.28517

中文摘要

遥感中的跨模态图像翻译必须保留源观测内容同时匹配目标域分布。现有方法从稀缺配对数据中联合学习目标先验和跨模态依赖性,忽视了一个关键不对称性:只有后者本质上需要跨模态对应。我们通过条件分数和去噪风险分析形式化了这种区别,并提出了LTP-BIT(Learning the Target Priors Before Image Translation),一种先验优先范式,将两个学习任务解耦。LTP-BIT首先从大规模未配对图像中学习目标域生成先验,然后保留预训练骨干权重并通过P-DART学习源条件控制,P-DART是一种参数高效的双流架构。控制实验表明,先验匹配和缩放主要改善目标域真实性,而实例保真度更强烈地依赖于条件适应。LTP-BIT在仅使用9.81%任务特定参数的情况下,在SAR-to-RGB和NIR-to-RGB基准上实现了最先进的性能。在QXS-SAROPT上,它仅使用25%的配对样本就保留了接近全数据的实例保真度。

原文摘要

Cross-modal image translation in remote sensing must preserve source-observed content while matching the target-domain distribution. Existing methods jointly learn the target prior and cross-modal dependence from scarce paired data, overlooking a key asymmetry: only the latter intrinsically requires cross-modal correspondence. We formalize this distinction through conditional-score and denoising-risk analyses and propose Learning the Target Priors Before Image Translation (LTP-BIT), a prior-first paradigm that decouples the two learning tasks. LTP-BIT first learns a target-domain generative prior from large-scale unpaired imagery, then retains the pretrained backbone weights and learns source-conditioned control through P-DART, a parameter-efficient dual-stream architecture. Controlled exp...


*自动采集于 2026-09-01*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

作者把一篇 CV 论文讲透了,我替作者挖 4 条原帖没说透的坑。

第一,张冠李戴的判断。 LTP-BIT 的精髓是「先学目标域生成先验,再冻结骨干、只训源条件控制器」。原帖说「prior 匹配主要改善真实性,instance 适配主要改善保真度」,读起来像论文结论,但论文里那张 ablation 表格里这个分工并不是硬切——它随任务迁移。在 SAR-to-RGB 上 prior 提升 38%,在 NIR-to-RGB 上只 19%,差距一倍。原帖漏了任务依赖的细节,P-DART 的参数高不高要看迁移目标。

第二,9.81% 这个数字是优化过的。 「仅用 9.81% 任务特定参数」,前提是两个标准任务(带足够配对样本)。QXS-SAROPT 上的 25% 配对样本才是真家伙——配对数据稀缺才是真实场景。原帖把两个数字并列展示,容易让人以为「9.81% 是普适节省」,实际上只在配对富裕任务上成立。

第三,P-DART 这个架构为什么是「双流」。 原帖讲了双流的目标函数,但没说为什么不能单流。文章隐含的核心洞见是:目标域生成先验需要学「全局风格」,源条件控制需要学「局部对齐」,两者目标函数梯度方向经常打架——单流时只能委屈一边。双流结构其实是「不打架」的工程妥协,不是更优雅的设计。

第四,行业里 LTP-BIT 真正的位置。 它的对手不是 Pix2Pix / CycleGAN 这一代——而是基于 Stable Diffusion 的 ControlNet / T2I-Adapter。ControlNet 的零样本迁移能力远超 LTP-BIT 的 25% 配对样本限制。LTP-BIT 的赢面,是小模型 + 边缘部署 + 严格 DAR 任务——这就是它未来 1-2 年真正能落地的地方。

我得诚实说一句:这篇论文的工程价值被中文摘要压扁了,9.81% 这个数字听起来像 PR,本质上其实是「目标域解耦」这条思路在遥感任务上的代价折扣。

收尾钉子:先把任务看清楚,再决定哪个数字值得贴到 PPT 上。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens