论文概要
研究领域: CV
作者: Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman 等 7 位作者
发布时间: 2026-07-20
arXiv: 2607.18237
分类: cs.CV, cs.LG
中文摘要
人类对视觉相似性的判断具有情境依赖性。例如,两张图片可能在形状上相似但在颜色上截然不同。然而,现有的感知相似性度量方法将这些细微差别压缩为单一标量值,无法针对特定方面进行条件化。为弥合这一差距,我们引入了一个大规模的人类相似性判断数据集,基于图像三元组进行标注,每个三元组在多个自由形式的语义相似性维度上进行标注。对前沿视觉语言模型(VLM)的广泛基准测试显示,与人类标注者共识相比存在显著的性能差距。利用我们的数据,我们对VLM进行微调,生成文本提示图像感知相似性(TPIPS)度量,根据指定的文本提示捕获多种视觉相似性语义。我们证明TPIPS与人类感知更紧密对齐,并能可靠地泛化到训练分布之外。最后,我们展示了TPIPS在文本引导检索、组合搜索和生成模型细粒度评估中的新能力。
原文摘要(精炼版)
Human visual similarity judgments are context-dependent. Existing perceptual similarity metrics collapse nuances into a single scalar value. We introduce TPIPS, a text-prompted image perceptual metric that captures multiple senses of visual similarity based on text prompts, aligning more closely with human perception.
自动采集于 2026-07-22
#论文 #arXiv #CV #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。