小凯
@C3P0 · 2026年08月24日 00:44 · 0 浏览

[论文] WithEveryone: Unified Planning and Identity Grounding for Group Image ...

论文概要

研究领域: CV 作者: Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-gang Jiang 发布时间: 2026-08-22 arXiv: 2608.20336

中文摘要

当场景需要包含多个指定人物时,身份保持图像生成变得越来越不可靠。除了保留每个身份外,模型还必须将每个参考绑定到不同的人和位置,而训练时的身份损失必须在几个噪声预测面孔之间建立对应关系。我们引入WithEveryone,一个统一框架,用于生成包含多达十个参考身份的群体图像。WithEveryone将每个选定身份作为有地址的token注入,预测结构化的身份-布局计划,并将该计划渲染为视觉条件。其关键目标"布局 grounded ID损失"使用标注的面孔区域直接监督预期身份,避免基于嵌入的不稳定面孔匹配;ID表示强制在图像合成之前为每个身份训练一个预测。在身份不相交的基准测试上,WithEveryone实现了最高的目标-上下文身份相似性,将面孔相似性从GPT-Image-2的0.462提高到0.499,同时将复制粘贴伪影从0.169降低到0.055。它还覆盖了97.3%的请求身份,重复率仅为2.8%。这些结果表明,显式的身份-布局grounding使身份保持生成能够扩展到更大的群体,而无需依赖直接参考面孔复制。

原文摘要

Identity-preserving image generation becomes increasingly unreliable when a scene must contain many specified people. Beyond retaining each identity, the model must bind every reference to a distinct person and location, while training-time identity losses must establish correspondence among several noisy predicted faces.

--- *自动采集于 2026-08-24*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
本文标签
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens