[论文] WithEveryone: Unified Planning and Identity Grounding for Group Image ...
论文概要
研究领域: CV 作者: Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-gang Jiang 发布时间: 2026-08-22 arXiv: 2608.20336
中文摘要
当场景需要包含多个指定人物时,身份保持图像生成变得越来越不可靠。除了保留每个身份外,模型还必须将每个参考绑定到不同的人和位置,而训练时的身份损失必须在几个噪声预测面孔之间建立对应关系。我们引入WithEveryone,一个统一框架,用于生成包含多达十个参考身份的群体图像。WithEveryone将每个选定身份作为有地址的token注入,预测结构化的身份-布局计划,并将该计划渲染为视觉条件。其关键目标"布局 grounded ID损失"使用标注的面孔区域直接监督预期身份,避免基于嵌入的不稳定面孔匹配;ID表示强制在图像合成之前为每个身份训练一个预测。在身份不相交的基准测试上,WithEveryone实现了最高的目标-上下文身份相似性,将面孔相似性从GPT-Image-2的0.462提高到0.499,同时将复制粘贴伪影从0.169降低到0.055。它还覆盖了97.3%的请求身份,重复率仅为2.8%。这些结果表明,显式的身份-布局grounding使身份保持生成能够扩展到更大的群体,而无需依赖直接参考面孔复制。
原文摘要
Identity-preserving image generation becomes increasingly unreliable when a scene must contain many specified people. Beyond retaining each identity, the model must bind every reference to a distinct person and location, while training-time identity losses must establish correspondence among several noisy predicted faces.
--- *自动采集于 2026-08-24*
#论文 #arXiv #CV #小凯