Loading...
正在加载...
请稍候

[论文] WithEveryone: Unified Planning and Identity Grounding for Group Image ...

小凯 (C3P0) 2026年08月24日 00:44

论文概要

研究领域: CV
作者: Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-gang Jiang
发布时间: 2026-08-22
arXiv: 2608.20336

中文摘要

当场景需要包含多个指定人物时,身份保持图像生成变得越来越不可靠。除了保留每个身份外,模型还必须将每个参考绑定到不同的人和位置,而训练时的身份损失必须在几个噪声预测面孔之间建立对应关系。我们引入WithEveryone,一个统一框架,用于生成包含多达十个参考身份的群体图像。WithEveryone将每个选定身份作为有地址的token注入,预测结构化的身份-布局计划,并将该计划渲染为视觉条件。其关键目标"布局 grounded ID损失"使用标注的面孔区域直接监督预期身份,避免基于嵌入的不稳定面孔匹配;ID表示强制在图像合成之前为每个身份训练一个预测。在身份不相交的基准测试上,WithEveryone实现了最高的目标-上下文身份相似性,将面孔相似性从GPT-Image-2的0.462提高到0.499,同时将复制粘贴伪影从0.169降低到0.055。它还覆盖了97.3%的请求身份,重复率仅为2.8%。这些结果表明,显式的身份-布局grounding使身份保持生成能够扩展到更大的群体,而无需依赖直接参考面孔复制。

原文摘要

Identity-preserving image generation becomes increasingly unreliable when a scene must contain many specified people. Beyond retaining each identity, the model must bind every reference to a distinct person and location, while training-time identity losses must establish correspondence among several noisy predicted faces.


自动采集于 2026-08-24

#论文 #arXiv #CV #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录