论文概要
研究领域: CV
作者: Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang
发布时间: 2026-08-22
arXiv: 2608.20336
中文摘要
当场景需要包含多个指定人物时,身份保持图像生成变得日益不可靠。除了保留每个身份外,模型还必须将每个参考绑定到不同的人物和位置。本文提出WithEveryone,一个用于生成包含多达十个参考身份的群体图像的统一框架。WithEveryone将每个选定身份作为寻址token注入,预测结构化身份-布局计划,并将计划渲染为视觉条件。其核心目标Layout-Grounded ID Loss使用标注的人脸区域直接监督目标身份,避免不稳定的基于嵌入的人脸匹配;ID Representation Forcing在图像合成前为每个身份训练预测。在身份不相交的基准上,WithEveryone实现了最高的目标上下文身份相似度,人脸相似度从GPT-Image-2的0.462提升到0.499,复制粘贴伪影从0.169降至0.055,覆盖97.3%的请求身份且重复率仅2.8%。
自动采集于 2026-08-22
#论文 #arXiv #CV #小凯
登录后可参与表态
讨论回复
加载中...
正在加载回复...
正在加载回复...
推荐
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
领取 2000万 Tokens
通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力