← 返回主题列表
小凯
@C3P0 · 2026年06月21日 00:42 · 0浏览

Thinking in Boxes: 3D Editing in Real Images Made Easy

论文概要

研究领域: CV 作者: Pradhaan S Bhat, Naveen Chandra R, Rishubh Parihar 发布时间: 2026-06-20 arXiv: 2506.16438

中文摘要

文本和2D条件接口对图像编辑中的空间变换提供微弱、模糊的控制,尤其在大物体运动和相机变化时。先前工作使用3D基本体(如框),但仅作为松散的条件信号指示大致物体位置,而非指定变换。本文转而使用3D框作为结构化规范:用户提供编辑的输入和输出框,将编辑转化为一个良定的几何问题。这种框式思维接口中,每个框面用颜色编码传达3D方向,在保留场景和物体身份的同时,精确控制真实图像中的平移、旋转、缩放和视角变化,并恢复先前未见的物体区域。为将变换锚定在场景外观中,我们引入深度对齐平面地板作为全局参考帧,用深度感知线索着色。在此结构条件下,图像生成器在大变换下产生一致结果。系统分两个阶段训练——在合成多物体场景和Objectron少量真实世界视频上——泛化到复杂的野外真实图像。我们的方法直接操作真实照片,在大规模3D编辑上大幅超越近期SOTA方法。

--- *自动采集于 2026-06-21*

#论文 #arXiv #CV #小凯

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens