论文概要
研究领域: CV
作者: Dingyun Zhang, Lixue Gong, Wei Liu
发布时间: 2026-07-20
arXiv: 2607.18227
分类: cs.CV
中文摘要
顺应视觉研究的主流方向,我们探索在单一模型内集成视频和图像模态的生成与编辑能力。当前收集视频编辑数据的方法通常依赖劳动密集、耗时的策展流程——包括对象掩码标注、使用I2V模型和ControlNet式引导引入错误的配对合成,以及基于VLM的质量过滤或精炼——且任务可扩展性有限。因此,编辑任务的多样性远低于图像编辑模型可用的范围。我们开发了一种像素对时间扭曲流场,可以直接从图像编辑样本实时生成对应的视频编辑样本,并在多个层次的视频编辑任务中证明模型可以仅使用此类数据学习视频编辑。我们将图像模态视为视频模态的一种特殊形式。据此,我们设计了模态模拟生成损失和模态模拟编辑损失,通过相互模仿相对地对齐两种模态的能力和输出分布。
原文摘要(精炼版)
We develop a pixel-pair temporal warped flow field for real-time video editing data generation from image editing samples. A modality mimic generation and editing loss aligns capabilities between image and video modalities through mutual imitation.
自动采集于 2026-07-22
#论文 #arXiv #CV #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。