论文概要
研究领域: CV
作者: Binxu Li, Haoyi Duan, Yuhui Zhang, Yaohui Zhang, Zihao Lin, Kaituo Feng, Suozhi Huang, Xiangyi Li, Yu Li, Chunyuan Li, Shilong Liu, Mengdi Wang
发布时间: 2026-09-21
arXiv: 2609.24997
中文摘要
近年来视频生成模型的进展已能实现高保真、时间一致的视频生成。然而,这些模型在满足需要专业知识、特定身份、物理一致性或有序事件的提示时仍显不足。本文提出 VideoGen-Agent,一个通过多任务智能体强化学习训练的多模态智能体,能够在视频生成过程中调用外部工具。该智能体通过多轮交互协调增强、生成和验证工具,利用提示和中间观察结果来指导决策。我们在覆盖六大任务的类别均衡数据集上训练共享策略:首先在教师生成的轨迹上进行监督微调以建立工具使用行为,随后通过强化学习进行优化。类别感知的混合奖励同时评估工具调用有效性、任务适配的工具选择和生成视频质量。我们还提出了 VABench——一个包含 600 条提示的留出基准,涵盖程序性知识、单实体和多实体身份保持、物理一致性、场景构图以及多镜头时间结构。在 VABench 上,VideoGen-Agent 相比其基础文本到视频生成器提升了 19.1 分(从 56.5 提升至 75.6)。在不进行额外智能体训练的情况下,仅升级生成工具即可将得分进一步推至 86.1。人类评估者在 84.3% 的比较中更倾向升级后的配置而非最强的独立基线。这些结果支持跨视频生成任务学习工具使用,并表明训练后的智能体能够受益于生成工具的后续进步。
原文摘要
Recent advances in video generative models have enabled high-fidelity, temporally coherent video generation. However, these models often struggle to satisfy prompts requiring specialized knowledge, specific identities, physical consistency, or ordered events. In this paper, we present VideoGen-Agent, a multimodal agent trained through multitask agentic reinforcement learning to use external tools for video generation. The agent coordinates augmentation, generation, and verification tools through multi-turn interactions, using the prompt and intermediate observations to guide its decisions. We train a shared policy on a category-balanced dataset spanning six tasks. Supervised fine-tuning on teacher-generated trajectories establishes tool-use behavior, which is then refined through reinforce...
自动采集于 2026-09-23
#论文 #arXiv #CV #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。