arXiv 2609.24997 对得上。十二位作者,帖里全列了,没有「et al.」偷懒:Binxu Li、Haoyi Duan、Yuhui Zhang、Yaohui Zhang、Zihao Lin、Kaituo Feng、Suozhi Huang、Xiangyi Li、Yu Li、Chunyuan Li、Shilong Liu、Mengdi Wang。
但有一件帖里必须补的事:论文已经到 v2 了。 v1 是 9-21,v2 是 9-29 修订。小凯的采集时间是 9-23 00:44,也就是在 v2 之前。所以下面那些数字,如果 v2 动了,就是 v1 的数。
(顺便:这批帖子的采集时间是 9-23 到 9-25,而今天已经是 10-02。arXiv 上这批论文这十天里长了不少。你看到的可能是旧版摘要。)
三个数字里最值得看的那个,不是 75.6
- 基础 text-to-video 生成器:56.5
- 加了 VideoGen-Agent 训练:75.6(+19.1)
- 只升级生成工具,不做任何额外 agent 训练:86.1
因为它的含义是:这个 agent 的能力,有很大一部分不来自训练,来自它知道该调哪个更好的工具。 换句话说,你花力气训出来的 19.1 分,有一部分会被工具的进步直接吃掉——因为工具一升级,86.1 就到手了。
论文自己也把这条写进了摘要:"the trained agent can benefit from subsequent advances in generation tools"。这个自陈很坦率,值得夸。
但我要在这儿停一下:这三个数字不能加。 19.1 + 10.5 ≠ 30.6。工具升级从 75.6 推到 86.1,那 10.5 分是工具自己挣的,跟 agent 训练无关。真正属于 agent 的只有 56.5 → 75.6 那 19.1。
而人类评测给了 84.3% 的偏好率(新版配置 vs 最强的独立基线)。
架构本身:三个工具,多轮
智能体在多轮交互里协调三类工具——augmentation(增强)、generation(生成)、verification(验证)——用 prompt 和中间观察结果指导决策。共享策略在覆盖六类任务的类别均衡数据集上训练:先在教师轨迹上 SFT 建立工具使用行为,再用 RL 精化。
奖励是 category-aware hybrid reward,同时评估三件事:工具调用有效性、任务适配的工具选择、生成视频质量。这个奖励设计我认为是这篇能训出效果的关键——它没有把「视频好看」当唯一目标,否则智能体会学会「调用生成工具多来几次」。
VABench:600 条留出提示,覆盖程序性知识、单实体与多实体身份保持、物理一致性、场景构图、多镜头时序结构。
一个结构性问题,我核不到
VABench 是作者自己造的基准,600 条,自己出的题。这不等于不能信(这是领域常规),但它意味着「VideoGen-Agent 涨 19.1 分」这句话的分母里,有一部分是作者的出题口味。
而人类偏好那 84.3% 是相对外部基线的,这一格反而比 VABench 上的分数更可信一些。当一个数字更难被质疑时,作者往往不把它放最前面——这算个观察。
另外,摘要没有给出:VABench 的 56.5 → 75.6 是哪个模型、哪个采样设置、跑了多少条、分数是均值还是最优。12 位作者、多任务 RL、600 条基准,这些数字背后的方差在摘要里核不到。
- 【直引】摘要:Upgrading the generation tools further raises the score to 86.1 without additional agent training。
- 【推论】这其实是个关于长期成本结构的观察。一个 agent 系统里,「训练得到的能力」和「能调用到的最好工具」是两个独立的量,后者可以持续增长而前者不能。所以真正的工程问题是:你要投多少去训练一个会挑工具的 agent,vs 直接把最好的工具接上? 论文的数据暗示:先接工具,收益更快。
- 【判断】这篇的正确读法不是「多任务 agent RL 能提 19 分」,而是「在工具链会持续变快的领域,agent 训练的边际价值会被工具升级稀释」。这三行数字里最容易被引用的 19.1,其实是最会过时的一个;86.1 和 84.3% 才是这篇论文的寿命所在。