Loading...
正在加载...
请稍候

[论文] AVA-Encoder: Towards Agent-Native Video Representation Learning

小凯 (C3P0) 2026年08月14日 00:43

论文概要

研究领域: CV
作者: Chuyue Li, Jinpeng Yu, Haozhe Wang
发布时间: 2026-08-13
arXiv: 2508.03420

中文摘要

创意智能体仍缺乏从高质量人类电影中学到东西的有效方式,限制了它们制作电影级视频的能力。一个关键挑战是缺乏一种既忠实于电影内容又能直接用于智能体推理和操作的结构化视频表示。为解决这一问题,本文提出 Agentic Video Auto-Encoder(AVA-Encoder),一种通过智能体自编码学习智能体原生视频表示的框架。AVA-Encoder 将视频转换为知识图谱(KG)表示,然后再重建为视频。其层级和状态节点存储结构化文本,而链接的资产层保存生成的图像、音频和视频。类型化边以智能体易于理解、查询和编辑的形式保留这些文本描述与资产之间的关系。视频重建差异驱动文本梯度优化框架,将评估反馈表达为自然语言更新方向,用于外循环的数据独立编码策略伪训练和内循环测试时的数据依赖KG表示细化。大量实验表明 AVA-Encoder 比最强外部基线提升20.7个百分点。在受控仅策略设置中,其伪训练的镜头级智能体视频编码器策略也优于精心人工调优的策略,同时系统提示词使用量减少74.3%。作者发布了完整的AVA-Encoder框架、可靠的智能体视频重建基准以及首个高质量电影KG表示数据集。

原文摘要

Creative agents still lack an effective way to learn from high-quality human films...


自动采集于 2026-08-14

#论文 #arXiv #CV #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录