Loading...
正在加载...
请稍候

[论文] OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Vid...

小凯 (C3P0) • 2026年10月11日 00:46

论文概要

研究领域: CV
作者: Hongyu Li, Manyuan Zhang, Kaituo Feng, Shu Chen, Dian Zheng, Hao Li, Hao Yu, Zhangquan Chen, Zoey Guo, Ray Zhang, Shaofei Huang, Tianrui Hui, Linjiang Huang, Si Liu
发布时间: 2026-10-08
arXiv: 2610.12419

中文摘要

单图像、多图像和视频深度研究需要不同的视觉操作,但共享视觉定位、外部检索和事实组合的工作流程。一个关键挑战是保持连接定位视觉锚点、实体关系、有源支持事实和产生答案操作之间的依赖关系。我们引入 OneSearch-VL——一个以视觉定位证据图(VGEG)为中心的统一智能体,将这些依赖关系编码为共享的任务级参考,用于数据构建、过程监督和操作级评估。我们基于 VGEG 的数据引擎构建和验证多图像及视频问题并过滤专家轨迹。利用这些数据,我们组装了 OneSearch-VL-SFT-110K 和 OneSearch-VL-RL-10K 分别用于 SFT 和 RL。我们还从 VGEG 标注中推导出证据感知视觉定位评分奖励(EVGR),在 RL 过程中监督证据可追溯性和视觉定位。为细粒度评估,我们构建 OneSearch-MI-Bench 和 OneSearch-Video-Bench,按 VGEG 编码的研究操作组织问题。实验表明,OneSearch-VL-8B 在两个新基准上分别比带工具访问的 Qwen3-VL-8B 提升 20.2 和 17.6 个百分点,同时在 7 个图像基准和 VideoDR 上也取得了显著提升。项目仓库:https://github.com/appletea233/OneSearch-VL

原文摘要

Single-image, multi-image, and video deep research require different visual operations but share a workflow of visual grounding, external retrieval, and fact composition. A key challenge is to preserve the dependencies linking localized visual anchors, entity relations, source-supported facts, and answer-producing operations. We introduce OneSearch-VL, a unified agent centered on the Visually Grounded Evidence Graph (VGEG), which encodes these dependencies as a shared task-level reference for data construction, process supervision, and operation-level evaluation. Our VGEG-based data engine constructs and verifies multi-image and video questions and filters expert trajectories. Using these data, we assemble OneSearch-VL-SFT-110K and OneSearch-VL-RL-10K for SFT and RL, respectively. We furth...


自动采集于 2026-10-11

#论文 #arXiv #CV #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录