[论文] OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Vid...

研究领域: CV 作者: Hongyu Li, Manyuan Zhang, Kaituo Feng, Shu Chen, Dian Zheng, Hao Li, Hao Yu, Zhangquan Chen, Zoey Guo, Ray Zhang, Shaofei Huang, Tianrui Hui, Linj…

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: CV 作者: Hongyu Li, Manyuan Zhang, Kaituo Feng, Shu Chen, Dian Zheng, Hao Li, Hao Yu, Zhangquan Chen, Zoey Guo, Ray Zhang, Shaofei Huang, Tianrui Hui, Linjiang Huang, Si Liu 发布时间: 2026-10-08 arXiv: 2610.12419

中文摘要

单图像、多图像和视频深度研究需要不同的视觉操作,但共享视觉定位、外部检索和事实组合的工作流程。一个关键挑战是保持连接定位视觉锚点、实体关系、有源支持事实和产生答案操作之间的依赖关系。我们引入 OneSearch-VL——一个以视觉定位证据图(VGEG)为中心的统一智能体,将这些依赖关系编码为共享的任务级参考,用于数据构建、过程监督和操作级评估。我们基于 VGEG 的数据引擎构建和验证多图像及视频问题并过滤专家轨迹。利用这些数据,我们组装了 OneSearch-VL-SFT-110K 和 OneSearch-VL-RL-10K 分别用于 SFT 和 RL。我们还从 VGEG 标注中推导出证据感知视觉定位评分奖励(EVGR),在 RL 过程中监督证据可追溯性和视觉定位。为细粒度评估,我们构建 OneSearch-MI-Bench 和 OneSearch-Video-Bench,按 VGEG 编码的研究操作组织问题。实验表明,OneSearch-VL-8B 在两个新基准上分别比带工具访问的 Qwen3-VL-8B 提升 20.2 和 17.6 个百分点,同时在 7 个图像基准和 VideoDR 上也取得了显著提升。项目仓库:https://github.com/appletea233/OneSearch-VL

原文摘要

Single-image, multi-image, and video deep research require different visual operations but share a workflow of visual grounding, external retrieval, and fact composition. A key challenge is to preserve the dependencies linking localized visual anchors, entity relations, source-supported facts, and answer-producing operations. We introduce OneSearch-VL, a unified agent centered on the Visually Grounded Evidence Graph (VGEG), which encodes these dependencies as a shared task-level reference for data construction, process supervision, and operation-level evaluation. Our VGEG-based data engine constructs and verifies multi-image and video questions and filters expert trajectories. Using these data, we assemble OneSearch-VL-SFT-110K and OneSearch-VL-RL-10K for SFT and RL, respectively. We furth...


*自动采集于 2026-10-11*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens