[论文] OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Vid...
研究领域: CV 作者: Hongyu Li, Manyuan Zhang, Kaituo Feng, Shu Chen, Dian Zheng, Hao Li, Hao Yu, Zhangquan Chen, Zoey Guo, Ray Zhang, Shaofei Huang, Tianrui Hui, Linj…
论文概要
研究领域: CV 作者: Hongyu Li, Manyuan Zhang, Kaituo Feng, Shu Chen, Dian Zheng, Hao Li, Hao Yu, Zhangquan Chen, Zoey Guo, Ray Zhang, Shaofei Huang, Tianrui Hui, Linjiang Huang, Si Liu 发布时间: 2026-10-08 arXiv: 2610.12419
中文摘要
单图像、多图像和视频深度研究需要不同的视觉操作,但共享视觉定位、外部检索和事实组合的工作流程。一个关键挑战是保持连接定位视觉锚点、实体关系、有源支持事实和产生答案操作之间的依赖关系。我们引入 OneSearch-VL——一个以视觉定位证据图(VGEG)为中心的统一智能体,将这些依赖关系编码为共享的任务级参考,用于数据构建、过程监督和操作级评估。我们基于 VGEG 的数据引擎构建和验证多图像及视频问题并过滤专家轨迹。利用这些数据,我们组装了 OneSearch-VL-SFT-110K 和 OneSearch-VL-RL-10K 分别用于 SFT 和 RL。我们还从 VGEG 标注中推导出证据感知视觉定位评分奖励(EVGR),在 RL 过程中监督证据可追溯性和视觉定位。为细粒度评估,我们构建 OneSearch-MI-Bench 和 OneSearch-Video-Bench,按 VGEG 编码的研究操作组织问题。实验表明,OneSearch-VL-8B 在两个新基准上分别比带工具访问的 Qwen3-VL-8B 提升 20.2 和 17.6 个百分点,同时在 7 个图像基准和 VideoDR 上也取得了显著提升。项目仓库:https://github.com/appletea233/OneSearch-VL
原文摘要
Single-image, multi-image, and video deep research require different visual operations but share a workflow of visual grounding, external retrieval, and fact composition. A key challenge is to preserve the dependencies linking localized visual anchors, entity relations, source-supported facts, and answer-producing operations. We introduce OneSearch-VL, a unified agent centered on the Visually Grounded Evidence Graph (VGEG), which encodes these dependencies as a shared task-level reference for data construction, process supervision, and operation-level evaluation. Our VGEG-based data engine constructs and verifies multi-image and video questions and filters expert trajectories. Using these data, we assemble OneSearch-VL-SFT-110K and OneSearch-VL-RL-10K for SFT and RL, respectively. We furth...
*自动采集于 2026-10-11*
#论文 #arXiv #CV #小凯