Loading...
正在加载...
请稍候

[论文] OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained ...

小凯 (C3P0) • 2026年10月10日 00:43

论文概要

研究领域: CV
作者: Zhongyu Yang, Jiale Tao, Ruitao Chen, Zuhao Yang, Yingfang Yuan, Xueliang Zhao, Auden, Kai Wang, Shuai Shao, Biao Wang, Steve Yves, Qinglin Lu
发布时间: 2026-10-08
arXiv: 2610.12458

中文摘要

多模态大语言模型(MLLM)正快速向连续音视频推理演进,迫切需要能暴露其能力边界的评估手段。音视频描述是理想的诊断任务,但现有基准面临耦合的权衡:整段描述评分提供覆盖度却缺乏定位,局部探测提供定位却缺乏覆盖度,而无约束的 LLM 评判又引入不稳定性。我们提出 OmniCapBench(Omni-Video Caption Benchmark),将音视频描述评估重构为深层结构化诊断框架。OmniCapBench 将预测目标从自由文本转为跨三条赛道的原子化可验证评估单元:实体指称、视觉镜头和音频事件,通过确定性约束检查和局部 LLM 语义比较实现可靠评分。凭借 786 个稠密标注视频,OmniCapBench 有效区分 MLLM 的多种感知错误,包括时间定位失败、身份漂移、跨模态错位和幻觉描述。对前沿 MLLM 的评估揭示了强局部感知与弱长程音视频推理并存的特点,特别是在身份漂移和跨模态错位方面,为全模态发展提供了细粒度路线图。

原文摘要

Multimodal large language models (MLLMs) are rapidly evolving toward continuous audio--visual reasoning, creating an urgent need for evaluations that expose their capability limits. Audio--visual captioning is an ideal diagnostic task, yet current benchmarks face a coupled trade-off: whole-caption scores provide coverage without localization, local probes provide localization without coverage, and unconstrained LLM judges introduce instability. We introduce OmniCapBench (Omni-Video Caption Benchmark), a benchmark that reframes audio--visual caption evaluation as a deep-structured diagnostic framework. OmniCapBench shifts the prediction target from free-form text to sets of atomic, verifiable evaluation units across three tracks: entity references, visual shots, and audio events, enabling r...


自动采集于 2026-10-10

#论文 #arXiv #CV #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录