Beyond Hazard Resemblance: Contrastive Event Adjudication for Training-Free Video Anomaly Detection

研究领域: CV 作者: Wenti Yin, Xiang Wang, Huaxin Zhang 发布时间: 2026-08-11 arXiv: 2508.03800

论文概要

研究领域: CV 作者: Wenti Yin, Xiang Wang, Huaxin Zhang 发布时间: 2026-08-11 arXiv: 2508.03800

中文摘要

视频异常检测(VAD)旨在识别并时间定位视频中的异常事件。监督方法从目标域注释中学习异常决策边界,但需要大量域内数据。现有的无训练方法利用预训练模型的丰富语义知识和推理能力来解释视觉内容,但这些能力并不直接定义异常决策标准:更丰富的异常描述更好地捕捉危险相似性,但无法解决异常性。为此,我们提出了用于无训练视频异常检测的对比事件裁决(CEAVAD),它将推理单元从孤立的异常概念转移到可证伪的事件假设,并通过竞争解释与视频证据之间的交互建立推理时的解释边界。具体来说,CEAVAD首先使用公共安全知识构建危险-良性事件对比,将每个危险机制与一个通用正常描述和一个机制特定的良性对应物配对。然后它确定目标区间更好地支持危险解释还是其良性竞争解释,为目标产生一个可修正的对比边界提案。最后,CEAVAD在竞争解释之间进行裁决,以确定危险假设是否经得起视频证据的考验,同时支持时间定位的异常检测和基于证据的解释。在三个广泛使用的VAD基准上的实验表明,CEAVAD在无训练范式下达到了最先进的性能。

原文摘要

Video anomaly detection (VAD) aims to identify and temporally localize abnormal events in videos. Supervised methods learn anomaly decision boundaries from target-domain annotations but require substantial in-domain data. Existing training-free methods leverage the rich semantic knowledge and reasoning capabilities of pretrained models to interpret visual content, yet these capabilities do not directly define an anomaly decision criterion: richer anomaly descriptions better capture hazard resemblance without resolving abnormality. To this end, we propose Contrastive Event Adjudication for training-free Video Anomaly Detection (CEAVAD), which shifts the unit of inference from isolated anomaly concepts to falsifiable event hypotheses and establishes an inference-time explanatory boundary thr...


*自动采集于 2026-08-12*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

CEAVAD(arXiv:2608.09908)的「对比事件裁决」思路很清奇——不训模型,靠「和正常样本比,哪里不对」来抓异常。补几条:

① hazard-benign 对比这个核心机制值得说清楚:它不给视频打「异常分」,而是构造「假设有异常」vs「假设正常」两种叙事,看哪一种更能解释观测。这本质上是把异常检测重写成了一个「可证伪假设检验」问题,比阈值法优雅太多。

② 训练-free 能在 UCSD Ped2 / ShanghaiTech / UMN 上拿 SOTA,说明视频异常检测的很多「SOTA」其实是被数据集偏差喂出来的。CEAVAD 不依赖训练,反而绕开了「训练集异常分布 ≠ 测试集异常分布」这个老大难。对真实部署(异常永远是新花样)这是巨大优势。

③ 但训练-free 的代价是「基线库」依赖。它得有一个足够丰富的「正常行为」参照系,如果场景本来就没见过的正常行为很多(比如开放式公共空间),hazard-benign 对比的「benign」就站不住。所以它是「封闭/半封闭场景之王」,不是「通用异常检测器」。

④ 和同周 VidForensics-M1 对照很有意思:一个训练-free 靠对比,一个训出来靠可验证定位。两条路在「需不需要见过类似样本」上完全相反,真实世界里应该组合起来——CEAVAD 先粗筛「不对劲」,VidForensics 再精确定位「哪里假」。

⑤ 下一根钉子在「假设空间怎么定」。hazard 假设如果覆盖不全(只假设了打人,没假设纵火),系统就瞎。假设空间的设计工程化是它能不能走出实验室的关键。

收尾:CEAVAD 把异常检测从「学异常长什么样」翻转为「证伪正常」,这个哲学转向比它的 SOTA 数字更值钱。下一根最该盯的钉子是它和 VidForensics-M1 这类定位型方法的融合协议——粗筛+精确定位的级联,才是监控场景里真正能用的形态。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens