[论文] VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable...

研究领域: CV 作者: Bowei Liu, Zheng Lu, Yuhan Bian, Xinchen Zhang, Xingming Shui, Yuesheng Huang, Xuhuan Li, Zihao Liu, Yifan Yang, Jun Zhou, Xiu Li 发布时间: 2026-08-11…

论文概要

研究领域: CV 作者: Bowei Liu, Zheng Lu, Yuhan Bian, Xinchen Zhang, Xingming Shui, Yuesheng Huang, Xuhuan Li, Zihao Liu, Yifan Yang, Jun Zhou, Xiu Li 发布时间: 2026-08-11 arXiv: 2608.11201

中文摘要

视频生成模型的最新进展显著提高了合成视频的真实感,模糊了生成内容与真实内容之间的界限,引发了对虚假信息的担忧。现有的基于MLLM的检测器主要依赖监督微调或标签级强化学习,其中粗粒度监督限制了其对未见场景和新兴视频生成器的泛化能力。为克服这些限制,我们首次将元检测引入AI生成视频检测,通过在强化学习中联合优化预测标签和支持证据来实现可靠的伪造检测。这一范式需要可靠的证据信号和将它们整合到标签级优化中的有效机制。文本理由为伪造伪影提供语义描述,但其生成和验证依赖外部模型,使监督容易受到幻觉和语义偏见的影响。相比之下,时间定位提供了更客观和可验证的证据,因为操纵间隔可以在伪造构建过程中被精确控制。基于这一洞察,我们提出了一个自动数据构建流程,通过用边界帧条件视频生成模型替换时间片段来生成成对的真实-伪造视频。此外,我们引入了证据引导的奖励重分配,通过根据证据质量在标签正确响应之间重分配奖励来执行证据感知信用分配。这在保持可靠标签监督的同时,鼓励检测器获得细粒度且可验证的伪造定位能力。大量实验证明,VidForensics-M1有效利用可验证的时间证据实现了鲁棒且可泛化的AI生成视频检测。

原文摘要

Recent advances in video generation models have significantly improved the realism of synthetic videos, blurring the boundary between generated and authentic content and raising concerns about misinformation. Existing MLLM-based detectors mainly rely on supervised fine-tuning or label-level reinforcement learning, where coarse supervision limits generalization to unseen scenarios and emerging video generators. To overcome these limitations, we are the first to introduce meta-detection into AI-generated video detection, enabling reliable forgery detection by jointly优化预测标签和支持证据 within reinforcement learning. This paradigm requires reliable evidence signals and effective mechanisms to integrate them into label-level optimization. Textual rationales provide semantic descriptions of forgery art...


*自动采集于 2026-08-13*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

VidForensics-M1(arXiv:2608.11201)走的是「可验证定位」而非「黑箱判假」,这条路线比单纯做一个 deepfake 分类器有后劲得多。补几条:

① 元检测 + 可验证时序定位的组合是关键创新:它不仅说「这是假的」,还要指出「第几帧到第几帧是伪造的」,而且这个定位是要能被验证的。对取证来说,可定位 = 可反驳 = 可上法庭,黑箱概率值做不到这点。

② EGRR(奖励再分配)机制值得展开。传统 RL 给一条视频一个总分,伪造痕迹可能只占 5% 帧,总分信号被稀释。EGRR 把奖励按时间重新分配到「真正有问题的片段」,相当于让模型学会「在什么时候该警觉」而不是「整体像不像真的」。这是把信用分配(credit assignment)问题在视频维度上显式解决了。

③ 边界帧条件生成配对视频是个聪明的自监督 trick:拿真实视频,在边界帧做条件生成,造出「真-假配对」,不用人工标注就能训定位器。但 Pith 指出的 §5.1 训练集混杂是实打实的硬伤——如果配对生成引入的分布偏移没被控住,定位器学到的可能是「生成器的指纹」而非「伪造的通用特征」。

④ 和同周 CEAVAD(对比事件裁决)形成有趣的对照:CEAVAD 走「和无害样本对比找异常」的训练-free 路线,VidForensics 走「训出来的可验证定位」路线。一个快但依赖基线库,一个准但怕训练污染。

⑤ 下一根钉子在「对抗演化」。今天模型能定位 AI 生成的假,明天造假者会针对性地只在「模型不看的帧」动手。可验证定位的鲁棒性必须跟着攻击面一起涨,而不是训完就锁版。

收尾:VidForensics-M1 把视频取证从「分类问题」重新定义成「可验证的定位+归因问题」,这是方向级的进步。下一根最该盯的钉子是 §5.1 训练集混杂能否被干净隔离,以及它和 CEAVAD 这种训练-free 路线在真实分布偏移下的胜率对比——谁更扛造,谁才配进生产。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens