ATPO:安全不是一个开关而是一个旋钮——多标签视频安全检测的可控精度-召回
研究领域: Video Safety / RLHF 作者: Guangyu Yang, Haoze Yang, et al. 机构: 小红书 / 上海交大 arXiv: 2610.02019 代码: bruceyg.github.io/ATPO-project-page
论文概要
研究领域: Video Safety / RLHF 作者: Guangyu Yang, Haoze Yang, et al. 机构: 小红书 / 上海交大 arXiv: 2610.02019 代码: bruceyg.github.io/ATPO-project-page
一条视频可以同时"不安全"吗?
想象你在审核一条短视频。画面里,一个人在打架(暴力),背景音乐有侮辱性歌词(仇恨言论),评论区有人发布了骚扰信息(骚扰)。
这条视频"不安全"吗?当然。但它不安全的方式是单一的"不安全=是"吗?不是。它同时涉及暴力、仇恨言论、骚扰三个类别。如果你只回答"不安全",你丢失了大量信息——审核员不知道该删视频、删音乐还是删评论。
这就是现有视频安全检测系统的第一个问题:它们把安全检测简化成了二分类(安全/不安全),而忽略了不安全内容的多标签本质。
第二个问题更微妙:不同的审核场景需要不同的精确率-召回率权衡。
- 人工复核团队:宁可多标记(高召回),让审核员来过滤误报
- 自动下架系统:宁可漏掉(高精确),避免错误删除合法内容
- 不同类别(暴力 vs 色情)有不同的法律阈值
ATPO 的两个创新
ATPO(Adaptive Tversky Policy Optimization)是小红书联合上海交大提出的方案,用强化学习解决这两个问题。
创新一:多标签视频安全检测(Multi-VSD)
不再做二分类,而是同时预测多个不安全类别。模型输出的是一组标签(暴力: 0.8, 仇恨: 0.6, 骚扰: 0.3),而不是一个"不安全"分数。
创新二:Adaptive Tversky Reward(ATR)
这是核心创新。Tversky Index 是 Tversky 在 1977 年提出的一个度量,它有两个参数 α 和 β,分别控制对假阳性(FP)和假阴性(FN)的惩罚权重:
- α 大 → 更惩罚 FP → 更保守(高精确)
- β 大 → 更惩罚 FN → 更激进(高召回)
数据说话
在 SafeWatch-Bench-Real 数据集上:
- 基线方法 Jaccard Index: 40.66
- ATPO Jaccard Index: 75.44
更重要的是"可控性"实验:ATPO 能在不同 α/β 设置下可靠地调整精确率-召回率工作点,而基线方法做不到。这意味着同一个模型可以服务于不同的审核策略——人工复核场景调高召回,自动下架场景调高精确。
一个更深的洞察
ATPO 的设计揭示了一个被广泛忽视的问题:评测指标的刚性会限制模型的实用性。
传统训练用 F1 或准确率作为目标,隐含假设是"假阳性和假阴性的代价相同"。但在真实的内容审核中,这个假设完全不成立:
- 错误删除合法内容(FP)→ 用户投诉、舆论反弹、品牌损失
- 漏掉有害内容(FN)→ 监管处罚、法律风险、平台声誉
ATPO 的 Tversky 框架把这种不对称性显式地建模到训练过程中。这不是一个技术细节,而是一个范式转变:从"优化固定目标"到"学习目标可控的策略空间"。
跨域类比
ATPO 的思路让我想到汽车的可调悬挂系统。传统悬挂是固定的——你要么调硬(操控好但颠簸),要么调软(舒适但侧倾大)。可调悬挂让你按一下按钮就能在两种模式间切换。
ATPO 做的是同一件事:不是训练一个"高精确"或"高召回"的模型,而是训练一个"可调"的模型,部署时按需切换。这在工程上的价值是显而易见的——你不需要为每个审核场景训练一个单独的模型。
概念谱系:标量幻觉的又一例
这又是一个"标量幻觉"的实例:不能问"这个模型安不安全",要问"在什么精确率-召回率权衡下、对哪些类别、在什么场景中安全"。
安全不是一个标量,而是一个多维空间。把多维空间压缩成标量,就像把一张地图压缩成一个距离数字——你确实得到了一个"答案",但丢失了所有有用的信息。
ATPO 的贡献不只是"提升了 Jaccard Index",更重要的是它把安全检测从"标量判断"解放出来,变成了"多维可控的策略空间"。
诚实评价
ATPO 也有局限。首先,Tversky 参数的选择仍然需要人工设定——论文没有讨论如何自动确定最优 α/β。其次,多标签训练需要多标签标注数据,而这类数据的获取成本远高于二分类标注。最后,论文的实验集中在视频安全,但 ATPO 的框架是否适用于其他多标签分类任务(如医疗诊断、情感分析)还需要验证。
但作为一个"把内容审核从二分类推向多标签可控"的工作,ATPO 的方向是正确的:安全不是一个开关,而是一个旋钮。
论文链接: arxiv.org/abs/2610.02019 代码和模型: bruceyg.github.io/ATPO-project-page