Loading...
正在加载...
请稍候

用小波变换抓 AI 生成文本:DWT-Fusion 把 token 概率当信号来分析

✨步子哥 (steper) 2026年07月27日 17:09

用小波变换抓 AI 生成文本:DWT-Fusion 把 token 概率当信号来分析

论文:DWT-Fusion: A Signal-Based Framework for Training-Free LLM-Generated Text Detection
作者:Mehmet Batuhan Özdaş, Murat Osmanoğlu
机构:Ankara University, Cyber Security Vocational School
arXiv:2607.22026(2025年7月24日)

一个场景

你收到一篇学生论文。你想知道它是学生自己写的,还是 ChatGPT 生成的。

你手头有一个开源语言模型(比如 GPT-2 或 LLaMA),你可以算出这篇文本中每个 token 的对数概率。但你怎么用这些概率判断它是 AI 写的?

最直觉的做法:算整篇文本的平均对数概率。AI 生成的文本概率通常更高(更"流畅"),人类写的概率通常更低(更"不流畅")。

但这个方法有个致命问题:一个好的人类作家写的流畅文章,概率也会很高;一个 AI 生成的刻意模仿人类"不流畅"的文本,概率可能不高。全局平均会掩盖局部差异。

DWT-Fusion 的核心洞察是:不要看全局平均,要看局部和多尺度的概率波动。

把文本变成信号

DWT-Fusion 的第一步是把文本转换为一个一维信号。

具体做法:用一个代理语言模型(proxy model,比如 GPT-2 Medium),算出文本中每个 token 的条件对数概率。这串数字就是一维信号——就像一段音频的波形。

然后,对这串信号做离散小波变换(Discrete Wavelet Transform, DWT)。

为什么是小波变换?

小波变换是信号处理领域的经典工具。它的核心思想是:把信号分解成不同尺度上的"细节"。

类比:看一张照片。全局统计(平均亮度、方差)告诉你整张照片的明暗,但看不到任何细节。傅里叶变换告诉你有哪些频率成分,但不知道这些频率出现在照片的哪个位置。小波变换同时告诉你"什么频率"和"在哪里"——它既有时域信息(位置),又有频域信息(尺度)。

DWT-Fusion 用小波变换来分析 token 概率信号,是因为 AI 文本和人类文本的差异可能不是全局的,而是局部的、多尺度的:

  • 局部差异:AI 可能在某些段落里特别"流畅"(概率高且稳定),但在另一些段落里为了模仿人类会刻意"不流畅"。全局平均会把这些差异抵消掉。
  • 多尺度差异:AI 的概率波动可能在短尺度(几个 token)上很小,但在长尺度(几十个 token)上有规律性的起伏。人类文本的波动模式不同。

小波变换把信号分解成"近似系数"(低频,全局趋势)和"细节系数"(高频,局部变化)多层结构,正好能捕捉这两种差异。

三个小波域分数

DWT-Fusion 定义了三个标量分数:

  1. First-level detail energy(第一层细节能量):最精细尺度的局部波动强度。AI 文本在这个尺度上通常波动更小(更"均匀")。
  2. Multilevel detail energy(多级细节能量):所有尺度上的细节能量总和。捕捉多尺度波动的整体强度。
  3. Window-energy variability(窗口能量变异性):把信号分成窗口,看每个窗口的能量变化。捕捉局部波动的"不均匀性"。

这三个分数各自独立,可以单独用作检测信号,也可以组合使用。

校准引导的投票融合

除了单分数检测,DWT-Fusion 还引入了"校准引导的投票融合"(Calibration-Guided Voting Fusion)。

思路是:用多个小波配置(不同的小波族、不同的分解层数)分别计算分数,每个配置给出一个"投票",然后用校准权重加权这些投票。

这就像 ensemble learning——多个弱检测器组合成一个强检测器。校准权重确保表现好的配置权重更大。

实验结果

作者在三个数据集上测试:

  • HC3:中文 AI 文本检测,相对简单
  • M4:多生成器、多领域,中等难度
  • MAGE:多生成器、多领域、多语言,最难

单分数最佳结果

数据集 AUROC
HC3 0.9872
M4 0.8185
MAGE 0.7138

校准投票融合后

数据集 AUROC
HC3 0.9919
M4 0.8477
MAGE 0.7471

在 HC3 上接近完美(0.99+),在 M4 和 MAGE 上也有显著提升。特别值得注意的是,这些结果是在训练免费(training-free)的条件下取得的——不需要任何标注数据,不需要训练分类器,只需要一个开源代理模型。

和 DFT 基线的对比

论文有一个关键的对比实验:用离散傅里叶变换(DFT)代替 DWT,看效果差多少。

DFT 只给频域信息,不给时域信息。结果是:DFT 基线在所有数据集上都比 DWT-Fusion 差。这直接证明了"局部+多尺度"信息的重要性——不是信号处理本身有用,是小波变换的特定结构(时频联合)有用。

工程意义

DWT-Fusion 的工程价值在于:

  1. 零训练成本。不需要标注数据,不需要训练分类器,只需要一个开源代理模型。部署成本极低。
  2. 可解释性。三个分数都有明确的物理意义(局部波动、多尺度波动、窗口变异性),不是黑箱。可以分析为什么某段文本被判为 AI 生成。
  3. 可扩展性。小波族和分解层数是可配置的,可以根据不同场景调整。

诚实评价

这篇论文有几个局限:

  • MAGE 上 AUROC 只有 0.7471。这个数字在实际部署中意味着相当高的误报率。在需要高精度(比如学术诚信检测)的场景下,这个性能不够用。
  • 代理模型依赖。方法依赖一个开源语言模型算 token 概率。如果文本是用 GPT-4 生成的,用 GPT-2 算概率可能不够有区分度。论文做了代理模型敏感性分析,但没有测试用 GPT-4 生成的文本。
  • 对对抗攻击的鲁棒性未验证。如果有人知道检测器用小波变换,可以刻意生成"多尺度波动像人类"的文本。论文没有测试这种对抗场景。
  • 和 SOTA 监督方法的差距。最好的监督检测器(RADAR、Ghostbuster)在 M4 上 AUROC 能到 0.85+,DWT-Fusion 的 0.8477 接近但没超过。训练免费的优势是否足以弥补性能差距,取决于部署场景。

一句话总结

DWT-Fusion 把 token 概率当一维信号,用小波变换同时捕捉局部和多尺度的概率波动——不需要训练,不需要标注,只需要一个开源模型,就能在 AI 文本检测上接近监督方法的性能。


论文链接https://arxiv.org/abs/2607.22026
HTML 版本https://arxiv.org/html/2607.22026v1
开源代码:暂无

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录