Pangram 4:当 AI 文本检测器开始研究自己
一封邮件的审判
想象这个场景:一位大学教授收到一份学生论文。文笔流畅,论证清晰,引用规范。但教授心里有一丝疑虑——这学期 ChatGPT 发布了新版本,班上突然多了好几篇"好得不真实"的作业。
教授打开 Pangram 4,粘贴文本,点击检测。0.3 秒后结果返回:98.7% AI 生成。教授松了口气——终于抓到了。但学生申诉:这论文是我自己一个字一个字写的。教授犹豫了。Pangram 4 的准确率号称 99.98%,但假阳性率是多少?
2026 年 7 月 29 日,Pangram Labs 在 arXiv 发布了 Pangram 4 的技术报告。数字令人印象深刻:AUROC 0.9916,假阳性率 0.0041%,假阴性率 0.3396%。但真正有意思的不是这些数字——而是这篇技术报告本身揭示了一个更深的问题:当 AI 文本检测器开始研究自己,它发现的不是"AI 写作的特征",而是"人类写作的特征"。
问题的规模:互联网正在被 AI 淹没
论文开篇给出一组令人心悸的数据:
- 互联网新增内容中超过三分之一是 AI 生成的
- 长篇社交媒体帖子中 26% 是 AI 生成的
- 新闻文章中 9% 是 AI 生成的
- 机器学习会议的同行评审中 21% 是 AI 生成的
这造成了一种"努力不对称":AI 可以几乎零成本地生成看似专业的文本,但读者仍然要承担理解内容是否真实、是否有根据、是否值得信任的全部认知负担。Pangram 4 的目标就是打破这种不对称。
架构:MoE 骨干 + 多任务头
Pangram 4 的架构设计有几个值得注意的决策:
骨干模型: 基于一个开源的 MoE(混合专家)模型。选择 MoE 而非密集模型,可能是因为 MoE 在参数效率和推理成本之间的平衡更好——这对于一个需要大规模部署的检测器至关重要。
多任务头设计: 不是训练一个单一的"AI vs 人类"分类器,而是训练多个专门头:
1. 段落级编辑检测:检测文本中哪些片段被 AI 编辑过 2. 混合署名检测:检测文本是否为 AI-人类混合创作 3. 人性化检测:检测文本是否经过"人性化"工具处理(试图逃避 AI 检测) 4. Token 级溯源头:在 token 级别标注每个 token 是 AI 生成还是人类书写
这种多任务设计反映了一个关键认知:"AI 生成"不是一个二元标签,而是一个光谱。文本可能完全 AI 生成、完全人类书写、AI 生成后人类编辑、人类书写后 AI 润色、多轮 AI-人类协作……每个任务头专门处理一种混合模式。
Repeat2 技巧:让模型"看两遍"
论文中一个看似简单但效果显著的技巧:Repeat2——把输入 token 序列复制一遍并拼接,让模型"看两遍"。
这听起来像是一个 hack,但有深刻的原理。在因果注意力(causal attention)下,序列最后位置的隐藏表示 $\mathbf{h}_S$ 能看到整个输入窗口。但模型对窗口开头的信息可能"看不够仔细"。通过重复输入,模型有第二次机会在更丰富的上下文中重新处理每个 token。
这和人类阅读校对时的策略一致——重要文档我们会读两遍,第一遍理解内容,第二遍检查细节。Repeat2 把这个策略内置到了模型架构中。
Token 级溯源:CRF 解码
Pangram 4 最有技术含量的部分是 token 级溯源头。目标是在 token 级别标注每个 token 是 AI 生成还是人类书写——这比段落级检测难得多。
论文使用了一个经典的序列标注方法:条件随机场(CRF)解码。CRF 在 2000 年代是 NLP 的主力工具——命名实体识别、词性标注都用它。在 Transformer 时代,它被神经网络端到端训练取代了。但 Pangram 4 把它重新请回来了。
为什么?因为 token 级标注有一个关键约束:标签应该有空间一致性。如果一个 token 是 AI 生成的,它周围的 token 大概率也是 AI 生成的——AI 生成通常是连续的片段,而非零散地散布在人类文本中。CRF 的转移矩阵天然建模这种空间一致性,而纯 token 级分类器可能产生"AI-人-AI-人-AI"这种不合理的交替标签。
这是"换层面解决问题"的又一个例子:当端到端神经网络在某个任务上遇到瓶颈,回到更简单的统计模型但加入结构约束(CRF 的转移矩阵),可能比堆更多参数更有效。
软 N-Gram 标注:从 token 到子句
另一个有意思的技术是软 N-Gram 标注。不是在 token 级别标注,而是在子句/短语级别。这反映了 AI 文本和人类文本在局部模式上的差异——某些 n-gram 组合在 AI 文本中更频繁,某些在人类文本中更频繁。
这种标注方式让模型能捕捉到风格特征——AI 倾向于使用某些句式、某些过渡词、某些论证结构。这些特征在 token 级别不可见,在段落级别太粗,在 n-gram 级别刚好。
人性化攻击:对抗的军备竞赛
AI 检测器面临的最大挑战是人性化工具——专门设计来逃避 AI 检测的工具。它们通过改写、同义词替换、句式重组等方式,试图让 AI 文本看起来更像人类写的。
Pangram 4 的应对策略是专门的辅助人性化检测头。这个头只在主检测器判断"有 AI 使用"时才激活,做二次判断:这是原始 AI 文本,还是经过人性化处理的 AI 文本?
论文报告了针对 12 种商业化人性化工具的检测结果:
| 指标 | 数值 |
|---|---|
| 准确率 | 96.82% |
| F1 | 0.9678 |
| 假阳性率(AI 文本被误判为人性化) | 1.93% |
| 假阴性率(人性化文本被误判为 AI) | 4.43% |
主动学习:让模型自己选样本
论文提到了主动学习策略——模型自己选择最难的样本进行标注和训练。这是应对"长尾问题"的标准做法:大部分 AI 文本很容易检测,但有一小部分"边界情况"——AI 生成但看起来很像人类写的,或者人类写但看起来很像 AI 生成的——需要专门训练。
主动学习的做法是:让当前模型对未标注样本做预测,选择模型最不确定的样本(比如置信度在 0.5 附近的)交给人类标注者。这些"hard negatives"是最有训练价值的样本。
这和人类学习的方式一致——我们不把时间平均分配给所有题目,而是集中精力攻克最难的那些。
分布外泛化:真正的考验
Pangram 4 技术报告中我最看重的不是 AUROC 0.9916 这个数字——在分布内测试集上达到这个数字虽然不容易但并非不可能。我更看重的是分布外泛化和对抗鲁棒性的实验。
AI 检测器的真正挑战是:
- 能否检测到训练时没见过的 LLM 生成的文本?
- 能否检测到经过改写工具处理的文本?
- 能否检测到混合了人类和 AI 创作的文本?
评测盲区定律的再一例
这篇技术报告也印证了"评测盲区定律"。如果只看 AUROC 0.9916,Pangram 4 看起来已经"解决问题了"。但仔细看技术报告,会发现 AI 文本检测远未解决:
- 混合署名检测:AI-人类协作文本的检测准确率显著低于纯 AI 文本
- 细粒度编辑检测:哪些片段被 AI 编辑过,定位精度有限
- 人性化对抗:最好的逃避工具仍有 8.5% 的概率逃过检测
- 领域迁移:训练数据覆盖的领域和语言之外的检测效果未知
结语:检测器的悖论
Pangram 4 技术报告揭示了一个深层悖论:AI 文本检测器和 AI 文本生成器在训练同一个底层能力。
检测器需要理解"什么样的文本像 AI 写的",这本质上是在建模 AI 的生成分布。而生成器需要理解"什么样的文本像人类写的",这本质上是在建模人类的写作分布。两者在互相逼近对方的建模能力。
这意味着 AI 检测不会是一个"一次性解决"的问题。随着生成模型进步,检测器也必须进步。这是一场军备竞赛,而 Pangram 4 只是其中一个回合。
但论文也暗示了一个更积极的可能:如果检测器足够好,它可能改变生成器的训练目标。如果 AI 生成器知道自己的输出会被精准检测,它可能会被引导去生成更"人类化"的文本——这反过来又会让检测更难。这个博弈的均衡点在哪里,目前没有人知道。
也许,最终我们会接受一个混合署名的世界——文本不再被简单分为"AI 生成"或"人类书写",而是像学术论文一样标注每个段落的贡献者。Pangram 4 的 token 级溯源头,可能就是这个未来的雏形。
---
论文信息:
- 标题:Pangram 4 Technical Report
- 作者:Ben Glickenhaus, Katherine Thai, Jenna Russell, Elyas Masrour, Yue Han, Max Spero, Bradley Emi
- 机构:Pangram Labs
- arXiv:2607.27183
- 发布时间:2026-07-29