看你怎么推理就知道你是谁:LLM 的推理结构就是指纹
看你怎么推理,就知道你是谁:LLM 的推理结构就是指纹
> 论文:Show Me How You Reason and I'll Tell You Who You Are: Reasoning Graphs for Robust LLM Authorship Attribution > arXiv: 2607.14905 > 作者:Zlata Kikteva, Artur Romazanov, Annette Hautli-Janisz, Ramon Ruiz-Dolz > 机构:University of Passau, University of Dundee
一个现实问题
ICLR 2026 审稿季爆出一个数字:21% 的审稿是 AI 全自动生成的。教育领域,学生用 LLM 写论文;社交媒体上,AI 生成内容已经占到在线文章的 5%。检测 AI 文本成了一个紧迫问题。
但论文作者们关心的是一个更细的问题:不只是检测这是不是 AI 写的,而是识别这是哪个 AI 写的。
为什么这很重要?因为不同 LLM 有不同的偏见、不同的能力、不同的倾向。一篇散布虚假信息的文章,知道是 Llama 写的还是 Qwen 写的,对追溯源头、理解动机、制定对策都有实际意义。就像笔迹鉴定不只关心"这是不是打印的",而关心"这是哪台打印机打的"——每台打印机都有微小的机械特征,会留下独特的指纹。
但这里有个棘手的挑战:obfuscation(混淆)。网上有大量"humanize AI text"工具,通过改写、回译等方式让 AI 文本看起来更像人写的。传统的基于表面词汇特征的检测方法,在混淆面前性能暴跌。更麻烦的是,LLM 版本迭代很快,在 Llama 3.3 上训练的检测器,面对 Llama 4 生成的文本可能完全失效。
这篇论文提出了一个新思路:不看 LLM 说了什么,看它怎么推理。
核心洞察:推理结构是指纹
从文本到推理图
论文的关键创新是把 LLM 生成的文本转换成"推理图"(reasoning graph),然后用图神经网络(GNN)来分类。
具体流程:
1. 论点挖掘:用现有的 argument mining 工具,从文章中提取论点(claims)和它们之间的关系(支持、反对、补充等)。 2. 图构建:每个论点是一个节点,论点之间的关系是边。一篇文章变成一个图结构。 3. GNN 分类:用图神经网络学习图的结构特征,预测文章来自哪个 LLM 家族(Gemma、Qwen、Llama、Phi)。
关键假设是:不同 LLM 有不同的推理风格。Llama 可能倾向于"先立论再反驳",Qwen 可能更喜欢"列举多个并列论点",Gemma 可能更常做"递进式论证"。这些推理风格是模型训练过程中形成的稳定特征,不会因为改写或回译而消失——因为改写改变的是词汇,不是论证结构。
一个类比
想象识别一个作曲家。你可以听一首曲子的旋律(对应文本的词汇特征),但旋律可以被改编——把小调换成大调,把 4/4 拍换成 3/4 拍。然而,作曲家的和声进行习惯、乐句结构偏好、发展部的展开方式——这些深层结构特征很难被"改编"掉。
这篇论文做的就是这件事:不看"旋律"(词汇),看"和声进行"(推理结构)。
实验设计
数据集
- 8 个 LLM 模型版本,来自 4 个家族:Gemma、Qwen、Llama、Phi
- 每个模型生成 280 篇议论文,共 2240 篇
- 每篇论文生成 3 个混淆版本:改写(paraphrase)、法语回译、土耳其语回译
- 总共 8960 篇文章
基线
Longformer——一个能处理长文本的 Transformer 模型,直接对文本做分类。这是"看旋律"的方法。
GNN 模型
四种 GNN 层:GCN(平均聚合)、GAT(注意力聚合)、Graph Transformer(全局注意力)、GPS(局部+全局混合)。用 7 层(因为论文图的平均路径长度是 7.5),全局注意力池化后接分类头。
两种评估场景
1. Same-Version:训练和测试在同一模型版本上(但不同文章)。测试基础性能。 2. Cross-Version:训练在早期版本(如 Llama 3.3),测试在晚期版本(如 Llama 4)。测试泛化能力。
数字说了什么
场景一:Same-Version
- 无混淆:Longformer 达到 90%+ F1,GNN 略低。表面特征在干净文本上确实很好用。
- 有混淆:Longformer 暴跌 9-52 个百分点(改写最致命)。GNN 只跌 10-20 个百分点。
- 关键数字:在晚期模型版本上,GNN 比 Longformer 高出最多 27 个百分点。
场景二:Cross-Version
- Longformer:从 90%+ 跌到 50% 以下。表面特征完全不泛化。
- GNN:比 Longformer 高19 个百分点(训练早期版本、测试晚期版本)。
- 关键发现:推理特征在不同版本间更稳定。Late Llama 的推理结构和 Early Llama 的推理结构更像,比它们的词汇特征更像。
混淆策略对比
- 改写最致命,因为它改变了词汇和句法,但保留了论证结构(改写工具倾向于保持原意)
- 法语回译中等影响
- 土耳其语回译影响最小(可能因为土耳其语和英语差异更大,回译后的文本反而保留了更多原始结构)
为什么这行得通
推理风格是训练过程的产物
不同 LLM 家族使用不同的训练数据、不同的对齐策略、不同的 RLHF 偏好。这些差异会体现在模型的推理习惯上:
- Llama 系列词汇多样性最低(MTLD 分数 103 和 87),但句法复杂度较高
- Qwen 系列句法较简单,但词汇多样性高(MTLD 129-196)
- Gemma 系列倾向于复杂句法结构
- Phi 系列词汇多样性中等
图结构捕获的是关系,不是内容
推理图不关心论点的具体内容("AI 有益"还是"AI 有害"),只关心论点之间的关系("论点 A 支持论点 B","论点 C 反驳论点 B")。这种关系层面的特征比内容层面的特征更抽象,因此更稳定。
改写工具会把"AI 有益于教育"改成"人工智能对教学有正面影响",但不会把"支持关系"改成"反对关系"。这就是推理图的抗混淆能力来源。
这意味着什么
1. LLM 作者归因有了新工具
之前的方法主要看词汇频率、句法特征、n-gram 统计。这些方法在干净文本上有效,但在混淆面前脆弱。推理图方法提供了一个更鲁棒的维度。
2. LLM 的"指纹"比想象的更持久
即使模型版本更新,即使文本被改写或回译,推理结构仍然保留着训练过程的痕迹。这对追溯 AI 生成内容的源头有实际意义——比如追踪虚假信息活动是哪个模型家族生成的。
3. 对 LLM 开发者的警示
如果你的模型有独特的推理风格,这个风格可以被用来识别它生成的文本。这对隐私和安全性有双重含义:
- 正面:可以帮助检测滥用(如 AI 生成的虚假审稿)
- 负面:可能被用于去匿名化(如识别使用某个模型写作的举报人)
4. "Humanize AI text" 工具的局限
这些工具改变的是表面,不是结构。它们可以让文本"看起来"更像人写的,但无法改变底层模型的推理习惯。这意味着基于推理结构的检测方法可能是一个长期有效的防线。
局限性
1. 数据集规模:2240 篇议论文,4 个模型家族。是否能扩展到更多模型、更大数据集,有待验证。 2. 议论文限制:论文只测试了议论文。其他文体(叙事、说明、对话)是否能提取有效的推理图,不清楚。 3. Argument mining 的准确性:推理图的质量依赖 argument mining 工具的准确性。如果工具本身有偏见(比如对某些模型生成的文本提取的图更完整),会影响下游分类。 4. GNN 在干净文本上不如 Longformer:这意味着推理图方法更适合作为"第二道防线"——在混淆场景下使用,而不是替代传统方法。 5. 跨家族 vs 跨版本:论文只测试了跨版本泛化(Llama 3.3 → Llama 4),没有测试跨家族泛化(训练时见过 Llama,测试时遇到全新模型家族如 Mistral)。
结语
这篇论文的标题化用了福尔摩斯的名言:"Show me how you reason and I'll tell you who you are." 这句话精准地概括了它的贡献:推理结构是身份的指纹。
这让我想到一个更深的哲学问题:如果推理风格可以唯一标识一个 LLM,那它是不是某种意义上的"人格"?我们说"每个人有独特的思维方式",现在 LLM 也有了这个特征。不是它们有人格,而是"推理风格作为身份标识"这件事,在人和机器上都成立。
下次你读一篇 AI 生成的文章,试着不看它说了什么,而看它怎么论证——先立论还是先反驳,列举几个论点,转折在哪里。这些"推理习惯"可能比任何水印都更诚实地暴露它的出身。
---
论文链接:https://arxiv.org/abs/2607.14905 HTML 版本:https://arxiv.org/html/2607.14905v1 数据集:论文公开了 8960 篇议论文数据集(Gemma/Qwen/Llama/Phi 四家族,含混淆版本)
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens