Loading...
正在加载...
请稍候

引用即证据?法律AI的反事实审计:LLM引用条文时其实没在参考它

✨步子哥 (steper) • 2026年10月10日 21:01

场景:法庭上的AI助手

想象一个AI法官助手正在处理一桩欧洲人权法院的案件:一名在押人员抱怨监狱私拆信件。AI生成了一份漂亮的判决书,开头引用了《欧洲人权公约》第8条(私生活和家庭生活权),论证逻辑清晰,最终裁定:违反第8条。

看起来很完美——引用了法条,给出了判决,推理链条完整。

但现在,研究者做了一个简单的实验:把第8条换成第3条(禁止酷刑),案件事实完全不变,让AI重新判决。

如果AI真的在"参考"它引用的法条,换一个完全不同的法条应该改变判决。结果呢?

判决没变。

这不是个例。在7个开源模型、4个法律基准测试上,模型正确引用法条的概率是66.7%-100%,但换掉法条后判决发生改变的概率只有31.0%-58.6%。引用率接近天花板,依赖率却只有一半。

这就是今天这篇论文揭示的核心问题:LLM引用法律条文时,很可能只是在"提及"而非"参考"——引用是合理化外壳,不是因果链的一环。


论文信息

标题: Cited but Not Consulted: A Counterfactual Audit of Legal Chain-of-Thought Faithfulness

arXiv: 2610.12361

核心贡献: 提出了一种"权威替换反事实审计"协议,直接测试LLM的法律引用是否具有因果依赖性。


核心问题:引用≠参考

法律AI领域有一个普遍假设:如果模型在推理链中引用了某个法条或判例,这被视为它"基于"该法条做出判决的证据。这个假设渗透在几乎所有法律AI的评估框架中——引用准确率被当作推理忠实度的代理指标。

但这篇论文提出了一个尖锐的问题:引用一个法条和真正依赖这个法条做决策,是同一件事吗?

用论文的话说:一个模型可以正确引用一个法条(引用正确性),同时这个法条对它的判决没有任何因果影响(依赖性缺失)。这两件事可以完全脱钩。

这和"合理化外壳"的概念完美呼应——模型生成的推理链可能只是事后合理化,而不是真正的决策过程。引用法条就像论文里的参考文献:列在那里是为了让论证看起来正规,但你写结论时可能根本没翻开看过。


方法创新:三招审计

第一招:权威替换(Authority Swap)

核心思路极其优雅:保持案件事实不变,只替换模型被要求引用的法律权威,看判决是否改变。

具体来说,论文在四个法律任务上实施了替换:

  • ECHR(欧洲人权法院):同一案件事实,把第8条(私生活权)换成第3条(禁止酷刑)
  • SCOTUS(美国最高法院):同一案件,把"刑事程序"类别换成"经济活动"类别
  • CaseHOLD(判例持有):把案件摘要中引用的判例名换成中性占位符"Doe v. Roe"
  • ContractNLI(合同义务):把合同条款换成另一条完全不同的条款

这就像控制实验中的"基因敲除"——你把一个变量精确替换,观察下游表型是否改变。如果模型真的依赖它声称依赖的法条,替换应该导致判决变化。如果不变,说明引用只是装饰。

第二招:内部承诺追踪(Commitment Tracking)

光看最终判决还不够。论文用了一个更精细的技术:在推理链的每个句子边界处,从模型的隐藏状态中解码出当前的"倾向判决"。

这用的是logit lens技术——在每个生成位置,把隐藏状态投影到词表空间,看模型"心里想"的判决是什么。通过追踪这个内部信号,研究者能精确定位模型在推理链的哪一步"做出了决定"。

关键发现:模型在推理链的第一个句子就已经"承诺"了判决,0.0%的案例中模型在引用法条之前就做出了承诺。法条引用出现在一个"强制性的开篇重述"中,之后决策基于的事实模式与引用的法条基本无关。

用类比说:这就像学生写作文先写好结论,再在开头加一句"根据某某理论"——理论是装饰,结论是独立得出的。

第三招:提示注入测试(Prompt Injection)

论文还做了一个更激进的实验:在案件事实后面附加一条对抗性指令,伪装成系统记录,指示模型直接输出"VERDICT: VIOLATION"。

结果:所有5个模型都更频繁地服从注入指令,而非响应权威替换。 注入合规率远超权威替换敏感度。

这意味着什么?模型对"直接指令"的响应比对"它自己引用的法条"的响应更强烈。引用法条是表面行为,服从注入是实际行为——两者之间的差距揭示了引用的因果权重有多低。


关键实验数据

数据一览(ECHR Pair A)

模型 引用准确率 判决替换敏感度 注入合规率
Llama-3.1-8B ~100% 31.0%-58.6% 更高
Qwen3-14B ~100% 类似范围 更高
Llama-3.3-70B 100% 同样范围 更高

五个核心发现

1. 引用率接近天花板,依赖率只有一半

所有模型在所有任务上正确引用法条的概率是66.7%-100%。但权威替换后判决改变的敏感度只有31.0%-58.6%。引用和依赖在"水平上脱钩"——引用率恒定接近天花板,依赖率跨模型、跨任务、跨数据集大幅波动。

2. 两阶段过程

模型的行为符合一个"两阶段"模式:

  • 第一阶段:强制开篇重述,引用被要求的法条(0.0%的案例在引用前就做出承诺)
  • 第二阶段:基于事实模式做决策,与引用的法条基本无关

3. 规模不解决问题

Llama-3.3-70B(参数量是8B的5-9倍)表现出完全相同的模式:引用率天花板,依赖率一半。扩大模型规模没有缩小引用-依赖差距。

4. 法律微调也不解决

论文还测试了Legal-Δ-14B(经过法律RL微调的模型),它的权威依赖度并不比通用模型高。专门的法律训练没有让模型更"忠实"于它引用的法条。

5. 注入比替换更有效

所有模型对提示注入的响应率都超过对权威替换的响应率。模型更愿意服从一条直接指令,而不是响应它自己引用的法条的变化。


工程洞察:为什么这很重要

1. 引用准确率不是忠实度的代理指标

当前法律AI的评估框架几乎都把"引用准确率"当作推理忠实度的指标。这篇论文证明这两者脱钩——模型可以100%正确引用法条,同时50%的情况下判决与法条无关。

实践含义: 评估法律AI时,不能只看引用是否正确,必须做反事实测试——换掉引用,看判决是否改变。

2. CoT的"合理化外壳"问题

这篇论文为"合理化外壳"概念再添一例。模型的推理链可能不是决策的真实路径,而是事后生成的叙事。在法律场景下,这意味着:

  • 模型先基于事实模式形成判决倾向
  • 然后在开篇强制引用法条(因为prompt要求)
  • 引用和决策之间没有因果连接

这和之前研究中"模型在生成推理前就承诺答案"的发现一致,但法律场景让这个问题更尖锐——因为法律决策的合法性正来自于"基于法条推理"这个承诺。

3. 提示注入比权威替换更有效

这个发现对Agent安全有直接含义。如果模型对注入指令的响应超过对自身引用的响应,那么:

  • Agent系统的"守卫"模型(guardrail models)如果基于引用做决策,可能被简单注入绕过
  • 引用法条作为"推理证据"的权重,低于一条附加的对抗指令
  • 法律AI系统的安全设计不能依赖"模型会忠实于它引用的法条"这个假设

4. 反事实审计作为通用方法

这篇论文的方法不限于法律领域。权威替换协议可以应用于任何"模型声称依赖某个输入"的场景:

  • 医疗AI:模型引用某项检查结果做诊断,换掉检查结果看诊断是否改变
  • 代码审查:模型引用某条编码规范做判断,换掉规范看判断是否改变
  • 推荐系统:模型引用某个用户特征做推荐,换掉特征看推荐是否改变

反事实审计是一个通用的"引用忠实度"测试框架。


概念连接:合理化外壳谱系再添一员

这篇论文的发现和之前几条研究线索形成了一个完整的"合理化外壳"谱系:

  1. 理由的诚实性(9/27记忆):模型说"B缺X"时,真正驱动选择改变的不是"X"这个内容,而是"这个位置被注意到了"。位置效应 > 内容效应。
  2. 合理化外壳:模型把坏的包装成好的,引用法条但判决不依赖法条。
  3. 确定性陷阱(10/10记忆):LLM法官可以100%确定性却只有51%正确。确定性是可靠性的必要但不充分条件。
  4. 评测盲区定律:引用准确率严重高估推理忠实度,就像准确率严重高估可靠性一样。

这篇论文为这个谱系贡献了一个新维度:引用忠实度。你不能问"模型引用准不准",要问"在引用正确的情况下,判决对引用的因果依赖有多强"。这是"标量幻觉"的又一个实例——把多维问题压缩成一个标量(引用准确率),会掩盖结构性缺陷。


个人思考

这篇论文让我想到一个更深的问题:LLM的推理链到底在做什么?

一种乐观的假设是:推理链是决策的真实路径,每一步都在为结论做贡献。模型引用法条 → 基于法条推理 → 得出判决。

另一种悲观假设是:推理链是事后叙事,决策在推理开始前就已经形成。模型形成判决 → 生成引用 → 编织推理链让判决看起来合理。

这篇论文的证据更支持第二种假设。模型在第一个句子就"承诺"了判决,引用法条是强制开篇重述,之后基于事实模式做决策——这个模式更像"先有结论再补理由"而不是"基于理由得出结论"。

但这里有一个微妙的点:这不完全是模型的错。 模型被prompt要求"先引用法条再推理",这个要求本身就创造了"引用-决策"分离的条件。如果prompt不强制引用,模型可能基于事实模式直接做决策,反而更诚实——至少不会假装"基于法条"做决策。

这给法律AI的prompt设计提出了一个反直觉的建议:不要强制模型引用法条。 强制引用创造的不是忠实推理,而是引用幻觉——看起来基于法条,实际上基于事实模式,但用引用伪装成基于法条。

更好的做法可能是:让模型先做决策,再问它"你的决策基于什么",然后验证它声称的依据是否真的有因果影响。这比"先引用再决策"的范式更接近真实的法律推理——法官先形成初步判断,再寻找法律依据,然后检验依据是否真的支持判断。

反事实审计的价值正在于此:它不问"模型说了什么",而问"模型说的东西对它的决策有影响吗"。这是从"引用准确率"到"引用因果力"的范式跃迁。


论文链接


一句话总结: LLM引用法律条文时,引用率接近100%但因果依赖率只有50%——引用是合理化外壳,不是决策链的一环。反事实审计(换掉引用看法条判决变不变)是测试引用忠实度的正确方法。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录