他把刑法典换成了菜谱
设想一座法庭。被告席上坐着的不是人,而是一条待审核的内容;法官是某个大语言模型。它面前的案卷里除了案情,还附有一本规则——可能是平台的内容政策,可能是某个行业的监管条款,可能是某个法域写明的合规义务。判决只有两种:合规,或者不合规。
目录
他把刑法典换成了菜谱
⚖️ 一、一座没有抬头看法条的法庭
设想一座法庭。被告席上坐着的不是人,而是一条待审核的内容;法官是某个大语言模型。它面前的案卷里除了案情,还附有一本规则——可能是平台的内容政策,可能是某个行业的监管条款,可能是某个法域写明的合规义务。判决只有两种:合规,或者不合规。
这座法庭早已不开庭了——它流水线化地运转着。成百上千家机构把这类系统部署在生产环境里,让它们对真实世界的事物做出有法律后果的决定:这条帖子放不放行,这笔交易拦不拦截,这份合同标不标红。部署它们的前提朴素得像公理:判决取决于给它的规则。换一本规则,判决就该不同;规则变了,结论就该跟着变。
这个前提,从未被验证过。
标准化评估只报告一件事:在标注好的基准上,准确率是多少。没有任何一个主流评估问过那个更根本的问题——规则到底有没有参与判决?一个即使规则被完全删除也依然成立的判决,并不会因为在基准上得高分而更站得住脚。如果规则没有起任何作用,系统的高准确率反映的只是案例的表面特征,或者训练数据里学到的模式。把这种系统称为"合规判定系统",是名不副实的。
更糟的是,准确率天生无法区分这两种情况:一个不需要看规则就答对的判决,和一个必须借助规则才答对的判决,在准确率看来一模一样。成绩单上,它们并列第一。
这是「评测的递归困境」三部曲的第三篇,也是终篇。前两篇我们审计的是研究论文和行业对比里的数字——那些数字失真,代价是误导学术引用和市场选择。这一次被审计的对象不同:是已经进场干活、手握真金白银和法律后果的生产系统。赌注换了量级。前面两篇如果算体检,这一篇算尸检预告。
🔬 二、两把尺子
要测量"规则有没有被用上",得先有尺子。作者造了两把,一把量行为,一把量内心。
第一把叫 OCS(Output Compliance Sensitivity,输出合规敏感度),是行为层面的黑箱度量。逻辑像给法官做三个小动作:其一,把案卷里附带的规则悄悄抽走(del)——相当于删掉电器说明书;其二,把规则换成别的领域的规则(swap)——相当于把这台电器的说明书换成隔壁完全不同电器的说明书,文不对题;其三,把规则里的强制义务整个反转(neg)——凡是写"必须"的改成"禁止",相当于把说明书里的安全须知全部倒写。案情本身一字不动,然后看判决变不变。OCS 等于 0,意味着判决纹丝不动;OCS 等于 1,意味着每次都变。随机乱变的基线大约是 0.5——掷硬币式的"你动我就变"。
第二把尺子往模型内部再走一步,叫 ICS-delta,表征层面的探针。研究者在模型的残差流上寻找一个"合规—不合规"的方向,把内部活动投影到这根轴上;然后做规则扰动,测量投影移动了多少。如果模型内部真的处理过规则文本,扰动规则就该让这根轴上的读数挪动。
两把尺子互补,因为"判决不变"至少有两种原因:可能是模型在输出前就把规则的影响压制掉了,但内部表征过规则;也可能是表征里压根没有规则这回事。行为测试分不出这两种,表征测试可以。换句话说,OCS 问你"法官翻没翻书",ICS-delta 问你"书里的话进没进过他的脑子"。
📉 三、一百个格子,几乎全是冷的
实验在作者构造的 OmniCompliance-100K 数据集上进行:20 个监管与平台政策领域,每个领域 200 个案例,随机种子 42。五个模型,每个模型跑 12,897 次(案例乘条件)生成,合计 64,485 次。5 乘 20 等于 100 个格子,每个格子一个 OCS 分数,铺成一张热力图。
结果是一张几乎全冷的热力图。所有模型的规则敏感度都趴在地板上:
- Qwen2.5-7B:OCS-agg 0.094
- Llama-3.1-8B:0.070
- Llama-3.3-70B:0.081
- Llama-Guard-3-8B:0.013
- Mistral-7B-v0.3:0.089
- 全模型全领域平均:0.069
尤其值得一提的是,低温不是个别领域的孤例:100 个格子里几乎找不到热的角落,不存在某个监管领域让模型突然变得守规矩。规则敏感度的缺席是均匀的——不管是平台内容政策还是金融合规义务,模型一视同仁地置之不理。这排除了一个方便的解释:"也许是某些领域的规则写得太模糊"。模糊或许存在,但模糊解释不了一百格同冷。
如果这还不够让人坐不稳,看看 Llama-Guard-3-8B。这个模型存在的全部意义就是内容审核,是专门为"拿着规则做判决"训练的 Guard 模型。它的 OCS-agg 是 0.013,大约只有通用模型的六分之一——规则对它来说几乎是空气。而让它适配自定义规则时,准确率只有 51.1%。百分之五十一是什么概念?一个答题卡全涂同一个选项的考生,在某些分布里也能拿这个分。与此同时,四个通用模型的准确率是 90.3% 到 91.9%。专门训练的守门员掷出了硬币,几个路人甲倒像模像样。
这组数字该怎么读?旁观者还在称赞那位法官"判得准"——按基准测试,他确实判得准。可你把刑法典换成菜谱,判决一字未改;你把法条抽走,判决照旧。准,和依据什么准,是两回事。
🧠 四、探针伸进黑箱
行为冷,内心呢?
四个 Tier-1 模型上,ICS-delta 只有基线 ICS 幅度的 12.8% 到 22.9%。探针能测出模型内部确实存在"合规—不合规"的表征方向——这不是一无所有的黑箱——但你扰动规则文本之后,这根轴上的活动只挪动了基线幅度的零头。三个扰动条件里,OCS-neg 产生的表征变化最小:义务反转这种最粗暴的篡改,在模型内心激起的涟漪反而最微弱。它可能根本没读懂那些"必须",自然也无从察觉"必须"被倒了过来。
还有一个值得记录的阴性结果:OCS 与 ICS-delta 在领域间的排名,Spearman 相关不显著。两把尺子测的是相关但部分独立的属性——某个领域行为上敏感,不代表内部表征跟着动。这提醒我们,"用没用规则"不是一个标量,至少是两个维度的乘积,而两把尺子各自只照得见一个。
但即便表征这把更精细的尺子,读数也低。内外双低,结论就逼近了:模型对规则文本的处理,浅得像水面上的油花——存在过,没有沉下去。规则文本进入了上下文窗口,参与了注意力计算,却没有进入决定判决的那条通路。用本文的比喻收束这一节:书里的话路过了脑子,但没有停留。
🎯 五、关键一问:是不是题目本来就不用查法条?
严谨的读者此刻该拍桌子了:低敏感度未必是毛病。如果大多数案例凭内容本身就能判断——杀人越货显然违规,日常寒暄显然没事——那规则本来就只是摆设,判决不变恰恰是正确的。这就像一场考试,大多数题目靠常识就能答对,只有寥寥几题必须翻法条。考官不看题目、只看考生表情就打分,固然荒唐;但如果题目全是"一加一等于几",那看不看题目倒也无所谓。
这是全文最关键的对照实验,作者叫它 rule-necessity,规则必要性。做法是筛出一类特殊案例:基线判决正确,可一旦删掉规则,判决就变错——在这类案例上,规则是真的必要,没有法条就答不对。然后在它们身上重新测敏感度。
答案分成两半。
头一半让人松口气:在规则必要的案例上,模型的敏感度大幅上升。OCS-swap 跳到 0.73 到 1.00,而同样的扰动在全体案例池化时只有 0.08 到 0.12,整整一个数量级的差距。注意这组数字的言外之意:当规则真的不可替代时,模型的表现几乎堪称尽职——swap 之后判决几乎每次都跟着变。问题从来不在"模型绝无可能用规则",而在"默认状态下它懒得用"。低聚合 OCS 掩盖的两种状态是真实的:大多数案例可以从内容推断答案,少数案例确实需要规则,而模型只在后一类上表现出规则敏感性。办事员遇到真难题,还是会查手册的。
后一半让人重新坐不稳:四个通用模型里,只有 6 个案例是所有模型一致认定规则必要的。六个。在四千个案例里,模型们对"哪些题必须查法条"几乎没有共识。而标准准确率对此完全无感——它分不清卷面上哪个勾是靠常识画的,哪个勾是靠法条画的。成绩单上并列第一的那两位,一位过目不忘,一位根本没翻开书。用人话说:你以为系统考的是法律,其实它考的是世故;偶尔它也翻翻法条,但你不知道是哪一次,它自己可能也不知道。
🔨 六、救一下,能救吗
发现病灶之后,自然要问能不能治。作者试了两味药,两味都失败了,而这正是论文阴郁的地方。
第一味是提示工程,规则锚定:要求模型在判决前先引用最相关的规则条款,再下结论。好比强制考生先默写公式再答题,看你这次还怎么用"直觉"糊弄。它是所有干预里最轻量、也最容易落地的一种——只需改几行提示词,不需要触碰模型权重。可唯一显著的效果却令人啼笑皆非:Qwen2.5-7B 在 LOW-OCS 案例分区上显著变差,-0.028,p 小于 0.0001。强迫它先看规则,它反而错得更多。帮了倒忙。
第二味药更重:激活引导。直接在残差流上加或减"合规方向"的向量,试图从内部把判决拧向规则。结果没有任何设置显著优于基线;负向引导在两个模型上显著损害了准确率。往脑子里拧的那颗螺丝,拧反了。
干预的全面失败给论文添了一层底纹:规则敏感性低,似乎不是某个可以一键修掉的开关,而更像这些模型构造方式的一个深层属性。提示工程这种外伤药治不了它,开颅级的表征干预也治不了它。这不是"再调调 prompt 就行"的问题,这是地基的问题。
📏 七、唯一站住的语言学线索
作者还做了层文本分析:是不是规则文本的某些语言特征,决定了模型理不理它?五个文本特征里,只有一个通过了 BH 多重检验校正——平均依存树深度(MDD),相关系数 ρ 等于 0.570,校正后 p 等于 0.044。
翻译过来:规则文本的句法越复杂、嵌套层级越深,模型越倾向于让判决跟着规则走;写得平铺直叙的规则,越容易被当成背景噪音。一个直觉上合理的解释是,复杂句法逼迫模型认真解析文本结构,规则因此被"读进去"了。有意思的是,直觉上可能更该起作用的特征——例外条款的密度、交叉引用的数量——反而不显著。条款多不多、引用乱不乱不重要,句子拧不拧巴才重要。
当然,一个过了校正的相关系数,离因果还很远,而且是双向解读的:可能是复杂句法逼出了注意力,也可能是写得复杂的规则恰好都是重要规则,在训练数据里被反复标注过,模型不过是在回忆答案。作者诚实,读者也该诚实。
🌍 八、换个考场,规律还在吗
会不会是 OmniCompliance-100K 这个数据集特有的毛病?作者把实验搬到 LegalBench 和 ContractNLI 上检验泛化。规律成立:LegalBench 上 OCS-agg 为 0.255,是主实验的 3.1 倍;ContractNLI 上 0.318,3.9 倍。两个数字都爬高了,说明敏感度确实随任务形态波动;但都仍远低于 0.5 的独立性参考线——判决依旧主要不依赖规则。规则敏感度不是一个可以从任务到任务移植的模型属性,它一半在模型身上,一半在任务的格式身上。
尤其值得注意的是 ContractNLI 的格式:假设被当作规则,合同摘录被当作文档,案例和规则之间存在紧密的逻辑咬合,规则不再是悬在案情上方的总则,而是缠在案情里的线索。在这种结构里,想绕开规则独立作答反而难,OCS 随之上去了一截。同一个模型,换一张考卷,换一套题目和知识点的耦合方式,它对规则的依赖程度就变了。这再次指向一个老教训:任务格式塑造行为,分数只是格式的影子。你在基准上看到的"合规能力",有相当一部分是"这份基准的样子"。对采购方和监管者,这是句必须听进去的话:在别人的基准上验过,不等于在你的任务上可靠;而所谓"你的任务",也未必就是你以为的那个任务——系统的实际依赖,由格式决定,不由你的意图决定。
⚠️ 九、把免责声明读完
论文的局限值得一并记下,它们规定了结论的边界。规则文本截断在 300 字符,长规则的影响可能被低估——现实中的监管条文动辄几千字,300 字符以内的规则或许恰好是最容易忽略的那类。OCS 测量的是判决变不变,不测量变完之后是否法律正确:一个乱变的系统 OCS 会很高,但那不叫敏感,叫癫痫。LOW/HIGH-OCS 分区在主模型上定义后迁移到其他模型,分区本身携带偏差。ICS-delta 只沿单一方向、在锚定层上测量,模型内部的规则处理或许比探针所见立体得多——探针照见的只是它找得到的那一面。
这些局限不推翻主结论。64,485 次生成铺出来的地板,不是几处方法论漏洞能抬起来的。把它们摆出来,恰恰是因为这类论文最容易被两种人误读:想用它唱衰合规 AI 的人,会无视局限;想保住现有系统的人,会抓着局限不放。两种读法都懒。但它们提醒我们:我们知道了判决大面积不依赖规则,却还远远不知道模型到底依据什么在做判决。这另一半的问题,比前半更难,也更值钱。
🪞 十、终篇:谁来审计审计者
三部曲写到这里,可以收束了。
第一篇,我们看见评测数字如何系统性失真——好分数可以来自测量本身的水分,尺子歪了,量什么都歪。第二篇,我们看见行业对比的数字如何被选择性呈现——基准的排名可以讲述一个与事实无关的故事,胜出的未必是强者,可能只是最会考试的那位。两篇合起来是一个递进的怀疑:如果产生数字的工具本身不可靠,数字就不只是数字,而是叙事武器。谁掌握了尺子,谁就掌握了"什么叫好"。
第三篇把这个怀疑推进到了最不舒服的地方。前两篇审计的是纸上的数字,数字错了,代价是误导。这一篇审计的是在岗的系统——它们此刻就在过滤内容、拦截交易、标记风险,它们的判决带着真实的法律后果。而现在我们知道,这些判决在很大程度上不依赖号称支配它们的规则。它们更像一个熟读案例库的老办事员:凭经验、凭气味、凭训练里见过的一切,唯独不凭桌上那本规则。基准给的九成准确率是真的,但它是办事员的记性,不是法官的学问。
这就是递归困境的终点:你用评测证明系统合规,但评测测不到"合规"这件事真正依赖的东西。规则在卷面上,判决在心里——而心,从来没翻开过规则。更递归的一层在于:这些合规系统本身,正在成为新的评测者——为别的模型打分、做准入、发通行证。用不读规则的法官去考核另一个不读规则的法官,得到的合规认证,不过是两张成绩单的互相盖章。
出路不是更漂亮的基准,而是更刁钻的尺子。OCS 和 ICS-delta 是两次认真的尝试:不问"判对了吗",问"它是因为规则判对的吗"。在立法者开始要求 AI 决策可解释、可审计的今天,这类测量不该躺在论文里,该像碰撞测试之于汽车一样,成为出厂前的强制项目。否则,我们就是在用菜谱审判,然后把判决书端端正正地归档在刑法典下面。
前两篇的教训是:别轻信分数。终篇的教训是:连分数代表什么都不确定时,别把判决权交出去。
参考文献
- Sadhu, S., Sengupta, A., Sankarapu, V. K., & Seth, P. (2026). *Verdict Without the Rule*. arXiv:2610.12313. Lexsi Labs. https://arxiv.org/abs/2610.12313
- OmniCompliance-100K 数据集(Lexsi Labs):20 个监管/平台政策领域,每领域 200 案例,随机种子 42。