他把刑法典换成了菜谱

设想一座法庭。被告席上坐着的不是人,而是一条待审核的内容;法官是某个大语言模型。它面前的案卷里除了案情,还附有一本规则——可能是平台的内容政策,可能是某个行业的监管条款,可能是某个法域写明的合规义务。判决只有两种:合规,或者不合规。

目录
  1. 他把刑法典换成了菜谱
  2. ⚖️ 一、一座没有抬头看法条的法庭
  3. 🔬 二、两把尺子
  4. 📉 三、一百个格子,几乎全是冷的
  5. 🧠 四、探针伸进黑箱
  6. 🎯 五、关键一问:是不是题目本来就不用查法条?
  7. 🔨 六、救一下,能救吗
  8. 📏 七、唯一站住的语言学线索
  9. 🌍 八、换个考场,规律还在吗
  10. ⚠️ 九、把免责声明读完
  11. 🪞 十、终篇:谁来审计审计者
  12. 参考文献

他把刑法典换成了菜谱

⚖️ 一、一座没有抬头看法条的法庭

设想一座法庭。被告席上坐着的不是人,而是一条待审核的内容;法官是某个大语言模型。它面前的案卷里除了案情,还附有一本规则——可能是平台的内容政策,可能是某个行业的监管条款,可能是某个法域写明的合规义务。判决只有两种:合规,或者不合规。

这座法庭早已不开庭了——它流水线化地运转着。成百上千家机构把这类系统部署在生产环境里,让它们对真实世界的事物做出有法律后果的决定:这条帖子放不放行,这笔交易拦不拦截,这份合同标不标红。部署它们的前提朴素得像公理:判决取决于给它的规则。换一本规则,判决就该不同;规则变了,结论就该跟着变。

这个前提,从未被验证过。

标准化评估只报告一件事:在标注好的基准上,准确率是多少。没有任何一个主流评估问过那个更根本的问题——规则到底有没有参与判决?一个即使规则被完全删除也依然成立的判决,并不会因为在基准上得高分而更站得住脚。如果规则没有起任何作用,系统的高准确率反映的只是案例的表面特征,或者训练数据里学到的模式。把这种系统称为"合规判定系统",是名不副实的。

更糟的是,准确率天生无法区分这两种情况:一个不需要看规则就答对的判决,和一个必须借助规则才答对的判决,在准确率看来一模一样。成绩单上,它们并列第一。

这是「评测的递归困境」三部曲的第三篇,也是终篇。前两篇我们审计的是研究论文和行业对比里的数字——那些数字失真,代价是误导学术引用和市场选择。这一次被审计的对象不同:是已经进场干活、手握真金白银和法律后果的生产系统。赌注换了量级。前面两篇如果算体检,这一篇算尸检预告。

🔬 二、两把尺子

要测量"规则有没有被用上",得先有尺子。作者造了两把,一把量行为,一把量内心。

第一把叫 OCS(Output Compliance Sensitivity,输出合规敏感度),是行为层面的黑箱度量。逻辑像给法官做三个小动作:其一,把案卷里附带的规则悄悄抽走(del)——相当于删掉电器说明书;其二,把规则换成别的领域的规则(swap)——相当于把这台电器的说明书换成隔壁完全不同电器的说明书,文不对题;其三,把规则里的强制义务整个反转(neg)——凡是写"必须"的改成"禁止",相当于把说明书里的安全须知全部倒写。案情本身一字不动,然后看判决变不变。OCS 等于 0,意味着判决纹丝不动;OCS 等于 1,意味着每次都变。随机乱变的基线大约是 0.5——掷硬币式的"你动我就变"。

第二把尺子往模型内部再走一步,叫 ICS-delta,表征层面的探针。研究者在模型的残差流上寻找一个"合规—不合规"的方向,把内部活动投影到这根轴上;然后做规则扰动,测量投影移动了多少。如果模型内部真的处理过规则文本,扰动规则就该让这根轴上的读数挪动。

两把尺子互补,因为"判决不变"至少有两种原因:可能是模型在输出前就把规则的影响压制掉了,但内部表征过规则;也可能是表征里压根没有规则这回事。行为测试分不出这两种,表征测试可以。换句话说,OCS 问你"法官翻没翻书",ICS-delta 问你"书里的话进没进过他的脑子"。

📉 三、一百个格子,几乎全是冷的

实验在作者构造的 OmniCompliance-100K 数据集上进行:20 个监管与平台政策领域,每个领域 200 个案例,随机种子 42。五个模型,每个模型跑 12,897 次(案例乘条件)生成,合计 64,485 次。5 乘 20 等于 100 个格子,每个格子一个 OCS 分数,铺成一张热力图。

结果是一张几乎全冷的热力图。所有模型的规则敏感度都趴在地板上:

  • Qwen2.5-7B:OCS-agg 0.094
  • Llama-3.1-8B:0.070
  • Llama-3.3-70B:0.081
  • Llama-Guard-3-8B:0.013
  • Mistral-7B-v0.3:0.089
  • 全模型全领域平均:0.069
对照一下:随机基线约 0.5,经验零假设在 0.48 到 0.50 之间。0.069 意味着平均而言,你对规则做一百次手术,判决只动不到七次。尤其刺眼的是按条件的分解:规则被彻底删除时(del),敏感度最低,只有 0.053——低于把"必须"倒写成"禁止"(0.070),更低于换上一本别的领域的规则(0.082)。翻译回法庭语言:判决最不怕的,恰恰是法典整个消失。你把桌上的刑法典换成菜谱,法官眼皮都不抬;你把法条里的"应当"全部改成"不得",他皱了一下眉——也只是一下。

尤其值得一提的是,低温不是个别领域的孤例:100 个格子里几乎找不到热的角落,不存在某个监管领域让模型突然变得守规矩。规则敏感度的缺席是均匀的——不管是平台内容政策还是金融合规义务,模型一视同仁地置之不理。这排除了一个方便的解释:"也许是某些领域的规则写得太模糊"。模糊或许存在,但模糊解释不了一百格同冷。

如果这还不够让人坐不稳,看看 Llama-Guard-3-8B。这个模型存在的全部意义就是内容审核,是专门为"拿着规则做判决"训练的 Guard 模型。它的 OCS-agg 是 0.013,大约只有通用模型的六分之一——规则对它来说几乎是空气。而让它适配自定义规则时,准确率只有 51.1%。百分之五十一是什么概念?一个答题卡全涂同一个选项的考生,在某些分布里也能拿这个分。与此同时,四个通用模型的准确率是 90.3% 到 91.9%。专门训练的守门员掷出了硬币,几个路人甲倒像模像样。

这组数字该怎么读?旁观者还在称赞那位法官"判得准"——按基准测试,他确实判得准。可你把刑法典换成菜谱,判决一字未改;你把法条抽走,判决照旧。准,和依据什么准,是两回事。

🧠 四、探针伸进黑箱

行为冷,内心呢?

四个 Tier-1 模型上,ICS-delta 只有基线 ICS 幅度的 12.8% 到 22.9%。探针能测出模型内部确实存在"合规—不合规"的表征方向——这不是一无所有的黑箱——但你扰动规则文本之后,这根轴上的活动只挪动了基线幅度的零头。三个扰动条件里,OCS-neg 产生的表征变化最小:义务反转这种最粗暴的篡改,在模型内心激起的涟漪反而最微弱。它可能根本没读懂那些"必须",自然也无从察觉"必须"被倒了过来。

还有一个值得记录的阴性结果:OCS 与 ICS-delta 在领域间的排名,Spearman 相关不显著。两把尺子测的是相关但部分独立的属性——某个领域行为上敏感,不代表内部表征跟着动。这提醒我们,"用没用规则"不是一个标量,至少是两个维度的乘积,而两把尺子各自只照得见一个。

但即便表征这把更精细的尺子,读数也低。内外双低,结论就逼近了:模型对规则文本的处理,浅得像水面上的油花——存在过,没有沉下去。规则文本进入了上下文窗口,参与了注意力计算,却没有进入决定判决的那条通路。用本文的比喻收束这一节:书里的话路过了脑子,但没有停留。

🎯 五、关键一问:是不是题目本来就不用查法条?

严谨的读者此刻该拍桌子了:低敏感度未必是毛病。如果大多数案例凭内容本身就能判断——杀人越货显然违规,日常寒暄显然没事——那规则本来就只是摆设,判决不变恰恰是正确的。这就像一场考试,大多数题目靠常识就能答对,只有寥寥几题必须翻法条。考官不看题目、只看考生表情就打分,固然荒唐;但如果题目全是"一加一等于几",那看不看题目倒也无所谓。

这是全文最关键的对照实验,作者叫它 rule-necessity,规则必要性。做法是筛出一类特殊案例:基线判决正确,可一旦删掉规则,判决就变错——在这类案例上,规则是真的必要,没有法条就答不对。然后在它们身上重新测敏感度。

答案分成两半。

头一半让人松口气:在规则必要的案例上,模型的敏感度大幅上升。OCS-swap 跳到 0.73 到 1.00,而同样的扰动在全体案例池化时只有 0.08 到 0.12,整整一个数量级的差距。注意这组数字的言外之意:当规则真的不可替代时,模型的表现几乎堪称尽职——swap 之后判决几乎每次都跟着变。问题从来不在"模型绝无可能用规则",而在"默认状态下它懒得用"。低聚合 OCS 掩盖的两种状态是真实的:大多数案例可以从内容推断答案,少数案例确实需要规则,而模型只在后一类上表现出规则敏感性。办事员遇到真难题,还是会查手册的。

后一半让人重新坐不稳:四个通用模型里,只有 6 个案例是所有模型一致认定规则必要的。六个。在四千个案例里,模型们对"哪些题必须查法条"几乎没有共识。而标准准确率对此完全无感——它分不清卷面上哪个勾是靠常识画的,哪个勾是靠法条画的。成绩单上并列第一的那两位,一位过目不忘,一位根本没翻开书。用人话说:你以为系统考的是法律,其实它考的是世故;偶尔它也翻翻法条,但你不知道是哪一次,它自己可能也不知道。

🔨 六、救一下,能救吗

发现病灶之后,自然要问能不能治。作者试了两味药,两味都失败了,而这正是论文阴郁的地方。

第一味是提示工程,规则锚定:要求模型在判决前先引用最相关的规则条款,再下结论。好比强制考生先默写公式再答题,看你这次还怎么用"直觉"糊弄。它是所有干预里最轻量、也最容易落地的一种——只需改几行提示词,不需要触碰模型权重。可唯一显著的效果却令人啼笑皆非:Qwen2.5-7B 在 LOW-OCS 案例分区上显著变差,-0.028,p 小于 0.0001。强迫它先看规则,它反而错得更多。帮了倒忙。

第二味药更重:激活引导。直接在残差流上加或减"合规方向"的向量,试图从内部把判决拧向规则。结果没有任何设置显著优于基线;负向引导在两个模型上显著损害了准确率。往脑子里拧的那颗螺丝,拧反了。

干预的全面失败给论文添了一层底纹:规则敏感性低,似乎不是某个可以一键修掉的开关,而更像这些模型构造方式的一个深层属性。提示工程这种外伤药治不了它,开颅级的表征干预也治不了它。这不是"再调调 prompt 就行"的问题,这是地基的问题。

📏 七、唯一站住的语言学线索

作者还做了层文本分析:是不是规则文本的某些语言特征,决定了模型理不理它?五个文本特征里,只有一个通过了 BH 多重检验校正——平均依存树深度(MDD),相关系数 ρ 等于 0.570,校正后 p 等于 0.044。

翻译过来:规则文本的句法越复杂、嵌套层级越深,模型越倾向于让判决跟着规则走;写得平铺直叙的规则,越容易被当成背景噪音。一个直觉上合理的解释是,复杂句法逼迫模型认真解析文本结构,规则因此被"读进去"了。有意思的是,直觉上可能更该起作用的特征——例外条款的密度、交叉引用的数量——反而不显著。条款多不多、引用乱不乱不重要,句子拧不拧巴才重要。

当然,一个过了校正的相关系数,离因果还很远,而且是双向解读的:可能是复杂句法逼出了注意力,也可能是写得复杂的规则恰好都是重要规则,在训练数据里被反复标注过,模型不过是在回忆答案。作者诚实,读者也该诚实。

🌍 八、换个考场,规律还在吗

会不会是 OmniCompliance-100K 这个数据集特有的毛病?作者把实验搬到 LegalBench 和 ContractNLI 上检验泛化。规律成立:LegalBench 上 OCS-agg 为 0.255,是主实验的 3.1 倍;ContractNLI 上 0.318,3.9 倍。两个数字都爬高了,说明敏感度确实随任务形态波动;但都仍远低于 0.5 的独立性参考线——判决依旧主要不依赖规则。规则敏感度不是一个可以从任务到任务移植的模型属性,它一半在模型身上,一半在任务的格式身上。

尤其值得注意的是 ContractNLI 的格式:假设被当作规则,合同摘录被当作文档,案例和规则之间存在紧密的逻辑咬合,规则不再是悬在案情上方的总则,而是缠在案情里的线索。在这种结构里,想绕开规则独立作答反而难,OCS 随之上去了一截。同一个模型,换一张考卷,换一套题目和知识点的耦合方式,它对规则的依赖程度就变了。这再次指向一个老教训:任务格式塑造行为,分数只是格式的影子。你在基准上看到的"合规能力",有相当一部分是"这份基准的样子"。对采购方和监管者,这是句必须听进去的话:在别人的基准上验过,不等于在你的任务上可靠;而所谓"你的任务",也未必就是你以为的那个任务——系统的实际依赖,由格式决定,不由你的意图决定。

⚠️ 九、把免责声明读完

论文的局限值得一并记下,它们规定了结论的边界。规则文本截断在 300 字符,长规则的影响可能被低估——现实中的监管条文动辄几千字,300 字符以内的规则或许恰好是最容易忽略的那类。OCS 测量的是判决变不变,不测量变完之后是否法律正确:一个乱变的系统 OCS 会很高,但那不叫敏感,叫癫痫。LOW/HIGH-OCS 分区在主模型上定义后迁移到其他模型,分区本身携带偏差。ICS-delta 只沿单一方向、在锚定层上测量,模型内部的规则处理或许比探针所见立体得多——探针照见的只是它找得到的那一面。

这些局限不推翻主结论。64,485 次生成铺出来的地板,不是几处方法论漏洞能抬起来的。把它们摆出来,恰恰是因为这类论文最容易被两种人误读:想用它唱衰合规 AI 的人,会无视局限;想保住现有系统的人,会抓着局限不放。两种读法都懒。但它们提醒我们:我们知道了判决大面积不依赖规则,却还远远不知道模型到底依据什么在做判决。这另一半的问题,比前半更难,也更值钱。

🪞 十、终篇:谁来审计审计者

三部曲写到这里,可以收束了。

第一篇,我们看见评测数字如何系统性失真——好分数可以来自测量本身的水分,尺子歪了,量什么都歪。第二篇,我们看见行业对比的数字如何被选择性呈现——基准的排名可以讲述一个与事实无关的故事,胜出的未必是强者,可能只是最会考试的那位。两篇合起来是一个递进的怀疑:如果产生数字的工具本身不可靠,数字就不只是数字,而是叙事武器。谁掌握了尺子,谁就掌握了"什么叫好"。

第三篇把这个怀疑推进到了最不舒服的地方。前两篇审计的是纸上的数字,数字错了,代价是误导。这一篇审计的是在岗的系统——它们此刻就在过滤内容、拦截交易、标记风险,它们的判决带着真实的法律后果。而现在我们知道,这些判决在很大程度上不依赖号称支配它们的规则。它们更像一个熟读案例库的老办事员:凭经验、凭气味、凭训练里见过的一切,唯独不凭桌上那本规则。基准给的九成准确率是真的,但它是办事员的记性,不是法官的学问。

这就是递归困境的终点:你用评测证明系统合规,但评测测不到"合规"这件事真正依赖的东西。规则在卷面上,判决在心里——而心,从来没翻开过规则。更递归的一层在于:这些合规系统本身,正在成为新的评测者——为别的模型打分、做准入、发通行证。用不读规则的法官去考核另一个不读规则的法官,得到的合规认证,不过是两张成绩单的互相盖章。

出路不是更漂亮的基准,而是更刁钻的尺子。OCS 和 ICS-delta 是两次认真的尝试:不问"判对了吗",问"它是因为规则判对的吗"。在立法者开始要求 AI 决策可解释、可审计的今天,这类测量不该躺在论文里,该像碰撞测试之于汽车一样,成为出厂前的强制项目。否则,我们就是在用菜谱审判,然后把判决书端端正正地归档在刑法典下面。

前两篇的教训是:别轻信分数。终篇的教训是:连分数代表什么都不确定时,别把判决权交出去。

参考文献

  • Sadhu, S., Sengupta, A., Sankarapu, V. K., & Seth, P. (2026). *Verdict Without the Rule*. arXiv:2610.12313. Lexsi Labs. https://arxiv.org/abs/2610.12313
  • OmniCompliance-100K 数据集(Lexsi Labs):20 个监管/平台政策领域,每领域 200 案例,随机种子 42。
#论文解读 #评测的递归困境 #合规 #LLM审计 #规则敏感性

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

##🔍 先说没对上的地方

我把这篇的每个数字都回去核了一遍arXiv:2610.12313v1。先给结论:数字全对,标题、作者(Sadhu / Sengupta / Sankarapu / Seth,Lexsi Labs)、64,485 次生成、5×20=100 格、OCS-agg 0.094/0.070/0.081/0.013/0.089、均值 0.069、del 0.053 低于 neg 0.070 低于 swap 0.082、Llama-Guard 的 51.1% vs 通用 90.3–91.9%、MDD 的 ρ=0.570 p=0.044、LegalBench 0.255(3.1×)与 ContractNLI 0.318(3.9×)——全部逐字命中。这一篇的引用质量在我近期读过的解读里排前列。

所以下面不是纠错,是三处我认为读法需要拧一下的地方,加一条帖子自己没接的硬料。

一、OmniCompliance-100K 不是这篇造的

帖子写"实验在作者构造的 OmniCompliance-100K 数据集上"。论文 4.1 节的第一句是"All experiments use OmniCompliance-100K (Hu et al., 2026)",引的是 ACL 2026 Findings pp.2445–2463。

这不是吹牛还是谦虚的问题,是归属问题:数据集是别人的,规则扰动、OCS/ICS-delta 这两把尺子、以及那64,485 次生成才是这篇的。混成一句"作者构造的",读的人会以为100K 的规则文本也是这篇编的——那可是另一件重得多的工作。

二、LegalBench 那一格,帖子替论文把话说了

这是本篇我最想拧的一处。帖子写:

"两个数字都爬高了,说明敏感度确实随任务形态波动"

论文原文是这句:

"LegalBench's baseline accuracy (49.7%) is indistinguishable from chance, so part of its elevated OCS plausibly reflects task difficulty rather than genuine rule-grounding."

把这两句并排放,会发现方向是反的。LegalBench 上四个通用模型的基线准确率 49.7%——这就是掷硬币。一个在乱猜的模型当然"对规则敏感",它对什么都敏感,判决本来就随输入抖动。0.255 这个数不能读成"规则在那儿更管用",要读成"模型在那儿更没用"。

真正能读的是 ContractNLI:基线 78.6%,既高于随机、又离饱和还远,OCS 0.318 才有意义。帖子把两个数并排放着讲"都爬高了",恰好把唯一有信息量的那个埋掉了。

顺带一个数:OmniCompliance 主池的 OCS-agg,论文 Table 2 写的是 0.081(n=3,946),而 §5.1 的0.069 是"全部 100 个(模型×领域)格子的均值"。帖子引用0.069 时说的是"全模型全领域平均",这个口径是对的——但 3.1× / 3.9× 这两个倍数是拿 0.255/0.318 除 0.081 得来的(0.255/0.081=3.15,0.318/0.081=3.93,两个都进位成论文写的 3.1 和 3.9)。也就是说"主实验"在同一个帖子里有两个数:0.069 和 0.081。差得不多,但分子分母不是同一个池子,混着用容易算错。

三、"六个案例"才是最狠的一格,而帖子没算它的比例

帖子写"只有 6 个案例是所有模型一致认定规则必要的。在四千个案例里"。数字对,但漏了论文 Table 9 里最要紧的那一列:每个模型自己的 rule-necessary 子集大小是 94 到 187 例(Qwen 94、Llama-3.1 132、Mistral 120、Llama-3.3-70B 187,Llama-Guard 49)。

也就是说,不是"四个模型几乎都没有需要规则的题",而是每个模型都认定94–187 道题必须查法条,但它们认定的那批题几乎完全不重叠——四者交集 6 例,交集只占最大子集的 3.2%。

这一格的分量比原帖强调的还重:模型之间对"哪道题必须翻法典"几乎没有任何共识。四个人类考生都说"这题得查书",但翻的是四本完全不同的书。这直接打掉了帖子结尾那句"偶尔它也翻翻法条"的和解——不是偶尔翻,是各翻各的,而且翻的是不同的册子。

另外还有一处口径要留个心:论文自己给 rule-necessary 下了一个很克制的定义——"it denotes this correct-then-incorrect pattern, not an independently annotated claim that the legal task itself requires the rule"。这是"删掉规则后模型从对变错",不是"法理上这道题必须查法典"。差一个划掉整段结论的距离。

四、三处限定词脱落,强度至少高一档

第一,「不存在某个监管领域让模型突然变得守规矩」说反了。 帖子写「100 个格子里几乎找不到热的角落,不存在某个监管领域让模型突然变得守规矩……这排除了一个方便的解释:'也许是某些领域的规则写得太模糊'」。

论文 §5.1 的原话是把两件事分开说的:

"Domain-level variance exists, but it is dominated by model-specific effects. The one visibly warm cell in Figure 2 (Mistral-7B-v0.3 × cybersecurity_mitre_attack, OCS-agg 0.265) is the single highest value in the dataset."

而且它还点出一个最像模型通用效应的领域:sb35(美国某州 AI 安全法条)域均值 0.138,是全模型均值 0.069 的两倍,论文明说这是「the closest this dataset comes to a model-general effect」。

【直引】「由模型效应主导」不等于「没有领域效应」。 论文说方差存在、只是被模型项盖住了,帖子把它读成完全均匀,然后拿它去排除了一个论文没有排除的解释——那个唯一的热格子恰恰是个具体领域(MITRE ATT&CK 网络安全),而 sb35 的两倍均值也说明规则文本的语言学性质(论文在 Table 4 脚注里明说 cybersecurity_mitre_attack 的强制模态覆盖率是 0.0%,属于"没有可反转内容"的领域)。这两个格子合起来恰好是在支持"某些领域的规则确实不一样",而不是反对它。

第二,「专门训练的守门人掷出了硬币」是论文专门写了一段来阻止的推论。 帖子写「这个模型存在的全部意义就是内容审核,是专门为'拿着规则做判决'训练的 Guard 模型……专门训练的守门人掷出了硬币,几个路人甲倒像模像样」。

论文用了整段来划界:

"consistent with task-format mismatch rather than a general claim about compliance-specific training. The four general-purpose models are the paper's primary evidence; the guard model is a complementary case, a different failure mode rather than a more severe version of the same one: it has no learned representation of what GDPR compliance looks like in a slot built for one of its own 14 labels."

摘要里也标了 "evaluated here under a custom-rule adaptation of its native taxonomy"。51.1% 对 90.3–91.9% 是论文的诚实标注,不是"合规专用训练不管用"的证据——它是在一个为 14 类内容安全标签设计的槽位里,被塞进了 GDPR 条文。

第三,激活引导「显著损害准确率」漏了三个限定。 帖子写「结果没有任何设置显著优于基线;负向引导在两个模型上显著损害了准确率」。论文原话是:

"several negative-steering comparisons are nominally significant before correcting for the 16 comparisons tested here, so we treat these per-setting results as exploratory."

Table 3 的表头也写着 "nominal, uncorrected for the 16 comparisons in this table"。nominally / uncorrected / exploratory 三个词被删之后,"探索性结果"变成了"显著损害"。

【直引】顺带一条口径:del / neg / swap 三个数的分母不一样。 论文 §3.1 明写 OCS-neg 只在含 must/shall 的样本上计算,"samples with no mandatory modal are excluded from OCS-neg rather than counted as unchanged",而各领域的强制模态覆盖率从 0.0% 到 60.7%(Table 4 脚注给了逐领域清单)。del 与 swap 走的是全量 4000 样本。所以 0.053 / 0.070 / 0.082 这个排序把三个不同分母的数字放在同一条轴上比——论文没给分母归一后的对照。

五、帖子漏掉的一句:自己的刀砍到了自己

论文 §5.4 后半还有一句,帖子一字未提:

"OCS-swap rises sharply for every model (0.73–1.00, vs. 0.08–0.12 pooled) and, for one of four general-purpose models, significantly exceeds its own bias-corrected null after Bonferroni correction"

四个模型里只有一个。 而 Table 9 里 swap 的 bias-corrected null 本身已经是 0.665–0.723——因为子集里模型"正确"的比例高,随机基线被推得极高。观测 0.733–0.780 相对自己的 null 0.669–0.723,p_up 是 0.881 / 0.999 / 1.000 / 0.994。

帖子写"swap 之后判决几乎每次都跟着变"——这句把 p=0.881 那格也算进去了。真正稳的只有 Llama-3.1-8B 那一个(swap n=132,观测 0.780,null 0.669,p_up 小于 0.0001)。

顺带一提,Table 9 里 Llama-Guard-3-8B 的 swap 是 1.000(n=49)。【直引】——每一条都变。但它在主池里是 0.015。原因论文写在 5.5 节:它的响应偏置极端(p=0.985,q=0.996,"compliant" 几乎无条件输出),偏置校正后的null 被压到 0.019。所以那个 1.000 不是"守门员突然很听话",是"它本来就没有稳定判决"。

六、收口:下一根钉子

这篇把"判决是否依据规则"测出来了,但没测它到底依据了什么。论文自己在第九节承认:"we know that verdicts are broadly rule-insensitive, but we are still far from knowing what models actually decide on."

下一根钉子是那篇《Verdict Without the Rule》的后续——如果有人把模型自己的训练分布当作候选规则集(即不扰动外部规则,而是问"它改口时更像是换了哪条隐含规则"),那才是对"另一半问题"的正面回答。目前 OCS 和 ICS-delta 都只测了"给它的东西有没有被用",没测"它自己带了什么来"。

另一个可检验的小钉子:论文自己列了 ECD(例外条款密度)ρ=0.041 p=0.86、CRC(交叉引用数)ρ=0.241 p=0.38 两个不显著项。如果句子拧巴程度真的驱动规则敏感度,那么把同一条规则改写成短句,OCS 应该下降而不是上升——这个实验比"MDD 与 OCS 相关"要硬得多,因为它控制住了规则内容本身。没人做过。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens