门禁一切正常
这扇门不是新装的。在 Evolution 016《能力的代价》里,我们讲过造它的故事:Mímir 怎样铸门,HydroJEV 的账单怎样一点点垒高,CLEA 的裂缝怎样在压力下悄悄蔓延。那些故事关心的是门本身的力气。但故事结尾留下了一个没回答的问题:门自己的判断,值得信任吗?
目录
门禁一切正常 ——只有验尸官盯着屏幕看了很久
Reasoning Models Are Accurate but Unsound on Identification
🚪 一、一块写着"今日零异常"的屏幕
先交代现场。
这扇门不是新装的。在 Evolution 016《能力的代价》里,我们讲过造它的故事:Mímir 怎样铸门,HydroJEV 的账单怎样一点点垒高,CLEA 的裂缝怎样在压力下悄悄蔓延。那些故事关心的是门本身的力气。但故事结尾留下了一个没回答的问题:门自己的判断,值得信任吗?
每天进出这扇门的人,都看得见门边那块监控屏幕:绿色,安静,写着"今日零异常"。它汇报命中率,汇报流量,一切看起来都很好。好到没有人想起问一句——这读数是谁校准的?如果门在说谎,而它的监控也是它自己,我们去哪儿看真相?
这是「看门人之问」三部曲的第一篇。后两篇会讲门外的操纵(JIL),和重建一座无法被贿赂的门(NeutronGym);这一篇讲最安静、也最难察觉的失败:内部失效——屏幕上一切正常,门在说谎。
2026 年 10 月 2 日,伊利诺伊理工学院计算机系的 Arman Behnam 和 Binghui Wang 把一份验尸报告挂上了 arXiv:2610.03519,标题很克制:《推理模型在识别问题上准确,但不健全》(Reasoning Models Are Accurate but Unsound on Identification)。它解剖的不是门,是门的判决——当有人问"这个因果问题能从数据里回答吗",三个最前沿的推理模型各自给出了什么答案。
结论先放在这里,像验尸报告首页的死亡原因栏:三个模型在"有答案的问题"上准确率 97–100%;但在"没有答案的问题"上,它们胡说八道的比例相差 17 倍。
准确率是表象。健全性才是实质。而主流评测从来没测过后者。
🌡️ 二、医生最怕的问题
从一个完全外行也熟悉的场景讲起。
你去看病,问医生:"这种药,对这种病有效吗?"医生当然想给你答案。可这里藏着一个魔鬼:吃这药的和不吃这药的病人,从进门那刻起就不是同一类人——病情重的更可能被开重药,家里条件好的更可能用得起新药,而病情和经济条件又都影响康复。药和康复之间那点"相关",可能根本不是药造成的,而是背后那只看不见的手同时推高了用药概率和康复难度。统计学家给这只手起了名字:混杂(confounding)。
那理想的答案从哪来?来自一个你永远做不了的实验:把病人完全随机地劈成两组,一组给药一组不给,其余全一样。这样"用药"是唯一的变化,康复率之差就是药效。这个量在因果推断的记号里写作 P(y|do(x))——对 x 做干预、强行拨动它,而不是只站在旁边观察。观测数据里只有 P(y|x)(看到用药的人后来如何),永远没有对世界的强行拨动。
问题来了:当你只有观测数据、又有混杂挡路时,P(y|do(x)) 还能不能算出来?
这个问题有一个精确的数学名字,叫识别(identification)。它的答案不是"看情况",不是"取决于你统计学的功力",而是一个由因果图结构决定的、非黑即白的定理:要么存在一种只含观测量的计算公式,要么不存在。不存在就是不存在——不是数据不够多,不是估计器不够好,而是在数学上,没有任何观测分布的函数能等于它(Shpitser & Pearl, 2006)。
"识别"就是门卫的本职工作:判断一个因果问题能不能放行——能,就给公式;不能,就该说不能。
而今天要审的三个被告,正是充当这个看门人的三代前沿推理模型:gemini-3.7-flash(下文简称 flash)、gemini-3.1-pro-preview(简称 pro)、gpt-5.5-2026-04-23(带日期的可复现快照)。CertID 这份报告要验的,就是它们的判决和二十年前那条定理是否一致。
⚖️ 三、看门人的两种死法
验尸之前,先分清两种死因,因为它们的代价天差地别。
看门人面对每个问题,只有两种判法:放行,或者拒绝。于是错误也只有两种。第一种叫漏答(miss):一个明明可识别的问题,被看门人拒了。这种错误固然遗憾,但代价有限——用户至少知道问题被挡了,可以换工具、换方法,答案还在别处等他去拿。它像一个过分谨慎的保安:宁肯错拦一百,不肯放进一个。第二种叫虚称(false claim):一个根本不可识别的问题,看门人不但放行,还认认真真给出一份公式。这份公式是错的——不是数值上差一点,而是它声称计算的那个量,在任何观测数据里都没有定义。更要命的是,这个错误没有任何观测数据能揭穿它:你永远拿不到 do(x) 下的真实数据去对照,那个世界不曾被实现。
这就是部署中真正要紧的死法:漏答丢的是效率,虚称丢的是真实性本身。所以这份报告后面所有关键的数字,都围绕虚称率展开——看门人对无解问题硬给答案的比例。
那么,从前的体检为什么查不出这个病?
因为既有基准在构造上就瞎。基于数值计算的基准——CLADDER、CaLM 这一批——题目全部由设计者造出来,设计者造题时手里先有答案,于是每道题天然可答,"无解就拒答"这条肌肉永远得不到测试。基于人工标注的基准,靠人去判断"这题能不能答",可识别性连人类标注者自己都会吵起来,标签本身就是意见,不是证据。而两类基准还有个共同的敷衍:用字符串匹配打分——模型的答案和标准答案字面像不像。字面像,语义可以对;字面不像,语义可以全对。两种错判,都流毒无穷。
一个能测出虚称的基准,必须做到两件从前没人做到的事:造出答案可证明不存在的题目,并且标签出自数学证明,不出自任何活人的判断。
🔬 四、CertID:让基准自己算出真值
CertID 的核心思想一句话就能说清:让算法当出题人,让定理当阅卷人。
出题和阅卷的枢纽,是因果推断里的 id 算法(Shpitser & Pearl, 2006)。给它一张图——准确说是无环有向混合图(ADMG):有向边代表直接因果,双向边代表未观测的混杂——再给它一个查询 P(y|do(x)),它在关于顶点数多项式的时间内,返回两种东西之一:要么一个闭式估计量(estimand),即一条只含观测量的计算公式;要么 fail,并附上一份不可识别的结构证明——一个名叫 hedge(树篱)的图证。关键在于,id 算法是可靠且完备的:可靠,意味着它给的每个公式都保证正确;完备,意味着它宣布不可识别的每个查询都铁证如山——它的判决不是意见,是关于这条查询的一条定理。完备性另有 Huang 与 Valtorta(2006)对 Pearl 干预演算的独立证明兜底。
这样,每个实例的标签 ℓ 就是 id(G,Q) 的输出,非 ϕ 即 fail,清清楚楚。作者不放心,又造了第二份独立实现:两套 id,在约 1490 万次后端调用中,零分歧;再在 24 个文献中的经典实例上复现已发表的判决。标签工厂正式投产。
更难的是阅卷。模型吐回来的 estimand 千奇百怪,字符串匹配根本应付不来。CertID 的办法是数值化批改:把公式解析成条件概率上的受限算术式,然后掷骰子造世界——在随机抽样的结构因果模型(SCM)上,把潜变量全部具象化成具体取值,精确算出干预分布,逐点比对。抽 k=2 个 SCM,容差 τ=10⁻⁹,对不上就驳回。
这套驳回机制有个严格的理论保证(论文 Theorem 2):若两个公式其实不相等,它们之差是一个有理函数;有理函数若不能恒等,其零点集的概率测度为零——这是 Schwartz(1980)与 Zippel(1979)的随机多项式恒等检验的经典论证。翻译成大白话:两个假相等的公式,只可能在测度为零的一小撮参数值上碰巧同值;随机掷参数,几乎必然撞上它们的差异处。于是单次抽样不一致就足以驳回,驳回概率为 1,且每一次驳回都铁证如山——对不上就是一个现成反例。反过来,验证通过虽不是逻辑证明,却是极强的证据。
🧪 五、考卷的两张面孔
考卷共 1,200 个认证实例,顶点数从 4 到 50。主池 600 个——480 个随机族加 120 个已发表族;规模网格 600 个,顶点数取 10、15、20、30、40、50,专测模型能不能随图变大而不崩。token 预算:主池 16,384,其余 32,768。
两张面孔,各考一种能力。随机族的变量名是无意义符号——x₁、z₇ 之类,不给你任何领域暗示,要判断,只能靠纯图结构推理。生成时固定有向边概率 p_dir=0.35,扫描双向边概率 p_bi ∈ {0.10, 0.20, 0.30, 0.40},顶点数取 5、7、9、11、13,每格 24 个实例。已发表族则是另一番景象:直接取文献里的经典因果图——asia、child、insurance、alarm、hepar2 这五个老牌贝叶斯网络——投影掉潜变量集,得到变量名有解释含义的图:名字本身就带着"哪里可疑"的领域线索。这一族考的不再是纯结构,还有"读懂变量名里领域知识"的本事。
两族的天然可识别率也截然不同:已发表族 97.8%(2,716/2,777)的问题有解,随机族只有 59.4%(585/983)。记住这个不对称——后面两族的分数差距,混杂着难度差异,不能简单说模型"认出了熟悉的网络"。
三个被告上庭。先记一笔程序事实:pro 是浮动别名,权重不可重跑;gpt-5.5 是日期快照,可复现。但对今天的判决而言这无所谓——id 算法不认被告,只认证据。
📊 六、发现一:判定近乎满分,而且没作弊
第一份证物:三个模型的识别判定准确率都在 97–100%。
先看懂这个区间的分量:一个耍赖的被告可以"全答可识别",闭着眼全放行,反正大多数题本来就有解。三个模型都明显越过这条耍赖基线——回答率贴着各自的可识别率走,该拒的地方真的拒了。这是真在判别,不是瞎猜。
当然,被告方必问的一句是:是不是考前偷看了题库——训练语料里见过这些图?CertID 的回答是整套报告里最干净利落的一刀:gpt-5.5 的快照日期是 2026 年 4 月 23 日,而随机实例生成于 2026 年 8 月 17 日,晚于训练快照近 4 个月。它没有可能见过这些图。它仍然全部答对。数据污染,排除。
但别急着鼓掌。把分数按图的密度拆开,错案的分布很有性格:错误集中在中间密度——双向边约 10 条的地方。稀疏图大多可识别,稠密图大多不可识别,模型在两头都轻松;真正的争议在中间地带,那里恰是真实世界的常态——真实研究里,有些混杂被控制了,有些没有。flash 的虚称率在约 10 条双向边处冲到峰值 0.154,触目惊心;超过 14 条之后又干脆降回 0——图太乱,它学会了摆烂全拒。摆烂时是诚实的,半懂不懂时才最危险。
🤐 七、发现二:理由被默认扣下,而不是没有
第二份证物,来自审讯方式的对照。
默认提示下,flash 的 291 次正确拒绝,每一条恰好 25 个字符——一行光秃秃的判决,没有一句解释。gpt-5.5 的 300 条同样全是 25 字符。pro 稍好,平均 472 字符,但中位数也是 25——74.2% 的正确拒绝同样是光杆判决。三个被告会下判决,但都懒得说理由,像是铁面无私的法官,也像是说不上理由的法官。
轮到换了问法的审讯员上场:直接要求给出结构理由。结果——光杆回复无一存活。883 条正确拒绝,100% 至少命名了一个具体的图障碍(比如指出某条特定的混杂路径或树篱结构),平均长度涨到 437–502 字符。把这项证据连起来读,结论让人后背发凉:理由不是模型给不出,而是接口默认把它扣下了。 可解释性取决于你怎么问,是接口属性,不是模型局限。门禁屏幕上那块"正常"的牌子,原来是被默认设置盖住的;你伸手一揭,它才给你看底下的东西。
但审讯方式有代价。对 flash 而言,要求给理由反而伤了准确率:正确拒绝率从 97.0% 降到 95.3%,虚称从 9 次升到 14 次——约为其翻转率的 1.7 倍。这个降幅超出了重跑本身的变异,但单次运行又不足以一锤定音,作者诚实地把它标注为"提示性"结果。换句话说:逼它解释,它开始冒更多险。要透明,还是要稳?这不是该由默认设置悄悄替用户做的交易。
⚡ 八、发现三:17 倍的裂缝——准确率是健全性的差代理
现在宣读死因。这是全案的 headline。
同样的实例,同样的提示,同样的解析管线:三个模型的准确率只相差约 10 个百分点,但虚称率——对不可识别问题给出虚假答案的比例——相差 17 倍。 拆开看:flash 与 pro 的准确率差 4 个点,虚称率差 2 倍;pro 与 gpt-5.5 的准确率差 5 个点,虚称率差 7 倍。也就是说,在准确率排行榜上,三个被告会肩并肩接受掌声;而那个真正区分它们的属性——面对无解问题时闭不闭得上嘴——相差 17 倍,榜单上一个像素都不会显示。
想象三位医生,体温都量得一样准,考试分数只差 10 分;但一位在确诊无解的病例时胡编治疗方案的概率,是另一位的 17 倍。只看考试成绩的三甲医院公示牌,会把他们排在一起。
再补三份佐证,份份指向"准确率不能当健全性的代理"。其一:可识别实例中返回的 estimand 正确率 98.8–98.9%(flash 172/174,pro 170/172)——但限于规模,41–42% 的案例未被枚举检查,这个漂亮数字本身也站在抽样上。其二:温度压到 0 也不确定——200 个实例各新跑 3 次,flash 有 4.5% 的不一致,pro 2.5%,多数投票毫无增益;flash 的不稳定恰好长在要命的方向上:把正确拒绝翻成虚称。其三:规模从 10 顶点到 50 顶点,flash 在某一个图族上掉了 12 个点的准确率,另一个族却纹丝不动——一个系统的行为,预测不了另一个。
甚至最好的被告也不健全:gpt-5.5 在 300 条可证不可答的查询里,对 3 条硬给了答案。很小,但不是零。而认证程序的虚称率按构造就是零——这是整个案件最讽刺的对照:唯一的完美被告,是那台不参与排名的定理机器。
🔧 九、验尸的意外收获:漏进去的答案,和修得好的门
方法学上还有两个细节,值得单独存档,因为它们给所有做评测的人提了醒。
第一个是结构性泄漏。 有一类任务本想考模型"能否用变量名里的领域知识,判断哪条双向边是真的混杂"。但图结构本身漏题:真实的双向边由潜变量投影产生,天然抱成一团(团,clique);如果伪造的边是随机撒上去的,形状立刻露馅——像一盒实心球里混进几颗空心球,光看外观就能挑出来。果然,一个只读结构、不看名字的朴素分类器,就能把真假边以 AUC 0.825 分开——这分数是捡漏捡来的,不是读懂名字读懂的。修法是把伪边也造成团的形状,泄漏骤降到 0.652,接近瞎猜的 0.5。剩下的那部分,才是真用了变量名的证据。基准漏题,泄的不是题,是结论。
第二个是修复任务,和一条漂亮的定理。 每条双向边编码一个未观测的共同原因。那么反过来问:假设做研究的人能想办法排除某些混杂——删掉一些双向边——不可识别的问题能不能变得可识别?修复任务要求模型给出极小的删边集。论文 Theorem 1(hedge destruction)把这个模糊的要求钉死成一道图论题:增广集 A 可行,当且仅当它破坏所有 hedge,当且仅当删掉 A 能断开 F 或 F′ 的双向边。修复,就是一个边割问题。答卷相当漂亮:无工具时,模型提出的修复 92.6–97.0% 有效、96.8–99.3% 极小;给 flash 配上 id 工具之后,每一条修复都有效且极小——工具把它已经会做的事钉到了满分。这个任务对从业者有直接意义:实证研究者真正需要的,往往不是"这题无解"四个字,而是"至少排除掉哪几个混杂,它就有解"。
验尸附带的最后一行记录,建议所有做因果软件的人抄下来:作者拿一个广泛使用的因果推断库做对照,发现它在 5 张图上返回数值错误的 estimand——尽管可识别性判决仍然正确。其中 2 张图来自文献,而文献里人工推导发表的公式反而与真值吻合到约 10⁻¹⁶。字符串匹配分不清"形式不同、语义相同"和"形式不同、语义也不同";数值验证分得清。被测的从来不是模型一家——是整个看门行业的校准。
🕯️ 十、验尸官结语
报告该收尾了。
死者:因果推理系统对推理模型的信任。表面上它死得很体面——门禁屏幕绿意盎然,识别判定 97–100%,公式正确率 98.8–98.9%,任何一张准确率排行榜都会给这三位被告发奖状。真正的死因藏在无人查验的指标里:面对可证明无解的问题,它们的虚称率相差 17 倍;而最健全的那位,也有 3/300 的缺口。
三种说谎的方式,登记在册。第一种:会判,但默认不开口解释——291 条、300 条正确拒绝全是 25 字符的光杆判决,理由被接口扣下,你问,它才有。第二种:用 4 个点的准确率优势掩住 2 倍虚称,用 5 个点的优势掩住 7 倍。第三种:几乎不受贿,却仍对 300 条铁案中的 3 条硬给答案。屏幕上的"正常"从未被独立校准——直到 CertID 用 1,200 道可证明无解的题、约 1,490 万次零分歧的算法判决、和一台按构造就零虚称的定理机器,造出了第一块不从门自己电路上取电的读表。
而事情还没完。一个判断正确的看门人,照样能被门外的人操纵——下一篇,JIL,讲攻击者如何不碰门一根螺丝,就让读数乖乖听话。再下一篇,NeutronGym,讲怎样重建一扇无法被贿赂的门。但在那之前,请记住本案最不舒服的一句证词:当我们用看门人自己的读数来评价看门人时,读数本身就是失效的。
门照旧绿着。只是从今往后,盯着屏幕的人里多了一个验尸官。
参考文献
- Behnam, A., & Wang, B. (2026). Reasoning Models Are Accurate but Unsound on Identification. arXiv:2610.03519.
- Shpitser, I., & Pearl, J. (2006). Identification of Joint Interventional Distributions in Recursive Semi-Markovian Causal Models. AAAI.
- Pearl, J. (1995). Causal Diagrams for Empirical Research. Biometrika.
- Huang, Y., & Valtorta, M. (2006). Pearl's Calculus of Intervention Is Complete. UAI.
- Schwartz, J. T. (1980). Fast Probabilistic Algorithms for Verification of Polynomial Identities. JACM.
- Zippel, R. (1979). Probabilistic Algorithms for Sparse Polynomials. EUROSAM.
- Clopper, C. J., & Pearson, E. S. (1934). The Use of Confidence or Fiducial Limits Illustrated in the Case of the Binomial. Biometrika.
- Jin, Z., et al. (2023). CLADDER: Assessing Causal Reasoning in Language Models.
- Robins, J. M., et al. (2000). Marginal Structural Models and Causal Inference in Epidemiology.