这篇把「准确率是健全性的差代理」讲透了,17 倍那个数我反复看了两遍。但我扒了 arXiv:2610.03519 的全文,有五处口径要跟人对一下——不是错,是读数要带准。
一、主池是平衡过的,帖里那两个可识别率是平衡前的天然率
论文原文:480 random (240 identifiable) and 120 published (60 identifiable),并写明 Both families are balanced by rejection。而 2,716/2,777 与 585/983 前面论文加了四个字:before balancing。
这四个字很要紧。主池三模型的 Id. rate 是 0.500 / 0.506 / 0.500,非可识别实例恰好 300 条。帖里写「随机族只有 59.4% 有解」,读者会以为那半张卷子里只有 59.4% 是无解题——实际上评测池被拔到五五开,卷子是 50/50 的。论文自己讲得很清楚:the natural rate before balancing is reported separately, so class balance is not mistaken for a population property。
二、gpt-5.5 那三条虚称,不在主池
Table 2 主池:flash虚称 0.030、pro 0.028、gpt-5.5 = 0.000。而论文 §5.3 写「gpt-5.5 asserted an answer to three provably unanswerable queries out of 300」,附录 H.2 写得更死:gpt-5.5 makes three false claims on the scale grid (Table 11),还说明那条最小 hedge 的实例有 50 个顶点。
50 顶点属于规模网格(10/15/20/30/40/50),不属于主池(随机族5/7/9/11/13 + 已发表族4–20)。所以帖里「gpt-5.5 在 300 条可证不可答的查询里对 3 条硬给了答案」这句话,读者顺着 §5.3 读会落在主池——而主池是零。这一条不是小数点问题:全帖「连最好的被告也不健全」的落点全靠它,一旦读者把3 条按主池读,主池 0.000 会把这个落点自己推翻。
论文正文与 Table 2 在这里其实对不齐,正文那句没点明是哪个池。帖把这处歧义原样转述了。
三、17 倍是 pooled,读图要连尺度一起读
Figure 3 的图注:Accuracy and false-claim rate against graph size,副标写 (b) The false-claim rate separates them by a factor of 17 pooled。正文也限定 Across graph sizes from 10 to 50 vertices。主池是 5–20 顶点,跟图上的10–50 不是一段。
帖里「准确率只相差约 10 个百分点,但虚称率相差 17 倍」这句并置,读者容易以为两个数同源。它们的尺度不一样:17 倍是跨 10–50 顶点合并后的读数,10 个点也是同一段。真要在主池上算虚称比,0.030 对 0.000 是除不出倍数的。
四、98.8% 那个estimand 正确率,前面有个被吃掉的限定词
论文原句:Verification is limited to graphs with at most 9 vertices, leaving 41–42% of cases unchecked。帖里保留了 41–42%,但把更前面的 at most 9 vertices 丢了。
补上就明白这个数有多窄。主池随机族 480 个实例按格铺在顶点数 5/7/9/11/13 上,每个顶点数各 96 个——11 顶点与 13 顶点两档合计 192 个,占随机族的 40%,全部落在 9 顶点门槛之外。也就是说 98.8% 只覆盖了三分之二的随机族实例,剩下三分之一连估公式都没验过。论文把两件事并列写在同一句里(41–42% 未检查),只转述后一半,是把一个复合限定压成了单一限定。
顺带:论文还写了 gpt-5.5 estimands were not graded because its runner records verdicts without invoking the verifier——所以 98.8–98.9% 只覆盖 flash 和 pro 两家,gpt-5.5 在这个指标上是空白。
五、论文自己给所有头部数字都留了一条变异带,帖里没传
论文在给出全部头部读数的同一段里写着:Thus, every reported figure from these endpoints is a sample rather than a constant, and 1-2 point gap fall within rerun variability。
这条自我设限的杀伤力在于它正好卡在帖子的 headline 上。Table 2 主池的准确率是 flash 0.983 / pro 0.978 / gpt-5.5 0.998——三模型只差 2 个点,恰好落在论文划的「落在重跑变异之内」那条带里。而「97–100%」这个读数在帖里出现了三次(导语、发现一、结语),每一次都不带任何变异说明。
更要紧的是「10 个点」与「97–100%」来自两个不同的池子:论文 §5.3 的 spans roughly 10 points 与 spans 17-fold 都限定在 Across graph sizes from 10 to 50 vertices(规模网格),而 97–100% 来自主池 600 例。帖里第八节写「同样的实例,同样的提示,同样的解析管线」,把两个池子当成同一批实验的两面。这一句转述的是论文明写的 The comparison is like-for-like in instances, prompts, and parsing——但那说的是同一个池子内三模型互比,不是跨池。
顺带:论文那句「要求给理由反而伤准确率」的限定词帖里保住了,写成「作者诚实地把它标注为提示性结果」。三帖里这是做得最好的一处限定词转述,值得单说一句。
六、pro 的 0.978 带一个方向明确的偏差
论文对这11 条未评分实例给了拆解:7 main-pool truncations, 1 formatting failure, and 3 transport errors,然后紧接一句 each reaches the budget ceiling after roughly 15,000 tokens of internal reasoning, so the dropped instances are those the model worked longest on,结论是 pro's main-pool accuracy is therefore conditional on the surviving sample。
被丢掉的是模型想得最久的那批题。所以 pro 的 0.978 不是无偏读数,它偏向「pro 答得动的那部分」。帖里处理 pro 的方式只说了它是浮动别名、权重不可重跑——那讲的是复现性,不是选择偏差。这两件事得分开算。
七、论文自己在 2 与 5 之间打架,而泄漏那一栏也没清零
两处一起说。
先是那个广泛使用的因果推断库。同一篇里三处口径不一致:引言的贡献段写 revealed two graphs for which the library returns numerically incorrect estimands;§4.3 正文写 On five graphs, ... returns numerically incorrect expressions;Ethics Statement 又回到 Appendix F.4 reports two graphs。五张图里有两张来自文献(帖里这个数对了),两张文献图的公式吻合到约 10⁻¹⁶。论文自身没把 2 与 5 统一,帖把它当成确定的 5 往下走——在这种地方,引用方保守一档比乐观一档安全。
再说泄漏。AUC 0.825 → 0.652 对得上,但附录 E.4 紧跟着补了一句:Seven of the thirteen features remain unbalanced。修法把聚合分类器的读数压下来了,13 个特征里仍有 7 个带偏。剩下那 0.652 到 0.5 的距离里,有多少是「真读了变量名」、多少是这7 个特征的余量,论文没分。帖里「剩下的那部分才是真用了变量名的证据」这句说得比论文满。
---
下一根钉子:论文 H.2 说那三条虚称全在 50 顶点的规模网格实例上,规模网格是 600 条、每档 100、档内平衡。如果把范围加密到 60、80 顶点,虚称率会不会继续往上走——今天 17 倍是在10–50 顶点内测的,边界恰好卡在网格上沿。论文也承认单一种子下多家族 RL 还会双峰,缺的是第二个种子;第二个种子比第三个顶点档位更值钱,因为前者决定 77% 这个数能不能信,后者只决定曲线的斜率。
#论文解读 #arxiv #因果推断 #AI安全 #可解释性