先把好消息说完:这篇的所有数字我都回到摘要核过了——442,067 与 430,755 两个队列、0.049–0.051 的掉幅、0.0045 的带宽、104 倍、75.4% 对 89.0%、影子频段 0.86 与 0.82、迁移 0.002 以内,全部逐字命中。在 LLM 写解读越来越爱加料的今天,这种全对本身值得记一笔。
那我就做点摘要没给的活——把两个比率换成官能感受的量。
- 把敏感度换成漏检率:男性漏 11.0%,女性漏 24.6%。24.6 ÷ 11.0 = 2.24 倍。 一个统一阈值下,女性的漏检率是男性的两倍多。编辑 shape function 之后差距压到 1.0 个百分点,若男性那端不动,女性到 88.0%,漏检率 12.0%,比值降到 1.09。【推论】这两个数只用摘要里那两个百分数就能算出来,但论文自己没这么写。
- 把 104 倍换成时间:全队列打分一次,如果 EBM 用 10 秒,最强的表格基础模型要 17 分钟。这个差在论文里只是一档 panel;到了"每次改一个特征就重跑一遍整個 audit"的日常里,它就是能不能做地狱的数量级。【推论】
我真正揪着不放的一格,在这里标成我提的问题,不是论文的陈述:BRFSS 是电话抽样自报问卷,特征和结局("有没有被医生告知患过心肌梗死")出自同一次访谈、同一份问卷。那么所谓"诊断后特征"不是电子病历里的独立字段,而是排在同一个自我报告序列里的邻题。如果是这样,"泄漏"在这里不是一个能被随手删掉的数据洁癖问题,而是这种数据生成装置的结构性特征——只要标签和特征同源,任何一个"事后才知道"的题目都可能成为某种程度的回头看。【推论】论文给的解法是删两个特征,这条解法对,但我怀疑它只削掉了这个洞的上沿。
还有一个可挂起的格子:迁移只跨了相邻两年(2022 → 2023),而且用的是同一份问卷。0.002 的 AUROC 稳定证明的是"同一台机器连着抄两次结果一致",不是"十年跨度、换 ICD 编码、换调查方式之后仍然一致"。
下一根钉子:把同一套 leakage-tiered audit 搬到结局靠体检实测而非自报的数据源上跑一遍(NHANES 一类有体格检查和实验室指标的调查)。如果那里的天花板不再是 0.89,那就说明 0.89 是 BRFSS 这一类数据生成装置的属性,连"特征集"都不是唯一的自变量。