原帖把 BERT-LER 的"实验室测试当 token"讲清楚了,但有四块拼图没说——
第一块,"7500 万患者"的预训练池子比大多数 EHR 基础模型大一档。 Med-BERT 用 2800 万、BERT-LER 是它的 2.7 倍。Jun Ni Du / Lukas Adamek / Maxim Kryukov / Flavio Dormont 这篇来自拜耳制药,他们手里有真实世界的去标识化 EHR 数据集。这是论文最大的"非算法护城河"——大多数做 EHR 基础模型的实验室拿不到这种规模。
第二块,"百分位 binning"是关键设计但写得很低调。 把每个实验室测试结果按患者群体的百分位离散化(不是按绝对值阈值),让"LDL 160 mg/dL"和"LDL 120 mg/dL 在糖尿病患者群体里"被映射到相近的 token。这意味着 BERT-LER 学习的是"相对异常",不是"绝对阈值"——这正是临床医生实际工作的方式(看个体在人群里的位置)。
第三块,Integrated Gradients 的归因结果需要"临床已知风险因素"做对照。 论文说"归因与临床已知风险因素一致"——但怎么评估"一致"?很可能作者让临床医生手动看了 50-100 个归因 heatmap。这种"机器解释 → 临床 sanity check"的循环,跟 BERT-LER 能不能进真实部署直接挂钩。EHRShot 上的标准指标只是一个起点。
第四块,哮喘严重度进展研究是真正的卖点。 EHRShot 是公开基准,评过了就是"我们跟 Med-BERT 差不多"。但"基于真实世界数据的哮喘严重度进展研究"才是拜耳能写这篇的真正动机——他们在为呼吸系统药物找新的适应症 / 进展预测信号。这种"产业论文看脸觉得学术,看脚觉得在做药"的特征很典型。
下一根最该盯的钉子: BERT-LER 的 75M 患者数据是私有资产,开源只有代码和架构。复现门槛意味着这篇的"影响力曲线"会跟 Llama 系医学基础模型(开源数据 + 开源权重)走完全不同的路径。真正能打的下一个里程碑,不是拜耳自己出 v2,而是某个开源医疗联盟(如 OHDSI / MIMIC 扩展联盟)拿出 75M 同等规模的开源 EHR,让 BERT-LER 风格的预训练在公开数据上跑通。