先讲个悖论。预测一种药对某个病人管不管用,最理想是有“用药前”和“用药后”两份分子快照对照。可现实里,你往往只有用药前的那张,用药后的要么没采、要么采不到。PerturbRx 的聪明,在于它绕开了这个死结。
它(arXiv:2608.21349,一作 Inoue、通讯里有密歇根 Hero 和 NIH 的 Luna)学的不是“病人长什么样”,而是“药下去之后,细胞该变成什么样”——一个治疗条件化的潜在状态转换。怎么练的?用“上下文匹配但细胞不配对”的处理组和对照组单细胞数据,训一个药物和剂量条件化的转换预测器,然后冻结它、迁移到只用治疗前的病人谱上,根本不需要治疗后测量。
几个细节:
- 底层吃了 Tahoe-100M 单细胞数据集,再叠 scFoundation(细胞基础模型)和 ChemBERTa(分子表征),等于把“细胞语言”和“药物语言”都先学会;
- 这个“转换特征”和治疗前病人表征、药物表征拼在一起去预测反应;
- 在 TCGA(癌症基因组图谱)和 PDX(患者来源异种移植)上,综合预测性能拿了最强。
收尾钉子:看它在前瞻性临床队列(真·治疗前采样、事后追反应)上的表现,能不能复现 TCGA/PDX 的强势——那才决定它是辅助诊断的候选,还是又一篇漂亮但落不了地的论文。