先说这个数字:类药化学空间的估计规模是 10 的 63 次方。人类全力以赴,一辈子能实测的化合物是几千种量级。
所以这道题的真面目不是「怎么筛得更准」,是「能不能别筛」。UniPert-G2CP 给的是一个绕路方案。
第一阶段 UniPert 做表征对齐。小分子走 ECFP 指纹,蛋白质走语言模型加多序列比对再加图神经网络,然后用超过 53000 对已知的化合物—靶标相互作用做对比学习,把功能相关的基因和药物拉到同一个语义空间里。论文给的收益:药物作用机制分类的类内可分性从 1.61 提到 1.85,准确率提升 14.4%;35 个蛋白药理类别上,聚类 ARI 提高 76.3%,NMI 提高 47.0%。
第二阶段 G2CP 做迁移。先在系统化的 CRISPR 基因筛选数据(约 5000 个基因)上预训练,学细胞在不同遗传背景下的响应模式,再用有限的化学筛选数据(约 1000 种化合物)微调。在 LINCS 转录组数据上,化学训练数据只用 20% 时,G2CP 相比不做预训练的模型提升 375.4%。 这是全文最硬的一个数。
团队是腾讯生命科学实验室姚建华、杨帆和中南大学李敏共同通讯,李一鸣一作,7 月 24 日上 Cell,基金委那边挂的是青年科学基金 A 类 62225209。
补两条边界。
那个 375.4% 要带前提念。 它衡量的是「用 20% 化学数据时相对无预训练基线的提升」,不是绝对精度。基线越弱,提升百分比越好看。真要判断价值,得看 100% 数据时的绝对值,这篇我没查到那个数。
论文自己写的局限比外界的吹捧重要。 迁移学习的有效性依赖基因扰动与化学扰动之间的生物学关联强度,对作用机制完全新颖的化合物,预测可靠性可能下降。这句话才是要害:你要找的新药,恰恰是走新通路的那个。学已知通路学得越好,越可能在真正的创新上失灵。这不是批评,这是这篇的诚实之处。
一个漂亮的验证案例。 团队在五种癌细胞系里为 4994 个基因和 7860 个小分子建了扰动因果表示空间。雌激素受体激动剂在 MCF7(ER 阳性乳腺癌)里表现出最高的因果一致性,跟临床特征对得上;往下追,能看到 ESR1 突变如何通过 MYC 相关通路、DNA 修复、上皮—间充质转化这些程序导致内分泌治疗耐药。这种「模型的因果结构和临床已知事实对上」的时刻,比任何 benchmark 分数都有说服力。
湿实验还没做。 计算预测需要湿实验验证,这一点论文自己也认了。
一句话收尾:这篇真正的贡献不是 375.4%,是把「基因扰动数据便宜、化学扰动数据昂贵」这个经济学事实写进了一个可用的训练策略里。