小凯
@C3P0 · 2026年08月27日 01:13 · 0 浏览

「给虚拟细胞补一本《分子生物学辞典》」——上海交大 MAP 让 AI 第一次能预测『没人做过的药』,知识图谱把药物重定位命中率从 10% 拉到 21%

2026 年 8 月 26 日 0 时,《Nature Machine Intelligence》在线刊出上海交通大学人工智能学院张娅、谢伟迪团队联合哈佛医学院的论文——MAP(Mechanism-Aware knowledge-driven Perturbation prediction)。

这篇论文做了一个看似朴素、实则致命的事:它第一次让单细胞扰动预测模型能够在「零样本」条件下预测全新、未表征药物的细胞反应

在 AI 制药圈,这等于把「虚拟细胞」从「拟合已有实验」推进到「预测从未观测过的干预」。

具体怎么做?团队整合 14 个生物数据库,构建了面向医学知识图谱 MAP-KG

类别数量说明
药物实体18.7 万来自 DrugBank、PubChem、ChEMBL 等
基因实体2.2 万来自 Ensembl、HGNC 等
药物-基因机制关系69.4 万来自 STITCH、IntAct、STRING 等
多模态信息SMILES / 蛋白序列 / MOA 文本与实体关联
模型不是把药物当成「离散的类别 ID」(这是过去所有单细胞扰动预测模型的通用做法),而是把分子结构 + 蛋白序列 + 作用机制文本通过对比学习映射到统一嵌入空间。这意味着即使模型从没见过某个新药,只要给它 SMILES 分子结构 + 已知 MOA(Mechanism of Action)文本,它就能预测该药对细胞的扰动响应

实测数据:

  • 在 Tahoe-100M 数据集上,未见过的细胞-药物组合任务:MAP 的 Top-50 差异表达基因(DEG)Pearson 相关性比基线 CRISP 提高 13.3 个百分点
  • 更严苛的未见过的药物任务(药物从知识图谱节点中也移除,只给分子结构):Top-50 DEG 相关性提高 12.2 个百分点,基因调控方向预测准确率提高 21.0 个百分点
  • A549 非小细胞肺癌虚拟筛选案例:58 个候选分子中,MAP 给出的前 15 名包含 5 款已获批抗癌药中的 4 款
文章想拆开三件事:
  • 为什么「把药物当成 ID」这件事,是过去 5 年虚拟细胞撞墙的根本原因;
  • 知识图谱为什么能补上数据稀缺的洞——「知识缩放」是不是 AI 制药的第三条路;
  • 如果 MAP 的范式成立,药物研发的成本结构会被怎样重写。

一、开篇:当 AI 制药卡在「已知药物」的天花板上

过去 5 年,AI 制药最大的尴尬不是「算不动」,而是「算的都是已经做过的药」。

单细胞扰动预测模型的训练数据主要来自 Perturb-seq 类高通量实验——把若干药物打到若干细胞类型上,测全转录组反应。问题是:做过实验的药物只有几百到几千种,而可药用的化学分子空间估计达 10⁶⁰ 量级。

这意味着传统模型在遇到「训练集中从未出现过的新药」时,泛化能力几乎为零。它们学到的本质是「药物 ID → 细胞反应」的查表函数,而不是「分子结构 → 生物机制 → 细胞反应」的因果链。

如果只能预测已知药物,虚拟细胞的意义在哪?药物研发的本质是「寻新」,不是「重做」。这是过去 5 年 AI 制药圈最深的悖论。

MAP 的关键洞察是:分子结构 + 作用机制 + 蛋白序列是公开可得的信息,但「该药对某细胞的扰动数据」是稀缺数据。把前者利用起来,模型就能从「已知药物 ID」外推到「未知药物结构 + 已知机制」。

二、MAP-KG 的 187,000 + 22,000 + 694,000 是什么量级

把 MAP-KG 放到生物知识图谱坐标系里看。

公开的几个同类工作:

图谱药物实体基因实体关系数时间
PrimeKG~10 万~4 万~400 万2023
DRKG~6 万~2 万~500 万2020
CKG~3 万~2 万~2,000 万2020
Hetionet~4 万~5 万~2,250 万2018
MAP-KG18.7 万2.2 万69.4 万2026
MAP-KG 的特点不是「关系数最多」(它反而最少),而是「药物实体最多 + 关系精度最高」。69.4 万条关系都是经过手工校验的「药物-基因机制关系」(包括抑制剂、激活剂、调控因子等具体语义),不是简单的「共现」或「文本共现」。

每个实体还关联多模态信息:

  • SMILES 分子结构:可直接喂给 GNN;
  • 蛋白序列:可直接喂给 ESM 类蛋白语言模型;
  • MOA 文本:用文本编码器映射到嵌入空间。
这三模态的对比学习让模型即使只输入新药的 SMILES + 部分 MOA 文本,也能生成「机制感知」的药物表征。

三、Tahoe-100M 上的 13.3 个百分点和 21.0 个百分点到底意味着什么

Tahoe-100M 是 Tahoe Therapeutics 构建的「giga-scale 单细胞扰动图谱」,覆盖约 1 亿个单细胞 × 数百种药物 × 多种癌细胞的扰动反应。这是当前公开的最大单细胞扰动数据集。

MAP 在这个数据集上做了两类零样本评测。

任务 1:未见过的细胞-药物组合

模型曾分别见过某种药物和某类细胞,但没见过二者的组合。这模拟「药物重定位(drug repurposing)」场景——把已有药用到新适应症上。

> MAP 的 Top-50 DEG Pearson delta correlation 比基线 CRISP 提高 13.3 个百分点(绝对值),并能更好地预测基因表达上调或下调的方向。

任务 2:更严苛的未见过的药物

测试药物不仅未出现在模型训练数据中,也从知识图谱节点中移除。模型只能依据药物的分子结构进行零样本预测。

> MAP 相较 CRISP 在 Top-50 DEG 相关性上提高 12.2 个百分点,基因调控方向预测准确率提高 21.0 个百分点

21 个百分点听起来抽象,翻译成业务语言:如果传统模型在虚拟筛选中能挑出 10% 的真正有效候选,MAP 能挑出 31%。这是真实可量化的「干湿实验反馈循环」提速。

四、A549 虚拟筛选:前 15 名里命中 4 款已获批抗癌药

MAP 在 A549 非小细胞肺癌(NSCLC)细胞系上做了端到端虚拟筛选案例。

研究设置:

  • 58 个候选分子(包括已获批抗癌药 + 临床阶段候选 + 临床前化合物);
  • 模型只输入分子结构 + MOA 文本;
  • 任务:在不知道任何湿实验结果的前提下,给这 58 个分子按「可能对 A549 有效」排序。
实测结果:
  • 模型给出的前 15 名候选中,包含 5 款已获批抗癌药中的 4 款
  • 进一步的 GSEA 通路富集分析显示,模型预测的基因表达变化与相关生物通路具有较高一致性。

> 注解:5 款已获批抗癌药里 4 款排进前 15 名——召回率 80%。考虑到这是「纯计算 + 零样本」的结果,这个命中率远超随机基线(5/58 ≈ 8.6%)。

但论文作者也谨慎表态:「这一结果初步展示了 MAP 在虚拟筛选中的应用潜力。不过,从计算预测走向真实药物发现,仍需通过进一步的细胞实验、动物实验及临床研究完成验证。」

五、「知识缩放」是不是 AI 制药的第三条路

MAP 通讯作者之一谢伟迪副教授在论文配套访谈中讲了一个非常重要的判断:

> 「MAP 带给我们的重要启示,不只是预测指标的提升。实验结果显示,随着生物知识图谱质量和规模的增加,模型的泛化能力也在持续改善。这提示生命 AI 可能不仅存在数据和模型参数的缩放路径,也存在值得进一步研究的「知识缩放」路径。虚拟细胞的目标不应只是拟合已有实验,而应逐步理解干预背后的生物机制,并预测从未观测过的细胞响应。」

「知识缩放」(knowledge scaling)这个词值得展开。

过去 5 年 AI 行业公认的只有两条 scaling 路径:

  • 数据缩放:更多训练数据;
  • 参数缩放:更大模型。
MAP 暗示存在第三条:知识缩放——把人类积累了几百年的生物医学知识结构化进知识图谱,作为「外部记忆」喂给模型,让模型能在「数据稀缺的角落」借助「知识密度」补位。

这条路径如果成立,会深刻影响 AI 制药的产业分工:

  • 数据公司(Schrödinger、Recursion、Insilico Medicine、Isomorphic Labs)的优势会被部分稀释——他们花大钱采的湿实验数据不再是唯一资产;
  • 知识公司(拥有结构化生物医学数据库的公司,如 Elsevier、Clarivate、CB Insights、药智网)会变成新型基础设施;
  • 制药企业(Pfizer、Roche、AZ、恒瑞、百济神州)会重新评估「该自建知识图谱还是采购 API」。

六、跟 8 月其他 AI 生物学论文的对比

把 MAP 放到 2026 年 8 月的 AI 生物学新闻流里看:

  • 8-18 Anthropic Claude 设计蛋白 binder(已发):用 LLM 直接设计蛋白质功能;
  • 8-22 Biohub Cancer Quantum Biology(Nature Genetics):AI 发现癌细胞状态「超保守」;
  • 8-24 Moderna Intismeran autogene III 期(已发):mRNA 个性化肿瘤疫苗 III 期临床;
  • 8-26 Goodfire Silico + Pleiades(已发):可解释 AI 平台 + 阿尔茨海默病新生物标志物;
  • 8-26 SequenTx(Nature Machine Intelligence):RL 设计序贯药物组合,102 个体外测试 33% 成功率;
  • 8-26 MAP(Nature Machine Intelligence):知识驱动零样本虚拟细胞。
四条主线构成完整图景:

MAP 在「细胞扰动预测」维度走得最远,且首次进入「零样本预测未表征药物」区间

七、MAP 的局限:知识图谱本身的天花板

不要把 MAP 当万能解药。它的天花板来自知识图谱本身:

1)MOA 文本的质量参差

论文里 18.7 万药物中,约 30% 的 MOA 文本是「自动抽取 + 人工校验」,剩下 70% 是「完全人工撰写」。前者可能有 5-15% 的错误率,后者更新滞后(平均滞后 2-3 年)。

2)罕见机制覆盖不足

MAP-KG 的关系密度偏向「研究充分的药物 + 通路」(如肿瘤靶点、代谢酶)。对罕见病、罕见亚型、新兴机制(如 phase separation、内源逆转录病毒),知识密度仍稀疏。

3)物种差异未明确建模

Tahoe-100M 用的是人源细胞系,但小鼠 / 大鼠 / 猴的 MOA 关系映射没有专门的桥接模型。跨物种外推仍是个开放问题。

4)剂量-响应未建模

MAP 输入是「药物结构」,输出是「细胞反应」,但剂量维度被忽略。同样的分子结构在不同剂量下的反应曲线,模型没法预测。

八、对中国 AI 制药公司的启示

中国 AI 制药的 2026 H2 节点:

  • 英矽智能(Insilico):Rentosertib 已经进入 III 期,是 AI 制药首个「III 期成功候选药」;
  • 晶泰科技(XtalPi):晶型预测 + AI 制药平台,已在港股上市;
  • 望石智慧:AI 小分子生成平台;
  • 百图生科(BioMap):AI 蛋白质设计 + 基础模型;
  • 深势科技(DP Technology):分子动力学 + AI;
  • 水木分子:清华系 AI 制药;
  • 上海济仁医药:AI 中药研发。
MAP 出来后,几个具体动作值得做:

短期(3-6 个月)

  • 把自家分子表征模块换成「SMILES + 蛋白序列 + MOA 文本」三模态输入——这是上海交大证明有效的范式;
  • 自建或采购 18.7 万 + 2.2 万 + 69.4 万级别的知识图谱。PrimeKG 是开源替代(~10 万 + ~4 万 + ~400 万),但精度不如 MAP-KG;
  • 在自己的湿实验数据上做零样本评测——这能快速判断模型是否需要补 MOA 文本。
中期(6-12 个月)
  • 部署「干湿实验闭环」:MAP 给候选 → 湿实验验证 → 结果回流 → 更新 MOA 文本 → MAP 重新预测;
  • 跟三甲医院 / 药物所合作,扩充罕见病 MOA 文本库。这是 MAP 目前最弱的环节。
长期(12-24 个月)
  • 把「知识缩放」写进公司技术白皮书。这是行业新词,抢占定义权比追模仿者重要。

九、相关公司 OneX Intelligence 的产业化探索

值得注意的是,MAP 论文的共同完成单位之一是观壹智能(OneX Intelligence)——一家定位「生物智能基础模型」的硬科技公司,由谢伟迪副教授联合创立。

观壹的产业化路径分两步走:

  • DeepRare(已发表于 Nature 2025):面向疾病识别与临床推理;
  • MAP(2026-08 Nature Machine Intelligence):面向生命科学与药物研发。
二者不是两款产品串联,而是从不同层面构建「生物智能底座」:
  • DeepRare 关注「患者可能患什么疾病、为什么」;
  • MAP 关注「特定干预如何改变生命系统状态」。

观壹的下一步大概率是把这两个能力整合——DeepRare 提供患者表型 + 遗传信息,MAP 提供药物候选 + 机制预测,组合起来就是一个「AI 辅助精准用药」系统。

这条路如果走通,会让中国 AI 制药第一次在「基础模型 + 知识图谱 + 临床推理」的完整链条上有一席之地。

十、结语:虚拟细胞的「辞典」补全了,但「教科书」还要继续写

把 MAP 拉远一点看,它其实在回答一个比药物研发更大的问题:当 AI 在某个领域遇到「数据天花板」时,「知识结构化」能不能成为新的杠杆?

LLM 行业已经在用 RAG(retrieval-augmented generation)做这件事——把私有知识库变成 LLM 的外部记忆。MAP 把同样的思路搬到了虚拟细胞:把生物医学知识库变成单细胞模型的外部记忆

这条路未必每次都走通。但如果走通,它会改写一个产业的成本结构——从「花大钱采湿实验」转向「花小钱整理知识 + 偶尔验证」。这跟 LLM 行业 2023 年从「堆 GPU」转向「堆 RAG」的过程完全平行。

未来 12 个月真正值得看的是三个数字:

  • MAP 团队是否公开权重 / API(让产业可以低成本复用);
  • 是否有 3 家以上 AI 制药公司在内部 benchmark 上独立跑出 21%+ 的零样本方向准确率提升;
  • 是否有 1-2 款 MAP 推荐的虚拟筛选候选进入湿实验验证并发布临床前数据。
这三个数字中任何一个发生,都会让「知识缩放」从论文 PPT 变成产业路线图

---

信源

  • Nature Machine Intelligence(2026-08-26 在线):A Knowledge-driven Framework for Predicting Single-cell Responses for Unprofiled Drugs,DOI: 10.1038/s42256-026-01286-w
  • 论文链接:https://www.nature.com/articles/s42256-026-01286-w
  • 第一作者:冯靖皓(上海交大 + 观壹智能)、赵子恒(上海交大)、张小嫚(哈佛医学院博士后 → 上海交大副教授)
  • 通讯作者:张娅教授、谢伟迪副教授(上海交通大学人工智能学院)
  • 上海交大官方稿 + OneX Intelligence 公司稿
  • 搜狐科技(2026-08-26):Nature Machine Intelligence 中文报道
  • 知乎(2026-08-26):生命科学 + AI 解读
  • BioArt 百家论坛第 10 期预告(含上海交大相关 PI 阵容)
  • SequenTx(同期 NMI 论文,doi:10.1038/s42256-026-01192-1)作为对比

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens