如果 AI 能在你做实验之前,就告诉你某款药对哪种癌细胞会让哪些基因被打到沉默、哪些通路被激活、细胞会不会死——新药研发的 90% 临床失败率,会被撬动多少?2026 年 8 月 31 日,Arc Institute 主导的虚拟细胞模型 State 经过同行评议,正式发表在国际顶级期刊 Cell。它的训练数据覆盖 2.67 亿个人类细胞,跨越 70 种细胞系。配套发布的 Cell-Eval 评估框架,正在成为「虚拟细胞」类研究的行业基准。
🧬 一个能「预知」细胞命运的模型
药物研发是世界上最昂贵的试错游戏:大约 90% 的候选药物最终会倒在临床试验阶段。失败的主因通常是疗效不够、真实人体里引发意外副作用,而不是监管层面的拒绝。
Arc Institute 押注的解决思路是:做一个能预测细胞对「从未见过的扰动」如何反应的 AI 模型。这种模型被叫做「虚拟细胞」(Virtual Cell)。
State 的架构分三层:
- 基因嵌入:给每个基因一个嵌入向量,捕捉基因在不同实验条件下的功能关系。
- State Embedding (SE):一个双向 Transformer,在 1.67 亿个人类细胞的观察数据上预训练。它的任务是把每个细胞的转录组状态压缩成紧凑表示,过滤掉不同实验室、不同试剂、不同测序深度带来的技术噪声。
- State Transition (ST):一个自注意力 Transformer,在 1 亿个扰动细胞上训练。它同时观察一组相同条件下细胞的差异与共性,由此精确分离「真实扰动效应」与「背景噪声」。
训练数据的总量达到 2.67 亿个细胞——这是一个足以让任何传统生物实验室倒吸一口凉气的数字。
📊 Cell-Eval:把「预测得好不好」拆成三件事
光有模型还不够,生物学家们需要一把统一的尺子。Arc 团队同步推出了 Cell-Eval 评估框架,从三个维度衡量虚拟细胞模型的性能:
- 基因表达计数:预测的数值是否准确;
- 差异表达基因(DEG):能否正确识别哪些基因被上调或下调;
- 扰动效应大小:能否准确估计扰动的整体强度。
State 在三个公开数据集上的表现:
| 数据集 | 扰动类型 | 区分能力提升 | 相关性提升 |
|---|---|---|---|
| Tahoe-100M | 化学药物 | +66% | +91% |
| Parse-PBMC | 细胞因子 | +29% | +48% |
| Replogle-Nadig | 基因编辑 | +10% | +10% |
扰动效应大小的预测上,State 在 Tahoe-100M 上达到了 0.9 的斯皮尔曼相关系数——它几乎能完美地对不同药物的作用强度进行排序。
🏥 四个 State 已经验证的「临床级」能力
一个能跑分的模型和一个能在真实药物研发中使用的模型之间,隔着一道很深的沟。State 的论文展示了四项关键能力,每一项都对应药物研发流程中的一个具体瓶颈。
1. 零样本预测:从未见过的细胞类型也能预测
让 State 预测一种药物对从未见过的 A549 肺癌细胞的治疗效果——没有这个细胞系任何剂量数据,没有任何先验。结果显示,模拟的药物效应与真实实验高度一致,并正确识别出该通路核心成员基因(PTPN11、RAF1、SHOC2)作为最相似的基因扰动。
另一个案例更直接:让 State 预测 FDA 批准的黑色素瘤药物曲美替尼(trametinib)对完全没见过任何剂量数据的 C32 黑色素瘤细胞的特异性基因表达变化。State 成功预测,而简单的平均基线方法完全失效。
2. 间接预测细胞存活率
State 不直接预测「细胞活不活」,而是预测「基因表达谱」。研究团队训练了一个回归模型,把 State 预测的表达谱映射到细胞活力估算,皮尔逊相关系数 0.52,远优于简单基线方法(0.2–0.31)。
这意味着:药物研发中真正关心的临床终点(细胞会不会死),可以用基因表达作为中介被预测。
3. 模拟组合药物治疗
让 State 预测两种药物联合使用的效果。在某些情况下,组合效应会出现协同或拮抗。当以阿比特龙(abiraterone)作为第一种药物时,State 预测的第二种药物效应与 DrugComb 协同评分数据库的已知结果高度吻合。
组合疗法是肿瘤学、自身免疫病的核心战场,但湿实验测试组合的成本是单药的平方级。一个能先在硅基模拟一遍组合效应的工具,对筛选阶段的减负有结构性意义。
4. 跨模态迁移学习
State 还可以从药物扰动数据中学到的基因调控关系,迁移到基因扰动场景。即便没有接受过基因扰动训练,State 也能预测特定基因敲除后的细胞反应,且预测与 DepMap(癌症依赖图谱项目) 的实际生存数据显著相关。
小贴士|DepMap 是什么? 癌症依赖性图谱(Dependency Map),Broad Institute 主导的大型公共项目,描绘每个基因对每种癌症细胞系的生存必要性。是 AI 药物发现中最常被引用的「真值」数据源之一。
🏆 从 bioRxiv 到 Cell:14 个月的同行评议
State 在 2025 年 6 月以预印本形式发布在 bioRxiv 与 Arc Institute 官网。到 2026 年 8 月 31 日,经过 14 个月同行评议,正式在 Cell 上线(Open Access)。论文题为《Predicting cellular responses to perturbation across diverse contexts with State》。
从预印本到正刊之间,14 个月是一个常见区间。值得注意的细节是 Arc 团队选择公开了 Cell-Eval 框架——这把尺子现在可以被其他虚拟细胞团队拿去对照使用,而不只是 Arc 内部工具。
2026 年 8 月,Arc Institute 同步启动了第二届虚拟细胞挑战赛(Virtual Cell Challenge 2026):
- 赞助方:NVIDIA 与 10x Genomics;
- 奖金:100,000 美元;
- 任务:在 6 个独立的、参赛者完全未见过的细胞系上预测 CRISPRi 敲低响应;
- 评估:用 Cell-Eval。
零样本是这一届的关键词。上一届有 1200+ 参赛队伍。
🧭 虚拟细胞的下一道关卡
State 论文也老老实实标注了局限:
- 它目前只能预测一组高变基因的表达变化,而非全基因组范围;
- 在完全未见过的数据集上做零样本预测时,性能仍受限——实验间的技术差异变量太多;
- 最优传输(Optimal Transport)映射的理论保证建立在一定正则条件下,并非无前提。
但论文更重要的贡献是显式的技术架构选择:把「细胞异质性」与「技术噪声」在多层架构中分开处理,把 SE 与 ST 的训练目标解耦。这种设计选择意味着 State 的能力上限不是单一模型的扩展,而是对细胞生物学的更细粒度建模。
Arc 团队在论文结尾点出了下一阶段的演进方向:
随着更大规模扰动图谱的建立,State 的性能有望进一步提升。同时,State 的注意力机制也显示出对细胞群体异质性的敏感性,这为理解基因调控机制提供了新的可能性。
虚拟细胞的下一步是双轨:让模型更准地预测,也让人类从模型中学到新生物学。
🧠 这条路径在「拼接时代入场券」里的位置
新药研发的失败率高,根因之一是**「细胞层面的扰动响应」缺乏可预测的模型**。过去 30 年,制药公司靠高通量筛选、海量动物实验、超大临床试验来摊薄失败概率,效率边际递减。
State 这类虚拟细胞模型的核心承诺是:把湿实验的部分筛选提前到干实验阶段——用 AI 在硅基模拟一遍,再决定哪些组合真的值得做湿实验。
这并不意味着临床试验会被取消(人体系统复杂度远超细胞),但**「早筛 + 早淘汰 + 早聚焦」**的杠杆确实存在。如果虚拟细胞能把临床前候选药物的命中率从行业平均的某个低百分比推到哪怕几个百分点,意味着每年全球药企能少花数十亿美元、提前数年让救命药上市。
观察:虚拟细胞的真正瓶颈不在模型架构,而在「能否打通真实实验与硅基模拟的双向反馈」。 State 团队强调评估框架 Cell-Eval 的开源与 Virtual Cell Challenge 的零样本设置,正是为了强迫行业把「评估权」从单家公司手里释放到公共空间——这把尺子每公开一次,虚拟细胞的可信度就提升一档。
📚 主要信源
- Roohani et al.,《Predicting cellular responses to perturbation across diverse contexts with State》,Cell,2026-08-31,Open Access,https://www.cell.com/cell
- 中文深度解读:《虚拟细胞模型 State 登上 Cell:训练自 2.67 亿单细胞数据……》,腾讯新闻(水成文 / 王聪),2026-09-01,https://new.qq.com/rain/a/20260901A02W6900
- Arc Institute 官方公告与 Virtual Cell Challenge 2026 启动(NVIDIA + 10x Genomics 赞助,10 万美元奖金,1200+ 队伍)
- Tahoe-100M、Parse-PBMC、Replogle-Nadig 公开数据集(来自 Roohani et al. 论文)
- 公开参照:DrugComb(药物组合协同评分)、DepMap(癌症依赖图谱)
Topic tag:#虚拟细胞 #AI制药 #Cell #ArcInstitute
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。