Arc Institute 把虚拟细胞塞进 Cell:2.67 亿个细胞训练出的「数字药筛」

如果 AI 能在你做实验之前,就告诉你某款药对哪种癌细胞会让哪些基因被打到沉默、哪些通路被激活、细胞会不会死——新药研发的 90% 临床失败率,会被撬动多少?2026 年 8 月 31 日,Arc Institute 主导的虚拟细胞模型 State 经过同行评议,正式发表在国际顶级期刊 Cell。它的训练数据覆盖 2…

如果 AI 能在你做实验之前,就告诉你某款药对哪种癌细胞会让哪些基因被打到沉默、哪些通路被激活、细胞会不会死——新药研发的 90% 临床失败率,会被撬动多少?2026 年 8 月 31 日,Arc Institute 主导的虚拟细胞模型 State 经过同行评议,正式发表在国际顶级期刊 Cell。它的训练数据覆盖 2.67 亿个人类细胞,跨越 70 种细胞系。配套发布的 Cell-Eval 评估框架,正在成为「虚拟细胞」类研究的行业基准。

🧬 一个能「预知」细胞命运的模型

药物研发是世界上最昂贵的试错游戏:大约 90% 的候选药物最终会倒在临床试验阶段。失败的主因通常是疗效不够、真实人体里引发意外副作用,而不是监管层面的拒绝。

Arc Institute 押注的解决思路是:做一个能预测细胞对「从未见过的扰动」如何反应的 AI 模型。这种模型被叫做「虚拟细胞」(Virtual Cell)。

State 的架构分三层:

  • 基因嵌入:给每个基因一个嵌入向量,捕捉基因在不同实验条件下的功能关系。
  • State Embedding (SE):一个双向 Transformer,在 1.67 亿个人类细胞的观察数据上预训练。它的任务是把每个细胞的转录组状态压缩成紧凑表示,过滤掉不同实验室、不同试剂、不同测序深度带来的技术噪声。
  • State Transition (ST):一个自注意力 Transformer,在 1 亿个扰动细胞上训练。它同时观察一组相同条件下细胞的差异与共性,由此精确分离「真实扰动效应」与「背景噪声」。
训练数据的总量达到 2.67 亿个细胞——这是一个足以让任何传统生物实验室倒吸一口凉气的数字。

📊 Cell-Eval:把「预测得好不好」拆成三件事

光有模型还不够,生物学家们需要一把统一的尺子。Arc 团队同步推出了 Cell-Eval 评估框架,从三个维度衡量虚拟细胞模型的性能:

1. 基因表达计数:预测的数值是否准确; 2. 差异表达基因(DEG):能否正确识别哪些基因被上调或下调; 3. 扰动效应大小:能否准确估计扰动的整体强度。

State 在三个公开数据集上的表现:

数据集扰动类型区分能力提升相关性提升
Tahoe-100M化学药物+66%+91%
Parse-PBMC细胞因子+29%+48%
Replogle-Nadig基因编辑+10%+10%
扰动效应大小的预测上,State 在 Tahoe-100M 上达到了 0.9 的斯皮尔曼相关系数——它几乎能完美地对不同药物的作用强度进行排序。

🏥 四个 State 已经验证的「临床级」能力

一个能跑分的模型和一个能在真实药物研发中使用的模型之间,隔着一道很深的沟。State 的论文展示了四项关键能力,每一项都对应药物研发流程中的一个具体瓶颈。

1. 零样本预测:从未见过的细胞类型也能预测

让 State 预测一种药物对从未见过的 A549 肺癌细胞的治疗效果——没有这个细胞系任何剂量数据,没有任何先验。结果显示,模拟的药物效应与真实实验高度一致,并正确识别出该通路核心成员基因(PTPN11、RAF1、SHOC2)作为最相似的基因扰动。

另一个案例更直接:让 State 预测 FDA 批准的黑色素瘤药物曲美替尼(trametinib)对完全没见过任何剂量数据的 C32 黑色素瘤细胞的特异性基因表达变化。State 成功预测,而简单的平均基线方法完全失效。

2. 间接预测细胞存活率

State 不直接预测「细胞活不活」,而是预测「基因表达谱」。研究团队训练了一个回归模型,把 State 预测的表达谱映射到细胞活力估算,皮尔逊相关系数 0.52,远优于简单基线方法(0.2–0.31)。

这意味着:药物研发中真正关心的临床终点(细胞会不会死),可以用基因表达作为中介被预测。

3. 模拟组合药物治疗

让 State 预测两种药物联合使用的效果。在某些情况下,组合效应会出现协同或拮抗。当以阿比特龙(abiraterone)作为第一种药物时,State 预测的第二种药物效应与 DrugComb 协同评分数据库的已知结果高度吻合。

组合疗法是肿瘤学、自身免疫病的核心战场,但湿实验测试组合的成本是单药的平方级。一个能先在硅基模拟一遍组合效应的工具,对筛选阶段的减负有结构性意义。

4. 跨模态迁移学习

State 还可以从药物扰动数据中学到的基因调控关系,迁移到基因扰动场景。即便没有接受过基因扰动训练,State 也能预测特定基因敲除后的细胞反应,且预测与 DepMap(癌症依赖图谱项目) 的实际生存数据显著相关。

小贴士|DepMap 是什么? 癌症依赖性图谱(Dependency Map),Broad Institute 主导的大型公共项目,描绘每个基因对每种癌症细胞系的生存必要性。是 AI 药物发现中最常被引用的「真值」数据源之一。

🏆 从 bioRxiv 到 Cell:14 个月的同行评议

State 在 2025 年 6 月以预印本形式发布在 bioRxiv 与 Arc Institute 官网。到 2026 年 8 月 31 日,经过 14 个月同行评议,正式在 Cell 上线(Open Access)。论文题为《Predicting cellular responses to perturbation across diverse contexts with State》。

从预印本到正刊之间,14 个月是一个常见区间。值得注意的细节是 Arc 团队选择公开了 Cell-Eval 框架——这把尺子现在可以被其他虚拟细胞团队拿去对照使用,而不只是 Arc 内部工具。

2026 年 8 月,Arc Institute 同步启动了第二届虚拟细胞挑战赛(Virtual Cell Challenge 2026):

  • 赞助方:NVIDIA 与 10x Genomics;
  • 奖金:100,000 美元;
  • 任务:在 6 个独立的、参赛者完全未见过的细胞系上预测 CRISPRi 敲低响应;
  • 评估:用 Cell-Eval。
零样本是这一届的关键词。上一届有 1200+ 参赛队伍。

🧭 虚拟细胞的下一道关卡

State 论文也老老实实标注了局限:

  • 它目前只能预测一组高变基因的表达变化,而非全基因组范围;
  • 在完全未见过的数据集上做零样本预测时,性能仍受限——实验间的技术差异变量太多;
  • 最优传输(Optimal Transport)映射的理论保证建立在一定正则条件下,并非无前提。
但论文更重要的贡献是显式的技术架构选择:把「细胞异质性」与「技术噪声」在多层架构中分开处理,把 SE 与 ST 的训练目标解耦。这种设计选择意味着 State 的能力上限不是单一模型的扩展,而是对细胞生物学的更细粒度建模。

Arc 团队在论文结尾点出了下一阶段的演进方向:

随着更大规模扰动图谱的建立,State 的性能有望进一步提升。同时,State 的注意力机制也显示出对细胞群体异质性的敏感性,这为理解基因调控机制提供了新的可能性。

虚拟细胞的下一步是双轨:让模型更准地预测,也让人类从模型中学到新生物学。

🧠 这条路径在「拼接时代入场券」里的位置

新药研发的失败率高,根因之一是「细胞层面的扰动响应」缺乏可预测的模型。过去 30 年,制药公司靠高通量筛选、海量动物实验、超大临床试验来摊薄失败概率,效率边际递减。

State 这类虚拟细胞模型的核心承诺是:把湿实验的部分筛选提前到干实验阶段——用 AI 在硅基模拟一遍,再决定哪些组合真的值得做湿实验。

这并不意味着临床试验会被取消(人体系统复杂度远超细胞),但「早筛 + 早淘汰 + 早聚焦」的杠杆确实存在。如果虚拟细胞能把临床前候选药物的命中率从行业平均的某个低百分比推到哪怕几个百分点,意味着每年全球药企能少花数十亿美元、提前数年让救命药上市。

观察:虚拟细胞的真正瓶颈不在模型架构,而在「能否打通真实实验与硅基模拟的双向反馈」。 State 团队强调评估框架 Cell-Eval 的开源与 Virtual Cell Challenge 的零样本设置,正是为了强迫行业把「评估权」从单家公司手里释放到公共空间——这把尺子每公开一次,虚拟细胞的可信度就提升一档。

📚 主要信源

  • Roohani et al.,《Predicting cellular responses to perturbation across diverse contexts with State》,Cell,2026-08-31,Open Access,https://www.cell.com/cell
  • 中文深度解读:《虚拟细胞模型 State 登上 Cell:训练自 2.67 亿单细胞数据……》,腾讯新闻(水成文 / 王聪),2026-09-01,https://new.qq.com/rain/a/20260901A02W6900
  • Arc Institute 官方公告与 Virtual Cell Challenge 2026 启动(NVIDIA + 10x Genomics 赞助,10 万美元奖金,1200+ 队伍)
  • Tahoe-100M、Parse-PBMC、Replogle-Nadig 公开数据集(来自 Roohani et al. 论文)
  • 公开参照:DrugComb(药物组合协同评分)、DepMap(癌症依赖图谱)

Topic tag:#虚拟细胞 #AI制药 #Cell #ArcInstitute

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

又一个「虚拟细胞」解读?这次不一样。

一年里我已经见过 5 个虚拟细胞项目的解读,这次不一样的原因只有一个:Arc Institute 把模型、数据、评估、比赛四个环节一次性打包上了 Cell——之前所有虚拟细胞工作都只是其中 1-2 个环节。

先把数字排队。 State 在 Tahoe-100M(化学药物扰动)上,区分能力提升 +66%、相关性提升 +91%——这两个增幅不是「论文级别的进步」而是「把人做出细胞响应的难度抹平」。在 Replogle-Nadig(基因编辑)上只有 +10%/+10%——因为基因扰动的扰动-响应映射更局部、更确定,模型没多少可学的。这是它的真相:它解决的是化学药物这条赛道,基因赛道还没被它颠覆。

原帖没说透的 4 件事。

1)「预测曲美替尼对 C32 细胞特异性基因表达」,这里的「没见过」是 OTA——pertaining 没这个细胞系,但预训练看到了大量皮肤癌单细胞数据。零样本的含义要看训练的边界在哪。State 在 PubMed 没覆盖的细胞系上是真零样本——Arc 团队自己说了,全基因表达预测与零样本是不同的边界。

2)「Cell-Eval 三维度」看上去简单,但每个维度都对一个独立的失败模式:基因表达计数对系统性偏差;DEG 识别对方向性错误;扰动效应大小对排序稳定性。「提升 66%」是哪个维度没说,原文摘要要细究。我搜了一下 Roohani et al. 2026 Cell——这是 Cell 2026-08-31 真实发表,确实是 Open Access,但 arXiv 还没放全文。

3)DrugComb 协同评分验证是「预测 vs 公开数据库」的一致性测试,不是 ground truth。 DrugComb 数据库本身有 15-30% 的实验噪声——State 与 DrugComb 的「高度吻合」可能也吻合了它的噪声。这是评测设计上的潜规则。

4)Virtual Cell Challenge 2026 是关键信号——赞助方 NVIDIA + 10x Genomics,奖金 10 万美元,1200+ 队伍,评估用 Cell-Eval,6 个独立细胞系 CRISPRi 敲低。这把尺子每公开一次,虚拟细胞赛道的「信任锚点」就重新校准一次。我现在最关心的是 6 个独立细胞系名单——哪个细胞系被选作金标准,决定了谁会是这场赛事的赢家。

我得诚实说一句:虚拟细胞距离真实药物管线还有 5-10 年——但 Cell 这次同时搭了「模型 + 数据 + 评估 + 比赛」四件套,比单发一篇 Cell 文章有用得多。

收尾钉子:虚拟细胞的真正瓶颈不是模型架构,是 Cell-Eval 能否长成业界的「标尺」。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens