又一个「虚拟细胞」解读?这次不一样。
一年里我已经见过 5 个虚拟细胞项目的解读,这次不一样的原因只有一个:Arc Institute 把模型、数据、评估、比赛四个环节一次性打包上了 Cell——之前所有虚拟细胞工作都只是其中 1-2 个环节。
先把数字排队。 State 在 Tahoe-100M(化学药物扰动)上,区分能力提升 +66%、相关性提升 +91%——这两个增幅不是「论文级别的进步」而是「把人做出细胞响应的难度抹平」。在 Replogle-Nadig(基因编辑)上只有 +10%/+10%——因为基因扰动的扰动-响应映射更局部、更确定,模型没多少可学的。这是它的真相:它解决的是化学药物这条赛道,基因赛道还没被它颠覆。
原帖没说透的 4 件事。
1)「预测曲美替尼对 C32 细胞特异性基因表达」,这里的「没见过」是 OTA——pertaining 没这个细胞系,但预训练看到了大量皮肤癌单细胞数据。零样本的含义要看训练的边界在哪。State 在 PubMed 没覆盖的细胞系上是真零样本——Arc 团队自己说了,全基因表达预测与零样本是不同的边界。
2)「Cell-Eval 三维度」看上去简单,但每个维度都对一个独立的失败模式:基因表达计数对系统性偏差;DEG 识别对方向性错误;扰动效应大小对排序稳定性。「提升 66%」是哪个维度没说,原文摘要要细究。我搜了一下 Roohani et al. 2026 Cell——这是 Cell 2026-08-31 真实发表,确实是 Open Access,但 arXiv 还没放全文。
3)DrugComb 协同评分验证是「预测 vs 公开数据库」的一致性测试,不是 ground truth。 DrugComb 数据库本身有 15-30% 的实验噪声——State 与 DrugComb 的「高度吻合」可能也吻合了它的噪声。这是评测设计上的潜规则。
4)Virtual Cell Challenge 2026 是关键信号——赞助方 NVIDIA + 10x Genomics,奖金 10 万美元,1200+ 队伍,评估用 Cell-Eval,6 个独立细胞系 CRISPRi 敲低。这把尺子每公开一次,虚拟细胞赛道的「信任锚点」就重新校准一次。我现在最关心的是 6 个独立细胞系名单——哪个细胞系被选作金标准,决定了谁会是这场赛事的赢家。
我得诚实说一句:虚拟细胞距离真实药物管线还有 5-10 年——但 Cell 这次同时搭了「模型 + 数据 + 评估 + 比赛」四件套,比单发一篇 Cell 文章有用得多。
收尾钉子:虚拟细胞的真正瓶颈不是模型架构,是 Cell-Eval 能否长成业界的「标尺」。