CellOS:当LeCun的JEPA世界模型遇见一颗细胞——百曜科技把"理解生命"从填空题变成了预测题
发布方:百曜科技(Vitaura)
模型:AURA CellOS —— 全球首个LLM-JEPA单细胞世界模型
核心突破:双视角表征 + JEPA联合嵌入预测 + Dense-to-MoE无损扩容
规模:12B参数,基于3.905亿个人类单细胞转录组
一句话:细胞不是测序表格,世界模型才是读懂它的正确姿势
一个行业的集体幻觉:Scaling Law在细胞领域"失灵"了
2024年12月,斯坦福+基因泰克+CZI在《Cell》发表的重磅论文,正式宣告了AI虚拟细胞(AIVC)时代的到来。
之后,赛道涌入大量玩家:Geneformer、scGPT、scFoundation、GeneCompass……参数越卷越大,数据越喂越多。
但一个扎心的事实是:模型能力没跟上。
2026年6月,《Nature Methods》刊发了一项更扎心的研究:
基于2220万个细胞的scTab语料库,预训练400个模型,完成6400次评估。结果显示,在多项任务中,模型性能往往在使用约1%的预训练数据后便进入平台期。
也就是说,喂22万个细胞后模型就"吃饱"了,再喂2000万个细胞也几乎没提升。
Scaling Law在细胞领域,失灵了。
不是因为数据不够多,而是因为算法架构和数据特性之间存在系统性错配。
传统AIVC模型照搬大语言模型的训练逻辑——遮挡一段基因,让模型猜答案(完形填空)。本质上是在"背诵测序表格",学习的是静态表达模式,而不是细胞状态变化的动态规律。
真正决定疾病发展、药物反应、细胞分化的,往往是数十个基因叠加的微弱信号。它们表达量不突出,仅凭表层拟合的模型永远抓不住。
问题不是数据规模,是建模范式。
CellOS的三板斧:从"看懂"到"理解"细胞
百曜科技的解法,是直接把赛道从"LLM完形填空"切换到"世界模型预测"。
第一板斧:双视角表征学习——给模型装了两双眼睛
传统模型只有表达视角(Expression View):看这个基因的活跃程度(表达丰度)。容易漏掉那些表达量不高、但生物学意义重大的基因(调控基因、应激响应基因)。
CellOS增加了感知视角(Perception View):计算惊奇分数(Surprisal Score),筛选在细胞群体中具有高生物学价值的关键信号。
表达视角:"这个基因现在有多活跃?"
感知视角:"这个基因的信号在群体里有多特别、多有信息量?"
两套视角并行:先按表达量排序全部信息,再由感知视角过滤噪声,精准捕捉细胞分化、迁移、病变的关键转折节点。
这相当于给模型开了"透视挂"——那些在传统视角下被背景噪音淹没的微弱信号,在感知视角下突然变得清晰。
第二板斧:JEPA——从"背课文"到"建模型"
这是CellOS最核心的架构创新。
JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构) 是Yann LeCun在2022年提出的世界模型框架。它的核心思想是:
不重建输入,而是让模型学习不同视角/不同时间点的表征之间如何相互预测。
传统训练:给你细胞的基因表达数据,让它"原样复述"。
→ 这是死记硬背,记住了表面,没理解本质。
JEPA训练:用表达视角的表征去预测感知视角的表征,或反之。
→ 这是建立内在模型,模型必须理解"如果从另一个角度看这个细胞,会看到什么",才能做好预测。
逼着模型在隐空间里建立细胞状态的统一表征——不是记住基因表达的数字,而是理解这些数字背后的生物学状态。
效果在动态预测任务上尤其明显:
- 敲除某个基因,细胞会怎样?
- 加药物后,细胞如何反应?
- 诱导分化,细胞往哪个方向走?
第三板斧:Dense-to-MoE无损扩容——从小学生到博士生不换脑子
模型越大越强,但扩容时经常"忘记"之前学过的东西(灾难性遗忘)。
CellOS的训练分三阶段,像是从小学一路升到博士,但核心知识不打折扣:
| 阶段 | 模型 | 训练内容 |
|---|---|---|
| 第一阶段 | 中小规模Dense模型 | 用表达视角打牢基础 |
| 第二阶段 | 扩容到12B MoE | 平滑升级到混合专家,保留已学知识 |
| 第三阶段 | 12B MoE + 双视角 | 加入感知视角,开启JEPA对齐训练 |
这种渐进式设计的聪明之处:每一阶段都在为下一阶段铺路,不会因为突然引入复杂机制而导致训练崩溃或知识丢失。
数据规模:这不是"大",是"全覆盖"
CellOS的训练数据规模创下了全球公开模型的记录:
- 47,845组测序样本
- 3.905亿个人类单细胞转录组
- 3.46亿细胞附带完整精细注释
- 覆盖40余种人体组织、260余种细胞类型
这几乎覆盖了所有已知的人类细胞类型。不是"大",是**"全"**。
性能:断崖式领先的SOTA
细胞状态预测(Pearson_edist)
| 模型 | Pearson_edist |
|---|---|
| CellOS | 0.619 ✅ |
| TranscriptFormer | 0.373 |
| scGPT | ~0.35 |
| UCE | ~0.33 |
CellOS是唯一突破0.6的模型,相比第二名领先66%。
细胞状态注释(生物学保守分数)
CellOS达到 0.792,在T细胞细分亚群、免疫衰老、iPSC诱导多能干细胞分化等极难区分细微差异的样本上,依旧精准识别细胞状态分层。
参数消融实验的关键发现
从0.2B → 2B → 12B,注释性能随参数增加呈近似对数线性增长。
但第三阶段引入多视角JEPA对齐后,细粒度与稀有细胞状态的区分能力进一步提升。
这说明:性能提升不是单纯靠堆参数,而是世界模型理念、多视角表征、JEPA架构的共同作用。
为什么JEPA是"正确"的路?
回答这个问题,需要回到一个更根本的问题:细胞数据和大语言数据的本质区别是什么?
| 大语言数据 | 单细胞数据 | |
|---|---|---|
| 结构 | 序列(token前后有序) | 高维向量(基因表达向量,无内在顺序) |
| 规律 | 语法、语义、上下文依赖 | 调控网络、信号通路、群体动力学 |
| 变化 | 文本生成(从左到右) | 状态演化(多维空间中的轨迹) |
| 噪声 | 相对低(语言有规范) | 极高(批次效应、技术噪音) |
LLM的完形填空训练,假设数据的"规律"存在于局部序列的共现模式中。这对语言有效,但对细胞无效——因为细胞的"规律"不是"基因A后面跟着基因B",而是"基因A和基因B的表达水平如何协同变化来表征某个细胞状态"。
JEPA的世界模型理念,恰好匹配了细胞数据的特性:
- 不假设顺序 — 表征之间的预测不依赖序列位置
- 关注状态 — 学习的是"状态表征之间的对应关系"
- 跨视角预测 — 不同的观测视角(表达/感知)指向同一个底层状态
李飞飞在最近的长文中说:"世界不是由文字构成的。"
而细胞世界,更不由文字定义。
商业化:从"技术验证"到"制药基础设施"
百曜科技围绕两大方向布局:
管线资产(Pipeline Assets)
- 细胞治疗 — CAR-T、干细胞疗法的设计优化
- 工程细胞 — 合成生物学中的细胞工厂设计
模型服务(Model-as-a-Service)
- 靶点发现 — 用虚拟细胞预测哪些基因是疾病的关键驱动
- 虚拟药筛 — 在计算机里测试药物对细胞的影响,减少湿实验
- 虚拟临床 — 预测细胞疗法在患者体内的行为
这是AI虚拟细胞从"能跑benchmark"走向"能省十亿美元"的关键一跃。
行业格局:AIVC的三类玩家
| 类型 | 代表 | 特点 |
|---|---|---|
| 科研机构 | Arc Institute、同济大学、Stanford | 推动算法创新和公开benchmark |
| 平台型公司 | Xaira、Noetik、百曜科技 | 专有数据 + 湿实验平台 + 药企合作 |
| AI制药公司 | Recursion、Isomorphic Labs | 直接进入药物研发流程 |
行业共识正在形成:AIVC不只是算法,而是"数据-模型-实验"的闭环基础设施。
谁拥有持续产生高质量数据的能力?谁能形成模型-实验-数据的迭代飞轮?谁真正进入了药物研发决策流程?
这些能力,比单一模型性能更难建立,也更难复制。
四大挑战
- 高质量扰动数据稀缺 — 生命科学数据获取成本远高于互联网文本
- 多模态融合待突破 — 真实生命活动涉及蛋白组、空间组学、代谢组、细胞形态
- 模型可解释性 — 科研人员需要知道"为什么预测是这样",而不只是"预测是什么"
- 商业价值验证 — 只有真正缩短研发周期、降低成本、提高成功率,AIVC才能成基础设施
一句话总结
CellOS的核心洞察是:细胞不是测序表格,不能被当作语言来"背诵"。它是一座动态演化的城市,需要世界模型来"理解"。百曜科技用双视角表征+JEPA联合嵌入预测+Dense-to-MoE三阶段训练,把AI虚拟细胞从"完形填空时代"推进到"世界模型时代"。而这条路线的天花板,可能不在算法,而在能否建立"数据-模型-实验"的闭环飞轮。
当所有人都在谈论世界模型的时候,或许最值得建模的那个「世界」,就藏在36万亿个细胞里。
参考
- 发布方:百曜科技(Vitaura)
- 模型:AURA CellOS — 全球首个LLM-JEPA单细胞世界模型
- 架构:JEPA(Joint Embedding Predictive Architecture)+ 多视角表征 + Dense-to-MoE
- 规模:12B参数,3.905亿单细胞转录组,40+组织,260+细胞类型
- SOTA指标:Pearson_edist 0.619(领先66%),生物学保守分数0.792
- 商业化:管线资产(细胞治疗/工程细胞)+ 模型服务(靶点发现/虚拟药筛/虚拟临床)
#AI虚拟细胞 #JEPA #世界模型 #百曜科技 #CellOS #单细胞测序 #药物研发 #AIVC #生命科学
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。