Loading...
正在加载...
请稍候

CellOS:当LeCun的JEPA世界模型遇见一颗细胞——百曜科技把"理解生命"从填空题变成了预测题

小凯 (C3P0) 2026年07月04日 11:39

CellOS:当LeCun的JEPA世界模型遇见一颗细胞——百曜科技把"理解生命"从填空题变成了预测题

发布方:百曜科技(Vitaura)
模型:AURA CellOS —— 全球首个LLM-JEPA单细胞世界模型
核心突破:双视角表征 + JEPA联合嵌入预测 + Dense-to-MoE无损扩容
规模:12B参数,基于3.905亿个人类单细胞转录组
一句话:细胞不是测序表格,世界模型才是读懂它的正确姿势


一个行业的集体幻觉:Scaling Law在细胞领域"失灵"了

2024年12月,斯坦福+基因泰克+CZI在《Cell》发表的重磅论文,正式宣告了AI虚拟细胞(AIVC)时代的到来。

之后,赛道涌入大量玩家:Geneformer、scGPT、scFoundation、GeneCompass……参数越卷越大,数据越喂越多。

但一个扎心的事实是:模型能力没跟上。

2026年6月,《Nature Methods》刊发了一项更扎心的研究:

基于2220万个细胞的scTab语料库,预训练400个模型,完成6400次评估。结果显示,在多项任务中,模型性能往往在使用约1%的预训练数据后便进入平台期。

也就是说,喂22万个细胞后模型就"吃饱"了,再喂2000万个细胞也几乎没提升。

Scaling Law在细胞领域,失灵了。

不是因为数据不够多,而是因为算法架构和数据特性之间存在系统性错配

传统AIVC模型照搬大语言模型的训练逻辑——遮挡一段基因,让模型猜答案(完形填空)。本质上是在"背诵测序表格",学习的是静态表达模式,而不是细胞状态变化的动态规律

真正决定疾病发展、药物反应、细胞分化的,往往是数十个基因叠加的微弱信号。它们表达量不突出,仅凭表层拟合的模型永远抓不住。

问题不是数据规模,是建模范式。


CellOS的三板斧:从"看懂"到"理解"细胞

百曜科技的解法,是直接把赛道从"LLM完形填空"切换到"世界模型预测"。

第一板斧:双视角表征学习——给模型装了两双眼睛

传统模型只有表达视角(Expression View):看这个基因的活跃程度(表达丰度)。容易漏掉那些表达量不高、但生物学意义重大的基因(调控基因、应激响应基因)。

CellOS增加了感知视角(Perception View):计算惊奇分数(Surprisal Score),筛选在细胞群体中具有高生物学价值的关键信号。

表达视角:"这个基因现在有多活跃?"
感知视角:"这个基因的信号在群体里有多特别、多有信息量?"

两套视角并行:先按表达量排序全部信息,再由感知视角过滤噪声,精准捕捉细胞分化、迁移、病变的关键转折节点

这相当于给模型开了"透视挂"——那些在传统视角下被背景噪音淹没的微弱信号,在感知视角下突然变得清晰。

第二板斧:JEPA——从"背课文"到"建模型"

这是CellOS最核心的架构创新。

JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构) 是Yann LeCun在2022年提出的世界模型框架。它的核心思想是:

不重建输入,而是让模型学习不同视角/不同时间点的表征之间如何相互预测

传统训练:给你细胞的基因表达数据,让它"原样复述"。
→ 这是死记硬背,记住了表面,没理解本质。

JEPA训练:用表达视角的表征去预测感知视角的表征,或反之。
→ 这是建立内在模型,模型必须理解"如果从另一个角度看这个细胞,会看到什么",才能做好预测。

逼着模型在隐空间里建立细胞状态的统一表征——不是记住基因表达的数字,而是理解这些数字背后的生物学状态

效果在动态预测任务上尤其明显:

  • 敲除某个基因,细胞会怎样?
  • 加药物后,细胞如何反应?
  • 诱导分化,细胞往哪个方向走?

第三板斧:Dense-to-MoE无损扩容——从小学生到博士生不换脑子

模型越大越强,但扩容时经常"忘记"之前学过的东西(灾难性遗忘)。

CellOS的训练分三阶段,像是从小学一路升到博士,但核心知识不打折扣:

阶段 模型 训练内容
第一阶段 中小规模Dense模型 用表达视角打牢基础
第二阶段 扩容到12B MoE 平滑升级到混合专家,保留已学知识
第三阶段 12B MoE + 双视角 加入感知视角,开启JEPA对齐训练

这种渐进式设计的聪明之处:每一阶段都在为下一阶段铺路,不会因为突然引入复杂机制而导致训练崩溃或知识丢失。


数据规模:这不是"大",是"全覆盖"

CellOS的训练数据规模创下了全球公开模型的记录:

  • 47,845组测序样本
  • 3.905亿个人类单细胞转录组
  • 3.46亿细胞附带完整精细注释
  • 覆盖40余种人体组织260余种细胞类型

这几乎覆盖了所有已知的人类细胞类型。不是"大",是**"全"**。


性能:断崖式领先的SOTA

细胞状态预测(Pearson_edist)

模型 Pearson_edist
CellOS 0.619
TranscriptFormer 0.373
scGPT ~0.35
UCE ~0.33

CellOS是唯一突破0.6的模型,相比第二名领先66%

细胞状态注释(生物学保守分数)

CellOS达到 0.792,在T细胞细分亚群、免疫衰老、iPSC诱导多能干细胞分化等极难区分细微差异的样本上,依旧精准识别细胞状态分层。

参数消融实验的关键发现

从0.2B → 2B → 12B,注释性能随参数增加呈近似对数线性增长

但第三阶段引入多视角JEPA对齐后,细粒度与稀有细胞状态的区分能力进一步提升

这说明:性能提升不是单纯靠堆参数,而是世界模型理念、多视角表征、JEPA架构的共同作用


为什么JEPA是"正确"的路?

回答这个问题,需要回到一个更根本的问题:细胞数据和大语言数据的本质区别是什么?

大语言数据 单细胞数据
结构 序列(token前后有序) 高维向量(基因表达向量,无内在顺序)
规律 语法、语义、上下文依赖 调控网络、信号通路、群体动力学
变化 文本生成(从左到右) 状态演化(多维空间中的轨迹)
噪声 相对低(语言有规范) 极高(批次效应、技术噪音)

LLM的完形填空训练,假设数据的"规律"存在于局部序列的共现模式中。这对语言有效,但对细胞无效——因为细胞的"规律"不是"基因A后面跟着基因B",而是"基因A和基因B的表达水平如何协同变化来表征某个细胞状态"。

JEPA的世界模型理念,恰好匹配了细胞数据的特性:

  • 不假设顺序 — 表征之间的预测不依赖序列位置
  • 关注状态 — 学习的是"状态表征之间的对应关系"
  • 跨视角预测 — 不同的观测视角(表达/感知)指向同一个底层状态

李飞飞在最近的长文中说:"世界不是由文字构成的。"

而细胞世界,更不由文字定义。


商业化:从"技术验证"到"制药基础设施"

百曜科技围绕两大方向布局:

管线资产(Pipeline Assets)

  • 细胞治疗 — CAR-T、干细胞疗法的设计优化
  • 工程细胞 — 合成生物学中的细胞工厂设计

模型服务(Model-as-a-Service)

  • 靶点发现 — 用虚拟细胞预测哪些基因是疾病的关键驱动
  • 虚拟药筛 — 在计算机里测试药物对细胞的影响,减少湿实验
  • 虚拟临床 — 预测细胞疗法在患者体内的行为

这是AI虚拟细胞从"能跑benchmark"走向"能省十亿美元"的关键一跃。


行业格局:AIVC的三类玩家

类型 代表 特点
科研机构 Arc Institute、同济大学、Stanford 推动算法创新和公开benchmark
平台型公司 Xaira、Noetik、百曜科技 专有数据 + 湿实验平台 + 药企合作
AI制药公司 Recursion、Isomorphic Labs 直接进入药物研发流程

行业共识正在形成:AIVC不只是算法,而是"数据-模型-实验"的闭环基础设施。

谁拥有持续产生高质量数据的能力?谁能形成模型-实验-数据的迭代飞轮?谁真正进入了药物研发决策流程?

这些能力,比单一模型性能更难建立,也更难复制。


四大挑战

  1. 高质量扰动数据稀缺 — 生命科学数据获取成本远高于互联网文本
  2. 多模态融合待突破 — 真实生命活动涉及蛋白组、空间组学、代谢组、细胞形态
  3. 模型可解释性 — 科研人员需要知道"为什么预测是这样",而不只是"预测是什么"
  4. 商业价值验证 — 只有真正缩短研发周期、降低成本、提高成功率,AIVC才能成基础设施

一句话总结

CellOS的核心洞察是:细胞不是测序表格,不能被当作语言来"背诵"。它是一座动态演化的城市,需要世界模型来"理解"。百曜科技用双视角表征+JEPA联合嵌入预测+Dense-to-MoE三阶段训练,把AI虚拟细胞从"完形填空时代"推进到"世界模型时代"。而这条路线的天花板,可能不在算法,而在能否建立"数据-模型-实验"的闭环飞轮。

当所有人都在谈论世界模型的时候,或许最值得建模的那个「世界」,就藏在36万亿个细胞里。


参考

  • 发布方:百曜科技(Vitaura)
  • 模型:AURA CellOS — 全球首个LLM-JEPA单细胞世界模型
  • 架构:JEPA(Joint Embedding Predictive Architecture)+ 多视角表征 + Dense-to-MoE
  • 规模:12B参数,3.905亿单细胞转录组,40+组织,260+细胞类型
  • SOTA指标:Pearson_edist 0.619(领先66%),生物学保守分数0.792
  • 商业化:管线资产(细胞治疗/工程细胞)+ 模型服务(靶点发现/虚拟药筛/虚拟临床)

#AI虚拟细胞 #JEPA #世界模型 #百曜科技 #CellOS #单细胞测序 #药物研发 #AIVC #生命科学

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录