Cell 189(19):5980–5994.e8 / DOI 10.1016/j.cell.2026.08.026 / 9-17 入选封面 / 13 作者含 Zhavoronkov / Liquid AI + 巴克衰老所 + 哈佛医学院 + 布莱根妇女医院 / 港股 9-18 收涨 13.12%
一颗草莓从青到红,是按时间表走的光照、温度、乙烯的浓度,按一连串数字准时触发。一颗草莓从红到烂,时间表会更短,因为防御机制开始失效。
衰老这件事和草莓很像它有可以测量的「时钟」,也有从「能抵抗」到「不能抵抗」的转折点。今天测衰老时钟的工具大多是「基于一组分子标记的回归模型」,每一种模型都依赖特定的样本类型。今天用 AI 测衰老时钟的工具大多是「通用大模型加 prompt」,每一次 prompt 都可能被训练数据里的偶然相关项骗过。
英矽智能(Insilico Medicine)9 月 17 日在 Cell 上挂了一篇封面文章【直引 DOI 10.1016/j.cell.2026.08.026】。标题是 An open benchmark and language models for AI in aging biology,13 位作者,第一作者与共同通讯作者是 Alex Zhavoronkov英矽智能创始人兼联合首席执行官。
论文给衰老生物学领域开源了三件套:一个评测 AI 在衰老数据上推理能力的基准 LongevityBench、一个 0.6B 到 9B 参数的轻量模型族 Longevity-LLMs、一个能自主调用工具提名干预靶点的智能体平台 Longevity Claw。
三件套打包给出了一组反直觉的数字9B 的 L-Qwen3.5-9B 在 26 个参评系统里综合排名第一,跑赢 Gemini-3.1-Pro、Claude Opus-4.6、GPT-5.2、Kimi-K2.5 这些前沿模型;最小号 0.6B 的 L-Qwen3-0.6B 在 DNA 甲基化年龄预测上的一致性是 0.868,前沿模型最佳只有 0.685;Olink 蛋白组年龄预测上 L-Qwen3-0.6B 的平均绝对误差是 5.7 年,前沿最佳 10.1 年。
这件事给 2026 年 AI for Biology 领域提供了一个具体的范式在垂直领域,「专用小模型 + 高质量评测」比「通用大模型 + 通用评测」更接近真实研究需求。
三件套与它们的合作关系
Cell 论文的 13 位作者背后站着五个机构:英矽智能(Insilico Medicine)、Liquid AI、巴克衰老研究所(Buck Institute for Research on Aging)、哈佛医学院(Harvard Medical School)、布莱根妇女医院(Brigham and Women's Hospital)【直引 unite.ai 与 completeaitraining.com 收录的论文署名信息,2026-09-17】。
英矽智能是临床阶段的 AI 制药公司,2024 年在港交所上市(HKEX: 3696)。它在 2026-09-07 先在 Nature Biotechnology 上挂了一篇 IIa 期临床试验文章其 AI 发现并设计的特发性肺纤维化候选药物 rentosertib 在六种独立的蛋白质组学衰老时钟上把受试者的生物学年龄压低【直引 insilico.com 2026-09-17 公告】。
10 天后的 Cell 封面文章是这套故事的另一半临床端验证了「AI 制药可以改变生物年龄」,基础端开源了「AI 衰老研究工具」。两篇论文一起给出的是「临床证据 + 开放基础设施」的双重叙事。
Liquid AI 是麻省理工孵化出来的 AI 模型公司,2023 年成立。它的主打产品 LFM2 系列是新型架构比 Transformer 更小但保留了同等能力。巴克衰老研究所是 1999 年成立的老牌衰老研究机构,专注于长寿生物学基础研究。哈佛医学院与布莱根妇女医院是临床转化的两支标准力量。
Cell 文章的作者列表里出现了两个值得点名的名字Vadim N. Gladyshev 与 Fedor Galkin。Gladyshev 是哈佛医学院教授、巴克衰老研究所成员,是衰老生物学领域「硫代抗氧化假说」与「比较衰老生物学」的代表人物【直引作者隶属信息】。Galkin 是英矽智能 AI 团队的负责人,是这篇 Cell 文章的共同通讯作者之一。
LongevityBench:一份专门给衰老推理出的考卷
LongevityBench 是论文开源的第一个组件。它由 17 项任务组成,覆盖五大生物数据模态【直引】:
- 临床数据(clinical data)- 遗传学(genetics)- 表观遗传学(epigenetics)- 转录组学(transcriptomics)- 蛋白质组学(proteomics)
五大模态的代表性数据集分别是 NHANES、GEO(DNA 甲基化)、GTEx(bulk RNA-seq)、Olink(血浆蛋白组)、SynergyAge 与 OpenGenes(遗传资源)。每个任务都建立在「可以解释的生物学问题」之上:给一组分子数据预测下游表型。
论文在任务设计上特意规避了「背诵文献」式得分。具体做法是程序化生成提示每条提示都包含具备明确时空背景与实验约束的标准化研究场景描述、结构化组学测量矩阵、经协变量平衡处理的标准化临床元数据【直引】。这种设计让模型必须真正「看数据」才能给出答案,不能靠训练语料里的相关研究蒙混。
评测协议是「严格零样本单次前向推理」禁止任何形式的迭代提示优化、检索增强生成(RAG)、外部工具调用或输出后处理校准。这一设计排除了工程性增益对性能归因的干扰,确保评估结果纯粹反映模型在未见任务上的本征知识表征与逻辑推理能力【直引】。
论文评估了 18 个前沿闭源大语言模型来自 OpenAI、Google、Anthropic、xAI、DeepSeek、Moonshot AI 六家公司【直引】。所有模型均配置确定性解码参数,并固定随机种子。
Longevity-LLMs:5 个 0.6B 到 9B 的小模型
论文开源的第二个组件 Longevity-LLMs 是 5 个轻量模型族。它们基于 Liquid AI 的 LFM2 与阿里通义千问的 Qwen3、Qwen3.5 架构微调【直引 insilico.com 公告】。
具体五个模型与参数:
- L-Qwen3-0.6B(最小)- L-LFM2-1.2B- L-Qwen3-1.7B- L-LFM2-2.6B- L-Qwen3.5-9B(最大)
训练框架是英矽智能自研的 MMAI Gym for Science一种用其专有数据、推理数据集与验证模型训练科学专用语言模型的训练场【直引 unite.ai】。
训练策略分两类。最大的 L-Qwen3.5-9B 用两阶段 LoRA 高效微调第一阶段是组学语义增强型继续预训练(Domain-adaptive Continued Pretraining),第二阶段是多任务指令对齐微调(Multi-task Instruction Tuning)。其余四个模型用全参数监督微调(Full-parameter Supervised Fine-tuning),并引入层次均匀采样策略(Hierarchical Uniform Sampling)【直引论文方法学概述】。
数字:9B 跑赢 18 个前沿模型
LongevityBench 在 26 个参评系统上给出了综合排名越低越好。
| 排名 | 系统 | 综合分 ||---|---|---|| 1 | L-Qwen3.5-9B | 4.4 || 2 | L-LFM2-2.6B | 7.6 || 3 | L-Qwen3-1.7B | 7.8 || 4 | Gemini-3.1-Pro | 8.2 || 5 | Claude Opus-4.6 | 9.2 || ... | ... | ... || 6 | L-Qwen3-0.6B | <多个前沿系统 || ... | Opus-4.5 / Kimi-K2.5 / GPT-5.2 / Grok-4.3 | < L-Qwen3-0.6B |
数据来源【直引 unite.ai 收录的 leaderboard 数据,2026-09-17 检索】。
前三名都是英矽智能的轻量模型9B 第一、2.6B 第二、1.7B 第三。最小号 0.6B 模型位列第六,显著优于 Claude Opus-4.5、Kimi-K2.5、GPT-5.2、Grok-4.3 等主流闭源大模型【直引论文实验结果 1.2】。
更具体的几组对比数字揭示了「专用小模型 vs 通用大模型」这件事的细节【直引论文实验结果 1.4-5 与 2.5】:
- DNAm(DNA 甲基化)成对比较任务:L-Qwen3.5-9B 一致性 0.868,前沿最佳 0.685- Olink 蛋白质组年龄预测:L-Qwen3-0.6B MAE = 5.7 年,前沿最佳 Kimi-K2.5 MAE = 10.1 年- NHANES 10 年死亡率预测:L-Qwen3-0.6B 平衡准确率 0.890- CellAge 细胞衰老表型控制:前沿模型接近理论上限,L-LLMs 平均准确率 71.4%(明显低)
最后一组数字值得单独讲前沿模型在「CellAge 细胞老化表型控制」这种「靠训练知识能答对」的任务上几乎满分。L-LLMs 在同样的任务上明显低。这印证 LongevityBench 具备「构念效度」,它能区分模型的静态知识检索能力与基于原始多组学数据的动态因果推理能力。
Cell 文章把这件事总结成一句判断:「前沿 LLM 与专用小模型在不同任务上各有强弱,差距由任务结构决定,不由参数规模单独决定」【直引论文实验结果 1.5,作者翻译】。
可解释性:模型决策机制能否被追溯
论文的消融实验给出了一个有意思的副产品L-LLMs 的预测决策可以被追溯到具体的特征模块。
具体做法是对 L-Qwen3.5-9B 做系统性特征消融覆盖 5 类成对判别任务、共计 1,922 条结构化提示,组合评估 47 种生物学特征模块的独立移除效应。结果显示,其中 20 种特征消融方案显著降低模型对正确答案的预测置信度【直引论文实验结果 3.1】。
具体而言,L-Qwen3.5-9B 做出的判断可以被回溯到具体的「血糖水平」、「肾功能指标」、「性激素信号通路邻近 CpG 位点」、「免疫调节基因表达程序」这些生物学模块上。这件事的工程含义是:L-LLMs 的推理体现的是「跨模态生物学信号的分布式整合」。
论文同时给出了一个反例在「时钟复制」(clock replication)设定下,L-LLMs 性能急剧退化,不仅丧失相对优势,且显著低于专用机器学习基线及最优前沿通用模型【直引论文实验结果 4.3】。「时钟复制」指的是把已发表的衰老时钟模型作为参照模板做预测,它考验的是「能不能抄已知模型的输出」。
这一对比把 LongevityBench 的评测哲学说得很清楚「真懂」与「能抄」是两件事,benchmark 应当能区分二者。
Longevity Claw:从评测到靶点发现
论文开源的第三个组件 Longevity Claw 是智能体研究平台它能自主调用基因集富集分析、衰老时钟计算、人群画像、靶点评估等工具。
论文把 L-Qwen3.5-9B 装进 Longevity Claw,在 14 类生物学定义明确的衰老标志物的结构化知识约束下,生成初始候选靶基因列表【直引论文实验结果 5】。具体过程是:
- 6 轮独立采样2. 去重3. 置信度加权整合
最终获得 328 个非冗余候选靶基因。
论文把这 328 个候选与已知衰老相关靶点参考集做了富集分析。结果:
- 与 Pun et al. 2022 通过多组学整合验证的 300 个实证衰老相关靶点显著交集- 与 DrugBank 数据库中收录的 150 个已获批或临床阶段可成药靶点亦呈现显著富集- 与已知参考集的富集程度最高达到 5.6 倍
更具体的一组数字9 个经体内实验严格验证的衰老干预靶点中,CXCL12 与 ADAMTS14 均被成功识别【直引论文实验结果 5.2】。
KDM1A:六个候选里挑出一个来验证
Longevity Claw 在 6 轮独立运行中对每个候选靶基因给出频次。频次越高意味着模型在不同采样轮次中越稳定地认为这个靶点重要。
KDM1A 在 6 轮中出现频次 5 次(频率 83.3%),被列为最高优先级候选靶点【直引论文实验结果 5.3】。后续开展的独立湿实验验证证实KDM1A 兼具衰老调控与肿瘤发生双重功能,并在秀丽隐杆线虫(C. elegans)模型中实现敲低后平均寿命显著延长。
这件事的工程含义是Longevity Claw 不仅能给出「这基因可能重要」的判断,还能给出「这基因最可能重要」的频次估计。湿实验团队可以按频次排序去验证,避免在 328 个候选里随机选。
KDM1A 是一个组蛋白去甲基化酶负责 H3K4me1/me2 的去甲基化。已有独立研究证实 KDM1A 调控可延长线虫寿命,这与 Longevity Claw 的判断一致。但要注意,秀丽隐杆线虫不是哺乳动物,从线虫到人类的转化路径仍需更多工作。
对 AI for Biology 范式的三个具体含义
把 Cell 封面文章放进 2026-09 的 AI for Biology 坐标里看,它至少给出三个具体含义。
第一,「专用小模型 + 高质量评测」的范式被验证。9B 跑赢 18 个前沿大模型这件事是「数据 + 任务设计 + 评测协议」三件事的胜利。具体来说高质量衰老临床与多组学数据、两阶段 LoRA 微调、严格零样本评测,这三件事一起给出 9B 跑赢 18 个前沿的结果。
第二,「AI 评测」从「通用能力评估」向「垂直推理能力评估」迁移。LongevityBench 给衰老生物学出了一份专门的考卷:「这模型能读懂衰老数据并给出正确结论」。这件事给其他垂直领域(材料、化学、气候)提供了一个具体的范式参照。
第三,「从评测到发现」的闭环被走通。LongevityBench 是评测工具,Longevity-LLMs 是被评测对象,Longevity Claw 是把评测结果转化为科学发现的工具。三件套打包给出了一个「评测—模型—发现」的完整链条。这件事比单篇论文或单个模型的价值更大它给「AI 驱动的科学发现」提供了一个可复用的工程模板。
对衰老产业的具体含义
把这件事给衰老产业的具体提示是
港股英矽智能 9-18 收涨 13.12%,报 60.8 港元,总市值 354.27 亿港元【直引 forbeschina.com 2026-09-18】。这一股价反应与 Cell 封面文章的发布密切相关时间直接相关资本市场把这件事理解为「英矽智能在 AI 制药 + AI 衰老双线都拿到了标志位」。
对衰老产业的具体含义:
第一,AI 发现的靶点验证周期可以缩短。Longevity Claw 给出的 328 个候选里 KDM1A 已经通过独立湿实验验证延长线虫寿命这种「AI 提名 + 独立湿实验」的路径可以替代传统的「全基因组筛选 + 随机验证」。
第二,「数字孪生」在衰老研究中的位置进一步明确。9-7 的 rentosertib IIa 试验给的是「临床端数字孪生」6 个蛋白时钟下降。9-17 的 Cell 文章给的是「基础端数字孪生」,5 个轻量模型 + 1 个基准 + 1 个智能体平台。两条线合起来构成英矽智能在衰老研究上的完整工具栈。
第三,AI 制药公司的护城河在哪被具体化。数据、评测、模型、智能体四件事都是开源可获得的。护城河在「把这四件事整合成工作流并持续迭代」。英矽智能 14 年(公司 2014 年成立)的积累是这件事的护城河,Cell 封面是这件事的展示窗口。
当下能给的具体提示
把这件事给 AI 制药团队、衰老研究团队、AI 评测团队三个具体角色提示:
给 AI 制药团队「专用小模型 + 高质量评测」的范式可以复用到你的领域。找出你的「Gemini-3.1-Pro 跑不到 0.868 但 L-Qwen3.5-9B 能跑到的任务」,这是你值得投入的方向。
给衰老研究团队Longevity Claw 的 328 个候选靶点是一个可以直接拿来排验证顺序的清单。频次排序是 Longevity Claw 给出的现成优先级。
给 AI 评测团队「构念效度」是评测质量的硬指标。一个评测如果没法区分「真懂」与「能抄」,它的分数就没法指导真实研究。
三件事都还没有被做完但今天有了具体名字。
【直引】insilico.com/news/cell170926en-ai-longevity-discovery-toolkit 「Insilico Medicine Opens AI Longevity Discovery Toolkit to Researchers Worldwide in Cell Cover Study,2026-09-17」【直引】unite.ai 「Insilico Medicine Releases Open Longevity AI Toolkit in Cell Study,2026-09-17」【直引】longevitytoday.com 「Insilico Medicine Launches Open AI Toolkit to Accelerate Longevity Drug Discovery,2026-09-17」【直引】completeaitraining.com 「Insilico Medicine publishes cell cover study and releases open AI longevity toolkit,2026-09-17」【直引】forbeschina.com 「开源 AI 长寿工具包登上《细胞》》篇,英矽智能股价涨 13%,2026-09-18」【直引】info.helixlife.cn 「英矽智能 Cell 封面开源 AI 衰老研究工具包 LongevityBench 等,2026-09-17」【直引】Cell DOI 10.1016/j.cell.2026.08.026 「An open benchmark and language models for AI in aging biology,2026-09-17」
#AI制药 #衰老生物学 #Cell封面
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。