一颗草莓从青到红,光照、温度、乙烯,一连串分子按时间表点火;从红到烂,时间表会更短,因为防御机制开始失效。
衰老就是这张表——既可测,也有"能抵抗 / 不能抵抗"的转折点。今天测它的人,多半用一组分子标记做回归;今天用 AI 测它的人,多半把通用大模型 prompt 一下,再被训练数据里的偶然相关项骗一次。
英矽智能 9 月 17 日把第三种路径做成了 Cell 封面。【直引 DOI 10.1016/j.cell.2026.08.026;卷 189 期 19,5980–5994.e8;CC-BY 4.0】标题是 *An open benchmark and language models for AI in aging biology*,13 位作者,Zhavoronkov 与 Galkin 双通讯。论文一次性开源了三件套:
- LongevityBench——17 项任务,覆盖临床 / 遗传 / 表观 / 转录 / 蛋白五大模态,每条 prompt 都"程序化生成"以避免背诵文献。
- Longevity-LLMs——五个 0.6B 到 9B 的小模型,底座是 Liquid AI 的 LFM2 与阿里 Qwen3 / Qwen3.5。
- Longevity Claw——智能体平台,自主调用工具提名干预靶点。
反直觉的数字
这套东西的硬料不是"又有新 benchmark",是结果的方向:L-Qwen3.5-9B 在 26 个参评系统里综合排名第一,综合分 4.4(越低越好),跑赢 Gemini 3.1 Pro(8.2)、Claude Opus-4.6(9.2)、Kimi-K2.5、GPT-5.2、Grok-4.3。【直引论文实验结果 1.2 与 leaderboard 公开数据】
前 6 名里英矽的轻量模型占了 4 席(L-Qwen3.5-9B / L-LFM2-2.6B 7.6 / L-Qwen3-1.7B 7.8 / L-Qwen3-0.6B)。最小号 0.6B 模型在 NHANES 10 年死亡率预测上平衡准确率 0.890,DNA 甲基化年龄预测的一致性 0.868——前沿模型最佳是 0.685。Olink 蛋白组年龄预测 MAE 5.7 年,前沿最佳 10.1 年。
一句话:在 18 个前沿闭源大模型、6 家头部(OpenAI、Google、Anthropic、xAI、DeepSeek、Moonshot)参与评测的"严肃零样本单次前向推理"赛道上,一个 9B 的小模型靠高质量衰老数据与评测协议反超了量级更大的对手。
一处站不住
原帖有一处需要改:英矽智能不是 2024 年在港交所上市。招股书显示,英矽智能(InSilico Medicine Cayman TopCo,HKEX 3696)在 2025-12-30 正式挂牌,发行价 24.05 港元,募资净额约 20.26 亿港元,联席保荐摩根士丹利与中金。上市首日开盘涨 45.53%,收涨 38%(公司成立是 2014,IPO 在 2025)。【直引招股书 + 21 世纪经济报道 2025-12-30】
市值与股价(2026-09-18 收盘):60.80 港元,+7.050(+13.12%),成交量 4889 万股,总市值 354.27 亿港元(WSJ / Yahoo Finance / 腾讯财经三源一致)。振幅 10.5%、52 周区间 29.98–80.90 港元。
这件事给的两个判断
第一,"专用小模型 + 高质量评测"是一条真路径。 LongevityBench 在评测协议上严格禁止 RAG、工具调用、提示工程优化——这等于把"工程性增益"从分数里剥掉,留下的只是模型对原始多组学数据"本征知识表征与逻辑推理能力"。在这条赛道上,专用 + 小赢了通用 + 大。换到材料、化学、气候,这条范式可以原样复刻。
第二,"评测—模型—发现"被一次性走通了。 Longevity Claw 跑出 328 个候选靶基因,与 Pun et al. 2022 的 300 个实证衰老相关靶点显著交集,与 DrugBank 已获批或临床阶段可成药靶点的富集程度最高 5.6 倍;9 个经体内实验验证的衰老干预靶点中,CXCL12 与 ADAMTS14 均被识别。最高频次候选是 KDM1A(83.3%)——后续独立湿实验在线虫里敲低后平均寿命显著延长。【直引论文实验结果 5.2–5.3】
KDM1A 这条线不算"AI 凭空挖出来的金矿"。早在 McColl et al. 2008 与 Maures et al. 2011 就在 C. elegans 证实 LSD-1 / KDM1A 同源基因敲减能延长寿命 25%–46%;最新的 Del Blanco et al. 2024 进一步把它挂到了 PRC2 沉默的"aging related genes"通路上。Longevity Claw 做的事是在 328 个候选里把这条已有线索顶到最高优先级,让湿实验团队不用随机验证。
几处对照(补几条原帖没写的)
- rentosertib IIa 试验的论文:2026-09-07 同期上 Nature Biotechnology(DOI 10.1038/s41587-026-03286-y),42 例 IPF 患者,6 个蛋白时钟一致显示 30 mg BID 第 4 周生物年龄下降 3–4 年(一个时钟达 6 年)。TNIK 抑制剂;机制上 MMP10 / MMP13 / SPP1 下调,SenMayo 下降;LTBP2 是唯一在 6 个时钟里都重要的特征。【直引 Nature Biotechnology 论文】
- Liquid AI 的底座:LFM2 不是 transformer,是 hybrid 架构(gated short convolutions + 少量 GQA)。MIT 衍生,已与 AMD / Qualcomm / Intel / Samsung 合作做硬件适配;arXiv 2511.23404 是其 2025-11 技术报告。
- 公司近况:2026 上半年总收入约 1.06 亿美元,同比 +287%,首次半年度盈利(adjusted net profit 超 5,100 万美元)。2026 年内合同总额约 73 亿美元,2021 年以来累计约 110 亿美元;与礼来、Servier、Takeda、SK Biopharmaceuticals、齐鲁制药等有 BD。2026 年 8 月底前已提名 9 个开发候选(公司年度纪录)。
三件硬事的局限
把卡一打完,还是要承认:
- LongevityBench 仍是单次零样本评测——评测哲学正确,但"在数据格式创新"这件事上的边际收益会随模型升级递减。
- CellAge 控制那类靠"知识检索"的任务上,L-LLMs 71.4% 平均准确率明显低于前沿模型——专用模型不擅长"背诵"。
- 时钟复制(clock replication)设定下 L-LLMs 性能急剧退化,不仅失去相对优势,且低于专用 ML 基线与前沿模型。换句话说,"真懂"与"能抄"是两件事,基准的设计能区分二者。
给读者的几条可执行提示
- AI 制药团队:在垂直领域找"Gemini-3.1-Pro 跑不到 0.868,但 L-Qwen3.5-9B 能跑到"的任务结构——这才是值得投入的方向。
- 衰老研究团队:把 Longevity Claw 那 328 个候选的频次排序当验证优先级清单,而不是另起一份"全基因组筛选"。
- AI 评测团队:构念效度(区分"真懂"与"能抄")是评测质量的硬指标。一个分不出这二者的 benchmark,它的分数没法指导真实研究。
---
*论文:An open benchmark and language models for AI in aging biology, Cell 189(19):5980–5994.e8, DOI 10.1016/j.cell.2026.08.026, 2026-09-17* *关联:rentosertib IIa 期论文 Nature Biotechnology 2026, DOI 10.1038/s41587-026-03286-y* *数据源:Insilico 2026-09-17 公告 / unite.ai / WSJ 3696 历史价 / 港交所招股书 / 21 世纪经济报道 2025-12-30 / Liquid AI arXiv 2511.23404*