8 月 23 日《Genes》期刊发表 UC San Diego 卡多纳加实验室论文——他们用 AI 模型对 50 万种不同版本的人类基因「起始子」(initiator)做了高通量测序训练,首次识别出可预测的 DNA 序列模式,发现约 60% 的人类基因都携带这种关键的激活序列(远高于此前科学界预期),并据此提出突变致病效应预测与合成启动子设计的新工具。从「设计蛋白」位移到「解读基因组」,AI for Science 的下一个主场。
一、问题:基因是怎么被「打开」的
人类基因组里有大约 2 万个编码基因。每一个都要在正确的时间、正确的细胞里、以正确的强度被打开——否则发育异常、代谢紊乱甚至癌症就会发生。这个「打开」机制在分子生物学里被研究了 50 年,但底层规律一直没被完全读懂。
分子生物学家早就知道基因启动区域存在一种叫「起始子」(initiator)的关键 DNA 片段,标记着基因信息被首次转录为功能产物的位置。但起始子究竟依据什么 DNA 序列规律运作,始终是个谜。
如果我们能预测一段 DNA 里有没有起始子、起始子的强度多大、突变会不会破坏起始子——就有了预测基因激活规律的工具。但 50 年来没有人能写出可靠预测器。
UCSD 实验室的解法很直接:用 AI 一次性测 50 万条序列。
二、解法:50 万序列 + 机器学习 + 跨基因预测
博士生 Torrey Rhyne-Carrigg 主导的实验设计:
第一步,他们用高通量 DNA 测序技术,系统检测 50 万种不同版本起始子各自对应的基因表达活性。第二步,把这些测序结果作为训练数据喂给机器学习模型。第三步,让模型自己找出「哪些 DNA 序列模式与强起始子活性相关」。
「这些 AI 模型首次提供了强有力的预测能力,能够判断人类基因中是否存在起始子,并由此解码出起始子的 DNA 碱基序列模式」,卡多纳加教授说。
最关键的一步是第四步——把模型学到的模式扔进人类基因组扫描。结果让人意外:约 60% 的人类基因都携带起始子。这个比例远超此前预期,意味着起始子在基因调控网络里的覆盖度远比想象中更广、更基础。
三、应用:突变预测 + 合成启动子
理解起始子的精确序列规律带来两类直接应用:
应用一:预测致病突变。 许多遗传性疾病源于调控区域里看似微小的碱基变化。如果某个突变恰好破坏起始子结构,基因表达可能出现紊乱,引发疾病。有了 AI 模型,科学家可以在实验室之外,直接计算评估某个突变是否影响起始子功能——这给遗传性疾病的分子机制研究提供了低成本预测器。
应用二:设计合成启动子。 研究数据与模型可以用于设计人工合成的启动子序列,这类序列能精确控制基因的开关。定制化合成启动子在基因治疗、生物制药、农业育种等领域都有广泛应用。
「这项研究的价值远不止停留在基础科学层面」,人工智能学家解读时写道,「掌握起始子的精确序列规律后,科学家将首次具备预测特定 DNA 突变致病效应的能力」。
论文中卡多纳加提出一个更宏大的愿景:整个基因表达密码的全 AI 解读。「在每个细胞内 60 亿个 DNA 碱基里,藏着一套基因表达密码——它规定每个基因该在何时、何地、以何种程度被开启或关闭。如果我们有整套 AI 模型来读这套密码,就能预测每个人身上不同基因变体的活性。这次的 initiator AI 模型是这套密码的小而关键的一块,我乐观地认为我们会在不远的将来扩展到完整的基因表达密码 AI 模型」。
四、技术深度:机器学习如何识别 DNA 序列模式
这篇论文的方法论值得单独拆开来看。传统启动子研究依赖手工 motif 发现——研究人员根据先验知识列出可能的 DNA 模式,逐个验证。这种方法在过去 30 年里几乎触及天花板,因为启动子序列的语法远比「固定 6-8 碱基 motif」复杂得多。
AI 路径则把整个问题倒过来:让模型从大规模数据里自己学序列模式。50 万条序列的测序数据是真正的稀缺资源——它意味着模型可以同时看到「哪些序列好用」与「哪些序列没用」两类信号。
输出有两个层面:一是预测某段序列是否含起始子(分类),二是识别哪些碱基对激活起决定作用(归因)。后者的产物是可被分子生物学家读懂的 motif 列表——AI 学习的模式变成可被传统实验验证的假设。
这是一个很重要的科学方法论变化:AI 不再只是预测器,而是作为假设生成器,反向给湿实验提供新研究目标。这类 AI-for-Science 的工作流——大规模数据 → 模型训练 → 假设生成 → 湿实验验证——正在成为基因组学、蛋白质工程、材料科学、化学合成等领域的新标配。
五、对 AI4Science 范式的意义
把这一篇与过去半年 AI for Science 的大新闻拼在一起看:
| 时间 | 方向 | 模型做了什么 |
|---|---|---|
| 2024 | AlphaFold 3 | 预测所有生物分子结构 |
| 2025 | RFdiffusion | 从头设计蛋白质 |
| 2026 Q1 | Claude binder | 设计蛋白结合剂 |
| 2026 Q2 | RFdiffusion2 | 从头设计金属水解酶 |
| 2026 Q3 | HealthFormer | 多模态生成式生理模型 |
| 2026.08.23 | UCSD 起始子 AI | 解读人类基因组基础调控元件 |
每一波 AI4Science 论文都在做一件事——把某类生物/化学现象从「实验发现」位移到「AI 预测」。这条曲线在 2026 年下半年进入新阶段:AI 不再只是「设计新东西」,也开始「读懂既有东西」。
AlphaFold 读懂了蛋白质折叠的语言,RFdiffusion 写出新蛋白,UCSD 这次则是读懂了基因激活的语言。读懂与写出的差距正在快速缩小——下一步自然是「针对任意突变效应预测 → 反向设计最优基因调控序列 → 任意合成基因线路」。
更前沿的是,UCSD 模型输出的不只是预测,而是**「为什么这个 DNA 序列是起始子」的可解释 motif 列表**。这意味着分子生物学家可以回过头去把这些 motif 与已知转录因子数据库比对,建立新的调控网络假说。AI 在这里不是替代实验科学家,而是作为他们的加速器。
六、对基因治疗与合成生物学的具体影响
短期内,UCSD 这套模型对三类工作有具体落地价值:
- 罕见病诊断:很多遗传病源于调控区突变,过去要逐个做湿实验验证;现在能直接用模型筛候选
- 基因治疗载体:AAV、慢病毒载体的启动子强度决定治疗效果与脱靶风险,AI 设计可精确调控
- CAR-T 与免疫治疗:不同肿瘤微环境下需要的 T 细胞激活强度不同,合成启动子按需设计
- 合成生物学:工业菌株的代谢通路需要精准调控,启动子设计是核心工具
- 农业育种:作物抗逆、高产等性状需要精准的基因开关,合成启动子是基础设施
这套工具在 2026 年下半年大概率会以 API 或开源模型形式向生物学社区扩散。
七、判断:AI for Science 的范式跳跃
UC San Diego 这篇论文代表 AI4Science 的范式跳跃:从「AI 设计新分子」位移到「AI 解读既有生物语言」。
过去 30 年,基因组学靠湿实验发现 motif 与调控规律;过去 5 年,AlphaFold 与 RFdiffusion 让我们能用 AI 设计新蛋白。2026 年 8 月这个时间点,UCSD 论文标志 AI 开始系统性地读懂人类基因组的「语法」——这意味着基因组学的工作流正在被重构。
更长远看,AI4Science 的下一站是:完整的「读懂 + 写出」闭环——AI 既能预测任意突变的致病效应,也能反向设计任意强度、任意组织特异性的合成基因线路。这件事在 2026 年下半年看起来正在加速到来——不是某一家公司的产品,而是学术界 + 工业界 + 开源社区共同推进的基础设施层。
对做 AI4Science 的从业者:50 万序列 + 机器学习的范式可以扩展到所有「DNA/RNA 调控元件」——启动子、增强子、沉默子、绝缘子、3 U UTR 结合位点、可变剪接调控序列——每一个都是下一个「UCSD 论文」候选题目。
对基因治疗、合成生物学、CAR-T 等下游产业:未来 12 个月内会出现一批 AI 设计的「合成启动子库」,每个都附带强度、组织特异性、可调性等参数的精确预测。这是合成生物学从「手工艺」位移到「流水线制造」的拐点。
参考来源
- UC San Diego 卡多纳加实验室:Genes 期刊 2026 年 8 月 23 日,DOI: 10.1101/gad.353623.125
- 论文标题:「Machine learning analysis of the human initiator region reveals key features of different types of core promoters」
- 第一作者:Torrey E. Rhyne-Carrigg;合作者:Long Vo ngoc, Claudia Medrano, Kassidy E. Gillespie, James T. Kadonaga
- 数据规模:约 500,000 种起始子变体的高通量测序
- 关键结果:约 60% 的人类基因携带起始子
- ScienceDaily 报道:2026-08-23,sciencedaily.com/releases/2026/08/260823014943.htm
- 今日头条/人工智能学家解读:toutiao.com/article/7677143040629031451/
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。