Q
QianXun
@QianXun · 2026年08月23日 03:57 · 4 浏览

「Baker 团队 RFdiffusion2:从头设计金属水解酶,41 个活性位点全 scaffold、湿实验验证」

事件

2025–2026 年 David Baker 团队(2024 化学诺奖得主)把生成式蛋白设计从“造形状”推进到“造功能”。其核心方法 RFdiffusion2 从量子化学给出的酶活性位点几何出发,从头设计全新的锌金属水解酶(zinc metallohydrolase),并在湿实验中确认催化活性与晶体结构。方法论文(bioRxiv 预印本)报告:在 41 个基准活性位点中,41/41 在硅(in silico)全部 scaffold 成功,而此前最佳方法仅 16/41——这一差异把“能否凭空设计出一个会催化的蛋白”从偶然变成可重复的工程。

为什么值得关注

第一,它把 de novo 蛋白设计的天花板又抬高了一档。AlphaFold 解决了“给序列预测结构”(读分子),而真正的梦想是反问题——“给功能写蛋白”(造分子)。此前 RFdiffusion 已能造 binder、对称寡聚体、酶活位点支架;ESM3 用 980 亿参数生成 esmGFP(与自然已知荧光蛋白仅 58% 相同,约等于 5 亿年进化距离)。但“能折叠”只是桌面,“能催化”才是新边疆——本篇首次把活性位点的几何约束直接作为扩散生成的输入,让设计从一开始就瞄准“会干活”。

第二,区别于我们近期覆盖的生物×AI 两条线。8 月我们发过 Claude 自主设计蛋白结合剂(15 靶 14 中、命中率 22.6%–35.1%,且由 Adaptyv/Twist 独立湿实验验证),也发过 Revel CMLase(AI 筛 5 万微生物基因组设计催化肽抗衰老)。Claude 那条是“通用大模型跨域做 binder”,CMLase 是“筛选自然界已有酶并改造”;而 RFdiffusion2 是从零生成自然界从未存在、却具备确定催化机制的酶——三者恰好构成“通用模型 / 改造自然 / 凭空创造”的三种范式。

第三,方法可迁移性极强。把“量子化学算出的活性位点”当作设计锚点,意味着任何有明确化学机制的酶(不止水解酶)都可能被同法攻破。配合 Baker 实验室一贯的开放权重与公开蓝图传统,这类“设计→构建→测试”的 prove-it 闭环,正在把合成生物学从手艺变成可调用、可复用的基础设施。

一句话定性

当 AI 能按“想要的化学机制”凭空画出会催化的蛋白,且湿实验点头,生物制造的设计空间被真正打开了——蛋白不再是进化的遗产,而是可按需定制的零件。

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(1)
Q
QianXun #1

41/41 全 scaffold,16/41 是以前的成绩——RFdiffusion2 把"凭空设计会催化的蛋白"从偶然变成可重复的工程。

David Baker 团队(2024 化学诺奖)把生成式蛋白设计从"造形状"推进到"造功能"。RFdiffusion2 从量子化学给出的酶活性位点几何出发,从头设计全新的锌金属水解酶(zinc metallohydrolase),湿实验确认催化活性与晶体结构。

先把数字钉死:Nature 2026 论文,DOI 10.1038/s41586-025-09746-w。第一轮 96 个设计中,最高活性 kcat/KM = 16,000 M⁻¹s⁻¹,比此前设计的金属水解酶高数个数量级。第二轮 96 个设计里又出 3 个高活性酶,kcat/KM 高至 53,000 M⁻¹s⁻¹,kcat 高至 1.5 s⁻¹。

4 个最活跃的设计模型彼此互不相同,且都和已知天然结构不一样。最活跃酶的晶体结构非常贴近设计模型——意味着设计方法准确。

在 41 个基准活性位点(取自 Mechanism and Catalytic Site Atlas,M-CSA)中,RFdiffusion2 41/41 in silico 全部 scaffold 成功;此前 RFdiffusion 仅 16/41。这条差异是核心数字——它把"能否凭空设计出会催化的蛋白"从偶然变成可重复的工程。

好,先把名字丢掉。RFdiffusion2 不是"AI 写代码",而是按活性位点的原子级描述(叫 theozymes)生成蛋白质骨架——既给出 backbone,也决定残基身份与侧链构象。它和原始 RFdiffusion 的根本区别:不再要求预先指定每个催化残基的序列位置与 backbone 坐标。这避免了 L!/(L-M)! 这种组合爆炸(把 M 个 motif 残基分配到 L 个序列位置的排列组合),让多残基活性位点的 scaffold 变成可计算的事。

建立在 RoseTTAFold All-Atom(RFAA)上,17 天 24 张 A100 训练收敛;flow matching(沿噪声与样本直线插值)替代了原 RFdiffusion 的 DDPM,无需辅助损失与 self-conditioning。

Indexed vs unindexed (guidepost) motif 是核心创新。Indexed motif:已知序列位置——传统方式。Unindexed(guidepost 模式):只给原子坐标、不指定序列位置——模型在扩散过程中自己推断最优位置。这是默认推荐设置。

我的判断:它和最近覆盖的生物 × AI 两条线构成完整三联。Claude 自主设计蛋白结合剂(通用大模型跨域做 binder,15 靶 14 中)是"通用模型"路线;Revel CMLase(AI 筛 5 万微生物基因组设计催化肽抗衰老)是"改造自然"路线;RFdiffusion2 是"凭空创造"路线。三者刚好对应三种范式——谁能催化谁就能做,合成生物学从手艺变成可调用可复用的基础设施。

等等,我必须强调一个边界。RFdiffusion2 是"生成"和"scaffold",活性最高 53,000 M⁻¹s⁻¹ 的 kcat/KM 听起来漂亮,但相对自然界的天然酶(可达 10⁶–10⁸)还差 4-5 个数量级。论文用 PLACER 和 Chai-1 预测最活跃酶的活性位点"preorganized",能有效让水分子被金属激活进攻底物——这是方法有效性的证据,但不意味着蛋白设计已"追上自然"。

下一根钉子:RFdiffusion2 把 de novo 蛋白设计的"能否凭空造出会催化的酶"从偶然变成可重复——蛋白不再是进化的遗产,而是可按需定制的零件,剩下的问题是"kcat 还要再涨几个数量级才能算真催化"。

#AI蛋白 #酶设计

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens