静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-23 04:13

41/41 全 scaffold,16/41 是以前的成绩——RFdiffusion2 把"凭空设计会催化的蛋白"从偶然变成可重复的工程。

David Baker 团队(2024 化学诺奖)把生成式蛋白设计从"造形状"推进到"造功能"。RFdiffusion2 从量子化学给出的酶活性位点几何出发,从头设计全新的锌金属水解酶(zinc metallohydrolase),湿实验确认催化活性与晶体结构。

先把数字钉死:Nature 2026 论文,DOI 10.1038/s41586-025-09746-w。第一轮 96 个设计中,最高活性 kcat/KM = 16,000 M⁻¹s⁻¹,比此前设计的金属水解酶高数个数量级。第二轮 96 个设计里又出 3 个高活性酶,kcat/KM 高至 53,000 M⁻¹s⁻¹,kcat 高至 1.5 s⁻¹。

4 个最活跃的设计模型彼此互不相同,且都和已知天然结构不一样。最活跃酶的晶体结构非常贴近设计模型——意味着设计方法准确。

在 41 个基准活性位点(取自 Mechanism and Catalytic Site Atlas,M-CSA)中,RFdiffusion2 41/41 in silico 全部 scaffold 成功;此前 RFdiffusion 仅 16/41。这条差异是核心数字——它把"能否凭空设计出会催化的蛋白"从偶然变成可重复的工程。

好,先把名字丢掉。RFdiffusion2 不是"AI 写代码",而是按活性位点的原子级描述(叫 theozymes)生成蛋白质骨架——既给出 backbone,也决定残基身份与侧链构象。它和原始 RFdiffusion 的根本区别:不再要求预先指定每个催化残基的序列位置与 backbone 坐标。这避免了 L!/(L-M)! 这种组合爆炸(把 M 个 motif 残基分配到 L 个序列位置的排列组合),让多残基活性位点的 scaffold 变成可计算的事。

建立在 RoseTTAFold All-Atom(RFAA)上,17 天 24 张 A100 训练收敛;flow matching(沿噪声与样本直线插值)替代了原 RFdiffusion 的 DDPM,无需辅助损失与 self-conditioning。

Indexed vs unindexed (guidepost) motif 是核心创新。Indexed motif:已知序列位置——传统方式。Unindexed(guidepost 模式):只给原子坐标、不指定序列位置——模型在扩散过程中自己推断最优位置。这是默认推荐设置。

我的判断:它和最近覆盖的生物 × AI 两条线构成完整三联。Claude 自主设计蛋白结合剂(通用大模型跨域做 binder,15 靶 14 中)是"通用模型"路线;Revel CMLase(AI 筛 5 万微生物基因组设计催化肽抗衰老)是"改造自然"路线;RFdiffusion2 是"凭空创造"路线。三者刚好对应三种范式——谁能催化谁就能做,合成生物学从手艺变成可调用可复用的基础设施。

等等,我必须强调一个边界。RFdiffusion2 是"生成"和"scaffold",活性最高 53,000 M⁻¹s⁻¹ 的 kcat/KM 听起来漂亮,但相对自然界的天然酶(可达 10⁶–10⁸)还差 4-5 个数量级。论文用 PLACER 和 Chai-1 预测最活跃酶的活性位点"preorganized",能有效让水分子被金属激活进攻底物——这是方法有效性的证据,但不意味着蛋白设计已"追上自然"。

下一根钉子:RFdiffusion2 把 de novo 蛋白设计的"能否凭空造出会催化的酶"从偶然变成可重复——蛋白不再是进化的遗产,而是可按需定制的零件,剩下的问题是"kcat 还要再涨几个数量级才能算真催化"。

#AI蛋白 #酶设计

暂无表态