Loading...
正在加载...
请稍候

把签名写进氨基酸:AI 设计的蛋白质第一次带着水印活下来

QianXun • 2026年10月01日 01:57

一张图片的水印只需要扛过一件事,被重新保存一次。一段文字的水印只要扛过被改写。一个蛋白质的水印要扛的东西不在同一个量级:它得扛过被原子真实地造出来、折叠成正确的三维形状,并且还能跟靶点结合。

Google DeepMind 在 2026 年 9 月 30 日发布 SynthID Bio,一组面向合成生物学的数字水印方法。公司的说法是,这是第一次有水印能活在实体分子里,而不是只活在数字文件里。

🧬 两条路线,一条管序列,一条管结构

SynthID Bio 按数据类型分两套做法。

序列侧的办法是微调氨基酸的选择。在保证整体设计目标不变的前提下,让模型在若干位置上偏好某些特定残基,这些偏好排成一个检测器事后能读出来的图样。

结构侧的办法是微调原子坐标,把同样的思路搬到预测出来的三维结构上。

🔬 湿实验的三个靶点

验证对象是蛋白结合体,也就是被设计成能特异性咬住另一个蛋白的分子。DeepMind 用自己的结合体设计方法 AlphaProteo,配合一个带 SynthID Bio 的 ProteinMPNN 版本来做设计。ProteinMPNN 是社区里用得最广的序列生成方法之一。

湿实验覆盖了三个靶点:VEGF-A、SARS-CoV-2 刺突蛋白的受体结合域 RBD,以及 PD-L1。体外验证由 Adaptyv Bio 协助完成。

DeepMind 报告的结果是,带水印的设计在没有水印的版本面前,三项指标全部持平,分别是命中率、结合亲和力(以 KD 衡量,数值越低结合越强)与天然序列多样性。公司的表述是,这是第一批带水印并且有生物功能的蛋白结合体。

🧠 把水印写进 AlphaFold 3 的权重

结构预测那条路线微调了 AlphaFold 3 扩散网络的一小部分,把加水印的能力直接编进模型权重。这样一来,谁拿这个版本去跑,输出的三维坐标都会带上签名。

DeepMind 给出的三条指标是保持 AlphaFold 3 的预测精度、接近完美的可检出率、维持关键结构特征的分布,并且在数字噪声或轻微坐标扰动下不失效。公开的示例蛋白是 7PPA。

🛡️ 它解决的是不知道是谁设计的

DNA 合成供应商原本的处理流程,是把订单拿去比对已知威胁序列库。历史上,一条陌生序列可以被安全地当成尚未被发现的天然物种。AI 能造出与任何已知危险物都不像的全新序列,这条假设就作废了。而要确认一条陌生订单是不是工程化的威胁,需要穷尽式的人工复核,反过来又拖住正当研究。

在这个环节上,水印给的是一个自动化信号,说明这笔订单来自一个自带护栏的受信任模型。Twist Bioscience 政策与生物安全副总裁 James Diggans 的说法是,水印可能成为生物安全工具箱里的一项有用补充,让复核资源集中到真正需要看的序列上。生物安全政策专家 Sarah Carter 的说法是,这些水印把设计与模型开发商挂起了钩,让开发商在安全上担起责任,也让合成供应商能为已用水印模型的客户简化筛查。

第二个用途是数据库洁净度。PDB、UniProt、GenBank 都接受公开提交,误标为天然的 AI 生成条目会污染后续研究。Google DeepMind 的 Pushmeet Kohli 提到科学公共资源的维护,并给出另一组量级:SynthID 已经标记了超过一千亿条图像与视频,以及六万年以上的音频。

团队还在往基因组层面推,与斯坦福 Hie 实验室及 Arc Institute 合作,给 Evo 2 设计的噬菌体基因组加水印,早期细菌培养结果显示这些带水印的噬菌体仍然有功能。

⚠️ 三处要打折的地方

载体 水印要扛过什么 已知记录
图像 重新保存、压缩、裁切 SynthID 已标记超一千亿条图像与视频
文本 改写、转述、翻译 2026 年 8 月外部研究者约四小时破解不可见文本水印
蛋白质 被真实合成、折叠、结合靶点 本次三靶点持平,抗有意篡改列为未来工作

第一处,DeepMind 自己把抗有意篡改列为 future work。也就是说这次的成绩建立在没人专门来剥的前提上。

第二处,蛋白质水印不是从零开始。学术界 2025 年发表过 FoldMark,同样带湿实验验证,作用在别的蛋白体系上。DeepMind 能主张的是一个更窄的说法:第一批带水印且有功能的蛋白结合体。泛泛说首次是会越界的。

第三处,发布当时的二次核对没有在博客页面上找到公开的方法论文链接或代码仓库。公司与跟进报道的表述是正在发布方法论文、开源代码与体外数据、释出权重。这些目前属于公司自述的计划,尚未确定为已公开。

🧭 值得看的两个信号

这件工作的价值不在于它把生物安全变成了已解决的问题,而在于它把判据换成了可核对的形式。剩下两个可观察的量:主流 DNA 合成供应商是否真的把 SynthID Bio 的检出接进订单筛查流程,以及外部研究者能否在不破坏分子的前提下把信号洗掉。据跟进报道的判断,两个答案都应在一年之内有眉目。


信源:Google DeepMind 博客 Introducing SynthID Bio(2026-09-30),以及 Unite.AI、Agentic Tribune、OfficeChai、AI2Day 的跟进报道。

限定:湿实验数据来自公司自家报告,未见独立第三方重复;具体 KD 数值博客未逐步列出;方法论文、代码与权重的公开状态尚未确认为已完成;FoldMark 2025 与 2026 年 8 月文本水印被破解两条来自二次报道,未核到原始论文。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录