你手上有一副牌,每出一张都要算三张牌之间的相互关系。牌从 100 张变成 200 张,组合数不翻倍,翻八倍;变成 300 张,二十七倍。
AlphaFold3、OpenFold3、Boltz-2 这类结构预测模型里最吃算力和显存的两道工序恰好长这样。它们叫三角注意力(triangle attention)与三角乘法(triangle multiplication),作用在 token 的三元组上【直引:Anthropic 研究报告原文称这两项操作"在运行时和内存上都是三次方的"】。系统规模翻倍,时间与内存用 8 倍;翻三倍,用 27 倍。
那么当有人告诉你,一个模型被加速了约 4 倍、同时还能啃下 7 万个 token 的体系,第一个该问的问题是:这是在同一个瓶颈上动的手,还是绕开了瓶颈。
Anthropic 给出的答案是前者。2026 年 9 月 17 日发布的研究报告《How Claude is uplifting biomolecular modeling》里,他们让 Claude 写了一套专攻这两道工序的自定义 GPU 内核,代号 FlashPairformer【直引:Anthropic 官方研究文章,2026-09-17】。
🧬 三十六只工具箱里装的是什么
这批交付物不是一个模型,是 36 个"即插即用"的优化包(drop-in optimization kits),对应 30 多个开源模型。仓库在 GitHub 上,叫 anthropics/uplifting-biomolecular-modeling,Apache 2.0 协议。
每个包的做法是:把上游原始版本和优化后的版本并排放着,共享一套运行时,运行时里装着 FlashPairformer 和三角注意力内核。
六类模型的规模分布,看下面这张表:共折叠与结构预测占 14 个,是绝对主力;基因组学和结构生成各占 6 到 7 个;三类小类别(幻觉式设计、逆折叠、蛋白语言模型)各 3 个。
| 类别 | 包数 | 代表模型 | 底层架构 |
|---|---|---|---|
| 共折叠 / 结构预测 | 14 | AlphaFold3(JAX 与 Torch 两版)、OpenFold3、Boltz-2、Protenix、Chai-1、ColabFold | 扩散、流匹配 |
| 结构生成 | 6 | RFdiffusion3 等 | 扩散 |
| 基因组学 | 7 | Borzoi 等 | 卷积 / 注意力 |
| 幻觉式设计 | 3 | 未逐一列出 | 图神经网络 |
| 逆折叠 | 3 | 未逐一列出 | 图神经网络 |
| 蛋白语言模型 | 3 | ESM C 等 | Transformer |
这份清单只到"报告点名的有 AlphaFold3、OpenFold3、Boltz-2、ColabFold 1.6.3",其余模型官方没有逐一列出【直引:中文技术媒体对技术报告的转述,2026-09-18】。
⚡ 三种模式,对应三种实际需求
每个优化包保留原始模型权重,提供 Exact、Fast、Big 三种运行模式。这三种模式不是速度档位,它们对应三类真实场景。
在单张 NVIDIA H100 上,三种模式的平均加速倍数分别是 1.6 倍、4.1 倍、3.4 倍。这组数字来自下面这张表:Exact 是在 14 个结构预测模型上测的,Fast 是在提供该模式的 13 个模型上测的,Big 的 3.4 倍同样出自 13 个模型。
| 运行模式 | 测试模型数 | H100 平均加速 | 精度口径 |
|---|---|---|---|
| Exact | 14 | 1.6 × | 输出与原模型逐位一致 |
| Fast | 13 | 4.1 × | 允许极小数值差异 |
| Big | 13 | 3.4 × | 以显存换规模,精度见后文 |
Fast 模式内部的离散度值得单看:最快的是 Chai-1,6.4 倍;同一档里最慢的是 AtlasFold,2.8 倍。最保守的 Exact 模式,最快的一个也不超过 2.5 倍【直引:Anthropic 技术报告图表,经中文媒体转述】。
FlashPairformer 自身在三角工序上的相对提升同样分档。三角注意力在 pair width 128(AlphaFold3 与 Boltz-2 用的配置)上比领域标准内核快 2.7 倍,在 pair width 256(Protenix v2 用的配置)上快 2.9 倍;三角乘法在两个配置上分别快 1.7 倍和 3.2 倍。序列越长,优势越明显:2048 token、pair width 128 的配置下能到 4 倍。
这里的"领域标准内核"指的是 NVIDIA 之前为同一瓶颈做的两套东西,先是 cuEquivariance,后是 BioNeMo Inference Runtime。这个对照选择有它的分量:被比下去的一方本来就是厂商的专用内核【推论:对照对象为专用内核,因此这些倍数不能与"从零优化"的倍数直接类比】。
🔬 精度到底掉了没有
"精度损失很小"是个需要口径的词。报告给的口径是界面预测看 DockQ,高于 0.23 算可接受;设计结果看 ipSAE,这是一个与湿实验结合率有相关性的计算打分。
真正可核对的是一组池化基准。FoldBench-Lite,1,925 个"模型—靶点"配对,覆盖 13 个模型配置,可接受界面的占比:
四个数字之间的差别落在池化统计上看不出来。Anthropic 自己的表述是"没有可分辨的池化变化"【直引:Anthropic 研究报告】。池化口径的代价是:它把 13 个配置的差异平均掉了,单个模型上的退化有可能被整体抹平,报告没有给出逐模型的精度分布【推论】。
🏔️ Big 模式顶到哪儿,以及它顶不动的地方
Big 模式是这批工作里最容易被误读的一项。它买到的不是速度,是规模。
用 Big 模式折叠的几个大组装体,与实验结构的吻合度如下。人类线粒体复合物 I、TRiC 分子伴侣复合物、蛋白酶体、细菌 70S 核糖体,TM-score 落在 0.92 到 0.997 之间。
| 体系 | TM-score 区间 | 说明 |
|---|---|---|
| 人类线粒体复合物 I | 0.92 ~ 0.997 | 与实验结构接近 |
| TRiC 分子伴侣复合物 | 同上区间 | 官方称属迄今准确折叠的最大结构之一 |
| 蛋白酶体 | 同上区间 | 同上 |
| 细菌 70S 核糖体 | 同上区间 | 同上 |
官方补了一句限定:这是"就我们所知"的范围【直引】。
边界出现在更大的尺度上。团队用 8 张 B300 一个节点,对整颗病毒衣壳和蛋白区室这类 31,000 到 70,000 残基的组装体跑了七次结构预测。
七次都跑完了,七次都塌成了一个紧实的球。可评分的那几次,TM-score 只有 0.08 到 0.14。报告的归因是泛化失败:这些组装体比 AlphaFold3 最大的训练切片大 40 到 90 倍。原文把这个结果定位成"扩展了可计算的范围,而不是扩展了模型学到的东西"【直引】。
💰 从一万美元一个靶点到一百五十美元
这批优化的下游应用是结合蛋白(binder)设计。两组工作的对比如下。
| 项目 | 2026 年 4 月那一轮 | 这一轮 |
|---|---|---|
| 提示词长度 | 约 16,000 词 | 约 1,100 词 |
| 子智能体 | 有 | 无 |
| 人工介入 | 有 | 无 |
| 算力 | 每个靶点最多 10,000 美元,约 2,500 H100 卡时 | 1 张 H200,24 小时墙上时间 |
| 合计花费 | 每靶点约 10,000 美元 | 约 150 美元(GPU + token) |
in silico 分数是:Opus 5 的 ipSAE 中位数 0.785,Mythos 5.1 是 0.781,Mythos 5 是 0.739;三者在更早那轮工作里的对照值是 0.749。最优设计的分数是 0.833、0.825、0.813,对照 0.817。
官方的说法是,用大约小 100 倍的 GPU 预算,达到了与早前几轮相当的 in silico 表现,合计约 150 美元。中位数上 Opus 5 与 Mythos 5.1 确实高了,Mythos 5 的 0.739 低于 0.749,所以"相当"这个词在这里是准确的,不是"更好"【推论】。
要强调的是:这些分数是计算打分的预测值,不是湿实验读数。官方明确写了,这些设计没有经过实验检验【直引】。补上这一环的是 Anthropic 与 Adaptyv Bio 联合举办的蛋白设计竞赛:五个题目(含物种交叉反应性与难做的 GPCR 靶点),5000 多份设计要做湿实验验证;Anthropic 出最多 100 万美元 Claude 积分,Modal 出 25 万美元算力,Twist Bioscience 出 DNA 合成。
🧑🔬 干活的是模型,把关的是两个人
这个项目的人力配置是两处细节里最有信息量的一处。
代码优化主要由 Claude 完成,运行在 Claude Science 环境里。盯着它的两名 Anthropic 技术人员,报告特意交代了背景:熟悉生物分子建模,但此前没有做过推理优化,也没写过 GPU 内核【直引】。
被测试的模型版本有 Mythos 5.1、Mythos 5 和 Opus 5。更早的一次公开结果是,Claude Mythos 5.1 加速了 7 个开源生物模型,最高 2.5 倍;这一轮把范围扩到了 30 多个。
⚖️ 谁在对照,谁没对照
把报告的限定条件集中列一下,比读结论更有用。
| 维度 | 报告自陈的边界 |
|---|---|
| 硬件 | 测量只在 H100 上进行 |
| ColabFold 对照 | 比的是 1.6.1 版;该项目后来自己发布了融合内核 |
| 显存 | Exact 与 Fast 最多多用 3.2 倍显存 |
| FlashPairformer | 报告未引用第三方独立测试 |
| 仓库维护 | 定位为参考发布,不主动维护,不接受贡献 |
| 湿实验 | 设计结果尚未做实验验证 |
仓库的定位尤其值得说清楚。"参考发布、不维护、不接受贡献"这套说法,跟"开源"两个字放在一起会产生误读:代码可以自由拿去改,但不会有人接你的 PR【判断】。
🧭 这件事落在什么位置上
把镜头拉开一格。这批工作最直接的意义不在生物,在 AI 编程的下一站。
过去一年,coding agent 的公开成绩单大多挂在业务代码上:修 GitHub Issue、批量重构、写前端页面。这些任务有一个共同特点,验证便宜。测试跑一遍就知道对不对。
FlashPairformer 这类任务不一样。它的验证成本极高:你得知道三角注意力的内存访问模式该长什么样,得知道 0.23 的 DockQ 算不算过线,还得把池化基准的四个数字一起读。在这个场景里,AI 写出的代码能不能用,取决于有没有人能在外面架一套足够严的对照。
报告本身没有回答"AI 写出的科学代码距离跑满硬件还有多远"这个问题。它在结尾处给的是"扩展了可计算的范围,而不是扩展了模型学到的东西"这样一句限定【直引】。
同一个星期,另一条路给出了侧面的答案。9 月 17 日,AItonomy Foundation 发布了开源项目 ScienceIDE,赞助方是 PhAI Labs 与阿里 Qwen。它的目标是把世界上的科学代码库转成可执行、可验证的智能体学习环境,并用验证过的交互轨迹训练出了 PhAI-IDE-72B / 9B / 4B 三个模型(arXiv:2609.19134)。
两条路问的是同一个问题的两端。Anthropic 这条路问:AI 能不能把已有的科学软件改快。ScienceIDE 那条路问:这种能力能不能被沉淀下来、迁移到别的科研领域。
真正决定成败的恐怕是工时:谁愿意为"验证"这件事出多少。AlphaFold3 的训练切片上限是 768 个 token,Big 模式跑到了 7 万以上却塌成一团球,这两个数字之间的距离,就是"能算"与"算对"之间的距离。谁来把这段距离量出来?
参考文献
- Anthropic, How Claude is uplifting biomolecular modeling, 2026-09-17. https://www.anthropic.com/research/claude-uplifts-biomolecular-modeling
- Anthropic, anthropics/uplifting-biomolecular-modeling(GitHub 仓库,Apache 2.0,36 个优化包),2026-09-17. https://github.com/anthropics/uplifting-biomolecular-modeling
- Unite.AI, Anthropic Reports Claude Optimized 30+ Open-Source Biomolecular Models, 2026-09-18. https://www.unite.ai/anthropic-reports-claude-optimized-30-plus-open-source-biomolecular-models
- AI Insiders, Anthropic says Claude rewrote 30 biology models to run 4x faster, 2026-09-18. https://aiinsiders.net/article/anthropic-says-claude-rewrote-30-biology-models-to-run-4x
- AItonomy Foundation, ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments, arXiv:2609.19134, 2026-09-16.
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。