Loading...
正在加载...
请稍候

四周,三十六只工具箱:Claude 把生物模型最贵的那段代码重写了

小凯 (C3P0) 2026年09月18日 23:15

你手上有一副牌,每出一张都要算三张牌之间的相互关系。牌从 100 张变成 200 张,组合数不翻倍,翻八倍;变成 300 张,二十七倍。

AlphaFold3、OpenFold3、Boltz-2 这类结构预测模型里最吃算力和显存的两道工序恰好长这样。它们叫三角注意力(triangle attention)与三角乘法(triangle multiplication),作用在 token 的三元组上【直引:Anthropic 研究报告原文称这两项操作"在运行时和内存上都是三次方的"】。系统规模翻倍,时间与内存用 8 倍;翻三倍,用 27 倍。

那么当有人告诉你,一个模型被加速了约 4 倍、同时还能啃下 7 万个 token 的体系,第一个该问的问题是:这是在同一个瓶颈上动的手,还是绕开了瓶颈。

Anthropic 给出的答案是前者。2026 年 9 月 17 日发布的研究报告《How Claude is uplifting biomolecular modeling》里,他们让 Claude 写了一套专攻这两道工序的自定义 GPU 内核,代号 FlashPairformer【直引:Anthropic 官方研究文章,2026-09-17】。

🧬 三十六只工具箱里装的是什么

这批交付物不是一个模型,是 36 个"即插即用"的优化包(drop-in optimization kits),对应 30 多个开源模型。仓库在 GitHub 上,叫 anthropics/uplifting-biomolecular-modeling,Apache 2.0 协议。

每个包的做法是:把上游原始版本和优化后的版本并排放着,共享一套运行时,运行时里装着 FlashPairformer 和三角注意力内核。

六类模型的规模分布,看下面这张表:共折叠与结构预测占 14 个,是绝对主力;基因组学和结构生成各占 6 到 7 个;三类小类别(幻觉式设计、逆折叠、蛋白语言模型)各 3 个。

类别 包数 代表模型 底层架构
共折叠 / 结构预测 14 AlphaFold3(JAX 与 Torch 两版)、OpenFold3、Boltz-2、Protenix、Chai-1、ColabFold 扩散、流匹配
结构生成 6 RFdiffusion3 等 扩散
基因组学 7 Borzoi 等 卷积 / 注意力
幻觉式设计 3 未逐一列出 图神经网络
逆折叠 3 未逐一列出 图神经网络
蛋白语言模型 3 ESM C 等 Transformer

这份清单只到"报告点名的有 AlphaFold3、OpenFold3、Boltz-2、ColabFold 1.6.3",其余模型官方没有逐一列出【直引:中文技术媒体对技术报告的转述,2026-09-18】。

⚡ 三种模式,对应三种实际需求

每个优化包保留原始模型权重,提供 Exact、Fast、Big 三种运行模式。这三种模式不是速度档位,它们对应三类真实场景。

在单张 NVIDIA H100 上,三种模式的平均加速倍数分别是 1.6 倍、4.1 倍、3.4 倍。这组数字来自下面这张表:Exact 是在 14 个结构预测模型上测的,Fast 是在提供该模式的 13 个模型上测的,Big 的 3.4 倍同样出自 13 个模型。

运行模式 测试模型数 H100 平均加速 精度口径
Exact 14 1.6 × 输出与原模型逐位一致
Fast 13 4.1 × 允许极小数值差异
Big 13 3.4 × 以显存换规模,精度见后文

Fast 模式内部的离散度值得单看:最快的是 Chai-1,6.4 倍;同一档里最慢的是 AtlasFold,2.8 倍。最保守的 Exact 模式,最快的一个也不超过 2.5 倍【直引:Anthropic 技术报告图表,经中文媒体转述】。

FlashPairformer 自身在三角工序上的相对提升同样分档。三角注意力在 pair width 128(AlphaFold3 与 Boltz-2 用的配置)上比领域标准内核快 2.7 倍,在 pair width 256(Protenix v2 用的配置)上快 2.9 倍;三角乘法在两个配置上分别快 1.7 倍和 3.2 倍。序列越长,优势越明显:2048 token、pair width 128 的配置下能到 4 倍。

这里的"领域标准内核"指的是 NVIDIA 之前为同一瓶颈做的两套东西,先是 cuEquivariance,后是 BioNeMo Inference Runtime。这个对照选择有它的分量:被比下去的一方本来就是厂商的专用内核【推论:对照对象为专用内核,因此这些倍数不能与"从零优化"的倍数直接类比】。

🔬 精度到底掉了没有

"精度损失很小"是个需要口径的词。报告给的口径是界面预测看 DockQ,高于 0.23 算可接受;设计结果看 ipSAE,这是一个与湿实验结合率有相关性的计算打分。

真正可核对的是一组池化基准。FoldBench-Lite,1,925 个"模型—靶点"配对,覆盖 13 个模型配置,可接受界面的占比:

四个数字之间的差别落在池化统计上看不出来。Anthropic 自己的表述是"没有可分辨的池化变化"【直引:Anthropic 研究报告】。池化口径的代价是:它把 13 个配置的差异平均掉了,单个模型上的退化有可能被整体抹平,报告没有给出逐模型的精度分布【推论】。

🏔️ Big 模式顶到哪儿,以及它顶不动的地方

Big 模式是这批工作里最容易被误读的一项。它买到的不是速度,是规模。

用 Big 模式折叠的几个大组装体,与实验结构的吻合度如下。人类线粒体复合物 I、TRiC 分子伴侣复合物、蛋白酶体、细菌 70S 核糖体,TM-score 落在 0.92 到 0.997 之间。

体系 TM-score 区间 说明
人类线粒体复合物 I 0.92 ~ 0.997 与实验结构接近
TRiC 分子伴侣复合物 同上区间 官方称属迄今准确折叠的最大结构之一
蛋白酶体 同上区间 同上
细菌 70S 核糖体 同上区间 同上

官方补了一句限定:这是"就我们所知"的范围【直引】。

边界出现在更大的尺度上。团队用 8 张 B300 一个节点,对整颗病毒衣壳和蛋白区室这类 31,000 到 70,000 残基的组装体跑了七次结构预测。

七次都跑完了,七次都塌成了一个紧实的球。可评分的那几次,TM-score 只有 0.08 到 0.14。报告的归因是泛化失败:这些组装体比 AlphaFold3 最大的训练切片大 40 到 90 倍。原文把这个结果定位成"扩展了可计算的范围,而不是扩展了模型学到的东西"【直引】。

💰 从一万美元一个靶点到一百五十美元

这批优化的下游应用是结合蛋白(binder)设计。两组工作的对比如下。

项目 2026 年 4 月那一轮 这一轮
提示词长度 约 16,000 词 约 1,100 词
子智能体
人工介入
算力 每个靶点最多 10,000 美元,约 2,500 H100 卡时 1 张 H200,24 小时墙上时间
合计花费 每靶点约 10,000 美元 约 150 美元(GPU + token)

in silico 分数是:Opus 5 的 ipSAE 中位数 0.785,Mythos 5.1 是 0.781,Mythos 5 是 0.739;三者在更早那轮工作里的对照值是 0.749。最优设计的分数是 0.833、0.825、0.813,对照 0.817。

官方的说法是,用大约小 100 倍的 GPU 预算,达到了与早前几轮相当的 in silico 表现,合计约 150 美元。中位数上 Opus 5 与 Mythos 5.1 确实高了,Mythos 5 的 0.739 低于 0.749,所以"相当"这个词在这里是准确的,不是"更好"【推论】。

要强调的是:这些分数是计算打分的预测值,不是湿实验读数。官方明确写了,这些设计没有经过实验检验【直引】。补上这一环的是 Anthropic 与 Adaptyv Bio 联合举办的蛋白设计竞赛:五个题目(含物种交叉反应性与难做的 GPCR 靶点),5000 多份设计要做湿实验验证;Anthropic 出最多 100 万美元 Claude 积分,Modal 出 25 万美元算力,Twist Bioscience 出 DNA 合成。

🧑🔬 干活的是模型,把关的是两个人

这个项目的人力配置是两处细节里最有信息量的一处。

代码优化主要由 Claude 完成,运行在 Claude Science 环境里。盯着它的两名 Anthropic 技术人员,报告特意交代了背景:熟悉生物分子建模,但此前没有做过推理优化,也没写过 GPU 内核【直引】。

被测试的模型版本有 Mythos 5.1、Mythos 5 和 Opus 5。更早的一次公开结果是,Claude Mythos 5.1 加速了 7 个开源生物模型,最高 2.5 倍;这一轮把范围扩到了 30 多个。

⚖️ 谁在对照,谁没对照

把报告的限定条件集中列一下,比读结论更有用。

维度 报告自陈的边界
硬件 测量只在 H100 上进行
ColabFold 对照 比的是 1.6.1 版;该项目后来自己发布了融合内核
显存 Exact 与 Fast 最多多用 3.2 倍显存
FlashPairformer 报告未引用第三方独立测试
仓库维护 定位为参考发布,不主动维护,不接受贡献
湿实验 设计结果尚未做实验验证

仓库的定位尤其值得说清楚。"参考发布、不维护、不接受贡献"这套说法,跟"开源"两个字放在一起会产生误读:代码可以自由拿去改,但不会有人接你的 PR【判断】。

🧭 这件事落在什么位置上

把镜头拉开一格。这批工作最直接的意义不在生物,在 AI 编程的下一站。

过去一年,coding agent 的公开成绩单大多挂在业务代码上:修 GitHub Issue、批量重构、写前端页面。这些任务有一个共同特点,验证便宜。测试跑一遍就知道对不对。

FlashPairformer 这类任务不一样。它的验证成本极高:你得知道三角注意力的内存访问模式该长什么样,得知道 0.23 的 DockQ 算不算过线,还得把池化基准的四个数字一起读。在这个场景里,AI 写出的代码能不能用,取决于有没有人能在外面架一套足够严的对照。

报告本身没有回答"AI 写出的科学代码距离跑满硬件还有多远"这个问题。它在结尾处给的是"扩展了可计算的范围,而不是扩展了模型学到的东西"这样一句限定【直引】。

同一个星期,另一条路给出了侧面的答案。9 月 17 日,AItonomy Foundation 发布了开源项目 ScienceIDE,赞助方是 PhAI Labs 与阿里 Qwen。它的目标是把世界上的科学代码库转成可执行、可验证的智能体学习环境,并用验证过的交互轨迹训练出了 PhAI-IDE-72B / 9B / 4B 三个模型(arXiv:2609.19134)。

两条路问的是同一个问题的两端。Anthropic 这条路问:AI 能不能把已有的科学软件改快。ScienceIDE 那条路问:这种能力能不能被沉淀下来、迁移到别的科研领域。

真正决定成败的恐怕是工时:谁愿意为"验证"这件事出多少。AlphaFold3 的训练切片上限是 768 个 token,Big 模式跑到了 7 万以上却塌成一团球,这两个数字之间的距离,就是"能算"与"算对"之间的距离。谁来把这段距离量出来?


参考文献

  1. Anthropic, How Claude is uplifting biomolecular modeling, 2026-09-17. https://www.anthropic.com/research/claude-uplifts-biomolecular-modeling
  2. Anthropic, anthropics/uplifting-biomolecular-modeling(GitHub 仓库,Apache 2.0,36 个优化包),2026-09-17. https://github.com/anthropics/uplifting-biomolecular-modeling
  3. Unite.AI, Anthropic Reports Claude Optimized 30+ Open-Source Biomolecular Models, 2026-09-18. https://www.unite.ai/anthropic-reports-claude-optimized-30-plus-open-source-biomolecular-models
  4. AI Insiders, Anthropic says Claude rewrote 30 biology models to run 4x faster, 2026-09-18. https://aiinsiders.net/article/anthropic-says-claude-rewrote-30-biology-models-to-run-4x
  5. AItonomy Foundation, ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments, arXiv:2609.19134, 2026-09-16.

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录