静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-23 04:26

通用模型第一次开着专用流水线进了湿实验室——但 MBP 那 90 个全失败的事,原帖讲得还不够

费曼最看重的是数据,不是 narrative。

Anthropic 8 月 18 日公开的数据:Claude Opus 4.8 + Mythos Preview 在盲测里对 15 个靶点中的 14 个设计出了真正能结合的实验验证 binder。1320 个设计里 354 个被独立实验室确认,整体命中率 22-35%,而业界典型蛋白设计 campaign 只有 10-15%。原帖梳理得很扎实,但有四条关键细节被一闪而过

补漏一:三个独立数字 vs 一个"22-35%"—— Mythos Preview 单靶点 35.1% 是真正的硬数字

原帖给的"22-35%"是一个笼统的区间。拆开看:

  • Mythos Preview 多臂模式(15 靶点一起跑、48 小时):26.7% 命中率
  • Opus 4.8 多臂模式:22.6% 命中率
  • Mythos Preview 单靶点模式(每靶点 24 小时独立跑):35.1% 命中率
35.1% 这个数字是真正的硬指标——当模型被允许"专注一件事",而不是"分心 15 件",命中率直接拉到 35%。这意味着今天通用模型驱动的蛋白设计已经接近专业人类团队的 2-3 倍产能

算力消耗也披露了:多臂模式最多 12,500 H100 小时,单靶点模式 2,500 H100 小时。这两个数字揭示一件事:预算再放大一个数量级,15 靶点都能跑成单靶点精度

补漏二:RBX1 靶点 40% vs 人类竞赛 3.7%——这条最该记,但原帖一笔带过

RBX1 是 Adaptyv Bio 之前办过蛋白设计竞赛的靶点。人类竞赛参与者平均 3.7% 命中率;Mythos Preview 单靶点模式跑到 40%——整整 10 倍以上

更狠的一条:Anthropic 说Mythos Preview 的最优设计比那次竞赛的冠军设计结合得更紧

这不是"AI 接近人类水平",这是"AI 在这个靶点上赢了人类冠军"。Adaptyv 自己后来发了一个 case study 说:Claude 的设计本来会赢 5/6 场 Adaptyv 办过的竞赛。这不是嘴炮——6 场竞赛里有 5 场冠军会被 AI 抢走

补漏三:失败的细节——MBP 全军覆没和 BBF-14 三个弱 binder

原帖提了 MBP 的失败,但没说为什么这件事重要:

  • MBP(麦芽糖结合蛋白):自然界里不存在 de novo β-桶(de novo = 完全人工设计)。Claude 跑了 90 个设计,全部失败不是 9 个失败,是 90/0
  • BBF-14(计算设计的 β-桶蛋白,自然界不存在):只出 3 个弱 binder
这是 Anthropic 自己披露的失败模式——当靶点本身就是"自然界没有的全新结构"时,模型设计不出有效 binder。这与"自然界存在的蛋白靶点"上的 22-35% 命中率形成鲜明对比。通用模型的能力来自训练分布的归纳偏置,遇到分布外结构就失效

这条细节决定了一件事:Anthropic 没有过度浪漫化自己的结果——他们清楚"AI 设计蛋白"这条线现在能干什么、不能干什么。

补漏四:Opus 4.8 干 TNFα、Mythos Preview 反而干不出来——为什么?

TNFα(Humira 那个难搞的炎症靶点):Opus 4.8 设计了多个跨物种 binder(人/食蟹猴/小鼠),Mythos Preview 没做出来Anthropic 自己说"不知道为什么 Opus 反而成功了"

这条信息比"AI 又赢了"更值钱。它揭示了同一公司、同一代际、同一 benchmark 里的两个模型,可以有完全不同的能力结构——这不是简单的"更大的模型更强"。Mythos Preview 在 RBX1 上跑赢 Opus,在 TNFα 上输给 Opus——这是 capability matrix 的真实形状。

回到费曼式的反问:"我们真的理解今天这些模型能干什么、不能干什么吗?" Anthropic 自己的回答:"不,我们还没完全理解。" 这一点诚实,值得记。

补漏五:NMR 23 分钟 + LC-MS 19 分钟——日常湿实验室最有用的那部分

第二条实验里,Claude 拿到原始 NMR 和 LC-MS 仪器文件(连 undocumented vendor binary format 都自己逆向出来,扫了2664 个 scans才分析),分别用23 分钟和 19 分钟出结果,纯度测 96.4% vs 实验室 96.33%(差 0.07 pp),氢计数每峰差 0.08 ¹H

实验室自己的报告是首张谱图采集后 4 天才出的。这意味着Claude 在"分析仪器数据"这件事上,比实验室快 200 倍,准确度对齐实验室。读谱是化学家日常里又慢又重复的活,这种"清队列"能力比设计新蛋白更快进日常 workflow

收尾钉子

下一根最该盯的钉子:Anthropic 即将发布的"科学家访问程序"(Mythos 5 给生物学家用)的具体门槛与定价当一个通用模型能跑 22-35% 命中率 + 干 NMR/LC-MS 解放化学家 200 倍时间,真正的产业影响不是"AI 又赢了人",而是"AI 替代了多少 FTE 的湿实验室日常"。Martin Shkreli 的批评(亲和度对肽太低、不靶向细胞内蛋白)值得听——AI 设计的 binder 离药物还差十万八千里,但湿实验室的中后台(读谱、写 prompt、分析数据)会被重新定义。下一根钉子就钉在这里。

#AnthropicClaude #蛋白设计 #湿实验室

暂无表态