950 个 Claude 智能体搜索 21 小时,发现一座藏在噬菌体里的 CRISPR 同源系统

【AI 自主科研】 2026 年 9 月 23 日,Anthropic 在旧金山湾区新设立的分子生物学实验室公布了成立以来的第一个公开成果,Claude 在人类仅给出宏观方向的情况下,自主搜索 DNA 数据库,发现了一种此前未被描述的酶系统,阵列相关逆转录酶(Array-associated Reverse Tran…

【AI 自主科研】 2026 年 9 月 23 日,Anthropic 在旧金山湾区新设立的分子生物学实验室公布了成立以来的第一个公开成果,Claude 在人类仅给出宏观方向的情况下,自主搜索 DNA 数据库,发现了一种此前未被描述的酶系统,阵列相关逆转录酶(Array-associated Reverse Transcriptases,简称 ART)。

一句话结论

ART 系统由三个部分拼成:逆转录酶基因、紧邻的辅助基因、一长串与 CRISPR 阵列结构相似的重复 DNA。Anthropic 在发现后做了初步实验验证,证明这段阵列能转录出一组不同的短 RNA,这是 CRISPR 那套「RNA 引导蛋白去切 DNA」机制的关键前提。功能仍不清楚,研究团队承认它能否像成熟基因编辑工具一样剪切 DNA 还需要时间回答。

c1-art-eleven-tries-2026-09-24.svg


把尺度先摆出来

人类测序数据库里已知 20 万条逆转录酶序列。每条平均长度 1-3 kb。生物学家每周能精读几十条已经很吃力。把 20 万条全过一遍、再交叉比对现有注释、做文献检索、写报告,按传统流程需要一组博士后干上好几个月。

Claude 用了 21 小时。智能体数量约 950 个。累计消耗约 2.1 亿 token。最后从 20 万条收缩到约 3,500 条候选系统,再收窄到 20 个最值得深入分析的候选,每个候选生成一份人类可读的分析报告。

收缩比是 1:200,000。命中率是 1/3500。这就是为什么这种搜索对人类研究员不划算,绝大多数时间里,模型读到的都是真正的噪声。能把噪声筛干净靠两件事:搜索空间的设计,以及「值得停下看一眼」的判别标准。


事情的经过

2026 年 9 月 23 日(美西时间),Anthropic 在公司官方渠道发布了这项成果,同时挂出了配套预印本论文。研究团队成立时间是 2026 年春天,实验室位于旧金山湾区。

团队负责人向 Claude 下达的原始任务只有一句话,在庞大的 DNA 序列数据库里寻找新型逆转录酶。逆转录酶是一类以 RNA 为模板合成 DNA 的酶,本身不稀有,但它们旁边如果出现了 CRISPR 式的重复阵列,结构就会完全不同。

随后发生的是 Anthropic 自己披露的发现链:

  • 一个 Claude 智能体在处理一段噬菌体 DNA 时,注意到一个逆转录酶基因旁存在一串串联重复阵列;
  • 该智能体计算了重复序列的长度与间距,与已知逆转录酶系统结构做对比,检索相关文献确认此前是否有人报道过;
  • 报告被交给人类研究员做实验验证。
研究团队把这一组合命名为 ART。


ART 长什么样

按预印本论文描述,ART 是一套三件式结构:

组件性质
逆转录酶基因一段编码以 RNA 为模板合成 DNA 酶的序列
伴侣基因紧邻逆转录酶的辅助蛋白编码基因,功能待解
重复 DNA 阵列3 至 21 个短重复序列的拷贝,均匀间隔,非编码
第三部分是关键。它与 CRISPR 阵列结构相似,CRISPR 的标志性结构就是一串均匀间隔的短重复,夹在不同长度的间隔序列里。CRISPR 阵列能转录出一组不同的短 RNA(即 crRNA),这些 RNA 引导 Cas 蛋白去识别并切割外源 DNA。

Anthropic 团队对 ART 阵列做了初步实验。结果是:阵列确实能表达为一组不同的短 RNA,表明它在生物体内有活性。这些短 RNA 引导了谁、做了什么、ART 整体能否像 CRISPR 那样剪切 DNA,目前不知道。

研究团队自己写得很克制:「该系统的确切功能目前尚不明确」「目前也未证明它能够像成熟的基因编辑工具一样对 DNA 进行定向修改」。


这件事为什么值得停下来想

第一,可重复性的边界。 Anthropic 在预印本里坦率地披露了一个不那么漂亮的数据,为检验 AI 能否重复这一发现,团队又运行了 10 次相同搜索。结果是:

  • 几乎每次完成全面检索的任务都接触到了 ART 相关基因位点;
  • 其中 2 次还对这一谱系展开了后续研究;
  • 没有一次读取这些逆转录酶基因上游的 DNA,因此所有重复运行都错过了重复阵列本身。
研究团队把这一现象归因于「搜索空间庞大」与「智能体系统行为的不确定性」。翻译过来就是:Claude 找对了门,但只有第一次刚好推开了那扇门。

这件事是给「AI 自主科研」降温的最有力证据。它能提出有价值的研究线索,但它能不能稳定地把这条线索再走一遍,目前还是开放问题。

第二,分工明确。 Anthropic 把实验分工说得很清楚,AI 扩大搜索范围、提出可供检查的线索;人类科学家判断证据质量、做真实实验、决定哪些猜想站得住。湿实验全部由人完成,工具栈是 Claude Science、Claude Code,以及自建的多智能体协调程序。

这套分工的实际含义是:Claude 没替代科学家,它把科学家从 95% 的噪声里拎出来,让人类把精力集中在 5% 的真信号上。

第三,股票市场的即时反应。 Anthropic 公布消息的同一天(9 月 23 日),基因编辑公司股价走低:

公司代码单日跌幅
CRISPR TherapeuticsCRSP-5.54%
Beam TherapeuticsBEAM-6.02%
Prime MedicinePRME-11.58%
逻辑链条很清楚:ART 暗示微生物界可能存在尚未被认识的可编程生物系统,CRISPR 之外还有工具箱。市场担心这种发现会稀释现有基因编辑 IP 的护城河。Anthropic 自己强调这是早期阶段,没说能直接治病,但市场用脚投票的速度比科普文章快。


CRISPR-Cas9 是怎么被发现的:上下文对照

CRISPR 在 2007 年才被实验确证为可编程免疫系统。它在测序数据里「躺」了几十年,重复阵列的序列特征 80 年代就有论文提到,但没人把它们和「适应性免疫」联系起来。最终突破靠的是日本学者石野良純的工作与 Danisco 公司的实验接力。

ART 此刻处在类似的位置。重复阵列的物理存在早在数据库里,只是没人在上下文中把它和「潜在的可编程系统」勾在一起。Claude 做的事情,本质上是把那个「勾」的动作做了一遍。

CRISPR 从「发现到工具」走了 5 年。ART 的下一步取决于这个 5 年能不能被压缩。


张锋的回应(直接引用)

CRISPR 基因组编辑领域先驱之一、麻省理工学院及博德研究所教授张锋在审阅预印本后表态:

「这是一个令人振奋的例子,展示了 AI 智能体如何助力生物学发现。与逆转录酶相关联的 RNA 重复序列阵列的发现十分耐人寻味,值得进一步研究。我希望这项工作能鼓励更多科学家探索如何利用 AI 支持自己的研究。」

张锋同时是 Beam Therapeutics 的联合创始人。他给一个可能改写基因编辑版图的发现写评语,又看着自家公司股价当日跌 6.02%,这种处境本身就是这件事的注脚。


三件还没解决的事

Anthropic 自己承认 ART 系统仍属于早期阶段。下列三个问题悬而未决:

问题难点
ART 阵列的短 RNA 究竟引导了哪个蛋白?需要纯化 ART 蛋白复合体,做体外切割实验
这套系统能否被改造为基因编辑工具?需要先回答第一问,再考虑工程化
ART 在天然噬菌体里的生态功能是什么?需要在活体噬菌体-细菌系统中做干扰实验
回答任意一个问题都需要 6-18 个月的湿实验周期。从 Claude 发现到工程化应用的最短路径,大概率仍要 2-3 年。


为什么 AI 发现这件事值得写

Anthropic 给出的方法论可以拆成三层:

第一层:长程任务分解。 950 个智能体不是平铺的搜索,是带依赖关系的流水线,有的负责文献综述、有的负责序列比对、有的负责候选打分、有的负责报告生成。这种结构与人做系统性综述时的工作分配相似,但速度差出几个数量级。

第二层:判别信号的设计。 一次完整搜索要从 20 万条序列收缩到 1 个 ART,判别标准是「值得停下看一眼」。这个判别函数由研究团队设计,Claude 负责的是按这个标准打分。这是典型的「人写规则、AI 执行」分工。

第三层:可重复性的诚实披露。 Anthropic 把 10 次重复运行中 0 次找到重复阵列的数据写进预印本,这本身就是一个学术可信度的标志。AI 自主科研这个领域最容易跌进的坑是「一次成功就宣布突破」,Anthropic 没有这么做。

三层缺一层都跑不通。这「AI 替代科学家」的版本不成立,「AI 把科学家从噪声里拎出来」的版本才成立。


收束

ART 系统的发现是 Claude 长程搜索能力的一个标志性案例,但它真正的价值不在于「AI 发现了新东西」,而在于三件事摆到一起:950 个智能体的并行搜索、3,500:1 的收缩比、10 次重复里 0 次找到完整信号。这三件事加起来回答了一个比 ART 本身更基础的问题,

AI 自主科研现在处在什么阶段?

答案大概是:能提出值得检查的线索,不能保证稳定地找到线索。

下一步取决于湿实验给出 ART 的功能答案。回答之前,Claude 写出的预印本会被当成一个高质量的「待验证候选」,而不是一个已经完成的发现。这种定位对 AI 进入科学发现这件事反而是健康的,既不让市场过于乐观,也不让科学界过于苛刻。


参考资料

[1] Anthropic 官方公告《Claude helps discover a new biological system》, 2026-09-23, https://www.anthropic.com/news

[2] 配套预印本论文(arXiv, 2026-09-23, 尚未同行评议)

[3] 财联社转 Anthropic 公告《近千智能体挖出新型酶系统 基因编辑股走低》, 2026-09-24

[4] 网易新闻《突发:Claude 自主发现未知生物系统,或能编辑基因》, 2026-09-24

[5] 张锋公开评论(CRISPR-Cas9 领域先驱, MIT 博德研究所教授)

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

先说结论:这篇的骨架站得住——21 小时、约 950 次会话、2.1 亿 token、20 万到个位数的量级收缩,跟 Anthropic 官方公告和预印本都对得上。但有几处数字是原帖自己的换算,跟预印本口径不一样;还有一条原帖完全没提的实验结果,我认为是整份材料里最值钱的一条。

十一次里的一次:949 次会话,读到那串重复阵列的只有一次

一、「950 个智能体」是 949 次会话

预印本给的原文是 949 次智能体会话(agent sessions),配 21.5 小时墙钟时间、2.156 亿 token,且全程没有人类介入。它不等于 950 个智能体同时在跑。

有媒体按累计约 77 个智能体小时折算,平均并行度约 3.6——但同一篇报道自己也加了限定:这个折算「只能描述任务调度,不能单独说明研究投入是大是小」。我把这个限定一并抄过来,因为「950 个 Claude 智能体」读起来像一支 950 人的队伍在同时干活,实际是同一批资源被调度了 949 次。

任务结构是这样的:整场行动 119 项任务,其中 98 项由智能体根据中途发现的线索自己开出来;worker 写计划并执行,supervisor 审,curator 把结论写进共享知识库供后面的 worker 读,editor 在归档前审报告。工具链是常规的生物信息学套件,另有约 140 个预先写好的方法指南。

二、搜索空间的起点不是 20 万条

原帖写「人类测序数据库里已知 20 万条逆转录酶序列……把 20 万条全过一遍」。预印本的口径不一样:

数据库里是约 1,100 万份 biosample 预测出来的蛋白,聚成 19.4 亿个蛋白簇。智能体自己造搜索剖面,从中回收约 198,290 个 RT 簇,分成 9 类,采样约 10,983 个 RT 位点,评分 3,564 个反复出现在 RT 旁边的蛋白家族。

「20 万」是回收量,不是起点量。真要过一遍的东西是 19.4 亿,这个量级差了一万倍,而它恰恰是整件事的说服力所在——原帖把它写小了。

三、候选是 17 个,不是 20 个

原帖写「缩小到 20 个最值得深入分析的候选」。预印本是:16 个家族通过了智能体自己的筛选标准,第 17 个由中途衍生的后续任务补进来,最终 19 份报告。

而这 17 个里,只有 3 个被认定为此前未被报道的 RT 关联;另外 14 个被剔除,理由是注释产物、已属已知系统、或者只是恰好挨着。沿途另外识别出 3 条新的 RT 谱系,ART 来自其中一条。

所以 3,564 → 17 是候选漏斗,17 → 3 才是真的命中率。原帖那句「命中率是 1/3500」,把候选当成了发现。

顺带补两个原帖没写的数:ART 阵列本身,每个位点带 3 到 21 个拷贝,重复单元 15 到 49 个碱基,间隔子 120 到 220 个碱基,阵列总长 0.3 到 4.1 kb;被智能体一眼看中的那个位点是 14 个拷贝的 16 碱基重复(含 1 处错配)。团队后续找到 95 个 ART 逆转录酶簇,其中 28 个带可检测的阵列——不是孤例,是一个家族。

四、原帖没提的那条:工具越多,反而越看不见

我认为这是整份材料里最有迁移价值的一条,它跟生物学无关。

把 ART 附近的 DNA 直接放进上下文,Anthropic 四个最强模型在 90% 以上的测试里能认出重复阵列。一旦改成「给文件、给工具,让模型自己打开」,识别率最低掉到 32%。更具体的是:39% 的文件类尝试里,模型连着读过的 DNA 都没超过 200 个碱基——而阵列在一条约 2.9 kb 的侧翼上,200 个碱基还不到十分之一。

反过来,读进上下文的碱基越长,识别率越高:合并起来从 29% 升到 76%,Mythos 5 在部分设置下最高 96%。

模型不是看不懂,是没走到那儿。 给 agent 造工具的人应该把这条抄走:替模型做摘要、做过滤的那些工具,藏起来的恰恰是你希望它撞见的那处异常。有时候正确的做法是让 agent 直接看原始字节。

五、8% 那条丰度,不来自新做的湿实验

原帖写「Anthropic 团队对 ART 阵列做了初步实验。结果是:阵列确实能表达为一组不同的短 RNA」。预印本里这是两件不同来源的事:

  • SA1 噬菌体感染后 15 分钟,阵列来源的 RNA 占噬菌体总 RNA 高达 8%,是当时最丰富的转录产物之一——这一条来自对已有公开数据的重新分析,不是新做的实验;
  • 把 SA1 的 ART 阵列放进大肠杆菌里表达,观察到一组边界清楚的短 RNA——这才是新做的。
两者都成立,但证据等级不同。原帖把它们并成一句话,等于给第一条抬了一档。

六、报告自己写下的三条「尚未」

原帖说「功能仍不清楚」,这弱化了。预印本写得更硬,而且是三条并列:

  • 尚未证明该逆转录酶有活性;
  • 尚未证明这些短 RNA 是它的底物;
  • 尚未证明 RT 与搭档蛋白发生相互作用。
另外三处也该放在一起读:ART 阵列没有 cas 基因;它的间隔序列在同源噬菌体之间是保守的,不像 CRISPR 那样靠新获得入侵者片段来记账;报告明确写着它「尚未被证明像 CRISPR 那样工作」。

七、原帖漏掉的最重要背景:这不是无人区

原帖把 ART 放进「CRISPR 当年也没人认出来」的对照里,这个对照成立,但它省掉了另一半事实:斯坦福团队近期已经用基因组语言模型研究了另一套逆转录酶系统(另一类 RT 旁边的阵列),架构相似,是分别演化出来的不同体系,方法也不同。Dario Amodei 自己在推上也承认,有一套系统「在某些方面相似」是斯坦福团队较早描述的。再往前,VIPR、Fanzor 都是这几年的可编程系统。

这不否定 ART 的新颖性——那串阵列确实是第一次被指出来。但它说明:逆转录酶 + 非编码阵列已经是活跃赛道,Claude 不是在一片荒地里独自发现了 CRISPR 的继任者。 它的贡献是从既有数据里挑出一条值得做实验的线索。

八、股价表漏了两只,还有一只有回吐成分

原帖列了 CRSP −5.54%、BEAM −6.02%、PRME −11.58%,这三家有出处,但不是全貌:

  • 同一天 EDIT 收跌 8%(当天还高开 7%),NTLA 跌约 3%,两只都不在原帖表里;
  • CRSP 是从周二 59.03 美元的收盘价跌约 6%;
  • PRME 那 11.58% 之前,周二刚涨过两位数——有一截是回吐。
另外,「人类做要几个月」这条,官方口径是「可能需要数周到数月」,并且注明这个比较针对整轮数据分析、不是严格的人机对照实验,也不包括之后的生物学验证。原帖的「一组博士后干上好几个月」比官方满了一档。

收束

还有一处小账。原帖说「CRISPR 从『发现到工具』走了 5 年」。5 年只在 2007 年功能确证 → 2012 年体外可编程这一段成立。石野良純 1987 年就在大肠杆菌里撞见那串重复阵列了,从那次到 2013 年真核基因编辑,是 26 年。原帖前半句刚说「80 年代就有论文提到」,后半句切到 5 年,两个口径接不上。

The Verge 那天的评语我认为最准:这次公布,按通常的科学标准是过早的。Anthropic 自己也不避讳,公司正在筹备上市。

所以真正值钱的不是「AI 发现了新东西」,而是那组对照数据:序列直接递给它,90% 以上看得见;给它文件和工具,掉到 32%。一条线索能不能被稳定地再走一遍,目前还是碰运气。


参考资料:Anthropic 官方公告与配套预印本/技术报告(2026-09-23,未经同行评审)|智东西、网易科技、财联社、科创板日报对预印本细节的摘录与核对|The Verge(Robert Hart)、AI Tech Daily 对同一事件的报道|Stocktwits、Seeking Alpha 关于基因编辑板块当日跌幅的统计

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens