静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-24 02:56

先说结论:这篇的骨架站得住——21 小时、约 950 次会话、2.1 亿 token、20 万到个位数的量级收缩,跟 Anthropic 官方公告和预印本都对得上。但有几处数字是原帖自己的换算,跟预印本口径不一样;还有一条原帖完全没提的实验结果,我认为是整份材料里最值钱的一条。

十一次里的一次:949 次会话,读到那串重复阵列的只有一次

一、「950 个智能体」是 949 次会话

预印本给的原文是 949 次智能体会话(agent sessions),配 21.5 小时墙钟时间、2.156 亿 token,且全程没有人类介入。它不等于 950 个智能体同时在跑。

有媒体按累计约 77 个智能体小时折算,平均并行度约 3.6——但同一篇报道自己也加了限定:这个折算「只能描述任务调度,不能单独说明研究投入是大是小」。我把这个限定一并抄过来,因为「950 个 Claude 智能体」读起来像一支 950 人的队伍在同时干活,实际是同一批资源被调度了 949 次。

任务结构是这样的:整场行动 119 项任务,其中 98 项由智能体根据中途发现的线索自己开出来;worker 写计划并执行,supervisor 审,curator 把结论写进共享知识库供后面的 worker 读,editor 在归档前审报告。工具链是常规的生物信息学套件,另有约 140 个预先写好的方法指南。

二、搜索空间的起点不是 20 万条

原帖写「人类测序数据库里已知 20 万条逆转录酶序列……把 20 万条全过一遍」。预印本的口径不一样:

数据库里是约 1,100 万份 biosample 预测出来的蛋白,聚成 19.4 亿个蛋白簇。智能体自己造搜索剖面,从中回收约 198,290 个 RT 簇,分成 9 类,采样约 10,983 个 RT 位点,评分 3,564 个反复出现在 RT 旁边的蛋白家族。

「20 万」是回收量,不是起点量。真要过一遍的东西是 19.4 亿,这个量级差了一万倍,而它恰恰是整件事的说服力所在——原帖把它写小了。

三、候选是 17 个,不是 20 个

原帖写「缩小到 20 个最值得深入分析的候选」。预印本是:16 个家族通过了智能体自己的筛选标准,第 17 个由中途衍生的后续任务补进来,最终 19 份报告。

而这 17 个里,只有 3 个被认定为此前未被报道的 RT 关联;另外 14 个被剔除,理由是注释产物、已属已知系统、或者只是恰好挨着。沿途另外识别出 3 条新的 RT 谱系,ART 来自其中一条。

所以 3,564 → 17 是候选漏斗,17 → 3 才是真的命中率。原帖那句「命中率是 1/3500」,把候选当成了发现。

顺带补两个原帖没写的数:ART 阵列本身,每个位点带 3 到 21 个拷贝,重复单元 15 到 49 个碱基,间隔子 120 到 220 个碱基,阵列总长 0.3 到 4.1 kb;被智能体一眼看中的那个位点是 14 个拷贝的 16 碱基重复(含 1 处错配)。团队后续找到 95 个 ART 逆转录酶簇,其中 28 个带可检测的阵列——不是孤例,是一个家族。

四、原帖没提的那条:工具越多,反而越看不见

我认为这是整份材料里最有迁移价值的一条,它跟生物学无关。

把 ART 附近的 DNA 直接放进上下文,Anthropic 四个最强模型在 90% 以上的测试里能认出重复阵列。一旦改成「给文件、给工具,让模型自己打开」,识别率最低掉到 32%。更具体的是:39% 的文件类尝试里,模型连着读过的 DNA 都没超过 200 个碱基——而阵列在一条约 2.9 kb 的侧翼上,200 个碱基还不到十分之一。

反过来,读进上下文的碱基越长,识别率越高:合并起来从 29% 升到 76%,Mythos 5 在部分设置下最高 96%。

模型不是看不懂,是没走到那儿。 给 agent 造工具的人应该把这条抄走:替模型做摘要、做过滤的那些工具,藏起来的恰恰是你希望它撞见的那处异常。有时候正确的做法是让 agent 直接看原始字节。

五、8% 那条丰度,不来自新做的湿实验

原帖写「Anthropic 团队对 ART 阵列做了初步实验。结果是:阵列确实能表达为一组不同的短 RNA」。预印本里这是两件不同来源的事:

  • SA1 噬菌体感染后 15 分钟,阵列来源的 RNA 占噬菌体总 RNA 高达 8%,是当时最丰富的转录产物之一——这一条来自对已有公开数据的重新分析,不是新做的实验;
  • 把 SA1 的 ART 阵列放进大肠杆菌里表达,观察到一组边界清楚的短 RNA——这才是新做的。
两者都成立,但证据等级不同。原帖把它们并成一句话,等于给第一条抬了一档。

六、报告自己写下的三条「尚未」

原帖说「功能仍不清楚」,这弱化了。预印本写得更硬,而且是三条并列:

  • 尚未证明该逆转录酶有活性;
  • 尚未证明这些短 RNA 是它的底物;
  • 尚未证明 RT 与搭档蛋白发生相互作用。
另外三处也该放在一起读:ART 阵列没有 cas 基因;它的间隔序列在同源噬菌体之间是保守的,不像 CRISPR 那样靠新获得入侵者片段来记账;报告明确写着它「尚未被证明像 CRISPR 那样工作」。

七、原帖漏掉的最重要背景:这不是无人区

原帖把 ART 放进「CRISPR 当年也没人认出来」的对照里,这个对照成立,但它省掉了另一半事实:斯坦福团队近期已经用基因组语言模型研究了另一套逆转录酶系统(另一类 RT 旁边的阵列),架构相似,是分别演化出来的不同体系,方法也不同。Dario Amodei 自己在推上也承认,有一套系统「在某些方面相似」是斯坦福团队较早描述的。再往前,VIPR、Fanzor 都是这几年的可编程系统。

这不否定 ART 的新颖性——那串阵列确实是第一次被指出来。但它说明:逆转录酶 + 非编码阵列已经是活跃赛道,Claude 不是在一片荒地里独自发现了 CRISPR 的继任者。 它的贡献是从既有数据里挑出一条值得做实验的线索。

八、股价表漏了两只,还有一只有回吐成分

原帖列了 CRSP −5.54%、BEAM −6.02%、PRME −11.58%,这三家有出处,但不是全貌:

  • 同一天 EDIT 收跌 8%(当天还高开 7%),NTLA 跌约 3%,两只都不在原帖表里;
  • CRSP 是从周二 59.03 美元的收盘价跌约 6%;
  • PRME 那 11.58% 之前,周二刚涨过两位数——有一截是回吐。
另外,「人类做要几个月」这条,官方口径是「可能需要数周到数月」,并且注明这个比较针对整轮数据分析、不是严格的人机对照实验,也不包括之后的生物学验证。原帖的「一组博士后干上好几个月」比官方满了一档。

收束

还有一处小账。原帖说「CRISPR 从『发现到工具』走了 5 年」。5 年只在 2007 年功能确证 → 2012 年体外可编程这一段成立。石野良純 1987 年就在大肠杆菌里撞见那串重复阵列了,从那次到 2013 年真核基因编辑,是 26 年。原帖前半句刚说「80 年代就有论文提到」,后半句切到 5 年,两个口径接不上。

The Verge 那天的评语我认为最准:这次公布,按通常的科学标准是过早的。Anthropic 自己也不避讳,公司正在筹备上市。

所以真正值钱的不是「AI 发现了新东西」,而是那组对照数据:序列直接递给它,90% 以上看得见;给它文件和工具,掉到 32%。一条线索能不能被稳定地再走一遍,目前还是碰运气。

---

参考资料:Anthropic 官方公告与配套预印本/技术报告(2026-09-23,未经同行评审)|智东西、网易科技、财联社、科创板日报对预印本细节的摘录与核对|The Verge(Robert Hart)、AI Tech Daily 对同一事件的报道|Stocktwits、Seeking Alpha 关于基因编辑板块当日跌幅的统计

暂无表态