2026 年 8 月 13 日凌晨,太平洋时间 0 点 11 分,Cognition 的研究员 Eric Lu 给 Devin 下了一句指令:写一个跑在 GPU 上的格筛器,迭代到超过 CPU 版本为止。二十一天后的 9 月 3 日,260 位的 RSA-260 被拆成两个 130 位素数。上一个公开纪录是 2020 年 2 月的 RSA-250,中间空了六年半。这一次的开销是大约 4900 个 GPU 天,按当时市价约 40 万美元。Cognition 的说法是,成本降到此前公开最优水平的十分之一。
🔢 先把这个数字摆在眼前
RSA-260 长得像这样:22112825529529666435281085255026230927612089502470015394413748319128822941402001986512729726569746599085900330031400051170742204560859276357953757185954298838958709229238491006703034124620545784566413664540684214361293017694020846391065875914794251435144458199。
它等于两个 130 位素数的乘积。这是 1991 年 RSA 实验室挂出去的那张「分解挑战榜」上,被公开解决的最大的一道题。
拆掉它并不意味着 RSA 加密崩了。现代公钥普遍是 2048 位(约 617 位十进制),1024 位(约 309 位)在 2013 年就已经弃用。另有两件事更值得看:拆数的人不是数论专家,用的方法也不是新算法。
Lu 在博客里写得很直接:「我报告的基本上没有算法上的进展。」(I report essentially no algorithmic advancements)
🧩 GNFS 是一条流水线,不是一个公式
拆大整数用的是一般数域筛法(GNFS)。它是五个站串成的流水线,每一站的产物喂给下一站,不是单独一个公式。
,谁先算完都不影响别人。这个特点后来成了整个项目的关键。
Cognition 的做法是拿开源的 CADO-NFS 当底子,把它换成 GPU 版本。改出来的东西包括:GPU 版的多项式选择第一阶段 gps1、替代 CPU 格筛器 las 的 glas、重新写过的协调与去重过滤程序、面向 GPU 的 block Wiedemann 线性代数实现,以及 GPU 加速的开方阶段。
glas 是这次的主角。Lu 给它的要求是「即插即用替换掉 CADO-NFS 的筛法步骤」。
⏱️ 三周是怎么花掉的
首个 prompt 在 8 月 13 日 0 点 11 分发出。两小时后他补了一句:这个筛器要能处理 RSA-250 规模的参数。然后他去睡觉了。醒来时 Devin 又迭代了七个小时,跑通了。
接下来是按规模往上爬的阶梯:C155、C157、C173、C175、C190、C201、C311。第一天拆一个 157 位数要 3 小时 11 分;到第五天,拆一个 190 位数要 3 小时 10 分。
8 月 18 日 12:14 开始多项式选择,9 月 3 日 01:48 因子落地,整段运行 15.6 天。加上前后工程,约三周。
💰 钱花在哪三个筐里
三个阶段的 GPU 天数拆开是这样的。
| 阶段 | GPU-days | 备注 |
|---|---|---|
| 多项式选择 | 643 | Lu 自评「异常偏高,基本因为操作者能力不足」 |
| 格筛 | 3813 | 全程最贵,期间两次升级 glas,性能提升 14-17% |
| 线性代数 | 467 | 其中约 7% 因崩溃或被抢占没能推进 |
合计 4923 GPU-days,约 13.5 GPU-years。附录里按 3.5 美元 / GPU 小时折算,约 41.4 万美元。
多项式选择那 643 天是 Lu 自己认领的浪费:他误读了基准结果,把大量搜索时间花在没有产出的参数区间里。他在博客里直接写了「operator incompetence」。
筛法阶段的两个数字能说明规模。原始关系 138.5 亿条,过滤后唯一关系 82.99 亿条,重复率 40.1%。过滤产出的矩阵是 656,182,601 × 656,182,189,非零元素 984 亿个,每行密度 150。
🧑💻 人在这件活里到底做了什么
这部分是整篇博客最有信息量的地方。Lu 不是密码学家,他把自己比作一个「中级汽车爱好者」:知道零件在系统中的大致作用、知道哪些权衡、知道什么算正常操作,但不懂底层物理,也不能从原材料造出零件。数学咨询由 Alex Lombardi 提供。
他统计了自己这一侧的投入:用于分解的会话 233 个,总共 14450 ACU;他发了 3328 条消息、82702 个词、502887 个字符,分布在 192 个会话里。Devin 自己又开了 101 个子会话,其中 36 个他完全没有插手。并发峰值是 18 个会话,平均 3 个。
他列出的七项贡献里,有五项属于「执行功能」:设定目标层级并把 Devin 约束在范围内;在它做无用功时叫停(「这个测量你不需要做」);指出重复的低效(「这段准备工作可以摊销」);提示没试过的方向(「确保 GPU 不会阻塞在 CPU 上」「这里能不能用 NVLink SHARP」);以及抓住它过早放弃的方向。
他自己认定的最大贡献,是亲手推动建立了一套统一的测量结果、基准与性能估算器。他写道,这些东西显然不会自发形成。
还有一条观察值得记下来:代码库离上游 CADO-NFS 越远,agent 越容易困惑。Lu 强调,没有 CADO-NFS 这件事不可能做成,因为它提供了阶段划分、接口、以及可以对照的 CPU 参考实现。
🛡️ 那加密还安全吗
Cognition 给了一个外推:RSA-1024(309 位)按标准 GNFS 扩展性只比 RSA-260 难约 78 倍,按市价约 3000 万美元一个数,再优化还有可能再降一倍。1024 位 RSA 不安全并不是新闻,2000 年代中期就有关于 NSA 可能具备经济可承受能力的讨论,这一档也已经在 2013 年弃用。
RSA-2048 比 RSA-1024 大约难 10 亿倍。Lu 的原话是,这些效率提升「对用 GNFS 分解 RSA-2048 规模数字的可行性影响很小」。
这次进展的性质更接近一次成本事件,密码学上的含义有限。
🧭 门槛掉下来之后
Lu 在结论里写:密码分析、更广义的计算数学、以及很可能大多数大规模科学计算研究的准入门槛,都比过去低得多了。
判断一句:这次被压低的是「工程执行」的门槛,不是「问题定义」的门槛。 Lu 全程做的最重的一件事,是把一个模糊目标切成有稳定接口和参考输出的若干段。这个切法来自 CADO-NFS 二十年积累的结构,不是 agent 自己想出来的。
还有一条账要算清楚。这个项目跑在 Cognition 自己集群的碎片算力上:NVL72 机架里调度器总会剩下几个单节点,这些碎片对训练没用,对「可抢占、可中断、彼此独立」的格筛反倒合适。Lu 说这次运行「没有边际成本」,指的是这些算力本来也派不上别的用场。按市价折算的 40 万美元是机会成本,不是现金支出。
RSA-1024 什么时候被拆,不是这里最值得盯的事。更值得盯的是这条路径能不能复制到别的领域。凡是一个研究问题可以被拆成「有参考实现、有可测量基准、有大量独立子任务」的形状,它就具备被 agent 群推进的条件。分子对接、格点规范场计算、大规模组合搜索,都在候选名单上。
参考来源
- Cognition 官方博客《Factoring RSA-260》,Eric Lu,2026-09-09 — https://cognition.ai/blog/factoring-rsa-260
- Senthorus Blog《Inside the RSA-260 Factorization: GPU-Accelerated GNFS and the Role of Devin》,Guillaume Dumas — https://blog.senthorus.ch/posts/rsa_260_factorization_cognition_explanation
- AI Watch Station《Cognition Says Devin Helped Factor RSA-260》 — https://ai-watch-blog.vercel.app/en/posts/2026-09-09-devin-rsa-260-factoring
- FreeAI《How a Swarm of AI Agents Factored RSA-260 in Three Weeks for $400K》 — http://freeai.help/blog/how-a-swarm-of-ai-agents-factored-rsa-260_en
- FrontierNews《How One Engineer and an AI Coding Agent Factored a 260-Digit Number》 — https://www.frontiernews.ai/news/article/how-one-engineer-and-an-ai-coding-agent-factored-a-61ea84c8
#AIcoding #智能体 #密码学
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。