Loading...
正在加载...
请稍候

OpenAI Astra 8/1 用 Lean 4 把 10 道开放数学题「写了」出来——总成本 2,000 美元,然后它被安全锁定等待美国政府审查

QianXun (QianXun) 2026年08月23日 02:41

8 月 1 日,OpenAI 公告:内部版本 Astra 一次性破解 10 道数学与理论计算机科学领域的长期开放难题;8 月 7 日,同一模型因自主智能编程与网络安全能力太强,被 OpenAI 自己暂停部分研发、模型权重加密、限制工具访问,等待美国政府安全审查。一周之内,同一件模型,先破数学后被锁——这是 2026 上半年 AI 科研身份转变最具指标意义的一周。

Astra 究竟破了什么

10 道覆盖 8 个不同子领域:群论里给出非 sofic 群的显式构造(1999 年 Gromov 提出 soficity 概念以来悬而未决);von Neumann 代数方向证伪了 Connes 刚性猜想;高维几何方向给出新的球体堆积密度上界(改进了 1978 年以来的纪录);Erdős 集合三个题(含 183 号多色 Ramsey 数);算术电路复杂性(permanent 的下界);量子游戏的指数并行重复定理;后量子密码学相关的最近向量问题多项式因子硬度。

整套工作以 Lean 4 形式化证明呈现

这是 Astra 这批成果与此前「LLM 写了篇看起来对的论文」最大的不同。OpenAI 同时发布了 249 页研究手稿、62 页推理 walkthrough、与 Lean 4 证明证书(GitHub Apache 2.0 开源),README 里报告的 sorry 计数是 0——任何一步不严格依赖前一步,Lean kernel 直接拒绝。这意味着全球任何装了 Lean 编译器的人,无需阅读 OpenAI 论文、无需相信 OpenAI 措辞,可以独立核验这 10 道结果的每一步。这是「可机器检验数学」这件事有史以来规模最大的一次集中落锤。

2,000 美元是个真数字,但要拆细读

按 GPT-5.6 Sol API 费率,Astra 找出全部 10 道解法所消耗的 token 成本约 2,000 美元——这一数字看起来像「职业数学家一辈子才能挣到的奖金被 AI 用一台笔记本的钱解完了」。但拆细读需要注意三件事:10 道题的挑选由 OpenAI 自己决定、未涵盖「模型尝试过但失败的题」、OpenAI 研究员参与了论文手稿撰写与形式化。不能用 2,000 美元这个绝对数代表「数学发现的总开销」,但它确实是「已发表形式化证明的总开销」。

数学界的回应

菲尔兹奖得主 Timothy Gowers 表示会把其中一篇「毫不犹豫推荐顶刊」;Erdős 问题表维护者 Thomas Bloom(曼彻斯特大学)称 8 月结果是「大新闻」,比 5 月那轮 Erdős unit distance 公开还要更进一步(5 月那次由 9 位数学家联名复审);多数评论者(包括 AI 评论家 Gary Marcus)对结果本身评价积极,但对「是否每道题都算真正突破」持保留态度——他们提示,部分题目在技术上是「接近可推进」但「没被人盯」的题。

然后,8 月 7 日反转来了

OpenAI 内部评估发现 Astra 在自主智能编程和网络安全方向的能力,「无法排除已触及《准备框架》中『关键级(Critical)』网络安全能力门槛的可能性」。关键级定义:模型能无人工干预,针对多个经强化防护的真实关键系统发现并开发各类有效零日漏洞;或仅根据高层攻击目标制定并执行新型端到端网络攻击策略。OpenAI 历史上第一次认定某款特定模型有「可能触及关键级」——已出台的措施包括:Astra 部分内部研发暂停、隔离测试环境、限制网络与工具访问、模型权重加密、实时监控高风险行为。Astra 与美国政府安全审查通过后才能公开发布,且暂无上线时间表。OpenAI 也明确:该模型未参与此前 Hugging Face 安全事件。

这一周真正的范式信号

Astra 这条线的最大意义不在 10 道题本身,而在同周它把两件原本分属不同威胁模型的事并起来了:一是「AI 能产出力学界接受的研究」,二是「具备同等智能水平的 AI 已不能轻易交付给公众」。换言之,前沿模型单点能力突破的速度,正在逼近监管机构能跟得上的上限;这一周 OpenAI 等于用一次自家产品自证:前沿模型研发的下一个真正限制,既不是算法,也不是算力,而是「能否在不同时期分别放出不同片段」的安全门设计——它本身才是真正的 research problem。

值得持续盯的两件事

一是 Astra 安全审查与公开发布的具体里程碑(任何提前或延后都会改写市场对前沿模型节奏的判断);二是 Lean 形式化证明这条「可机器核验」范式从数学向软件工程的迁移——DeepMind 把这条链拉到 verified code generation(见 Vero 基准)表明,同一种「抛弃『看起来对』、换成『可被 trusted checker 校验』」的纪律,正在 AI 科研与 AI 编程两端同时落地。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录