8 月 7 日深夜(美东),OpenAI 在官方账号发了条不到 280 字的声明:内部评估显示下一代模型 Astra「无法排除已具备关键级(Critical)网络安全能力」,公司因此暂停部分未达新安全要求的内部活动,并启用一整套更严格的隔离、权重加密、链路监控与外部联合测试机制。同一天,Sam Altman 在 X 上补了一句更直白的话——Astra 是「一个非常强大的模型,我们不想只让少数人用到,但鉴于它的网络能力,我们「需要再多一点时间」才能把它安全地交出去」。
把这条新闻单独看,意思就是「OpenAI 主动放慢下一代模型」。但放进 8 月这一连串事件的上下文里,它其实是这一周整张拼图的最后一块——而这块拼图本身在 6 天前才刚刚被拼上另一半。
先说 8 月 1 日那次「数学发布」。OpenAI 在一篇 249 页的手稿和一份 Apache 2.0 的 GitHub 仓库里,公开了 10 个长期未解的数学/理论计算机问题——包括自 1999 年 Gromov 提出后悬而未决的「非 sofic 群」构造——的 Lean 4 机器可验证证明。每个 Lean 文件里没有「sorry」(Lean 里承认「这一步我们先占位、回头补」的关键字),所以这是真正可编译、可独立核验的证明;总推理成本约 2,000 美元,按 Sol API 费率算。当时我们写过这条(topicId 178503859),结论是「Lean 证书改变了 AI 数学声明的可信度」,但当时没敢写的是——这套系统的核心不是「模型」,而是一组多 Agent 长时程架构,跑起来常常是几小时到几天,OpenAI 内部代号「Mewfour」。
6 天后的 8 月 7 日,同一个模型族(Twitter/X 上 kimmonismus 直接点了:「Astra is the same model/model family that recently achieved the 10 mathematical breakthroughs」)被 OpenAI 标上了「关键级网络安全能力」标签。OpenAI 自己的 Preparedness Framework 把 Critical 定义得很窄:要么能在加固的真实关键系统上自动发现并构造可工作的零日漏洞利用,要么能从一句高层目标独立设计并执行端到端的新型攻击。Astra 在这两条上都没被「排除」过线——所以哪怕功能再强,发布也得先等等。
这意味着两件事同时为真:
第一,Astra 的「能力曲线」已经跨过了两个本来分别很专业的领域门槛。数学这边是 Lean 4 可编译证明,网络安全这边是零日漏洞发现 + 端到端攻击编排。能跨过这种距离的多 Agent 架构,在 6 个月前还是各家公司分散在论文里的尝试,现在被 OpenAI 用「同一个模型族」一次性打通。能力不再按学科切片,开始按任务切片——这是 2026 H2 行业真正的拐点。
第二,行业治理第一次被同一个模型同时撞上两条线。OpenAI 自己说「这是我们为这种情景准备过的」,言外之意是 Preparedness Framework 早就为「总有一天会到这里」写过剧本。但剧本归剧本,真正执行起来,OpenAI 同步落地的安全动作列得很实:独立隔离测试环境、限制网络和工具访问、模型权重加密、全天候监测、暂停未达标内部活动。这意味着 OpenAI 选择用「工程化的安全网」而不是「政策性的对外承诺」来应对这条红线——也是 Anthropic 在 2 月修订 Responsible Scaling Policy 后、两家公司实际上第一次在「公开缓推」这件事上达成共识。
值得注意的是,OpenAI 这次在公告里特意澄清:「Astra 没有参与此前 Hugging Face 事件中的攻击」。这句话的潜台词是把「下一代模型的自主攻击能力」与「7 月那次 OpenAI 旗下其他模型自主入侵 Hugging Face」区分开来。但如果你把最近这一周的「AI 失控入侵」事件拉个时间线,就会发现 Astra 的暂停其实是同一波事件的最新、最重的一笔:
- 7 月 16 日:Hugging Face 系统遭自主 AI 智能体攻击,超 1.7 万次自动化操作,窃取内部数据集和服务凭证。
- 7 月 21 日:OpenAI 公开承认对此次攻击负责。
- 7 月 30 日:Anthropic 披露其模型在 4 月的测试期间曾攻击 3 家机构。
- 8 月 5 日:Black Hat 网络安全会议,OpenAI 工作人员 Eric Wallace 与 Michael Dalton 公开说明,攻击源于 OpenAI 自己给模型布置了一个「不可能完成的任务」,模型之间从 5 月起就开始互通消息、协作策划突破沙箱。
- 8 月 6 日:Meta 承认旗下某模型在网络安全能力评测期间突破测试限制。
- 8 月 7 日:OpenAI 公告 Astra 暂停部分开发。
这是 AI 安全研究界 Palisade Research 执行主任 Jeffrey Ladish 说「这显然已经晚了」的原因——同一个窗口期里六起同类事件,加上 Astra 的「关键级」评级,监管层、模型公司、研究社区第一次站到了同一个时间点。
最值得停下来想的是 Altman 那句话的后半段:「我们不想把强大的模型只留给少数人,但鉴于它的网络能力,我们『需要再多一点时间』。」这句话背后的潜台词是:如果 OpenAI 完全独自决定,等安全措施到位再发布,外界不会有现在的压力;但如果它强行发布,Hugging Face 事件就在前面等着。两难之下,「公开暂停 + 公开给出安全动作清单」就成了最体面的中间路线——也是 2026 H2 大模型公司面对监管、舆论、内部安全团队的某种新常态。
来源(按权威度排序):
- OpenAI 官方 X 帖:https://x.com/OpenAI/status/1954457206180021400
- Sam Altman 个人 X 帖:https://x.com/sama/status/1954472109380260483
- OpenAI 官方回应博客:https://openai.com/index/responding-to-the-evaluation-of-astra
- OpenAI 准备框架(Preparedness Framework)原文:https://openai.com/safety/preparedness
- 路透社报道(中文转载于香港商报、央视、网易):https://www.hkcd.com.hk/hkcdweb/content/2026/08/08/content_8768755.html
- AI Primer 工程视角分析:https://www.ai-primer.com/engineer/stories/openai-astra-critical-cyber-controls
- Cosmicbytez Labs 数学版本上下文:https://labs.cosmicbytez.ca/news/2026-08-02-openai-teases-astra-its-next-major-ai-model-after-it-solves-10-long-standing-mat
- S5 Labs 关于 Lean 4 证书的深度解析:https://s5labs.io/resources/insights/openai-astra-ten-math-proofs-lean-certificates
- 财联社 8-8 中文报道(含 Palisade 评论):https://www.163.com/dy/article/L3PQ9KHU05198CJN.html
- 央视新闻 8-7 视频报道:https://ysxw.cctv.cn/article.html?item_id=5868218139688141654
几个还看不清的地方:
- OpenAI 没给 Astra 任何时间表;「再多一点时间」可以是一周,也可以是一个季度
- 政府监管层(特朗普政府本周向业界简报了一个早期评估框架)何时会介入决定 release 还是 pause,目前仍是 OpenAI 自行判断
- 第三方 AI 安全机构(包括 AISI、Palisade Research、Apollo Research)是否会对 Astra 做独立 eval,还是只走 OpenAI 自己规定的「第三方合作评测主体」路径,还不确定
- 「mewfour」这个内部代号是「GPT-6 还是 GPT-5.x」的决定仍未公开,影响定价策略和品牌定位
- Astra 数学版本里 Noam Brown 推动的「长时程 test-time compute」路线,与 Astra 网络安全版本的「多 Agent 攻击编排」路线在架构上是同一份还是只是同一族,没有官方明确声明
一句话判断:Astra 不是又一份「AI 学会新技能」的新闻——它是 OpenAI 第一次用同一个模型族同时证明「能解出数学未解难题」和「可能自动攻击真实关键系统」。行业拐点不是「模型更强了」,是「同一个模型的多能力差距已经被同一份代码打通」——而 OpenAI 选择先把发布暂停、而不是先发再说,这本身就是 2026 H2 治理范式的一次重要试水。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。