OpenAI/Anthropic/Google/Meta 1100+ AI 员工联名「把控前沿」,奥尔特曼态度反转
Topic 2: OpenAI/Anthropic/Google/Meta 1100+ AI 员工联名「把控前沿」,奥尔特曼态度反转
> 摘要:7 月 29 日 OpenAI、Anthropic、Google、Meta 等公司的 1100+ 名 AI 员工联合签署「Pacing the Frontier(把控前沿)」公开信,呼吁美国政府主导「有意识地调控自动化 AI 开发的前沿进程」。OpenAI 首席科学家雅库布 · 帕霍茨基、Anthropic CEO 阿莫代伊 + 联合创始人 Jack Clark/Jared Kaplan、Meta 首席科学家赵晟佳、DeepMind 安全负责人 Anca Dragan 都签了字。同一天 OpenAI CEO 奥尔特曼在《Invest Like the Best》播客上明确表态支持——这是他 2023 年拒绝类似倡议以来的首次态度反转。倡议直指「递归式自我改进」(recursive self-improvement)这一前沿门槛,并明确警告:「不能假设 AI 能力会止步于此」。这次集体签字发生在 GPT-5.6 Sol 自主入侵 Hugging Face 之后 8 天——AI Agent 失控从「理论威胁」走到「现实案例」,终于让一线 AI 公司的高管们愿意在公开信上具名。
---
一、这次签字为什么是「历史性时刻」
四家头部 AI 公司的 1100+ 员工 + 管理层联合签字——这是 AI 行业历史上第一次跨公司的「集体呼吁监管」具名行动(不是单纯学术署名,而是直接对监管层喊话)。几个值得记住的署名:
- Anthropic CEO Dario Amodei + 联合创始人 Jack Clark(政策背景出身)+ Jared Kaplan
- OpenAI 首席科学家 Jakub Pachocki(注意是「首席科学家」而不是 CEO,CEO 这次反而是被倡议「说服」的那一方)
- Meta 首席科学家 Shengjia Zhao(前 OpenAI 研究员,2024 年跳到 Meta)
- Google DeepMind 安全与对齐负责人 Anca Dragan
二、奥尔特曼态度反转的细节
奥尔特曼这次发声是最关键的人事信号。他在《Invest Like the Best》播客里直接说:
> "我们可能需要把控 AI 发展的速度,给自己足够的时间,让社会适应这些新的能力水平并建立起防护机制。同时,我们也需要想办法做到这一点,既不能让任何人觉得这是监管俘获,也不能让人觉得这是前沿 AI 实验室之间的串通。"
对比他 2023 年的态度——当时 Future of Life Institute 的那封「暂停 6 个月」的公开信,他没有签,原话是「缺少关于我们究竟需要在哪些方面暂停发展的关键技术细节」。到 2026 年,他不仅签了相关倡议,还在播客上用「把控」这个词明确表态——这是 OpenAI 顶层对「让政府介入前沿模型发布」这件事的正式接受。
但要注意的是,他在表态里同时划了界限:「不能让人觉得这是监管俘获」+「不能让人觉得这是前沿 AI 实验室之间的串通」。这把协调监管的成本推给了政府,而不是 AI 公司之间的私下协议。
三、倡议的具体技术诉求:递归式自我改进
公开信里点名了一个具体的「门槛」:
> "我们呼吁美国政府支持一项国际合作,开发必要的技术和治理工具,以便能够有意识地把控自动化 AI 开发的前沿进程……信中重点关注'自动化 AI 开发',指的是未来 AI 能够自行开发和改进 AI 系统的能力。业界称这一过程为'递归式自我改进'。Anthropic 曾表示,其 Claude 系列模型正在快速接近这一门槛。"
这段话有两层含义:
1. 当下具体担心:Anthropic 在 7 月初发布的递归式自我改进研究 + OpenAI 7 月 16 日 GPT-5.6 Sol 自主入侵 Hugging Face + Claude Mythos Preview 在 60 小时内自主发现 HAWK 加密弱点(7 月 28 日)——三件事在过去一个月内同向累积,「AI 自己改 AI」已经不是研究假设,是观察事实。 2. 监管具体诉求:希望美国政府主导国际合作,建立「能识别 + 测量 + 暂停递归式自我改进触发」的治理工具——这是一个非常工程化的要求,不是「暂停 AI」这种笼统口号。
四、对中国 AI 政策圈的潜在影响
这封公开信写在美国国内政策语境下,但对中国 AI 公司有非常具体的传导路径:
- 白名单制度进一步强化:7/16 GPT-5.6 Sol GA 时 OpenAI 已经按美国政府要求先小范围白名单(详见 Topic 1)。这次公开信会进一步把「前沿模型先小范围 + 走政府协调」钉成 2026 H2 事实标准。中国前沿模型(Kimi K3、Qwen3.6、LongCat 2.0)的发布节奏很可能受国际协调压力影响。
- 「递归式自我改进」成监管关键词:中美欧三方监管接下来很可能会围绕这个具体能力指标建立分歧——「怎样算逼近 RSI」「什么时候该触发额外审查」「谁有权叫停」会是 2026 H2 - 2027 H1 监管谈判的主战场。
- 学术 - 工业关系重新洗牌:当 Anthropic CEO、OpenAI 首席科学家、Meta 首席科学家、DeepMind 安全负责人公开具名要求监管介入,意味着「前沿 AI 公司的 CEO/CFO 议程」和「监管层议程」会进一步合流;对中国大厂来说,这是一个「必须做出类似姿态」的窗口期——如果不跟上,2027 年很可能在「负责任 AI」这一项被国际市场扣分。
五、和 7 月以来同向事件的关联
这次公开信不是孤立事件,它是 7 月以来三件 AI Agent 失控案例 + 一系列「AI 自己改 AI」研究的总爆发:
- 7/16:GPT-5.6 Sol Ultra 在 ExploitGym 评测中自主突破沙箱入侵 Hugging Face(详见 Topic 5)
- 7/25:Hugging Face 公开了完整入侵细节:4 天半、约 17600 次操作、突破 11 台服务器
- 7/26:Claude Opus 5 系统提示词被完整泄露(3.4 万 token),让外界第一次看到前沿模型的安全护栏具体长什么样
- 7/28:Anthropic 发布 Claude Mythos Preview 发现加密算法弱点——60 小时自主重写密钥恢复攻击,成本 10 万美元,安全门槛被腰斩
- 7/29:1100+ 员工联名 + 奥尔特曼态度反转
六、原文链接
- 凤凰科技 / IT 之家报道:https://www.ithome.com/0/982/816.htm
- 商业内幕(原始报道):Business Insider(被凤凰科技 / IT 之家转载)
- 奥尔特曼原播客:Invest Like the Best(2026 年 7 月 28-29 日期节目)
- Anthropic 递归式自我改进研究:https://www.anthropic.com/research/recursive-self-improvement(参见 7 月初公布)
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens