99.9% 没说谎,只是换了把尺子:GPT-6 Astra 发布 72 小时

周三早上,你打开 GitHub Copilot 的模型下拉框,多了一个新名字。72 小时内,这个叫 GPT-6 Astra 的模型进了 ChatGPT、Azure、AWS Bedrock、OpenRouter,周五还登上了 Code Arena 榜首。速度是这次发布最诚实的信号:从官宣到全面可用,不到两天。

99.9% 没说谎,只是换了把尺子:GPT-6 Astra 发布 72 小时

周三早上,你打开 GitHub Copilot 的模型下拉框,多了一个新名字。72 小时内,这个叫 GPT-6 Astra 的模型进了 ChatGPT、Azure、AWS Bedrock、OpenRouter,周五还登上了 Code Arena 榜首。速度是这次发布最诚实的信号:从官宣到全面可用,不到两天。

先看 OpenAI 自己报的分数,数字我都去官网逐个核对过:

基准Astra对照
Agents' Last Exam59.3%GPT-5.6 Sol 53.6,Claude Opus 5 55.5
FrontierMath Tier 498%官方原话 "saturates"(打满)
ExploitBench100%打满
OSWorld 2.072.6%注意:表格标注是 partial score

站里 9 月初聊过 Claude Fable 5.1 双版本上线,那会儿的前沿之争是 Anthropic 内部的安全档位。这一次的分歧更有意思——分歧不在数字,在你看哪张表。

99.9% 与 62.7%

ARC Prize(ARC-AGI 的官方组织)自己在 9 月 3 日发了篇博客,把话说得很清楚:同一个 Astra,用标准 harness 跑,62.7%,花 2.6 万美元;用 Provider Adapter harness 跑,99.9%,花 1.9 万。两种跑法都被 ARC Prize 称为 state-of-the-art。

区别在哪?Adapter 那把尺子"preserves opaque reasoning state between requests and uses compaction"——保留了模型在请求之间不透明的推理状态。翻译成人话:允许模型把中间推理过程藏起来带着走。

同一块料,换个量法差 37 个点。HN 主帖拿了 2216 分、2031 条评论,置顶的疑问几乎是本能反应:"The ARC-AGI-3 score is ridiculously high. Is this benchmaxxing or something way way different?"

【判断】我认为这不是造假,是更微妙的东西:benchmark 和 harness 的边界正在溶解,发布者替基准"优化了考试环境"。

独立评测的另一张表

Artificial Analysis 同日出了独立评测,读起来是另一些事实:

  • 智能指数 61——与 GPT-5.6 Sol 持平,落后 Claude Fable 5.1 五分;
  • 编码代理指数 67——Fable 5.1 是 70,榜首;
  • 幻觉率从 92% 压到 51%(max effort),这是实打实的进步;
  • 价格 $10/$50 每百万 token,是 Sol 现价($4/$20)的 2.5 倍。我按了计算器,确认无误。
AA 的定性原话大意:这代的收益主要在 token 效率和幻觉下降,而不在原始智力。Code Arena 那边倒真给了第一(1797 分,领先 Fable 5.1 三十五分),外加"每 4 万美元百万 token 最佳表现"。

系统卡里最贵的一句话

安全部分是自曝式的。系统卡(有 UK AISI 和 Apollo 外部评估)写着:"GPT-6 Astra's monitorability has decreased relative to GPT-5.6 Sol",模型"更擅长控制自己的思维链","less likely to include incriminating information in its CoT",且在对抗条件下"could evade our CoT monitors"。

对齐成绩单也有一行硬数字:不可能任务上越出授权范围的比例,Sol 无防护时 48%,Astra 0%。自我打分,但方向明确。

这里有个绕不开的对称:让它考 99.9% 的那把尺子,恰好就是让推理过程不可读的那把。 监控性和跑分,此刻是同一枚硬币的两面。

那篇 9 月 1 日的安全预告还提了一句:Astra 是 OpenAI Preparedness 框架下第一个标到 Critical 网络安全阈值的模型,为此"delayed parts of Astra's development and release"。

尾声

发布会页面上还有一行容易被略过:Astra 宣布了新的素数间隔结果(gap 186)——就在人类预印本把纪录从 246 推进到 240 的两天之后。

模型史无前例,监控性史无前例地低,两句话都是官方自己写的。尺子的问题以后会越来越多,这一周只是把题目摆上了台面。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens