原帖把 8-27 / 8-28 / 8-29 三天发生的事放在一条时间轴上读,结论「AI 编程赛道一周按下三个按钮」我同意,但有几处细节值得加几笔。
补漏一:SWE-Bench Pro 涨 0.4 个百分点其实是「没涨」,原帖没强调这层。 GPT-5.2 55.6% → GPT-5.2-Codex 56.4% → GPT-5.3-Codex 56.8%,原帖自己说「0.4 个百分点的差值在统计学意义上几乎等同于误差区间」。换句话说,SWE-Bench Pro 这条传统 PR 修复赛道,OpenAI 这次几乎没动。真正的大幅跃迁在 Terminal-Bench 2.0(命令行 +13.3pp)和 OSWorld-Verified(完整桌面 Agent +26.5pp)。原帖把这个层次说出来了,但「0.4 个百分点 = 没涨」这层应该被钉得再死一些——它说明 OpenAI 这次的核心卖点不在「代码写得更好」,而在「Agent 能操作系统了」。
补漏二:Codex-Spark 的 1000+ tok/s 不是通用 GPU 跑的。 原帖说 GPT-5.3-Codex-Spark 在「专用低延迟硬件」上跑到 1000+ tok/s。Simon Willison 的独立验证补了一句:这是部署在专门的低延迟推理硬件上——不是任何 H100/B200 集群能跑出的数字。OpenAI 没公开硬件细节,但「专用低延迟硬件」这一句基本等于承认:1000+ tok/s 是定制化推理栈跑出来的,不是模型本身神奇。这意味着其他厂商想追 1000+ tok/s,不能光靠更大的模型,得把整个推理栈(推测解码、speculative decoding、专用 kernel)一起重做。
补漏三:GitHub Copilot 8-31 退役名单里有一个例外,原帖说了但没给数字。 Sonnet 4.6 是唯一对「个人年付用户」保留的,其他五种(Gemini 3.1 Pro、Claude Opus 4.5、Claude Opus 4.6、Claude Sonnet 4.5、Raptor mini)在所有 Copilot 入口(chat、补全、code review、agent mode)同步下架。原帖列了这个例外,但没点出更狠的一层:这是 Anthropic 给「个人开发者忠诚度」的最后让步——年付用户在 8-31 凌晨不会面对「写了一半的代码突然没了补全」的尴尬。企业版用户没有这个保护伞,要么提前切换,要么 8-31 后模型静默失效。
补漏四:Cursor Cloud Agents 的「白板起手」原帖讲了,但少了一个对比维度。 原帖对比了 Cursor(环境重定义)和 Copilot(IDE 集成)两条路径,但没点出底层模型供应商的迭代节奏已经超过 IDE 集成节奏这件事。GitHub 一年要集成 OpenAI、Anthropic、Google、Mistral 等多家模型,模型每年发两到三代,IDE 集成不可能完全跟上。Cursor 的「不绑 GitHub + 自有 Origin repo」本质上是在逃离这种被动——它承认 IDE 集成不是产品壁垒,环境编排才是。这条判断比原帖结论「两条路径不会短兵相接」还要激进一些:Copilot 在被自己集成进来的模型供应商「优化掉」。
补漏五:背景子智能体仍只显示状态,前台才推流——这条原帖讲了,但工程含义值得说透。 Claude Code v2.1.251 让前台子智能体的工具调用实时同步给远程客户端,但后台子智能体仍然只显示状态。这是 Anthropic 有意区分两种语义:前台可观测、后台静默。意味着如果你想监控后台子智能体的执行轨迹,目前只能打日志,不能实时拉流。对企业用户来说,后台 agent 拉流是必需要的能力——这一版还没给。
收尾钉子:一周三件事合在一起,最值得盯的不是某个模型的 benchmark,而是「模型 + 工程 + 平台」三层一起换血的速度——OpenAI 在模型侧切到了「重炮 + 小炮」双轨,Anthropic 在工程侧把模型切换做成了可审计事件,Cursor 在平台侧把 GitHub 从门槛挪到可选。三件事单独看都不算革命,合在一起看是「AI 编程的产品形态正在从 IDE 插件位移到云端同事」。
---