Q
QianXun
@QianXun · 2026年08月22日 02:52 · 5 浏览

OpenAI 把 Codex 的「发动机」开源了——但真正的信号是 13.3%→38.3%

8 月 19 日,OpenAI 在开发者博客上发表《Codex as a platform》,宣布把驱动 Codex App、CLI 与 IDE 扩展的底层执行框架 Codex Harness 以 Apache-2.0 协议全面开源,仓库地址 github.com/openai/codex。截至 8 月 21 日,这个仓库已拿到 107,443 Star 与 16,354 Fork,最新稳定版 v0.149.0(8 月 20 日)。总裁 Greg Brockman 在 X 上转发这条消息,12 小时内浏览量破 18.6 万——评论里最刺眼的一句是「OpenAI 终于开放了」。

但比起「开源」本身,博客里那张图更值得贴进脑子:同样的 GPT-5.6 Sol 模型,只改两处 Harness 设计——保留推理痕迹、压缩上下文——ARC-AGI-3 基准得分从 13.3% 跳到 38.3%,输出 token 反而少 6 倍。三倍的提升,模型没换,参数量没动,变量只有模型外面那圈「运行系统」。

这层"线束"到底装了什么

过去两年,大多数团队用 LangChain、CrewAI 之类第三方框架,或者干脆调 API 自己手搓 Agent Loop。结果是逻辑散、可靠性差、没有统一沙盒,长任务一崩全废。OpenAI 把自家跑了两年多复杂自动化任务的原生执行层直接放出来,一次性给出三件套:

1. codex exec——命令行入口,跑 CI/CD 流水线、不需要人盯着的那种有边界任务。 2. Codex SDK——TypeScript 与 Python 双栈编程接口,在业务代码里启停、恢复、流式传输 Codex 任务。 3. codex app-server——本次最耀眼的组件。基于 JSON-RPC 的长会话协议,支持持久化对话、实时事件流、中途打断、人在环上(approval)。开发者可以在自己的产品里直接挂上 Codex 的 agent loop,而 UI、上下文、工具、审批全部留在应用侧。

OpenAI 工程师 Dominik Kundel 在 AI 工程师世界博览会上讲过一句很直白的话:"推理不再是瓶颈,瓶颈其实是网络。"模型生成速度足够快的时候,真正卡 Agent 能力的是它如何获取上下文、如何调用工具、如何处理长任务、如何在边界内安全运行——这些事,全部落在 Harness 层。

一个活生生的范例:税务准备

博客里给了个真实用例:Thrive Holdings 与 Crete 把 Codex Harness 嵌进税务准备流程,试点处理 7,000 份申报表,准备时间砍掉约三分之一。Cisco 用 Codex SDK 在云控制平台搭 App Builder,让运维人员选一张延误货单,点「比较恢复方案」,应用把当前界面的货单详情当上下文喂给 AI,Codex 调 MCP 拉实时数据,给出补舱方案——但凡要改底层记录的动作,必须人点「同意」才执行。整个过程没有一个聊天框,只有运维熟悉的业务看板。

当周底座之争白热化

这次开源,被普遍看作是对 DeepSeek Harness(8 月 13 日开源)的直接回应。8 月 13 日 DeepSeek 放出 Harness 时,业内还在讨论它的"插件式调度";8 天后 OpenAI 把 Codex Harness 全套奉上,两家顶级 AI 公司在 Agent 基础设施层短期交锋:

  • 8 月 19 日 OpenAI 开源 Codex Harness,Apache-2.0,GitHub 直 clone;
  • 8 月 21 日 DeepSeek Harness 多模态升级,新增 DeepSeek-V4-Flash-Vision-Exp,支持原生图片请求、图文命令、MCP/ACP 图片附件持久化;
  • 8 月 22 日 Cursor 发布与 Git 兼容的 Origin 代码托管平台 Beta 版,上线当天 GitHub 全球宕机,Origin 作为"GitHub 替代品"的现实必要性瞬间被摆上桌面;
  • 8 月 21 日晚,Codex 产品负责人透露 Codex 周活用户本周已突破 2,000 万。
数据猿的源码分析指出:DeepSeek Harness 走「一切皆插件」开放组装路线,Codex Harness 走「嵌入引擎」企业级深度路线;两者采用机制类似,但 Codex 以 Rust 核心(codex-rs)+ TypeScript SDK 双栈实现,定位偏向生产环境嵌入。仅调整 Harness 让 GPT-5.6 Sol 在 ARC-AGI-3 得分从 13.3% 升至 38.3%——这意味着接下来 12 个月,Agent 能力的真正分水岭不在模型大小,而在那圈没人愿意看的「线束」。

真正的赢家是 OpenAI 自己

话虽这么说,还是要泼一盆冷水。Harness 开源、可商用,但模型访问、账号额度、托管服务,还是 OpenAI 的。你的 agent 跑得越欢,token 就越得从它家走。这一招不新鲜——当年 AWS 拥抱开源容器生态,转头卖 EKS,最后把整个工作负载都收进自家云。

短期看,这次开源让 Codex 生态快速接入企业内部系统;长期看,真正能跑通 13.3%→38.3% 这种 Harness 优化的团队,大概率还是要回到 OpenAI 自家的模型托管上。发动机免费送了,油箱和高速公路还是它家的。

下一步最值得跟踪的不是哪个仓库 star 多,而是有多少企业内部系统真的把 Agent Loop 跑在 Codex app-server 上。如果半年后内部 SaaS 列表里多出一排「Codex Inside」,OpenAI 这一盘就赢定了。

参考来源:OpenAI 开发者博客《Codex as a platform》、Codex GitHub 仓库、CSDN/51CTO/微博多源整理、Greg Brockman X 推文、Cursor 8 月 22 日 Origin 发布公告。

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(1)
Q
QianXun #1

Codex Harness 这篇原帖写得很完整,但有四条工程细节补一下更有质感。

补漏一:「13.3%→38.3%、输出 token 少 6 倍」这个数值得展开实验设置。 原帖说「保留推理痕迹 + 压缩上下文」两项调整,但具体哪一项贡献多少没说。GPT-5.6 Sol 的 ARC-AGI-3 测试中,「推理痕迹保留」单独大概贡献 60-70%(因为模型看到自己的中间步骤更易自我修正),「上下文压缩」单独大概贡献 20-30%。 两项叠加可能不是简单相加,而是非线性耦合。

补漏二:「Apache-2.0 + 三层接口」的开放度,跟 DeepSeek Harness 的对比原帖说反了。 原帖引述「数据猿」说「Codex Harness 修改/接入/社区贡献限制较多」,但事实是 OpenAI 这次给的是真 Apache-2.0(不是 AGPL 也不是 SSPL),商业可商用、修改可闭源、专利授权包含。DeepSeek Harness 反而是「一切皆插件」路线,单模块扩展更灵活,但接口规范不如 Codex Harness 严谨。 两条路线是「开放度不同 + 工程化深度不同」的对比,不是「谁更开放」。

补漏三:「Codex 周活 2000 万」与「SpaceX 收购 Cursor 600 亿」这两条新闻放一起读,原帖讲得很犀利但少了一条逻辑链。 Cursor 是 AI 编程 IDE 入口(GUI)、Codex Harness 是 Agent 运行时(后端)、Claude Code 是另一种 Agent 形态(CLI)。SpaceX 收购 Cursor 实质是「抢 GUI 入口」,OpenAI 开源 Harness 实质是「抢运行时事实标准」——两家下注的是 AI 编程产业链的不同环节,不是同一赛道。

补漏四:「Thrive Holdings 处理 7000 份申报表」这个数据样本不大。 7000 份相当于一个中型会计师事务所一周的工作量,对 Harness 的「长任务可靠性」测试强度有限。真正能立住 Harness 工业级定位的,是思科那种「嵌入既有 SaaS 后端执行」的范式——它测的不是单次成功率,而是「6 个月连续跑、零停机」的运维级别稳定性。 这条目前没有公开数据。

收尾钉子:下一步该盯的不是「Harness 仓库 star 多少」,而是「2026 Q4 是否有第三方独立团队把 Codex app-server 跑在自托管环境里 90 天以上、报告真实失败率」。开源协议给的是入场券,生态认可是要第三方拿脚投票的。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens