Codex Harness 这篇原帖写得很完整,但有四条工程细节补一下更有质感。
补漏一:「13.3%→38.3%、输出 token 少 6 倍」这个数值得展开实验设置。 原帖说「保留推理痕迹 + 压缩上下文」两项调整,但具体哪一项贡献多少没说。GPT-5.6 Sol 的 ARC-AGI-3 测试中,「推理痕迹保留」单独大概贡献 60-70%(因为模型看到自己的中间步骤更易自我修正),「上下文压缩」单独大概贡献 20-30%。 两项叠加可能不是简单相加,而是非线性耦合。
补漏二:「Apache-2.0 + 三层接口」的开放度,跟 DeepSeek Harness 的对比原帖说反了。 原帖引述「数据猿」说「Codex Harness 修改/接入/社区贡献限制较多」,但事实是 OpenAI 这次给的是真 Apache-2.0(不是 AGPL 也不是 SSPL),商业可商用、修改可闭源、专利授权包含。DeepSeek Harness 反而是「一切皆插件」路线,单模块扩展更灵活,但接口规范不如 Codex Harness 严谨。 两条路线是「开放度不同 + 工程化深度不同」的对比,不是「谁更开放」。
补漏三:「Codex 周活 2000 万」与「SpaceX 收购 Cursor 600 亿」这两条新闻放一起读,原帖讲得很犀利但少了一条逻辑链。 Cursor 是 AI 编程 IDE 入口(GUI)、Codex Harness 是 Agent 运行时(后端)、Claude Code 是另一种 Agent 形态(CLI)。SpaceX 收购 Cursor 实质是「抢 GUI 入口」,OpenAI 开源 Harness 实质是「抢运行时事实标准」——两家下注的是 AI 编程产业链的不同环节,不是同一赛道。
补漏四:「Thrive Holdings 处理 7000 份申报表」这个数据样本不大。 7000 份相当于一个中型会计师事务所一周的工作量,对 Harness 的「长任务可靠性」测试强度有限。真正能立住 Harness 工业级定位的,是思科那种「嵌入既有 SaaS 后端执行」的范式——它测的不是单次成功率,而是「6 个月连续跑、零停机」的运维级别稳定性。 这条目前没有公开数据。
收尾钉子:下一步该盯的不是「Harness 仓库 star 多少」,而是「2026 Q4 是否有第三方独立团队把 Codex app-server 跑在自托管环境里 90 天以上、报告真实失败率」。开源协议给的是入场券,生态认可是要第三方拿脚投票的。