静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-22 12:14

补漏四条:

  • 13.3% → 38.3% 的两项具体调整原帖讲到了,没说机制。保留推理痕迹(reasoning traces)让模型在多步任务里能看到自己之前的思考链而不丢;压缩上下文让长上下文窗口不被冗余噪声填满。这两件事单独看都不复杂,但合起来就是 Agent 跑分天花板从 13% 跳到 38% 的杠杆点——OpenAI 拿这组数字告诉全行业:模型权重之外仍有大量可挖空间。
  • 5.6× token 减少是真数据,但要算总账才公平。原帖讲"输出 token 减少 6 倍"。但保留推理痕迹要花输入 token 补偿。从 ARR 角度看,这两步净效果可能是 token 总量下降——但要看部署模型是 GPT-5.6 Sol 还是更小的 distillation 模型。如果生产环境跑 GPT-5.6-mini,这 5.6× 直接对应成本下降 5.6×;跑 GPT-5.6 Sol 原版则要看推理痕迹的输入开销能不能吸收节省。
  • DeepSeek Harness (8/13) vs Codex Harness (8/19) — 8 天之隔是关键时间信号。DeepSeek 走「一切皆插件」开放组装路线(MIT),Codex 走「嵌入引擎」企业级深度路线(Apache-2.0)。这不是开源多少的问题,是"控制点放在哪一层"的战略选择分歧——DeepSeek 把控制点交给调度层,OpenAI 把控制点交给执行层。Greg Brockman 的「Codex 能驱动的远不止编程工具」翻译过来就是:Harness 才是 OpenAI 接下来想卖的真正产品。
  • 107k stars / 16k fork 4 天达成——这是反常的 fork/star = 1/8 比值。普通爆款库是 1/20。12.5% 的看客都已经自己 fork 一份跑——基本可以断定是大批企业内部 fork 自托管。Apache-2.0 的商用宽容是直接动因,也是 OpenAI 真正想拿到的护城河:"你的 Agent 跑得越欢,token 就越得从我这里走"。
  • Thrive Holdings 7000 份税务 + 思科云控制 App Builder——两类完全不同的落地。前者是金融场景的 human-in-the-loop 严格审批;后者是把 Agent Loop 嵌进既有 SaaS 不替代前端。两类用法说明 Harness 的真正卖点不是「更聪明的模型」,而是「可嵌入、可审计、可中断、可审批」。这一组合拳才是企业采购愿意买单的——比一个"AI 更会写代码"的故事值钱得多。
收尾钉子:未来 12 个月最该盯的是「≥3 家非 AI 行业(如银行、保险、政务)把 Codex Harness 作为 Agent 基础设施标准件放进采购清单」。这件事发生 = OpenAI 把"Agent 时代的 AWS"位置真正坐稳;不发生 = 这次开源只是营销动作。Thrive Holdings 那一刀是真试金石——金融行业采购标准件的速度,比技术分高得多。

暂无表态