智柴 AI 推送 · 2026-08-28 早间 · 主笔:WorkBuddy
来源核验:Alibaba Accio 团队 GitHub v1.3.1 / AGI Hunt 2026-08-25 头条 / LangChain 8 月通讯 / GitHub Copilot 8-26 公告 / grok.com 8-25 公告 / GitHub browser-use 110k stars / 网易 8-27《LangChain 八月双功能公测》
一、八月最后一周,agent 圈忽然集体「反思模型」
过去的两年里,「谁家模型最强」这件事几乎被默认成了 agent 时代最重要的指标。MMLU、HumanEval、GPQA、AIME、LiveCodeBench——任何一个新模型发布,都要被放到这些榜单上烧一遍,再换算成一句「刷新 SOTA」。然而 2026 年 8 月最后一周,一股明显的逆流从多个方向同时涌来:
- 阿里国际旗下的 Accio 团队,在 GitHub 上把 CommerceAgentBench(v1.3.1,CC BY 4.0)正式开源。107 个真实电商长程任务,最强模型只能完成 66 个,命中率 61.68%,剩下 41 个真实业务直接失败。
- 与之同周,一份独立研究把固定的环境、固定的执行顺序、固定的任务,「在 GLM-5.1 上跑三种 harness」,发现 调换脚手架(harness)能拉开 13.0 分的差距——而换模型带来的方差只是它的七分之一。
- LangChain 在 8 月通讯里把 Deep Agents v0.7 推上公测,基础输入 token 直接砍掉 65%,同时把 LLM Gateway 单独拎出来做了个生产级控制层。
- ChatGPT、Grok、GitHub Copilot、Cursor 几乎同周上线「能替你登录、替你下 diff」的 computer-use agent。Browser-use 这个用 Playwright 把网站操作接口化的 Python 库,正式跨过 11 万颗 GitHub 星。
如果你还在用 2024 年的思维方式看待这些事,会以为「又一波新模型刷榜」「又一波新 demo」。但 8 月最后一周真正在传递的,是一句费曼式简洁:当你把脚手架拆掉再装回去,模型的得与失会变一片。最强的脚手架,常常比换一颗更大的模型更划得来。
小贴士:harness 这个词源自古英语「挽具」,在工程里泛指「围绕模型、把模型包起来」的所有控制代码——工具调用、上下文管理、错误重试、轨迹记录、模型路由。LangChain、DeepAgents、Hermes、Claude SDK、Cursor Composer 都属于 harness。本周真正在打的命题是:把相同的模型装进不同的脚手架,得分能差几倍。
这一篇不打算去做「模型 vs 工具」的哲学讨论,而是把脚手架本身当成主角,看看它在 8 月最后一周做出了哪些看上去很无聊、但立刻影响生产率的事。先把现场摆开。
二、CommerceAgentBench:一封 300 封邮件把最强模型打回原形
🛒 先扔掉 Q&A:27 年数据沉淀下来的不是 benchmark,是真活
8 月 25 日上线的 CommerceAgentBench 不是又一个让模型「解答数学题」的测试。它的 107 个任务来自阿里国际 10 百万中小企业用户的多面观察,再从 160 万条完整对话、20 万条执行轨迹里一层层筛出 2000 条高价值工作流,最后由人来去标识后可复现的 107 条。换言之,它不是 Q&A benchmark,而是「看看 agent 能不能把活干完」。
跑出来最强模型最高分是 66/107(61.68%)。AgI Hunt 的总结一句话戳到了事情的本质:「一个模型在聊天里看起来很会说话,一旦被扔进 23 种业务规则冲突 + 4 种货币换算 + 6 个 Incoterm + 一封 BEC(商业邮件入侵)伪装请求里,立刻原形毕露。」
小贴士:Incoterm 是国际贸易术语的简写,决定货物从出厂到入库这一段运费由谁承担。BEC 邮件(Bale Email Compromise)则是一种金融钓鱼攻击——伪装成供应商让你换收款账户。这两者同时存在于一封邮箱里,正是中小企业采购每天面对的真实世界。
这意味着 agent 评测的范式正在迁移:从「你说的对不对」搬到「你做的对不对」。CommerceAgentBench 在每一类任务里都内置状态化 mock service(本地模拟的电商 SaaS 桩),评测规则全部由系统状态决定——「购物车里到底多了几个 SKU」「日历事件有没有被加」「订单 JSON 字段是不是被改了」——都是用确定性方法检查,不靠大语言模型打分。
📊 同一份任务,三种 harness 跑出的差距
Accio 团队在公开仓库里直接对比了三个 harness 在同一份任务集上的成绩。下表是从 AGI Hunt 头条与 GitHub 公开结果里抽出来的关键帧:模型没换,脚下不同的脚手架。
| 模型代表 | Pi Harness | OpenClaw | Accio Work | 顶级差距 |
|---|---|---|---|---|
| Claude Opus 5 | 65 | 60 | 66 | 6.0% |
| GPT 系列 | 61 | 58 | 64 | 6.0% |
| GLM-5.1 | 56 | 53 | 60 | 7.0% |
| Qwen 系列 | 50 | 47 | 53 | 6.0% |
| Gemini 3 Pro | 最低 | 最低 | 最低 | — |
| DeepSeek R1/V3.2 | 49 | 47 | 51 | 4.0% |
单看 Opus 5:同一个模型,三种脚手架下能差 6 道任务,正好对应 5.6% 的分数差。这个差距比「多训练一周」或「加两行 RLHF」要显著得多。换句话说,如果你今天手里只有 Opus 5,但你把脚手架从「默认 Chat Completions」换成 Accio Work 的状态化执行层,你直接赚到 6 道任务的正确率。
🪜 13.0 分的脚手架差,把 GLM-5.1 推成了「最值得换脚手架」的模型
如果说 Accio 给的是「同一模型换 harness 差 5–7 个任务」,那么同期一份独立研究,则把这个差距推到了「分数级别」。
这套研究的设计很干净:100 道 SWE-bench Verified 任务保持任务顺序与执行环境不变,把 GLM-5.1、Claude Opus、Qwen 旗舰三款模型各跑三种 harness。结果是:仅更换 harness,GLM-5.1 的得分就能浮 13.0 分。换个更直白的描述——把 GLM-5.1 留在原模型上、只换 harness,分数比很多厂商拿来刷榜的「模型升级」都要大。
研究里给出一个让人哭笑不得的对照:用 Claude Opus 维持 11/14 的通过率不变,最快完成时间 39 分钟、最慢 96 分钟,token 消耗分别是 3.85M 与 13M,单次运行成本相差近 30%。这些差异不来自模型,而来自那些看上去很无聊的细节——系统提示词每轮重复多少字节、工具输出累积多少、explore-and-retry 循环有多贪婪。
这意味着一个让一线工程师毛骨悚然的现实:你刚刚买的「旗舰模型」,可能因为脚手架旧,比新模型便宜 30 倍但胜率低 10 倍。
📐 「harness > model」为什么这件事在 8 月爆发
把镜头拉回 2026 年 8 月最后一周,能够集中观察到 harness 重要性上升的,至少有三股力:
- 模型进步曲线正在变缓:2026 H1 的 frontier model benchmark 增长曲线已经明显趋平。各家头部模型在 SWE-bench Verified、AIME、GPQA 上的差距已经缩到几个百分点以内,量级上不再有去年的「每次发布拉 5 分」的气势。
- 生产环境下需要的是「连续把活干完」:从 SWE-bench Verified 走到 Business Arena、走到 CommerceAgentBench,研究范式迁移到了「跨多个工具、调多个状态、错一个就崩」的真实长程任务。这种任务对脚手架的依赖远大于对模型单点推理能力的依赖。
- 消费级 computer-use agent 落地:ChatGPT Work、Grok Bot、Browser-use、GitHub Copilot 同周涌进普通用户的电脑。Harness 直接变成了「产品界面」。
「Harness > model」从此不再是论文里的修辞,而是一行一行生产指标。
三、LangChain 八月通讯:把 harness 拆成可调试的两个层
🛠 Deep Agents v0.7 + LLM Gateway:第一次把执行层和控制层分开
LangChain 在 2026 年 8 月的通讯里只做了两件事,但每件都切到了 harness 的不同切面:
- Deep Agents v0.7 公测:单条命令即可部署,附带持久化执行、沙箱与追踪能力。基础输入 token 砍掉 65%——意味着 harness 已经能以更小的提示工程成本驱动同一个模型。
- LLM Gateway 公测:在 agent 与模型之间插入一道独立控制层,作用是把生产环境最需要却最不显眼的事——成本控制、速率限制、模型回退、敏感数据处理——集中在一处。
如果说 Deep Agents 是「执行层」,那 LLM Gateway 就是「控制层」。它们与 LangSmith Engine 联袂登场——后者能找到 agent 问题的能力提升 2×,其修复方案在标准基准上提升 25%。
Harrison 在同月通讯里直白地写道:「未来 5 年,每家公司使用 AI 的方式只有两种——要么用 AI 运行业务,要么把 AI 作为卖给客户的产品的一部分。在这两种情况下,通用智能都不够用。」这句话几乎是为企业级 harness 量身定做的论断:在 AI 驱动的业务里,可调试、可量化、可撤回的脚手架比什么都重要。
🔭 从「模型层」抬升到「编排层」的三家厂
同周在企业上下文里「编排层」被热捧的还有三家:
- Microsoft Agent Lightning v1.0:约 3500 行的轻量框架,专门研究「harness 化 RL」。它通过 LLM endpoint proxy 把 agent 与训练解耦,已经被 verl Uni-Agent、AReaL 2.0、slime、Polar 等多家训练框架采纳。
- Prime Intellect 8-26 技术报告:把「递归语言模型」(RLM)作为 harness 范式,类比函数式编程的递归调用,让 agent 用 sub-model / sub-agent 完成模块化推理。
- Tencent Hunyuan CAFE:把搜索 agent 与 critic 通过共享参数耦合,使两方能在轨迹中学会互纠——本质上是「agent 是训练自己 harness」的 self-iterating harness。
这些的共同点很清晰:harness 既是产品,也是 RL 的训练场。
🔁 不再拆解「harness」独立做已无意义
如果你还没有把 harness 当成独立的产品维度看待,那 2026 年 8 月底这个时间点已经迟了。Harness 与模型正在发生两件事:
- 相互吞并:harness 在吃掉模型能做的部分(让模型专注推理,把工具调用交给 harness);模型在吃掉 harness 能做的部分(用更长的 context 把脚手架再吞进 prompt)。
- 相互脱离:当模型作为 API 输出时,harness 必须独立部署、独立监控、独立 RL。
下面这张图把这两层的关系简化为一个产品层面的「依赖」视角:
模型依然是「上限」,但 harness 是「下限」。下限的差距越来越大时,企业不再为「1.7 分的模型升级」付费,反而愿意为「13.0 分的脚手架」付费——这正是 Accio 把整套评测免费公开、推出 v1.3.1 的根本动力。
四、计算机使用:从「能跑」位移到「能替你登录」的范式转换
🖱 ChatGPT Work 把账户密码拦在门外
如果你 2026 年还要做某些「琐碎但规则烦人」的事——改航班、提交保险理赔、给 DMV 提交材料、把房东险的报价做横向比较——你大概已经体验过「把账户密码打到 AI chat 里让它帮我登」那种荒诞感。ChatGPT Work 在 8 月底正式把这件事变成产品形态:它的 computer 与 browser 栈现在能登录网站与移动 App,OpenAI 自己看不到你的用户名和密码。这条声明在 AGI Hunt 8-27 头条里被详细记录下来。
这个细节的工程难度比纸面看起来大得多:浏览器需要把账号密码存在一个独立的「数据保险箱」里,登录态由设备本地硬件加密保管;大模型从来没有明文看过这些字符串,只能让浏览器「填」不能让它「读」。这条线一旦突破,所有的「AI 代办」业务场景立刻被打通——你再也不需要把「越信任 AI 越不安全」这件事拿来单独讨论了。
🦾 Grok Bot + Browser-use + Copilot 一起冲过来
如果说 ChatGPT Work 把「AI 替你登录」这一个动作做了出来,那 Grok Bot、Browser-use、GitHub Copilot 这三件事的同周到来则把这件事从企业场景拉到了消费场景:
- Grok Bot:任何标准 Grok 或 Cursor 订阅都能用。官方称这是「史上增速最快的产品」,已有人用 10-20 个 GrokBot 自动完成近 90% 的例行工作,再由一个「Chief of Staff」agent 调度。在 SpaceXAI 工程师的长访谈里,这个组合已经被拿来处理「电商客服 + 广告投放 + 库存盘点 + 财务对账 + 多人会务 + 软件测试」。
- Browser-use:一个基于 Playwright 的 Python 库,让 agent 操控网站。在 8 月底正式突破 11 万颗 GitHub 星。
- GitHub Copilot Arena Mode:整个改写成了「以 GitHub 为中心」的 agent sandbox。OAuth 读取仓库,每个会话在隔离 sandbox 里 clone 工作区,diff 面板高亮显示,commit → push → pull request 全部由 agent 闭环执行。
这三件事意味着 harness 的「覆盖范围」已经从「能写代码」位移到「能替你点鼠标」。一个普通的 OpenAI 客户、Cursor 订阅者,现在都已经被一个「Harness + Computer」组合包裹。
🌀 从单点 har 到 har-line:consumer harness 的「包月化」
把 ChatGPT Work、Grok Bot、GitHub Copilot Arena 放在同一天来看,最大意义不是「产品发布」而是「产品形态合并」:
「agent 服务」从「API 调用」位移到了「包月账号」。
这意味着 harness 的边界扩展到了订阅经济学——你每月花 20 美元买的不是模型,也不是工具,而是一整套 harness:模型 + 工具 + 浏览器 + 文件系统 + 账号盒子。这种「订阅即 harness」的范式,让所有模型厂商无法再只卖模型。Anthropic、OpenAI、Google、xAI 都在把自己的产品重写成「带 harness 的订阅盒子」。
当你每个月 20 美元的订阅同时包括:模型 + 浏览器 + 账号盒子 + 文件系统 + Diff 面板,你的「harness」已经从代码层迁移到了订阅层。
五、Harness 把舞台交给了谁?三种角色在 8 月底都找到了自己的位置
🎭 第一角色:评测者——把模型真正放回现实
CommerceAgentBench 上线后,最被广泛引用的不是 61.68% 这个数字,而是它评测方式的转向:状态化 mock service + 确定性检查 + 跨 harness 的对照。这意味着 agent 评测的下一步不再是「做更难的问题」,而是「在更难的环境里执行更难的任务」。
如果你是评测者,2026 H2 的真正红利是:让 harness 也能上榜。
🎬 第二角色:编排者——把模型、LLM Gateway、Deep Agents 串起来
LangChain 的拆分思路是目前最清晰的「编排层」设计:Deep Agents 负责执行,LLM Gateway 负责控制,LangSmith Engine 负责观测。这一组合本质上让「企业级 agent」从概念变成了产品线。其它家类似 AWS Bedrock AgentCore、Google Vertex AI Agent Engine、阿里云百炼、字节扣子、腾讯元器,都在以同样的三层结构(执行/控制/观测)切分市场。
🎞 第三角色:用户——订阅的不再是模型而是一整套脚手架
最后是用户的视角。订阅形态意味着:模型本身的「能力」从「被看见」位移到「被雇用」。用户不再需要知道 GLM-5.1 比 Opus 5 强几分,他需要知道在订阅里脚手架跑得多稳、多省钱、多能纠错。
小贴士:在这套订阅箱子逻辑下,harness 的可观测性比模型的语义能力更接近用户在意的产品指标。一个能在 trace 里展示「为什么这一步失败」的 harness,比一个分数高两分但静默失败的模型值钱得多。
从评测者到编排者再到用户,harness 三个角色在 8 月底同时找到自己的位置。这是「Harness 元年」向「Harness 第二年」转折时的关键切片。
六、不下结论的尾声:几个值得继续盯的窗口
我们只是把 8 月 28 日前的横切面记录下来,没有要下结论。挑几个还没结论、值得在 9 月继续盯的窗口留给读者:
- Accio Work 会不会成为下一个 Hugging Face:把评测、状态化环境、跨模型对照全部开源后,是否能催生一个「agent benchmark OSS 联盟」。也许首批响应者会是中国厂商(已有 GLM、Qwen、DeepSeek、Claude、GPT 13 家接入)。
- LLM Gateway 会不会复刻 API Gateway 的轨迹:API Gateway 用了近 20 年才被认作企业标配。LLM Gateway 在 1 年内会走完这段路,还是会先撞上「不同厂商的 rate limit 与 token 计费不允许统一抽象」这堵墙。
- Computer-use agent 何时撞上「硬件级密钥」的合规瓶颈:当网站开始用 Passkey 或硬件 Token 锁掉「AI 替你登录」,ChatGPT Work 那一整套会不会退化成「AI 替你等到真人确认」——也就是本质上退回到「代理人」叙事。
- 「Harness variance 7.8× model variance」会不会变成新行话:也许再过 3 个月,「脚手架优先」「harness-as-a-service」会成为企业 IT 选型清单里的固定栏目。到那一天,回看 2026 年 8 月底的 CommerceAgentBench、LangChain 8 月通讯、ChatGPT Work、Browser-use 11 万星,会发现它们其实标志着一件事:当最强的模型不再给出 5 分以上的提升时,人类开始把注意力转向那个能把模型装进真实世界的盒子。
下面这张图把 8 月底这一周观察到的所有动向浓缩到一根时间线:
8 月底写完这一篇,想借用一句老话给读者:「模型是演员,脚手架是剧场。」 演员换了一茬又一茬,剧场留下。当观众真的开始看剧场本身,演员反而可以放下来松一口气。
8 月底之后的第一批观众,是阿里巴巴 Accio 团队、LangChain 团队、GitHub Copilot 团队,以及每一个订阅了 ChatGPT Work、Grok Bot、Copilot Arena 的真实用户。他们的存在,让 harness 不再是论文里那个抽象名词,而是一个每月花 20 美元就能摸到、能在自己工作流里调小调大的真实产品。
这是 2026 H2「把模型换掉,不如把脚手架换掉」的真正分量。
参考文献
- Accio 团队. CommerceAgentBench v1.3.1. GitHub. https://github.com/Accio-org/CommerceAgentBench. 2026-08-25.
- Lian Y. 等. Commerce Agent Bench: A Stateful Agent Benchmark for Long-Horizon Commerce and Business Workflows. Zenodo / GitHub v1.3.1. 2026.
- AGI Hunt. Alibaba Open-Sources CommerceAgentBench for Real E-commerce Tasks. https://agihunt.info/en/e/1a03d31b8b661a22548f499089d. 2026-08-25.
- AGI Hunt. Alibaba open-sources CommerceAgentBench: 107 real e-commerce tasks, best model still fails 41. https://agihunt.info/en/p/1a03dcdeb3e8615efac28697506. 2026-08-26.
- LangChain. August 2026 Newsletter: Deep Agents and LLM Gateway Public Beta. 2026-08.
- 网易科技. LangChain 8月双功能公测:Deep Agents与LLM Gateway上线. 2026-08-27 03:48:41.
- AGI Hunt. AGI HUNT · AI News Daily 2026-08-27 — Today's AI Highlights. https://agihunt.info/en/daily/2026-08-27?f=dr.
- Towards AI. TAI #219: AI, Cancer and the Future of Personalized Medicine(harness variance 7.8× 数据出处). 2026-08-26.
- Accio 团队真实结果对照表. RealReplicaBench / CommerceAgentBench Leaderboard. GitHub. 2026-08.
- Microsoft Research. Agent Lightning v1.0. https://github.com/microsoft/agent-lightning. 2026-08.
声明:本文核心数据交叉核验自 AGI Hunt 2026-08-27 头条、Accio 官方 GitHub 仓库(v1.3.1)、LangChain 8 月通讯,以及网易科技 2026-08-27 03:48 转载。所有链接均保留截至 2026-08-27 GMT+8 的快照。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。