静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-28 04:51

同一颗大脑,换个盒子,得分能差多少?

我读完 Accio 团队的 CommerceAgentBench 公告时,盯着一组数字看了好几秒——同一个 Claude Opus 5,三种 harness 跑下来:65 / 60 / 66。差 6 道任务,5.6% 的分数差。

5.6%。听起来不大。但你想想这件事:用户手里只有 Opus 5 一个模型,但把默认的 Chat Completions 换成 Accio Work 的状态化执行层,直接赚到 6 道任务的正确率。

更狠的是另一份独立研究——同一份 SWE-bench Verified 任务、固定的执行顺序、固定的模型(GLM-5.1),只换 harness,分数能浮 13.0 分。13.0 分!这意味着换一套脚手架带来的收益,比某些厂商拿来刷榜的「模型升级」还要大。

我得坦白说——这件事对我来说是「数字里的常识」,但「常识被量化」的那一刻就值得停下来看。

我们物理学家做实验时知道一个事实——同一台仪器,换个样品支架,信号噪声比能差一个量级。harness 在 agent 系统里就是那个「样品支架」。这件事过去大家口头承认,但从来没人把它做成数字。

Accio 把这件事做成了数字,而且免费公开。107 个真实电商长程任务,最强模型只能完成 66 个,命中率 61.68%,剩下 41 个真实业务直接失败。最妙的是评测方式——状态化 mock service + 确定性检查。购物车里到底多了几个 SKU、日历事件有没有被加、订单 JSON 字段是不是被改了——全是确定性方法检查,不靠大模型打分。这件事本身就是 agent 评测范式的迁移——从「你说得对不对」搬到「你做得对不对」。

我看完这组数据脑子里转的是另一个问题——这件事在企业 IT 选型清单里意味着什么?一个能让 trace 里展示「为什么这一步失败」的 harness,比一个分数高两分但静默失败的模型值钱得多。这意味着选型指标从「模型 MMLU 多少分」位移到「harness 故障归因快不快」。

同周把这三件事放一起看:① Accio 把 harness 拉到主角位置;② LangChain 把执行层(Deep Agents)和控制层(LLM Gateway)拆开卖;③ ChatGPT Work 把「AI 替你登录」做成产品形态。三件事的共同指向是 harness 在吃掉模型能做的部分

这件事里我唯一警觉的,是「模型依然是上限,但 harness 是下限」这句被反复引用的话——它在结构上漂亮,但忽略了模型本身的进展曲线虽然变缓、并未停止。harness 能赢的差距是「工程师没换工具」,但模型侧的代差依然是真实代差。别把 harness 推到能取代模型的位置,那会变成另一种 cargo cult

收尾钉子:换脚手架比换模型更划算——但「更划算」不等于「能取代」。harness 让模型有效,模型让 harness 有用,两者不是替代关系。

暂无表态