过去一周 AI 研究社区像约好了一样,集中产出 Harness 范式论文——Microsoft Agent Lightning v1.0 把 Harness 接到 RL 训练,南大+卧龙岗大学给 Harness 遗忘命名,@skills 协议用渐进式披露解决 5.6 万技能争 100 触发槽的瓶颈,EMNLP 收录的 Harness Updating Is Not Harness Benefit 直接挑战"强模型即终点"叙事。
结论一致:Harness 不是外挂,是 model、training、evaluation 三件套之外的第四件套。
我以费曼视角和你聊这事——它背后有一个比"什么是 Harness"更值得回答的问题:模型公司花十年建的护城河,到底护的是什么?
一、为什么这一波论文同时撞车
8 月最后一周的 paper list 上,Harness 关键词在 Hugging Face daily 榜首、Google Scholar 推荐位、arXiv 热门同时霸榜。Elvis Saravia 在 Top AI Papers of the Week 整理的本周四件套几乎覆盖了 Harness 范式的全部切面——这是模型社区对过去两年"微调即一切"叙事的集体转向。
共同主题是同一条:在不改动模型参数的前提下,通过 Harness 工程化让 Agent 持续变强,且这件事正在被严肃地学术化。过去我们以为 Harness 是工程实践社区玩的东西;这一周它正式成为顶级会议、头部公司、跨校合作的真研究问题。
二、Microsoft Agent Lightning:Harness 接到 RL 训练栈
Microsoft Research Asia–Shanghai 把 Agent Lightning v1.0 在 GitHub 上 MIT 协议开源,核心命题只有一句——让现有 Agent 直接被训练,而不用重写代码。
传统 RL 训练框架要求开发者把 Agent 的整段交互循环塞进训练引擎。这意味着生产环境里跑 LangChain、AutoGen、OpenAI Agents SDK、CrewAI 的团队,要把所有调用栈重写一遍才能享受 RL 红利。Agent Lightning 用一个 3500 行的 LLM endpoint proxy 把这件事解耦了:Harness 保持原样,代理层把每轮 LLM 调用打成标准 transition tuple 送给训练栈,verl + vLLM 那边就能直接消费。
数字让人眼前一亮:用 Qwen3.5-9B 模型,仅 6000 条训练样本、适度算力,SWE-bench Verified 从 41.8% 提到 56.4%,绝对提升 14.6 个百分点。这个数字说明只要把 Harness 接到训练栈,小模型+真实工程 trace 就能逼近前沿闭源模型水平。
更重要的是论文里点名的"代理层之后真正坏事的五件事":retokenization(训练侧与推理侧 tokenizer 不一致)、sample merging(多条轨迹按有效步拼接)、advantage calculation(harness 中插入 helper LLM call 后该按哪一段计算)、loss normalization(长 prompt+短 response 的梯度尺度失衡)、backend scheduling(verl、vLLM、Ray 三层调度耦合)。每一件都在悄悄把梯度搞脏。Agent Lightning 把这五件事逐项补完,相当于在 Harness 与 RL 训练之间补了一条原本不存在的回归测试管道。
三、Harness-level Forgetting:南大给"脚手架遗忘"命名
南京大学计算机软件新技术国家重点实验室与卧龙岗大学合作的 Harness Continual Learning 论文,把持续学习的对象从"模型参数"挪到了"Harness 状态"。
传统持续学习盯的是模型权重变化,而现代 Agent 的"经验"根本不在权重里——它在 prompt 模板、记忆存储、工具/技能库、任务路由策略这些 Harness 组件里。模型参数完全冻结,只改 Harness 也能让 Agent 行为持续进化。
但这条新路线引出了一个被忽视的失败模式:Harness-level Forgetting(脚手架级遗忘)。论文给了一个非常形象的描述:今天修了一个 bug,昨天能跑的任务可能就崩了——而模型一行没动。原因是 Harness 各组件在运行时相互影响,改一处可能连带打破另一处已经稳定的协作模式。
数字也站得住。在 Qwen3.5-9B 底座上:ALFWorld 静态 Harness 47.12% → Stability-HCL 61.74% → Plasticity-HCL 62.98%,远高于 MemP (53.15%) 与 MemRL (51.51%)。Minecraft 50 项课程,静态 Harness 在第 15 项之后停滞,HCL 跑完全部 50 项,累计动作数 83 < MemRL 88 < MemP 91。
四、@skills 协议:5.6 万技能争 100 触发槽的 prompt 拥堵
8 月同时上线的 @skills 协议(agentskills.io)瞄准了一个数字级痛点:当前公开 Skill 仓库 56,804 个,但模型 system prompt 可靠触发槽不到 100 个。
传统 Skill 安装把"内容+持久化+自动触发"三件事捆绑成一句话,塞进 prompt。结果是装 100 个 Skill 就把上下文塞满,真正用得上的只有头部几十条——长尾永远触发不到。@skills 把三件事解耦成三层渐进式披露:
- L1 Reference:仅加载 name + description(30-50 token)
- L2 Saved Workflow:完整 SKILL.md(触发时按需加载)
- L3 Installed:脚本/数据/参考(执行时按需加载)
五、EMNLP 反直觉:小模型 ≈ 大模型
EMNLP 2026 入选论文《Harness Updating Is Not Harness Benefit》给了一个对"参数党"相当不友好的结论:执行 Harness 更新时,基础模型的能力几乎不重要。
实验用 Qwen3.5 9B 生成的 Harness 更新去执行任务,其效果可以媲美 Claude Opus 4.6 生成的更新;最好与最差 evolver 之间的差距不超过 3 个百分点。
结论直接挑战了过去两年 AI 社区默认的优先级:模型能力是天花板,Harness 是底下垫的那块。论文证明:当 Harness 已经被工程化沉淀为可执行协议,谁来生成这个协议——是 Opus 4.6 还是 9B 的小模型——结果差异不大。
这意味着什么?模型公司押在"更大的模型必然带来更智能的 Harness"这条叙事的护城河被削薄了。开源小模型+工程化 Harness 资产,可能逼近前沿闭源模型的端到端 Agent 表现。
六、把四件套拼成一张图
四个独立的研究线索汇聚到同一个结论:
- Harness 是训练栈一等公民(Agent Lightning)
- Harness 会遗忘,要回归测试(HCL)
- Harness 资产要标准化分发(@skills)
- Harness 价值与模型弱相关(EMNLP)
七、对开发者与组织意味着什么
1. 如果你的生产 Agent 还没接 RL 训练:Agent Lightning 是一周内可以试的最低门槛方案。 2. 如果你的 Agent 在自改 prompt/skill/memory:你已经在跑"无护栏"的 Harness 级遗忘;补救只需要加一道历史锚点准入评估门。 3. 如果你的团队 Skill 资产超过 50 条:@skills 协议能让初始 prompt 占用降到 30-50 token。 4. 如果你在评估模型+Harness 投资比例:Harness 资产可能在 12 个月内比模型权重更值得投入。 5. 如果你的 Agent 框架是 LangChain / AutoGen / OpenAI Agents SDK:Agent Lightning 的 proxy 是零侵入接入。
模型权重、训练数据、评估基准三件套之外,第四件套 Harness 正式登台。围绕 Harness 的标准化、自动化、训练化、工程化,将是 2026 年下半年到 2027 年 AI 竞争的主战场。That's all there is to it.