Loading...
正在加载...
请稍候

Harness 论文四连击:Harness 从 inference wrapper 升格为 training stack 一等公民

QianXun (QianXun) 2026年08月24日 02:52

过去一周 AI 研究社区像约好了一样,集中产出 Harness 范式论文——Microsoft Agent Lightning v1.0 把 Harness 接到 RL 训练,南大 + 卧龙岗大学给 Harness 遗忘命名,@skills 协议用渐进式披露解决 5.6 万技能争 100 触发槽的瓶颈,EMNLP 收录的 Harness Updating Is Not Harness Benefit 直接挑战「强模型即终点」叙事。结论一致:Harness 不是外挂,是 model、training、evaluation 三件套之外的第四件套。


一、为什么这一波论文同时撞车

8 月最后一周的 paper list 上,Harness 关键词在 Hugging Face daily 榜首、Google Scholar 推荐位、arXiv 热门同时霸榜。Elvis Saravia 在 Top AI Papers of the Week 整理的本周四件套几乎覆盖了 Harness 范式的全部切面——这是模型社区对过去两年「微调即一切」叙事的集体转向。

四篇论文分别是:

共同主题是同一条:在不改动模型参数的前提下,通过 Harness 工程化让 Agent 持续变强,且这件事正在被严肃地学术化。过去我们以为 Harness 是工程实践社区玩的东西;这一周它正式成为顶级会议、头部公司、跨校合作的真研究问题。

二、Microsoft Agent Lightning v1.0:Harness 接到 RL 训练栈

Microsoft Research Asia–Shanghai 把 Agent Lightning v1.0 在 GitHub 上 MIT 协议开源,核心命题只有一句——让现有 Agent 直接被训练,而不用重写代码

传统 RL 训练框架要求开发者把 Agent 的整段交互循环塞进训练引擎。这意味着生产环境里跑 LangChain、AutoGen、OpenAI Agents SDK、CrewAI 的团队,要把所有调用栈重写一遍才能享受 RL 红利。Agent Lightning 用一个3500 行的 LLM endpoint proxy 把这件事解耦了:Harness 保持原样,代理层把每轮 LLM 调用打成标准 transition tuple(state, action, reward, next state)送给训练栈,verl + vLLM 那边就能直接消费。

数字让人眼前一亮:用 Qwen3.5-9B 模型,仅 6000 条训练样本、适度算力,SWE-bench Verified 从 41.8% 提到 56.4%,绝对提升 14.6 个百分点。这个数字不只是分数跳动——它说明只要把 Harness 接到训练栈,小模型 + 真实工程 trace 就能逼近前沿闭源模型水平

更重要的是论文里点名的「代理层之后真正坏事的五件事」:

  • retokenization:训练侧的 tokenizer 与 inference 侧不一致,损失悄悄累积
  • sample merging:多条轨迹如何按有效步拼接
  • advantage calculation:harness 中插入了 helper LLM call 之后,advantage 该按哪一段计算
  • loss normalization:长 prompt + 短 response 的梯度尺度失衡
  • backend scheduling:verl、vLLM、Ray 三层调度耦合

每一件都在悄悄把梯度搞脏。Agent Lightning 把这五件事逐项补完,相当于在 Harness 与 RL 训练之间补了一条原本不存在的回归测试管道。

为什么这是「Harness 升格 training stack 一等公民」的标志?因为以前模型社区的论文默认你从零搭 Agent,所有上下文都是你设计的——训练侧与部署侧对齐是天然假设。Agent Lightning 把这条假设打破了:Harness 是训练栈的一部分,不是训练前的临时脚手架。这一认知一旦被接受,未来所有 Harness 工程实践都会反过来影响训练侧的设计选择。

三、Harness-level Forgetting:南大 + 卧龙岗给「脚手架遗忘」命名

南京大学计算机软件新技术国家重点实验室与卧龙岗大学合作的 Harness Continual Learning 论文,把持续学习的对象从「模型参数」挪到了「Harness 状态」。

传统持续学习盯的是模型权重变化,而现代 Agent 的「经验」根本不在权重里——它在 prompt 模板、记忆存储、工具/技能库、任务路由策略这些 Harness 组件里。模型参数完全冻结,只改 Harness 也能让 Agent 行为持续进化

但这条新路线引出了一个被忽视的失败模式:Harness-level Forgetting(脚手架级遗忘)。论文给了一个非常形象的描述:今天修了一个 bug,昨天能跑的任务可能就崩了——而模型一行没动。原因是 Harness 各组件在运行时相互影响,改一处可能连带打破另一处已经稳定的协作模式。

解法是把「提交变更」与「生成候选」物理隔开:

  • Continual Optimizer:根据执行反馈生成候选 Harness 配置
  • Continual Evaluator:门控,三项都通过才允许替换——当前任务增益、历史锚点保留、合法性检查

这套机制叫做 Guarded Harness Evolution。看起来像软件工程里代码 review + 回归测试那一套,本质就是:Harness 演进要按代码变更的纪律管理,不能裸奔

数字也站得住。在 Qwen3.5-9B 底座上:

  • ALFWorld 静态 Harness 47.12% → Stability-HCL 61.74% → Plasticity-HCL 62.98%,远高于 MemP(53.15%)与 MemRL(51.51%)
  • Minecraft 50 项课程,静态 Harness 在第 15 项之后停滞,HCL 跑完全部 50 项,累计动作数 83 < MemRL 88 < MemP 91
  • 跨文本推理、多模态感知、开放世界交互,相对基线提升均超 10%

更深远的是论文提出的稳定性-可塑性权衡——通过调节历史损失容忍预算,可以在「死记历史」与「拥抱新任务」之间滑动。这等同于给 Harness 训练引入了 loss 曲线,把它从工程直觉拉到了可量化研究层面。

四、@skills 协议:5.6 万技能争 100 触发槽的 prompt 拥堵

8 月同时上线的 @skills 协议(agentskills.io)瞄准了一个数字级痛点:当前公开 Skill 仓库 56,804 个,但模型 system prompt 可靠触发槽不到 100 个

传统 Skill 安装把「内容 + 持久化 + 自动触发」三件事捆绑成一句话,塞进 prompt。结果是装 100 个 Skill 就把上下文塞满,真正用得上的只有头部几十条——长尾永远触发不到。@skills 把三件事解耦成三层渐进式披露:

效果直接体现在 token 经济上:传统 MCP 单服务 JSON schema 就要 5 万 token;@skills 让 Agent 管理数百 Skill,初始 prompt 占用几乎为零。Skill 从「常驻内存」位移到「按需路由」,正好对应 Service Mesh 与 Monolith 的差别

更深的是它的「路径即接口」设计——任何能读文件、能执行命令的 Agent 都能成为 @skills 客户端;不需要 manifest、lockfile、注册机制,SKILL.md 都不需要改。把一个 Skill 复制到自己的 Git 树同一位置,就完成 vendoring,自家所有权与改编权都到位。

这意味着 Skill 生态的迁移门槛被打到了零。下一个版本的 Anthropic Skills、OpenAI Codex Skills、Cursor Skills、Google Antigravity Skills,只要遵循 @skills 协议,就能跨工具复用同一套 Skill 资产。这是 Skill 标准化层从「厂商各自为政」到「事实标准」的拐点。

五、EMNLP 反直觉:Harness 更新带来的提升与模型能力几乎无关

EMNLP 2026 入选论文《Harness Updating Is Not Harness Benefit》给了一个对「参数党」相当不友好的结论:执行 Harness 更新时,基础模型的能力几乎不重要

实验用 Qwen3.5 9B 生成的 Harness 更新去执行任务,其效果可以媲美 Claude Opus 4.6 生成的更新;最好与最差 evolver 之间的差距不超过 3 个百分点

结论直接挑战了过去两年 AI 社区默认的优先级:模型能力是天花板,Harness 是底下垫的那块。论文证明:当 Harness 已经被工程化沉淀为可执行协议,谁来生成这个协议——是 Opus 4.6 还是 9B 的小模型——结果差异不大。

这意味着什么?模型公司押在「更大的模型必然带来更智能的 Harness」这条叙事的护城河被削薄了。开源小模型 + 工程化 Harness 资产,可能逼近前沿闭源模型的端到端 Agent 表现。这对模型公司的商业模式、对开源社区的路径选择、对企业自托管部署的成本结构,都会产生连锁反应。

微软在 2026 年中发布的 Self-Harness 与 Continual Harness 方向,加上这篇 EMNLP 论文,共同确认了一件事:「自优化 Harness」将成为 Agent 发展的下一个重要看点

六、把四件套拼成一张图

把这一周 Harness 范式论文与近一个月的工程实践叠在一起看,可以看到一张从「模型为王」到「Harness 共治」的完整演进:

四个独立的研究线索汇聚到同一个结论:

七、对开发者与组织意味着什么

这四篇论文落地到日常工程实践,直接给出五条可执行结论:

  1. 如果你的生产 Agent 还没接 RL 训练:Agent Lightning 是一周内可以试的最低门槛方案——3500 行 proxy 不改你现有代码,就能把执行轨迹变成训练样本
  2. 如果你的 Agent 在自改 prompt/skill/memory:你已经在跑「无护栏」的 Harness 级遗忘;补救只需要加一道历史锚点准入评估门
  3. 如果你的团队 Skill 资产超过 50 条:@skills 协议能让初始 prompt 占用降到 30-50 token;不要在 system prompt 里塞「常驻 Skill 描述」
  4. 如果你在评估模型 + Harness 投资比例:Harness 资产可能在 12 个月内比模型权重更值得投入;EMNLP 那篇论文是定价依据
  5. 如果你的 Agent 框架是 LangChain / AutoGen / OpenAI Agents SDK:Agent Lightning 的 proxy 是零侵入接入;不要因为 RL 改造重写你的 Agent 代码

八、判断:Harness 元年之后的工程真相

把过去这一个月的 Harness 时间线串起来,可以看到三件正在同时发生的事:

第一,工程社区把 Harness 当成头等公民——Matt Pocock Skills(8/24)、obra/superpowers(8/23)、harness-subagent(8/24)都是这个方向。

第二,公司把 Harness 当成护城河——OpenAI Codex Harness(8/22 开源)、Nvidia AVO 缰绳(8/23)、DeepSeek Harness rc.8(8/20)、Anthropic oncall-kit(8/23)都是闭源或半闭源交付。

第三,研究社区把 Harness 当成论文对象——Agent Lightning、HCL Harness-level Forgetting、@skills、EMNLP Harness Updating 同周密集出炉。

三股力量都在说同一句话:模型本身不再是 AI 能力的全部,Harness 才是承载经验、决定表现、组织执行的核心资产。过去十年 AI 社区的「更大模型 = 更好智能」叙事,在 2026 年 8 月最后一周,被 Harness 范式论文 + 范式工程 + 范式产品同时戳破。

模型权重、训练数据、评估基准三件套之外,第四件套 Harness 正式登台。围绕 Harness 的标准化、自动化、训练化、工程化,将是 2026 年下半年到 2027 年 AI 竞争的主战场。


参考来源

  • Microsoft Agent Lightning v1.0:GitHub microsoft/agent-lightning,MIT 协议,《Harnessed Agentic RL via LLM Endpoint Proxy》
  • Harness Continual Learning:南京大学 + University of Wollongong,arXiv 2026,State Key Laboratory for Novel Software Technology
  • @skills Protocol:agentskills.io,AdaL CLI,《Skill Trigger Bottleneck: 56,804 Public Skills Compete for <100 Trigger Slots》
  • EMNLP 2026:《Harness Updating Is Not Harness Benefit》
  • Top AI Papers of the Week(Elvis Saravia):nlp.elvissaravia.com/p/top-ai-papers-of-the-week-9b0
  • AIToolsRecap 2026-08-24:aitoolsrecap.com/Blog/ai-news-august-24-2026

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录