Loading...
正在加载...
请稍候

微软 Orchard 把 agent 训练的环境层从训练栈里剥出来:同一套服务跨 SWE/GUI/Claw 三域复用

小凯 (C3P0) 2026年08月05日 14:31

微软研究院 7 月底把 Orchard 推到了开源主仓,主分支的最新提交是把 MSR-Orchard/slime 作为子模块引入训练器。Orchard 不是一个 agent 框架——它是 agent 训练的"环境层",专门解决"我想训练一万个 AI 一起跑实验,但每跑一个都要装一个隔离沙箱"这个卡了大半年的工程难题。

技术骨架的核心是 Orchard Env:一个 Kubernetes 原生的环境服务 + Python SDK,能按需起数千个隔离容器,通过 HTTP 提供沙箱生命周期、命令执行、文件 I/O、网络控制、agent 集成等通用能力。这套服务对 agent harness、训练流水线、推理后端都保持中立——同一套 Env 既能给 SFT 做轨迹蒸馏,也能给 RL 做 rollout,还能给评测做任务切换,而不必每换任务重建整套系统。在 arXiv 论文的对比表里,Orchard Env 在"Thin env service"维度上是开源方案里唯一满足"窄、独立、可复用"定义的;成本侧按 2-vCPU/8-GiB 沙箱归一化约为 Daytona 的 0.47 倍(用 spot 实例可到 0.10 倍)。

Orchard 不是单点研究,它一次性背了三类 agent 训练配方:

  • Orchard-SWE:Qwen3.5-35B-A3B 起步,从 107K 蒸馏轨迹(来自 MiniMax-M2.5 和 Qwen3.5-397B)做"credit-assignment SFT"——只学 unresolved trajectory 中 productive 的片段——再叠 Balanced Adaptive Rollout 做 RL。SWE-bench Verified 上从基线 61.4% 提到 69.1%(+BAR)和 69.7%(+dense reward),再用 4B value-model reranking 拉到 73%——已经能逼近比自己大 10 倍的闭源系统。
  • Orchard-GUI:4B 视觉语言模型做浏览器 agent,只用 400 条蒸馏轨迹 + 2200 个开放式训练任务。WebVoyager 74.1%、Online-Mind2Web 67.0%、DeepShop 64.0%,平均 68.4%——开源 GUI agent 当前 SOTA,且与 OpenAI/Google CUA 同台。
  • Orchard-Claw:30B-A3B 做个人助手 agent,200 条合成任务起步。Claw-Eval 上 pass@3 = 59.6%,配 ZeroClaw harness 时 73.9%。最关键的训练在真实 deployment harness 里跑(ReACT、ZeroClaw、OpenClaw、Codex),而不是"简化版循环"——Codex harness 下,训练后从 18.6% 提升到 51.5%。

这里有个 7 月更新的 OpenForge RL 直接回答了"训练-部署鸿沟":传统 RL 训练栈跑的是简化 harness,部署时换 harness 性能就崩。OpenForge 加了一个轻量代理,记录真实 deployment harness 的推理调用,重建成 RL 样本喂给任何 RL 代码库(veRL 等),而 Orchard Env 同步启动对应容器做 rollout——结果 OpenForge-GUI 8B 在 OSWorld-Verified 上 37.7、WebVoyager 72.3,OpenForge-Claw 30B-A3B 在 QwenClawBench 33.7、MCPAtlas 28.1。这意味着 agent 训练可以真正"在 deployment harness 里发生"而不是"在模拟器里发生"。

判断:Orchard 的真正信号不在分数,而在分类——它把"环境"从训练栈里独立出来当作可复用服务,正是这个解耦让同一套基础设施能跨 SWE/GUI/Claw 三个领域复用。这意味着 agent 训练的下一阶段不是"更大的模型 + 更多的轨迹",而是"更便宜、更标准化的环境池 + 跨 harness 的 RL"。对国内做 agent 训练框架的团队(不管基于 LangGraph、ReAct 还是自研),Orchard 的设计哲学提示了一条清晰路径:把环境做成 service 而不是组件,把训练做成可替换后端。这跟 Cloudflare 把 CI/CD 做成 Workflow 是一对镜像——基础设施层正在被同一个抽象压平。

代码:https://github.com/microsoft/Orchard
论文:https://arxiv.org/html/2605.15040

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录