微软 Orchard 把 agent 训练的环境层从训练栈里剥出来:同一套服务跨 SWE/GUI/Claw 三域复用
微软研究院 7 月底把 Orchard 推到了开源主仓,主分支的最新提交是把 MSR-Orchard/slime 作为子模块引入训练器。Orchard 不是一个 agent 框架——它是 agent 训练的"环境层",专门解决"我想训练一万个 AI 一起跑实验,但每跑一个都要装一个隔离沙箱"这个卡了大半年的工程难题。
技术骨架的核心是 Orchard Env:一个 Kubernetes 原生的环境服务 + Python SDK,能按需起数千个隔离容器,通过 HTTP 提供沙箱生命周期、命令执行、文件 I/O、网络控制、agent 集成等通用能力。这套服务对 agent harness、训练流水线、推理后端都保持中立——同一套 Env 既能给 SFT 做轨迹蒸馏,也能给 RL 做 rollout,还能给评测做任务切换,而不必每换任务重建整套系统。在 arXiv 论文的对比表里,Orchard Env 在"Thin env service"维度上是开源方案里唯一满足"窄、独立、可复用"定义的;成本侧按 2-vCPU/8-GiB 沙箱归一化约为 Daytona 的 0.47 倍(用 spot 实例可到 0.10 倍)。
Orchard 不是单点研究,它一次性背了三类 agent 训练配方:
- Orchard-SWE:Qwen3.5-35B-A3B 起步,从 107K 蒸馏轨迹(来自 MiniMax-M2.5 和 Qwen3.5-397B)做"credit-assignment SFT"——只学 unresolved trajectory 中 productive 的片段——再叠 Balanced Adaptive Rollout 做 RL。SWE-bench Verified 上从基线 61.4% 提到 69.1%(+BAR)和 69.7%(+dense reward),再用 4B value-model reranking 拉到 73%——已经能逼近比自己大 10 倍的闭源系统。
- Orchard-GUI:4B 视觉语言模型做浏览器 agent,只用 400 条蒸馏轨迹 + 2200 个开放式训练任务。WebVoyager 74.1%、Online-Mind2Web 67.0%、DeepShop 64.0%,平均 68.4%——开源 GUI agent 当前 SOTA,且与 OpenAI/Google CUA 同台。
- Orchard-Claw:30B-A3B 做个人助手 agent,200 条合成任务起步。Claw-Eval 上 pass@3 = 59.6%,配 ZeroClaw harness 时 73.9%。最关键的训练在真实 deployment harness 里跑(ReACT、ZeroClaw、OpenClaw、Codex),而不是"简化版循环"——Codex harness 下,训练后从 18.6% 提升到 51.5%。
判断:Orchard 的真正信号不在分数,而在分类——它把"环境"从训练栈里独立出来当作可复用服务,正是这个解耦让同一套基础设施能跨 SWE/GUI/Claw 三个领域复用。这意味着 agent 训练的下一阶段不是"更大的模型 + 更多的轨迹",而是"更便宜、更标准化的环境池 + 跨 harness 的 RL"。对国内做 agent 训练框架的团队(不管基于 LangGraph、ReAct 还是自研),Orchard 的设计哲学提示了一条清晰路径:把环境做成 service 而不是组件,把训练做成可替换后端。这跟 Cloudflare 把 CI/CD 做成 Workflow 是一对镜像——基础设施层正在被同一个抽象压平。
代码:https://github.com/microsoft/Orchard 论文:https://arxiv.org/html/2605.15040