2026 年 9 月 8 日,原名 OpenDevin 的开源自主编程 agent OpenHands 1.0 上线。它围着 Software Agent SDK 重写了整套架构,把生产级 Docker 沙箱、内置安全策略、资源限额、插件系统四件东西塞进了同一根管道。配上前沿模型,SWE-bench Verified 完成率约 68%;换开放权重的 Devstral 24B,仍有 46.8%,与商业产品 Devin 2.0 公开数字持平;自托管单任务成本约 0.20–1.05 美元(H100)。开源 agent 第一次在「安全护栏齐全」的前提下,逼近商业 agent 的水位。
🧰 把 agent 拆成四个包:每一段边界都钉得很死
1.0 不是一次功能升级。团队在 arXiv 上发了对应的 SDK 论文,把 OpenHands 从单体应用重写成 四个 Python 包,各自有清楚的责任边界:
openhands.sdk:核心抽象(Agent、Conversation、LLM、Tool、事件系统);openhands.tools:基于上面抽象的具体工具实现;openhands.workspace:执行环境,含 Docker 沙箱;openhands.agent_server:对外暴露 REST 和 WebSocket 远程执行 API。
里面三条工程决策值得拎出来:
所有东西都是事件。每一条 prompt、bash 命令、文件修改、编译器错误,都作为不可变事件写进 append-only 日志。这意味着凌晨 3 点 agent 做了奇怪的事,你可以按事件完整回放,不再只能从聊天记录里猜。
组件全部不可变。Agent、工具、LLM 配置都是构造时冻住的 Pydantic 模型,唯一可变的是会话状态。这听上去学院派,但谁能忍 agent 在中途悄悄改自己的配置?
安全是闭环,不是复选框。内置的 SecurityAnalyzer 会给每次工具调用打 LOW / MEDIUM / HIGH 风险等级,配套 ConfirmationPolicy 决定是否需要人类点确认才执行。默认的 ConfirmRisky 策略会让 agent 在执行高风险动作前停在 WAITING_FOR_CONFIRMATION 状态——这一步,agent 安全圈呼吁了很久,OpenHands 把它做成了默认。
📊 68% 的来历:为什么这是一个转折数字
OpenHands 1.0 的能力侧数字需要被认真翻译:
| Agent | SWE-bench Verified | License | 每任务估算成本 |
|---|---|---|---|
| OpenHands + Qwen3-Coder-480B | 68.0% | MIT | ~$0.30(tokens) |
| OpenHands + Claude Sonnet 4.5 | 72% | MIT(harness) | $1–3(tokens) |
| OpenHands + Devstral 24B | 46.8% | MIT | 极低(开放权重) |
| Devin(Max plan) | 77.8% | 专有 | $200/月 + ACU |
68% 这个数字本身是「配前沿模型跑 100 轮的上限」。把它和 Devin 的 77.8% 比,要先承认两件事:
- Devin 的 77.8% 是 Cognition 自己报的分数,有 vendor 污染风险;
- harness 单独影响成绩能差 15–20 个百分点,模型权重的实际差距没那么夸张。
把它换成成本调整后的吞吐量来读,意思就变了:在开放权重模型(Qwen3-Coder / DeepSeek V3.2)上跑 OpenHands,单任务成本约为 Devin 的 5%。一支做依赖升级、boilerplate 生成、内部工具的小团队,单凭这一项就能算回本。
一位早期用户在评价这一版时说得很直白:「harness 不在意后端模型是哪个」——常规任务用便宜开放模型跑,难架构题升级到前沿模型。这把 9 月 8 日同期 HydraFusion「路由即利润层」 的思路,在自托管侧落了地。
🏗️ 沙箱到底保护了什么:执行边界 + 资源上限 + 风险评分
过去企业拒绝自托管 OpenHands,最大的理由是「安全故事不完整」。1.0 把这一条补上:
- Docker 沙箱:CPU 与内存上限可配;
- 非 root 执行:
SANDBOX_USER_ID=1000; - LLM 驱动的 SecurityAnalyzer:对每次工具调用给风险评级;
- 高风险操作强制人类确认:bash 删文件、改凭据等高风险动作必须等人工信号;
- 插件系统:可扩展运行时;
- CLI 工具独立仓库:主框架与命令行的解耦更干净。
把这条线拉到当周的另两条新闻里看——同一天 GitHub 把 Copilot Workspace 推进到多专用 agent 并行协作(实现 / 测试 / 文档各自独立 agent,通过共享上下文窗口协调);同一天 CrowdStrike 上线 Falcon Guardian,专门发现端点上的影子 AI agent 并拦截未批准的 prompt。商业侧、开源侧、安全侧在同一周收敛到同一个判断:agent 的价值取决于它外面的沙箱与安全栏,而不是 agent 本身。
🔌 100+ 提供商、Ollama 在本地跑:自托管的最后一公里
OpenHands 用 LiteLLM 做底层 provider 路由,切换模型不需要改代码。Claude、GPT-6 Astra、Gemini,以及本地 Ollama、LM Studio 上的开放模型都行。
对敏感代码库特别有用的一点是 Ollama 集成:Ollama 暴露一个 OpenAI 兼容端点(http://localhost:11434/v1),OpenHands 接过去,代码、上下文、API 密钥全部留在你自己的机器或 VPC 里。
推荐的 1.0 Docker 启动命令大致是这样:
docker run -it --rm \
-e SANDBOX_USER_ID=$(id -u) \
-e LLM_MODEL=claude-sonnet-4-5 \
-e LLM_API_KEY=$ANTHROPIC_API_KEY \
-v /var/run/docker.sock:/var/run/docker.sock \
-v ~/.openhands-state:/.openhands-state \
-p 3000:3000 \
ghcr.io/all-handshq/openhands:1.0
运维侧还得叠两层:网络绑定限制、加 Compose 的硬化指南。默认配置不等于生产配置,但它已经迈出了「不是 demo」这一步。
📦 这不是一份副业项目:背后是 85k stars + 1800 万美元 A 轮
OpenHands 已经攒下一份不像「个人项目」的资产:
- 85,000+ GitHub stars;
- 900 万次+ 下载;
- 500+ 贡献者,含 AMD、 Google、 Amazon、 Netflix、 NVIDIA、 Mastercard 工程师;
- All Hands AI 在 2025 年 11 月完成 1800 万美元 A 轮,Madrona 领投,Menlo Ventures、Pillar VC、Obvious Ventures 跟投;
- 核心框架 + Docker 镜像走 MIT 协议;
- 企业版支持 Kubernetes VPC 部署。
对一个做自托管技术决策的人来说,这些数字意味着「两年后这套大概率还在」。
🔁 这件事的意义:自托管编程 agent 的「最后一公里」被打通
过去一年的节奏是「商业 agent 越跑越快,开放侧越跟越紧」。差距主要不在模型权重——Harness、沙箱、安全策略、审计回放才是工程门槛。
OpenHands 1.0 把这四件东西第一次以一致水准塞进 MIT 协议。对企业 IT 的直接影响:
- 成本:单任务 $0.20–$1.05,比 Devin Max plan 低 一到两个数量级;
- 数据边界:本地 Ollama / VPC 部署,代码与 API 密钥完全不出网;
- 审计:append-only 事件日志 + 不可变组件,agent 在做什么可以回放、不被事后改写;
- 路由:便宜模型跑日常,前沿模型啃架构题,成本结构由你控。
McKinsey 2026 年 AI 状态调研里有一个数字:32% 的组织已经因为能用 agentic coding 工具自建等价物,放弃了至少一笔 SaaS 采购。OpenHands 1.0 是这件事在自托管侧的「价格锚」。
📚 参考文献
- OpenHands 1.0 官方发布与 SDK 论文(arXiv),2026-09-08
- AI News Today:How OpenHands 1.0 Brings Production-Ready Sandboxing to Open-Source Coding Agents,2026-09-08
- byteiota:OpenHands 1.0 Self-Hosted Coding Agent With Safety Sandbox,2026-09-08
- AI Agent Store Daily AI Agent News 2026-09-08(GitHub Copilot 多 agent + OpenHands 1.0 同日)
- dev.to:OpenHands Just Hit 1.0 — Install Guide,2026-09-08
- AI 日报 2026-09-09(掘金,OpenHands 1.0 + GitHub Copilot Workspace 同周)
#OpenHands #OpenDevin #AIcoding #自主Agent #沙箱 #自托管 #SWE-bench
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。