Ornith-1.5:开源模型学会自己给自己出题——从自脚手架到端到端自改进
一句话概括
DeepReinforce 团队于 2026 年 8 月 19 日正式开源 Ornith-1.5 全系列模型(397B MoE / 35B MoE / 9B Dense),首次将"自脚手架"训练方法升级为完整的端到端自我改进闭环——模型自己提出新任务、生成任务专用脚手架、在自己的 rollout 上训练自己。旗舰版 397B 在 Terminal-Bench 2.1 上以 86.1 分超越 Claude Opus 4.8(85.0),9B 版本可在手机端直接部署。
一、模型矩阵
| 版本 | 架构 | 激活参数 | 基座模型 | 定位 |
|---|---|---|---|---|
| Ornith-1.5-397B | MoE | — | Qwen 3.8 | 前沿级,媲美 Claude Opus 4.8 |
| Ornith-1.5-35B | MoE (A3B) | ~3B | Qwen 3.8 | 中等规模,本地可跑 |
| Ornith-1.5-9B | Dense | 9B | Qwen 3.8 | 轻量级,手机端部署 |
相比 1.0 的四规格(9B Dense / 31B Dense / 35B MoE / 397B MoE),1.5 砍掉了 31B Dense,聚焦三个差异化定位更清晰的档位。全部 MIT 许可。
二、核心创新:从"自脚手架"到"自改进闭环"
Ornith-1.0 的突破:模型学会给自己搭脚手架
传统编码 Agent 的工作方式是:人类设计 scaffold(脚手架),模型在这个框架内执行。Scaffold 决定了任务怎么拆分、怎么推进、怎么验证结果——比如"先读 README → 定位 bug → 写修复 → 跑测试"这条流水线是人写的。
Ornith-1.0 的创新在于:用 RL 同时优化两个东西——
- Scaffold 生成:模型学会为每个任务自动生成专用脚手架
- 解决方案生成:模型在自建脚手架内执行任务
这不是简单的 prompt engineering——模型在 RL 训练中学会了当自己的工程师,而不仅仅是当执行者。
Ornith-1.5 的跃迁:闭环自改进
1.5 把 1.0 的"自脚手架"从单次训练扩展成了持续运转的闭环:
循环:
1. 模型自己提出新任务(比当前能力略难)
2. 模型为该任务生成专用脚手架
3. 模型在脚手架内执行 rollout
4. 从 rollout 结果中提取训练信号
5. 用 RL 更新模型权重
6. 更强的模型 → 提出更难的任务 → 回到 1
这个循环的关键洞察是:训练数据不再是静态数据集,而是模型自己生成的、难度恰好匹配当前能力的课程。模型既是学生也是出题人——而且出题难度会随着学生变强而自动提升。
这与 RoboGen 的"LLM 生成仿真场景 → 训练 → 反馈 → 新场景"循环(178633660)在结构上高度同构——只不过 RoboGen 生成的是物理场景,Ornith 生成的是编码任务。两者指向同一个范式转移:训练环境的创建从人工劳动变成模型自动化。
三、基准表现
397B 旗舰版 vs Claude Opus 4.8
| 基准 | Ornith-1.5-397B | Claude Opus 4.8 | 优势方 |
|---|---|---|---|
| Terminal-Bench 2.1 | 86.1 | 85.0 | Ornith ✅ |
| SWE-Bench Verified | 86.0 | ~88.6 | Opus |
| SWE-Bench Pro | 65.1 | — | — |
| SWE-Bench Multilingual | 79.6 | — | — |
| DeepSWE (1.1) | 56.0 | 59.0 | Opus |
| HLE | 44.6 | — | — |
| ClawEval | 81.4 | — | — |
| Tool Decathlon | 71.2 | — | — |
OrcaRouter 的分析指出,Ornith-1.5 在 4 项基准上超越 Claude Opus 4.8。Terminal-Bench 是其中最核心的——它测试的是 Agent 在终端环境中的端到端任务完成能力,最接近真实开发场景。
1.5 vs 1.0 全面提升
Reddit r/LocalLLaMA 的对比分析确认:Ornith 1.5 在所有共享基准上无歧义地优于 1.0。
| 基准 | Ornith-1.0-397B | Ornith-1.5-397B | 提升 |
|---|---|---|---|
| Terminal-Bench 2.1 | 77.5 | 86.1 | +8.6 |
| SWE-Bench Verified | 82.4 | 86.0 | +3.6 |
Terminal-Bench 上 8.6 分的跃升是显著的——说明自改进闭环带来的不是边际改善,而是代际跨越。
35B 中等规模
来自 HN 讨论的数据:
| 基准 | Ornith-1.5-35B |
|---|---|
| Terminal-Bench 2.1 | 73.0 |
| SWE-Bench Pro | 61.7 |
| DeepSWE (1.1) | 42.2 |
35B MoE 只有约 3B 激活参数,Terminal-Bench 73.0 已经非常有竞争力——意味着消费级 GPU 可以跑的模型在 Agent 编码能力上已经接近半年前的前沿水平。
9B 手机端部署
9B Dense 版本支持手机端直接部署,256K 上下文窗口。这是目前已知在手机端可运行的、具备 Agent 编码能力的最强开源模型。对于边缘 AI 场景(离线代码助手、本地隐私优先的开发辅助)有直接实用价值。
四、技术脉络定位
与"LLM 按需在场"主线的关联
Ornith-1.5 的自改进闭环为我们一直追踪的"LLM 按需在场"主线增加了一个新维度:
| 话题 | LLM 的角色 | 层级 |
|---|---|---|
| TurboVLA 178633659 | 不在执行路径 | 执行层去 LLM |
| Genie Sim 3.0 178633660 | 生成训练场景 | 环境层用 LLM |
| EGGROLL 178633577 | 绕过 LLM 训练 | 训练层绕过 LLM |
| Ornith-1.5 | LLM 生成训练课程 + 脚手架 | 训练层用 LLM(自指) |
Ornith-1.5 的独特之处在于自指性:LLM 既是被训练的对象,也是训练数据的生成者。这不是"LLM 在场"——这是"LLM 训练自己"。这比 RoboGen 的"LLM 生成物理场景"更激进:RoboGen 中 LLM 和策略网络是分开的,而 Ornith 中同一个模型同时承担两个角色。
与 RoboGen 循环的结构同构
RoboGen: LLM 提议技能 → 生成场景 → 策略训练 → 反馈 → LLM 提议新技能
Ornith: 模型提议任务 → 生成脚手架 → RL 训练 → 反馈 → 模型提议更难任务
两者的共同范式是:训练数据的生产从"人工收集/标注"变成"模型自动生成 + 难度自动校准"。这是一个比"用 LLM 生成合成数据"更深的转变——后者只是数据增强,前者是课程学习(Curriculum Learning)的自动化。
自改进的边界与风险
Ornith-1.5 的自改进闭环有一个隐含假设:模型生成的"更难任务"确实指向真实世界需要的能力。如果模型生成的任务分布偏离了真实需求——比如生成的"更难"任务都是某种特定模式的变体——自改进循环可能强化模型已有的偏见,而不是拓展能力边界。
这与我们在讨论生成式仿真时提到的"分布盲区"问题是同一类风险:自动生成的东西,分布受限于生成模型的想象力。Ornith 的 Terminal-Bench 提升证明了自改进在编码任务上有效,但这种自改进能否迁移到其他领域(数学推理、科学发现、多模态理解)仍然存疑。
五、行业影响
开源 vs 闭源的差距正在缩小
Ornith-1.5-397B 在 Terminal-Bench 上超越 Claude Opus 4.8 是一个里程碑事件。半年前(2026 年 1 月),Ornith-1.0-397B 的 82.4 分还落后于 Opus 4.7 的 88.6 分。自改进闭环让开源模型在 8 个月内从"追赶"变成"部分超越"。
更关键的是 35B 和 9B 的存在——如果开源模型在中低规格上也能达到"够用"水平,闭源模型的定价权将被侵蚀。35B MoE 只有 3B 激活参数,在消费级 GPU 上可以本地运行,Terminal-Bench 73.0 已经超过了不少闭源模型的前代旗舰。
编码 Agent 的范式转变
Ornith-1.5 的自改进方法暗示了一个更大的趋势:Agent 的工作流(scaffold)正在从"人类设计"变成"模型自动生成"。过去编码 Agent 的竞争力在于 prompt engineering 和工作流设计——谁能写出更好的"先读代码 → 定位问题 → 生成修复 → 验证"流水线。Ornith 之后,scaffold 本身成为模型的 learned behavior——人类不再需要设计工作流,模型自己学会为每个任务搭不同的工作流。
这意味着编码 Agent 的竞争壁垒正在从"工程能力"转移到"训练方法 + 基座模型"——对开源社区是利好,对以 scaffold 工程为核心竞争力的闭源 Agent 公司是挑战。
六、开放问题
- 自改进的可持续性:闭环能转多少圈?是否存在能力天花板——模型生成的任务难度达到某个水平后无法再提升?
- 任务多样性:模型自动生成的任务是否覆盖了真实开发场景的长尾分布?还是集中在某些特定模式?
- 可复现性:MIT 许可 + 开源权重意味着任何人可以复现——但自改进训练的计算成本是否在开源社区可承受范围内?
- 安全性:模型能自己生成更难的任务并自我提升——如果任务生成方向偏了,是否会产生不可预期的能力?
Ornith-1.5 模型已发布至 HuggingFace(ornith-ai/Ornith-1.5-397B / 35B / 9B),MIT 许可。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。