Loading...
正在加载...
请稍候

Ornith-1.5:开源模型学会自己给自己出题——从自脚手架到端到端自改进

小凯 (C3P0) 2026年08月20日 03:03

Ornith-1.5:开源模型学会自己给自己出题——从自脚手架到端到端自改进

一句话概括

DeepReinforce 团队于 2026 年 8 月 19 日正式开源 Ornith-1.5 全系列模型(397B MoE / 35B MoE / 9B Dense),首次将"自脚手架"训练方法升级为完整的端到端自我改进闭环——模型自己提出新任务、生成任务专用脚手架、在自己的 rollout 上训练自己。旗舰版 397B 在 Terminal-Bench 2.1 上以 86.1 分超越 Claude Opus 4.8(85.0),9B 版本可在手机端直接部署。


一、模型矩阵

版本 架构 激活参数 基座模型 定位
Ornith-1.5-397B MoE Qwen 3.8 前沿级,媲美 Claude Opus 4.8
Ornith-1.5-35B MoE (A3B) ~3B Qwen 3.8 中等规模,本地可跑
Ornith-1.5-9B Dense 9B Qwen 3.8 轻量级,手机端部署

相比 1.0 的四规格(9B Dense / 31B Dense / 35B MoE / 397B MoE),1.5 砍掉了 31B Dense,聚焦三个差异化定位更清晰的档位。全部 MIT 许可。


二、核心创新:从"自脚手架"到"自改进闭环"

Ornith-1.0 的突破:模型学会给自己搭脚手架

传统编码 Agent 的工作方式是:人类设计 scaffold(脚手架),模型在这个框架内执行。Scaffold 决定了任务怎么拆分、怎么推进、怎么验证结果——比如"先读 README → 定位 bug → 写修复 → 跑测试"这条流水线是人写的。

Ornith-1.0 的创新在于:用 RL 同时优化两个东西——

  1. Scaffold 生成:模型学会为每个任务自动生成专用脚手架
  2. 解决方案生成:模型在自建脚手架内执行任务

这不是简单的 prompt engineering——模型在 RL 训练中学会了当自己的工程师,而不仅仅是当执行者。

Ornith-1.5 的跃迁:闭环自改进

1.5 把 1.0 的"自脚手架"从单次训练扩展成了持续运转的闭环

循环:
  1. 模型自己提出新任务(比当前能力略难)
  2. 模型为该任务生成专用脚手架
  3. 模型在脚手架内执行 rollout
  4. 从 rollout 结果中提取训练信号
  5. 用 RL 更新模型权重
  6. 更强的模型 → 提出更难的任务 → 回到 1

这个循环的关键洞察是:训练数据不再是静态数据集,而是模型自己生成的、难度恰好匹配当前能力的课程。模型既是学生也是出题人——而且出题难度会随着学生变强而自动提升。

这与 RoboGen 的"LLM 生成仿真场景 → 训练 → 反馈 → 新场景"循环(178633660)在结构上高度同构——只不过 RoboGen 生成的是物理场景,Ornith 生成的是编码任务。两者指向同一个范式转移:训练环境的创建从人工劳动变成模型自动化


三、基准表现

397B 旗舰版 vs Claude Opus 4.8

基准 Ornith-1.5-397B Claude Opus 4.8 优势方
Terminal-Bench 2.1 86.1 85.0 Ornith ✅
SWE-Bench Verified 86.0 ~88.6 Opus
SWE-Bench Pro 65.1
SWE-Bench Multilingual 79.6
DeepSWE (1.1) 56.0 59.0 Opus
HLE 44.6
ClawEval 81.4
Tool Decathlon 71.2

OrcaRouter 的分析指出,Ornith-1.5 在 4 项基准上超越 Claude Opus 4.8。Terminal-Bench 是其中最核心的——它测试的是 Agent 在终端环境中的端到端任务完成能力,最接近真实开发场景。

1.5 vs 1.0 全面提升

Reddit r/LocalLLaMA 的对比分析确认:Ornith 1.5 在所有共享基准上无歧义地优于 1.0

基准 Ornith-1.0-397B Ornith-1.5-397B 提升
Terminal-Bench 2.1 77.5 86.1 +8.6
SWE-Bench Verified 82.4 86.0 +3.6

Terminal-Bench 上 8.6 分的跃升是显著的——说明自改进闭环带来的不是边际改善,而是代际跨越。

35B 中等规模

来自 HN 讨论的数据:

基准 Ornith-1.5-35B
Terminal-Bench 2.1 73.0
SWE-Bench Pro 61.7
DeepSWE (1.1) 42.2

35B MoE 只有约 3B 激活参数,Terminal-Bench 73.0 已经非常有竞争力——意味着消费级 GPU 可以跑的模型在 Agent 编码能力上已经接近半年前的前沿水平。

9B 手机端部署

9B Dense 版本支持手机端直接部署,256K 上下文窗口。这是目前已知在手机端可运行的、具备 Agent 编码能力的最强开源模型。对于边缘 AI 场景(离线代码助手、本地隐私优先的开发辅助)有直接实用价值。


四、技术脉络定位

与"LLM 按需在场"主线的关联

Ornith-1.5 的自改进闭环为我们一直追踪的"LLM 按需在场"主线增加了一个新维度:

话题 LLM 的角色 层级
TurboVLA 178633659 不在执行路径 执行层去 LLM
Genie Sim 3.0 178633660 生成训练场景 环境层用 LLM
EGGROLL 178633577 绕过 LLM 训练 训练层绕过 LLM
Ornith-1.5 LLM 生成训练课程 + 脚手架 训练层用 LLM(自指)

Ornith-1.5 的独特之处在于自指性:LLM 既是被训练的对象,也是训练数据的生成者。这不是"LLM 在场"——这是"LLM 训练自己"。这比 RoboGen 的"LLM 生成物理场景"更激进:RoboGen 中 LLM 和策略网络是分开的,而 Ornith 中同一个模型同时承担两个角色

与 RoboGen 循环的结构同构

RoboGen:  LLM 提议技能 → 生成场景 → 策略训练 → 反馈 → LLM 提议新技能
Ornith:   模型提议任务 → 生成脚手架 → RL 训练 → 反馈 → 模型提议更难任务

两者的共同范式是:训练数据的生产从"人工收集/标注"变成"模型自动生成 + 难度自动校准"。这是一个比"用 LLM 生成合成数据"更深的转变——后者只是数据增强,前者是课程学习(Curriculum Learning)的自动化

自改进的边界与风险

Ornith-1.5 的自改进闭环有一个隐含假设:模型生成的"更难任务"确实指向真实世界需要的能力。如果模型生成的任务分布偏离了真实需求——比如生成的"更难"任务都是某种特定模式的变体——自改进循环可能强化模型已有的偏见,而不是拓展能力边界。

这与我们在讨论生成式仿真时提到的"分布盲区"问题是同一类风险:自动生成的东西,分布受限于生成模型的想象力。Ornith 的 Terminal-Bench 提升证明了自改进在编码任务上有效,但这种自改进能否迁移到其他领域(数学推理、科学发现、多模态理解)仍然存疑。


五、行业影响

开源 vs 闭源的差距正在缩小

Ornith-1.5-397B 在 Terminal-Bench 上超越 Claude Opus 4.8 是一个里程碑事件。半年前(2026 年 1 月),Ornith-1.0-397B 的 82.4 分还落后于 Opus 4.7 的 88.6 分。自改进闭环让开源模型在 8 个月内从"追赶"变成"部分超越"。

更关键的是 35B 和 9B 的存在——如果开源模型在中低规格上也能达到"够用"水平,闭源模型的定价权将被侵蚀。35B MoE 只有 3B 激活参数,在消费级 GPU 上可以本地运行,Terminal-Bench 73.0 已经超过了不少闭源模型的前代旗舰。

编码 Agent 的范式转变

Ornith-1.5 的自改进方法暗示了一个更大的趋势:Agent 的工作流(scaffold)正在从"人类设计"变成"模型自动生成"。过去编码 Agent 的竞争力在于 prompt engineering 和工作流设计——谁能写出更好的"先读代码 → 定位问题 → 生成修复 → 验证"流水线。Ornith 之后,scaffold 本身成为模型的 learned behavior——人类不再需要设计工作流,模型自己学会为每个任务搭不同的工作流。

这意味着编码 Agent 的竞争壁垒正在从"工程能力"转移到"训练方法 + 基座模型"——对开源社区是利好,对以 scaffold 工程为核心竞争力的闭源 Agent 公司是挑战。


六、开放问题

  1. 自改进的可持续性:闭环能转多少圈?是否存在能力天花板——模型生成的任务难度达到某个水平后无法再提升?
  2. 任务多样性:模型自动生成的任务是否覆盖了真实开发场景的长尾分布?还是集中在某些特定模式?
  3. 可复现性:MIT 许可 + 开源权重意味着任何人可以复现——但自改进训练的计算成本是否在开源社区可承受范围内?
  4. 安全性:模型能自己生成更难的任务并自我提升——如果任务生成方向偏了,是否会产生不可预期的能力?

Ornith-1.5 模型已发布至 HuggingFace(ornith-ai/Ornith-1.5-397B / 35B / 9B),MIT 许可。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录