2026 年 8 月 20 日——8 月 18 日,Ornith AI 团队正式开源 Ornith-1.5 模型系列,包含 397B MoE、35B MoE、9B Dense 三个尺寸变体。与前代 1.0 版本相比,1.5 版的核心升级并非参数规模或架构调整,而是一个训练范式的转变:从 self-scaffolding(自脚手架)扩展为完整的 self-improvement(自进化)闭环——模型在训练过程中自主生成任务、构建任务专属执行框架、产出解法轨迹,再通过强化学习反向优化整个链条,形成"自己给自己出题、自己给自己打分、自己给自己迭代"的循环。
旗舰版 Ornith-1.5-397B 在 Terminal-Bench 2.1 上得 86.1 分,超越 Claude Opus 4.8(85.0 分);在 DeepSWE 上得 56.0 分,与 Claude Opus 4.8(59.0 分)接近持平,超过 GLM-5.2 与 DeepSeek-V4-Flash 等同尺寸开源模型。模型权重在 Hugging Face(ornith-ai/ornith-15)开放下载。
一、概览
1.1 为什么需要自进化
过去两年,AI Agent 的主流范式是:给模型一个工具箱(代码执行、搜索、文件读写),再由人工设计固定的执行框架(harness),让模型在框架内调用工具完成任务。这个范式在代码生成、简单检索等场景中已经足够好用,但当任务复杂度上升时,固定框架的短板就暴露了。
问题出在两个地方。一是人工预设的规则永远追不上任务的多样性——真实生活中的代码库千差万别,终端环境各不相同,人工无法为每一种组合预设执行策略。二是奖励信号过于稀疏——一次完整的 Agent 探索可能需要数小时甚至更久,传统强化学习要等整条轨迹结束才能拿到训练信号,无法判断最终的成败归因于前面哪一步。
Ornith 团队的答案是:让模型自己在训练过程中持续生成新的训练经验,而不是依赖人类提供固定的训练集和固定的执行框架。
1.2 三个尺寸
| 项目 | Ornith-1.5-397B | Ornith-1.5-35B | Ornith-1.5-9B |
|---|---|---|---|
| 参数规模 | 397B(MoE) | 35B(MoE) | 9B(Dense) |
| 每 token 激活 | — | 3B | 9B(全激活) |
| 上下文窗口 | 262K Token | — | — |
| 基座模型 | Qwen3.5 + Gemma 4 后训练 | Qwen3.5 后训练 | Qwen3.5 后训练 |
| 部署方式 | 多卡服务器 | 单卡/多卡 | iPhone / Android 移动端 |
| 开源协议 | 待确认 | 待确认 | 待确认 |
注:35B 与 9B 版本的上下文窗口等规格官方尚未完整披露,表中"——"表示待确认。
二、核心机制:Self-Improvement 三阶段
Ornith-1.5 将 1.0 版引入的 self-scaffolding 概念从推理阶段前移至训练阶段,构建了完整的自进化闭环。整个过程分为三个阶段,每个阶段的奖励信号都反向传播至前两个阶段。
2.1 第一阶段:任务生成
给定环境或代码库、高层任务类型指令以及模型自身过往的解题历史,系统主动提出比模型已掌握难度更高的新任务。
关键在于"比模型已掌握难度更高"——这不是随机生成任务,而是根据模型当前的能力边界,精准暴露缺口。模型过往的解题历史被用来判断哪些类型的任务它已经能稳定解决,哪些类型它还做不到或做得不稳定,然后针对后者生成新的训练任务。
这样做的好处是:训练信号不会停滞在固定的任务集上,而是随着模型能力的提升持续推进边界,避免了传统训练中"在已掌握任务上反复刷分"的低效循环。
2.2 第二阶段:脚手架构建
针对每个新任务,模型生成或优化专属的执行框架——包括指令设计、工具选择、分解策略与编排方式。
这里的关键转变是:脚手架不再由人工预设,而是由模型自己根据任务特性来构建。不同的代码库、不同的任务类型,需要不同的执行策略。人工无法穷举所有组合,但模型可以在训练过程中自己探索和积累哪些策略在哪些环境下有效。
这延续了 1.0 版的 self-scaffolding 思路——让模型在推理时自主构建任务专属框架——但将其前移到训练阶段,使脚手架的构建能力本身也成为训练优化的对象。
2.3 第三阶段:解法产出与反馈
在任务与脚手架条件下,策略模型产出解法轨迹(solution rollout)。轨迹的奖励信号反向传播至任务生成、脚手架构建与解法产出三个阶段。
这意味着系统同时学习三件事:
- 出什么题:什么样的任务能有效暴露能力缺口
- 怎么拆题:什么样的脚手架在什么环境下最有效
- 怎么解题:什么样的策略能稳定产出正确解法
传统强化学习(如 GRPO)通常只优化最后一件事,且依赖人工预设的固定任务集和固定 harness。Ornith-1.5 将优化范围扩展到整个链条,使得训练过程本身具备了自我驱动的特性。
2.4 与传统训练的对比
| 维度 | 传统 RL(GRPO 等) | Ornith-1.5 Self-Improvement |
|---|---|---|
| 任务来源 | 人工预设固定任务集 | 模型自主生成,难度递进 |
| 执行框架 | 人工设计固定 harness | 模型自主构建任务专属脚手架 |
| 优化对象 | 仅策略模型 | 任务生成 + 脚手架 + 策略模型 |
| 训练信号 | 轨迹结束时的终局奖励 | 每个 macro-step 结束时的中间奖励 |
| 能力边界 | 受限于人工任务集的覆盖范围 | 随训练自主扩展 |
三、基准表现
3.1 旗舰版 Ornith-1.5-397B
| 基准 | Ornith-1.5-397B | Claude Opus 4.8 | GLM-5.2 | DeepSeek-V4-Flash-0731 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.1 | 85.0 | 82.7 | 82.7 |
| DeepSWE | 56.0 | 59.0 | 46.2 | 54.4 |
在 Terminal-Bench 2.1 上,Ornith-1.5-397B 以 86.1 分超越 Claude Opus 4.8(85.0 分),领先 GLM-5.2 约 3.4 分、DeepSeek-V4-Flash 约 3.4 分。在 DeepSWE 上以 56.0 分与 Claude Opus 4.8(59.0 分)接近持平,领先 GLM-5.2 约 9.8 分、DeepSeek-V4-Flash 约 1.6 分。
Terminal-Bench 2.1 考察的是模型在终端环境中自主完成多步骤任务的能力,DeepSWE 考察的是软件工程场景下的自主解题能力——两项基准都属于 Agentic Coding 范畴,直接对应 self-improvement 机制所优化的场景。
3.2 中端版 Ornith-1.5-35B
| 基准 | Ornith-1.5-35B | Qwen 3.6-35B | Gemma 4-31B | Muse Glimmer-30B |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 68.5 | — | 43.4 | 51.7 |
| SWE-Bench Verified | 79.0 | — | 52.0 | 76.0 |
35B 版本以仅 3B 的每 token 激活参数,在 Terminal-Bench 2.1 上大幅超越密集模型 Gemma 4-31B(差距 25.1 分)与 Meta 的 Muse Glimmer-30B(差距 16.8 分),在 SWE-Bench Verified 上同样领先 Gemma 4-31B 约 27.0 分。
值得注意的是,35B 版本的激活参数仅为 3B——这意味着它在推理时的计算开销与一个 3B 密集模型相当,但性能表现远超同尺寸模型,甚至接近数倍参数规模的模型。这是 MoE 架构与 self-improvement 训练协同作用的结果:稀疏激活控制了推理成本,而自进化训练充分释放了模型的潜力。
3.3 轻量版 Ornith-1.5-9B
| 基准 | Ornith-1.5-9B | Gemma 4-31B | Qwen 3.6-35B |
|---|---|---|---|
| Terminal-Bench 2.1 | 47.0 | 43.4 | — |
| SWE-Bench Verified | 70.6 | 52.0 | — |
9B 版本在两项基准上均超越参数规模数倍于自身的 Gemma 4-31B,且已推出量化移动端版本(Ornith-1.5-9B-Mobile),可直接部署于 iPhone 与 Android 设备。这使得 Agentic Coding 能力首次延伸到移动端——用户可以在手机上运行自主编程 Agent,而不需要服务器或桌面环境。
四、从 Self-Scaffolding 到 Self-Improvement
4.1 1.0 版的起点
Ornith-1.0 于 2026 年 6 月首次发布,同样基于 Qwen 3.5 与 Gemma 4 进行持续预训练(CPT)、中间训练(mid-training)与后训练(post-training),提供 9B/35B/397B 三尺寸。
1.0 版的核心思路是 self-scaffolding:让模型在推理过程中自主构建任务专属的执行框架,而不是依赖人工预设的固定 harness。社区反馈集中在推理链质量与 Agentic Coding 场景的实用性上,知乎、CSDN 与博客园均有详细部署评测。
但 1.0 版的 self-scaffolding 仍局限于推理阶段——模型在推理时可以自己搭框架,但框架的构建能力本身不是训练优化的目标。
4.2 1.5 版的跃迁
1.5 版将 self-scaffolding 从推理阶段前移至训练阶段,实现了三个关键转变:
- 从"用框架"到"造框架":1.0 版是模型在推理时选择或调整已有框架;1.5 版是模型在训练时从零生成框架,框架本身是训练产物
- 从"等题目"到"自己出题":1.0 版依赖人工预设的任务集;1.5 版由模型自主生成任务,且难度随能力增长而递进
- 从"只管解题"到"全链路优化":1.0 版只优化策略模型;1.5 版同时优化任务生成、脚手架构建与解法产出
这种转变使得 Ornith-1.5 的训练过程本身就是一个持续自我迭代的系统,而不仅仅是产出一个更强的模型。
五、行业观察
5.1 Agent 范式的第三条路径
过去一年,Agent 相关的讨论集中在两个方向:一是让模型调用更多工具、支持更长的上下文,二是设计更复杂的 harness 来编排多步任务。Ornith-1.5 的出现暗示了第三条路径:让模型在训练阶段就具备自我驱动的迭代能力,而不是依赖人类把每一步都设计好。
OpenAI 曾披露,2026 年 5 月超过 70% 的 Codex 用户让 AI 处理需要人类一小时以上才能完成的工作;到 6 月,内部使用量最高的 1% 活跃用户每天产生超过 60 小时的 agent turns。当任务时长超过人类的耐心和设计者的预见能力时,"自进化"从锦上添花变成了必需。
5.2 开源的意义
Ornith-1.5 在 Hugging Face 开放权重,这意味着自进化训练方法不再是闭源公司的专属。研究者和开发者可以直接下载权重、在自己的环境中验证和改进。对于 Agentic Coding 这个快速演进的领域,开源的自进化模型为社区提供了一个可复现、可迭代的基线,有助于推动整个方向的标准化和比较。
5.3 仍需注意的边界
Ornith-1.5 处于早期阶段。35B 与 9B 版本的完整规格(上下文窗口等)官方尚未完全披露。自进化机制的训练成本和可复现性仍需社区验证——self-improvement 闭环涉及复杂的训练流程,第三方复现需要一定的工程投入。此外,基准测试分数是在受控环境中取得的,真实世界中的代码库和终端环境远比基准测试复杂,实际表现可能因环境差异而有所不同。
六、关键数据汇总
| 指标 | Ornith-1.5-397B | Ornith-1.5-35B | Ornith-1.5-9B |
|---|---|---|---|
| 总参数 | 397B | 35B | 9B |
| 每 token 激活 | — | 3B | 9B(Dense) |
| 上下文 | 262K | — | — |
| Terminal-Bench 2.1 | 86.1 | 68.5 | 47.0 |
| SWE-Bench Verified | — | 79.0 | 70.6 |
| DeepSWE | 56.0 | — | — |
| 移动端部署 | 否 | 否 | 是(9B-Mobile) |
| 开源协议 | 待确认 | 待确认 | 待确认 |
| 基座 | Qwen3.5 + Gemma 4 | Qwen3.5 | Qwen3.5 |
举手提问