2026 年 8 月 20 日——Ornith AI 团队于 8 月 18 日正式开源 Ornith-1.5 模型系列,包含 397B MoE、35B MoE、9B Dense 三个尺寸变体。该系列在 1.0 版 self-scaffolding(自脚手架)训练思路基础上,扩展为端到端 self-improvement(自进化)机制——模型自主生成任务、构建任务专属脚手架、产出解法轨迹,再通过强化学习持续优化,形成闭环。
旗舰版 Ornith-1.5-397B 在 Terminal-Bench 2.1 上得 86.1 分、DeepSWE 上得 56.0 分,与 Claude Opus 4.8(85.0/59.0)持平,超越 GLM-5.2(82.7/46.2)与 DeepSeek-V4-Flash-0731(82.7/54.4)等同尺寸开源模型。模型权重在 Hugging Face(ornith-ai/ornith-15)开放下载。
1. 模型规格
| 项目 | Ornith-1.5-397B | Ornith-1.5-35B | Ornith-1.5-9B |
|---|---|---|---|
| 参数规模 | 397B(MoE) | 35B(MoE) | 9B(Dense) |
| 架构 | MoE | MoE | Dense |
| 上下文窗口 | 262K Token | — | — |
| 基座模型 | Qwen3.5 + Gemma 4 后训练 | Qwen3.5 后训练 | Qwen3.5 后训练 |
| 部署方式 | 多卡服务器 | 单卡/多卡 | iPhone / Android 移动端 |
注:35B 与 9B 版本的上下文窗口等规格官方尚未完整披露,表中"——"表示待确认。
2. 核心机制:从 Self-Scaffolding 到 Self-Improvement
据官方技术博客(ornith.ai/ornith_1_5.html),Ornith-1.5 将 1.0 版引入的 self-scaffolding 概念扩展为完整的自进化闭环。整个过程分为三个阶段:
任务生成。给定环境或代码库、高层任务类型指令以及模型自身过往解题历史,系统会主动提出比模型已掌握难度更高的新任务,暴露能力缺口,持续推动训练边界。
脚手架构建。针对每个任务,模型生成或优化专属脚手架——包括指令、工具、分解策略与编排方式,而非依赖人工预设的固定框架。
解法产出与反馈。在任务与脚手架条件下,策略模型产出解法轨迹(solution rollout)。轨迹的奖励信号反向传播至任务生成、脚手架构建与解法产出三个阶段,使系统同时学习"出什么题""怎么拆题""怎么解题"。
与传统强化学习(如 GRPO)依赖固定任务集和人工设计 harness 不同,Ornith-1.5 在训练过程中持续生成新的训练经验,形成自我驱动的迭代循环。
3. 基准表现
据官方发布的基准测试数据:
3.1 旗舰版 Ornith-1.5-397B
| 基准 | Ornith-1.5-397B | Claude Opus 4.8 | GLM-5.2 | DeepSeek-V4-Flash-0731 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.1 | 85.0 | 82.7 | 82.7 |
| DeepSWE | 56.0 | 59.0 | 46.2 | 54.4 |
在 Terminal-Bench 2.1 上超过 Claude Opus 4.8,在 DeepSWE 上接近持平。两项指标均超越同尺寸范围内的开源模型 GLM-5.2 与 DeepSeek-V4-Flash。
3.2 中端版 Ornith-1.5-35B
| 基准 | Ornith-1.5-35B | Qwen 3.6-35B | Gemma 4-31B | Muse Glimmer-30B |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 68.5 | — | 43.4 | 51.7 |
| SWE-Bench Verified | 79.0 | — | 52.0 | 76.0 |
35B 版本以仅 3B 的每 token 激活参数,在 Agentic Coding 基准上大幅超越密集模型 Gemma 4-31B 与 Meta 的 Muse Glimmer-30B,以及同尺寸 MoE 模型 Qwen 3.6-35B。
3.3 轻量版 Ornith-1.5-9B
| 基准 | Ornith-1.5-9B | Gemma 4-31B | Qwen 3.6-35B |
|---|---|---|---|
| Terminal-Bench 2.1 | 47.0 | 43.4 | — |
| SWE-Bench Verified | 70.6 | 52.0 | — |
9B 版本在两项基准上均超越参数规模数倍于自身的 Gemma 4-31B,且已推出量化移动端版本(Ornith-1.5-9B-Mobile),可直接部署于 iPhone 与 Android 设备。
4. 与 1.0 版的关系
Ornith-1.0 于 2026 年 6 月首次发布,同样基于 Qwen 3.5 与 Gemma 4 进行持续预训练(CPT)、中间训练(mid-training)与后训练(post-training),提供 9B/35B/397B 三尺寸。1.0 版的核心思路是 self-scaffolding——让模型在推理过程中自主构建任务专属的执行框架,而非依赖人工预设。
社区对 1.0 版的反馈集中在推理链质量与 Agentic Coding 场景的实用性上,知乎、CSDN 与博客园均有详细部署评测。1.5 版在保留 self-scaffolding 能力的基础上,将其从推理阶段前移至训练阶段,实现了"自己给自己出题、自己给自己打分、自己给自己迭代"的完整闭环。
5. 开源与部署
Ornith-1.5 系列已在 Hugging Face 开放权重,官方 collection 地址为 ornith-ai/ornith-15。许可证信息截至发稿尚未在官方博客中明确标注,建议下载前查看仓库 LICENSE 文件。
部署方面,397B 版本需多卡服务器环境;35B 版本可在单卡部署;9B 版本的量化移动端版本可运行于手机。推理框架支持 vLLM、SGLang 与 Transformers。
举手提问