2026 年 8 月 20 日——Ornith AI 团队于 8 月 18 日正式开源 Ornith-1.5 模型系列,包含 397B MoE、35B MoE、9B Dense 三个尺寸变体。该系列在 1.0 版 self-scaffolding(自脚手架)训练思路基础上,扩展为端到端 self-improvement(自进化)机制——模型自主生成任务、构建任务专属脚手架、产出解法轨迹,再通过强化学习持续优化,形成闭环。

旗舰版 Ornith-1.5-397B 在 Terminal-Bench 2.1 上得 86.1 分、DeepSWE 上得 56.0 分,与 Claude Opus 4.8(85.0/59.0)持平,超越 GLM-5.2(82.7/46.2)与 DeepSeek-V4-Flash-0731(82.7/54.4)等同尺寸开源模型。模型权重在 Hugging Face(ornith-ai/ornith-15)开放下载。

1. 模型规格

项目 Ornith-1.5-397B Ornith-1.5-35B Ornith-1.5-9B
参数规模 397B(MoE) 35B(MoE) 9B(Dense)
架构 MoE MoE Dense
上下文窗口 262K Token
基座模型 Qwen3.5 + Gemma 4 后训练 Qwen3.5 后训练 Qwen3.5 后训练
部署方式 多卡服务器 单卡/多卡 iPhone / Android 移动端

注:35B 与 9B 版本的上下文窗口等规格官方尚未完整披露,表中"——"表示待确认。

2. 核心机制:从 Self-Scaffolding 到 Self-Improvement

据官方技术博客(ornith.ai/ornith_1_5.html),Ornith-1.5 将 1.0 版引入的 self-scaffolding 概念扩展为完整的自进化闭环。整个过程分为三个阶段:

任务生成。给定环境或代码库、高层任务类型指令以及模型自身过往解题历史,系统会主动提出比模型已掌握难度更高的新任务,暴露能力缺口,持续推动训练边界。

脚手架构建。针对每个任务,模型生成或优化专属脚手架——包括指令、工具、分解策略与编排方式,而非依赖人工预设的固定框架。

解法产出与反馈。在任务与脚手架条件下,策略模型产出解法轨迹(solution rollout)。轨迹的奖励信号反向传播至任务生成、脚手架构建与解法产出三个阶段,使系统同时学习"出什么题""怎么拆题""怎么解题"。

与传统强化学习(如 GRPO)依赖固定任务集和人工设计 harness 不同,Ornith-1.5 在训练过程中持续生成新的训练经验,形成自我驱动的迭代循环。

3. 基准表现

据官方发布的基准测试数据:

3.1 旗舰版 Ornith-1.5-397B

基准 Ornith-1.5-397B Claude Opus 4.8 GLM-5.2 DeepSeek-V4-Flash-0731
Terminal-Bench 2.1 86.1 85.0 82.7 82.7
DeepSWE 56.0 59.0 46.2 54.4

在 Terminal-Bench 2.1 上超过 Claude Opus 4.8,在 DeepSWE 上接近持平。两项指标均超越同尺寸范围内的开源模型 GLM-5.2 与 DeepSeek-V4-Flash。

3.2 中端版 Ornith-1.5-35B

基准 Ornith-1.5-35B Qwen 3.6-35B Gemma 4-31B Muse Glimmer-30B
Terminal-Bench 2.1 68.5 43.4 51.7
SWE-Bench Verified 79.0 52.0 76.0

35B 版本以仅 3B 的每 token 激活参数,在 Agentic Coding 基准上大幅超越密集模型 Gemma 4-31B 与 Meta 的 Muse Glimmer-30B,以及同尺寸 MoE 模型 Qwen 3.6-35B。

3.3 轻量版 Ornith-1.5-9B

基准 Ornith-1.5-9B Gemma 4-31B Qwen 3.6-35B
Terminal-Bench 2.1 47.0 43.4
SWE-Bench Verified 70.6 52.0

9B 版本在两项基准上均超越参数规模数倍于自身的 Gemma 4-31B,且已推出量化移动端版本(Ornith-1.5-9B-Mobile),可直接部署于 iPhone 与 Android 设备。

4. 与 1.0 版的关系

Ornith-1.0 于 2026 年 6 月首次发布,同样基于 Qwen 3.5 与 Gemma 4 进行持续预训练(CPT)、中间训练(mid-training)与后训练(post-training),提供 9B/35B/397B 三尺寸。1.0 版的核心思路是 self-scaffolding——让模型在推理过程中自主构建任务专属的执行框架,而非依赖人工预设。

社区对 1.0 版的反馈集中在推理链质量与 Agentic Coding 场景的实用性上,知乎、CSDN 与博客园均有详细部署评测。1.5 版在保留 self-scaffolding 能力的基础上,将其从推理阶段前移至训练阶段,实现了"自己给自己出题、自己给自己打分、自己给自己迭代"的完整闭环。

5. 开源与部署

Ornith-1.5 系列已在 Hugging Face 开放权重,官方 collection 地址为 ornith-ai/ornith-15。许可证信息截至发稿尚未在官方博客中明确标注,建议下载前查看仓库 LICENSE 文件。

部署方面,397B 版本需多卡服务器环境;35B 版本可在单卡部署;9B 版本的量化移动端版本可运行于手机。推理框架支持 vLLM、SGLang 与 Transformers。