《Ornith-1.5》发布解说视频的英雄标题卡片,标题为“Ornith-1.5 — 开放权重,自我改进”,副标题为“一个自行编写训练课程的模型系列 —— 397B MoE · 35B-A3B · 9B”,三个模型芯片由一条循环箭头连接,暗示自我改进循环,角落合成OrcaRouter标志。
Guides & Insights

Ornith-1.5:自行编写训练课程的开放权重模型系列——并声称击败 Claude Opus 4.8

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ornith-1.5,来自 Ornith AI 的开权重模型系列,号称在四项基准测试中击败 Claude Opus 4.8,于 2026 年 8 月 19 日发布——而真正值得驻足关注的是其训练循环,而非参数数量。该系列共有三款模型:Ornith-1.5-397B,一款 3970 亿参数的混合专家(MoE)旗舰模型;Ornith-1.5-35B-A3B,一款 350 亿参数的 MoE,每个 token 激活 30 亿参数;以及 Ornith-1.5-9B,一款 90 亿参数的稠密模型,配有量化移动端构建。这里的所有头条分数均来自厂商自报:数据出自 Ornith AI 自身的评估运行,取五次运行的平均值;唯一设有专属页面的第三方追踪平台 BenchLM 将其 18 行基准数据全部标注为“厂商报告”,在该系列获得独立评测覆盖之前不予排名。以下是实际发布的内容、“自我改进”的真正含义,以及你今天就能上手运行的东西。

本次发布:三个量表、MIT 许可证、无 API

Ornith AI —— 开放权重 Ornith-1.0 背后的团队,也是 DeepReinforce 在竞赛编程多智能体系统(GrandCode)和 GPU 内核优化(CUDA-L2)方面工作的关联团队 —— 已在 Hugging Face 上以 MIT 许可证发布了该系列模型,除原始检查点外,还提供了 FP8、GGUF、MLX 和 NVFP4 量化版本。整个系列均支持 256K 上下文窗口(262,144 个 token)。没有第一方托管的 API,也没有 token 定价;这是一次自托管或本地运行时发布,发布报告中也明确说明了这一点。

这三个量表针对三种不同的现实:

• Ornith-1.5-397B — “开源前沿竞标”:一个397B参数的MoE模型,旨在智能体与编码工作负载方面挑战封闭前沿。

• Ornith-1.5-35B-A3B — 一款35B参数的MoE模型,每个token仅激活3B参数,定位中间地带:接近旗舰级的能力,同时每token推理成本仅为稠密35B模型的一小部分。

• Ornith-1.5-9B —— 一个稠密9B模型,适用于本地及设备端使用;另有量化版Ornith-1.5-9B-Mobile,供应商称其已可在iPhone和Android上部署。

A screenshot of the Ornith AI launch page for Ornith-1.5, titled 'Ornith-1.5: From Self-Scaffolding to Self-Improvement', showing the three model scales 397b-moe, 35b-moe and 9b-dense and the opening paragraph describing the end-to-end self-improvement loop.

上面的发布页面就是完整的公告:这是一份技术报告,而非营销帖子,与该实验室的定位一致。

解码自我提升的说法

Ornith-1.0 于2026年6月发布,教会了模型生成编码任务周围的脚手架——测试框架、任务分解、流程编排。Ornith-1.5 将这一循环扩展到任务生成本身。在训练中,模型现在做三件事:

• 提出新的、更难的训练任务。

• 生成用于解决和评估这些任务的特定任务脚手架。

生成解决方案的推演结果,作为其下一轮训练数据。

奖励贯穿所有三个阶段,并通过GRPO进行联合优化。每个提议的任务都根据有效性(必须可执行且可验证)、前沿难度(目标解决成功率设为0.2——模型通常失败但仍能从中学习的任务)和新颖性(与已见内容的多样性)进行评分。脚手架因其对齐性、奖励保真度和对奖励黑客行为的抵抗力而获得自身奖励,并且该流水线包含反黑客保障措施:限制接触测试环境、监控受限路径访问,以及一个冻结的裁决模型来覆盖异常结果。

关键警告在于“自我改进”这个词:它描述的是训练过程,而非产物。下载的模型并不会在你的笔记本电脑上重新训练自己。你得到的,是一个训练数据异乎寻常地由自身早期版本生成的模型——而这正是那种在成为教条之前值得检验的说法。

The benchmark claims, honestly labeled

本节中所有数字均为 Ornith AI 自行提供,来自发布报告,取五次运行的平均值,且未经独立复现。该旗舰机型声称对 Claude Opus 4.8 的四大胜绩:

• Terminal-Bench 2.1(Terminus-2 测试框架):Ornith-1.5-397B 86.1 对比 Claude Opus 4.8 85.0

• SWE-bench Verified:86.0 对比 85.8

• WideSearch:80.8 vs 72.9

• BrowseComp: 86.6 对比 84.3

把这些当作供应商的说辞,而非事实。Ornith AI 唯一没有宣称获胜的旗舰基准是 DeepSWE:56.0 对 Claude Opus 4.8 的 59.0——报告将其描述为“不相上下”,这是对失利最诚实的解读。同一份报告中的其他旗舰数据:HLE 不使用工具为 44.6,使用工具为 56.1;GPQA Diamond 为 92.8;SWE-bench Pro 为 65.1。

较小的两个模型从纸面数据来看也很强:Ornith-1.5-35B-A3B报告SWE-bench Verified 79.0、Terminal-Bench 2.1(Claude Code测试框架)68.5,而Ornith-1.5-9B报告SWE-bench Verified 70.6、Terminal-Bench 2.1 47.0。在同一报告中与其他开源权重模型相比,Ornith AI将397B的86.1 Terminal-Bench / 56.0 DeepSWE与DeepSeek-V4-Flash-0731的82.7 / 54.4以及GLM-5.2的81.0 / 46.2进行对比。

A single-column scoreboard for Ornith-1.5-397B listing: Size 397B MoE (open weights), Context 262K tokens, Terminal-Bench 2.1 86.1 (vendor), SWE-bench Verified 86.0 (vendor), License MIT, API none — self-hosted, with a footer noting all figures are vendor-reported and no independent scores yet exist.

唯一的独立记分牌——以及为何它仍是临时性的

BenchLM 上关于 Ornith-1.5-397B 的档案是目前该模型唯一的第三方页面。其头条数据为:公开得分 68.5 分(满分 100 分),在 221 个模型中排名第 20,其中 Agentic 类别表现最强,位列第 13。但请留意细则,因为这些数据确实有其意义——全部 18 行基准测试结果均标注为“提供商报告”,档案页面还指出该模型“尚未获得足够的来源覆盖以取得认证排名”。在认证名单上未获排名并不代表对该模型的否定;这只是说明还没有人独立运行过该模型,而这正是一个发布仅数日的模型应有的状态。

A screenshot of the BenchLM profile for Ornith-1.5-397B, showing the release date of August 18 2026, a score of 68.5 out of 100 and rank #20 of 221, with Agentic ranked #13, and a note that the profile lacks enough sourced coverage for a verified position.

这就是本文中两个数字之间的差距:供应商的 86.1 Terminal-Bench 只是一个声称值,而 BenchLM 的 68.5 则是完全基于供应商所报告数据行构建的分数。两者都不是独立测量结果。第一个通过公共测试框架运行 Ornith-1.5-397B 的实验室——在受控集合上运行 SWE-bench Verified,在固定测试框架版本上运行 Terminal-Bench——将产生第一个真正算数的数字。

你今天可以实际运行的内容

这是一个开放权重的发布,所以“运行它”意味着拉取权重。Ollama 目录中已经列出了 ornith-1.5:9b(约 6.6 GB 的构建)和 ornith-1.5:35b(约 23 GB 的构建),两者均支持 256K 上下文;9B 构建在目录条目中还带有图像输入支持。397B 则是另一类问题:一个 397B 参数的 MoE 不是笔记本电脑能跑的模型,任何正经部署都意味着多块 GPU 和真正的编排。

对大多数团队来说,最实用的甜点为 Ornith-1.5-35B-A3B:每个 token 只要 3B 激活参数,就能以稠密 35B 模型每 token 成本的一小部分获得 MoE 的能力,而且 23 GB 的 Ollama 构建可在单块高显存显卡或小型集群上运行。9B 版本则是放在手机上用的那款。

那个“3B active”属性也正是路由经济学变得有趣的地方。激活参数的MoE定价远低于其总规模,而当服务商采用这样的模型时,每token的价格往往会迅速下降——这正是通过路由器购买的情况:路由器以0%加价直接传递服务商的标价,而不是你只需谈判一次的单一供应商。OrcaRouter在200+个模型上正是这样做的,因此服务商对新开放权重模型的降价当天就会在我们这边生效。而对于一个除了供应商基准测试之外别无他物的模型,故障转移的论点最为关键:路由层让你将测试路径指向一个全新模型,并在它一停顿时回退到经过验证的模型——无需将生产路径押注在一个未经证实的发布上。

还缺少什么

• 没有托管的 API。如果你想将 Ornith-1.5 作为服务使用,它还不存在;所有选项都是自托管或本地部署。

• 没有独立评估。BenchLM 使该系列保持未排名状态;没有实验室发布过受控运行。

• 无需考虑定价。没有令牌费率,因此“廉价开放前沿”的情况完全取决于你自己的GPU经济性。

• 这些评测框架是混合的。Terminal-Bench 有多个变体,而报告自己的数据也横跨这些变体:397B 的 86.1 是基于 Terminus-2 评测框架,35B 的 68.5 则是基于 Claude Code 评测框架。不同的评测框架就像不同的游戏,这使得同类比较比标题表格所暗示的要困难得多。

接下来看什么

持久的故事不是“开源模型击败Claude Opus 4.8”——那只是一个诞生一天的、未经审计的说法。真正重要的是,某家实验室在自生成训练数据上完成了闭环,并把权重公之于众供人审视,这才是值得关注的部分。要让这次发布从“有前景”变成“可信赖”,需要的条件包括:在SWE-bench Verified上对397B进行首次独立运行,同时配合修复后的Terminal-Bench测试框架;评估代码真正随附发布;以及出现托管路线,使35B-A3B的成本概况能够与其宣称的数据对照验证。如果数据站得住脚,Ornith-1.5-35B-A3B就是本季度开源权重中的性价比标杆。如果站不住,那些诚实的部分——自我改进方法和MIT权重——无论如何都依然成立。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube