
Ornith-1.5:自行编写训练课程的开放权重模型系列——并声称击败 Claude Opus 4.8
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
Ornith-1.5,来自 Ornith AI 的开权重模型系列,号称在四项基准测试中击败 Claude Opus 4.8,于 2026 年 8 月 19 日发布——而真正值得驻足关注的是其训练循环,而非参数数量。该系列共有三款模型:Ornith-1.5-397B,一款 3970 亿参数的混合专家(MoE)旗舰模型;Ornith-1.5-35B-A3B,一款 350 亿参数的 MoE,每个 token 激活 30 亿参数;以及 Ornith-1.5-9B,一款 90 亿参数的稠密模型,配有量化移动端构建。这里的所有头条分数均来自厂商自报:数据出自 Ornith AI 自身的评估运行,取五次运行的平均值;唯一设有专属页面的第三方追踪平台 BenchLM 将其 18 行基准数据全部标注为“厂商报告”,在该系列获得独立评测覆盖之前不予排名。以下是实际发布的内容、“自我改进”的真正含义,以及你今天就能上手运行的东西。
本次发布:三个量表、MIT 许可证、无 API
Ornith AI —— 开放权重 Ornith-1.0 背后的团队,也是 DeepReinforce 在竞赛编程多智能体系统(GrandCode)和 GPU 内核优化(CUDA-L2)方面工作的关联团队 —— 已在 Hugging Face 上以 MIT 许可证发布了该系列模型,除原始检查点外,还提供了 FP8、GGUF、MLX 和 NVFP4 量化版本。整个系列均支持 256K 上下文窗口(262,144 个 token)。没有第一方托管的 API,也没有 token 定价;这是一次自托管或本地运行时发布,发布报告中也明确说明了这一点。
这三个量表针对三种不同的现实:
• Ornith-1.5-397B — “开源前沿竞标”:一个397B参数的MoE模型,旨在智能体与编码工作负载方面挑战封闭前沿。
• Ornith-1.5-35B-A3B — 一款35B参数的MoE模型,每个token仅激活3B参数,定位中间地带:接近旗舰级的能力,同时每token推理成本仅为稠密35B模型的一小部分。
• Ornith-1.5-9B —— 一个稠密9B模型,适用于本地及设备端使用;另有量化版Ornith-1.5-9B-Mobile,供应商称其已可在iPhone和Android上部署。

上面的发布页面就是完整的公告:这是一份技术报告,而非营销帖子,与该实验室的定位一致。
解码自我提升的说法
Ornith-1.0 于2026年6月发布,教会了模型生成编码任务周围的脚手架——测试框架、任务分解、流程编排。Ornith-1.5 将这一循环扩展到任务生成本身。在训练中,模型现在做三件事:
• 提出新的、更难的训练任务。
• 生成用于解决和评估这些任务的特定任务脚手架。
生成解决方案的推演结果,作为其下一轮训练数据。
奖励贯穿所有三个阶段,并通过GRPO进行联合优化。每个提议的任务都根据有效性(必须可执行且可验证)、前沿难度(目标解决成功率设为0.2——模型通常失败但仍能从中学习的任务)和新颖性(与已见内容的多样性)进行评分。脚手架因其对齐性、奖励保真度和对奖励黑客行为的抵抗力而获得自身奖励,并且该流水线包含反黑客保障措施:限制接触测试环境、监控受限路径访问,以及一个冻结的裁决模型来覆盖异常结果。
关键警告在于“自我改进”这个词:它描述的是训练过程,而非产物。下载的模型并不会在你的笔记本电脑上重新训练自己。你得到的,是一个训练数据异乎寻常地由自身早期版本生成的模型——而这正是那种在成为教条之前值得检验的说法。
The benchmark claims, honestly labeled
本节中所有数字均为 Ornith AI 自行提供,来自发布报告,取五次运行的平均值,且未经独立复现。该旗舰机型声称对 Claude Opus 4.8 的四大胜绩:
• Terminal-Bench 2.1(Terminus-2 测试框架):Ornith-1.5-397B 86.1 对比 Claude Opus 4.8 85.0
• SWE-bench Verified:86.0 对比 85.8
• WideSearch:80.8 vs 72.9
• BrowseComp: 86.6 对比 84.3
把这些当作供应商的说辞,而非事实。Ornith AI 唯一没有宣称获胜的旗舰基准是 DeepSWE:56.0 对 Claude Opus 4.8 的 59.0——报告将其描述为“不相上下”,这是对失利最诚实的解读。同一份报告中的其他旗舰数据:HLE 不使用工具为 44.6,使用工具为 56.1;GPQA Diamond 为 92.8;SWE-bench Pro 为 65.1。
较小的两个模型从纸面数据来看也很强:Ornith-1.5-35B-A3B报告SWE-bench Verified 79.0、Terminal-Bench 2.1(Claude Code测试框架)68.5,而Ornith-1.5-9B报告SWE-bench Verified 70.6、Terminal-Bench 2.1 47.0。在同一报告中与其他开源权重模型相比,Ornith AI将397B的86.1 Terminal-Bench / 56.0 DeepSWE与DeepSeek-V4-Flash-0731的82.7 / 54.4以及GLM-5.2的81.0 / 46.2进行对比。

唯一的独立记分牌——以及为何它仍是临时性的
BenchLM 上关于 Ornith-1.5-397B 的档案是目前该模型唯一的第三方页面。其头条数据为:公开得分 68.5 分(满分 100 分),在 221 个模型中排名第 20,其中 Agentic 类别表现最强,位列第 13。但请留意细则,因为这些数据确实有其意义——全部 18 行基准测试结果均标注为“提供商报告”,档案页面还指出该模型“尚未获得足够的来源覆盖以取得认证排名”。在认证名单上未获排名并不代表对该模型的否定;这只是说明还没有人独立运行过该模型,而这正是一个发布仅数日的模型应有的状态。

这就是本文中两个数字之间的差距:供应商的 86.1 Terminal-Bench 只是一个声称值,而 BenchLM 的 68.5 则是完全基于供应商所报告数据行构建的分数。两者都不是独立测量结果。第一个通过公共测试框架运行 Ornith-1.5-397B 的实验室——在受控集合上运行 SWE-bench Verified,在固定测试框架版本上运行 Terminal-Bench——将产生第一个真正算数的数字。
你今天可以实际运行的内容
这是一个开放权重的发布,所以“运行它”意味着拉取权重。Ollama 目录中已经列出了 ornith-1.5:9b(约 6.6 GB 的构建)和 ornith-1.5:35b(约 23 GB 的构建),两者均支持 256K 上下文;9B 构建在目录条目中还带有图像输入支持。397B 则是另一类问题:一个 397B 参数的 MoE 不是笔记本电脑能跑的模型,任何正经部署都意味着多块 GPU 和真正的编排。
对大多数团队来说,最实用的甜点为 Ornith-1.5-35B-A3B:每个 token 只要 3B 激活参数,就能以稠密 35B 模型每 token 成本的一小部分获得 MoE 的能力,而且 23 GB 的 Ollama 构建可在单块高显存显卡或小型集群上运行。9B 版本则是放在手机上用的那款。
那个“3B active”属性也正是路由经济学变得有趣的地方。激活参数的MoE定价远低于其总规模,而当服务商采用这样的模型时,每token的价格往往会迅速下降——这正是通过路由器购买的情况:路由器以0%加价直接传递服务商的标价,而不是你只需谈判一次的单一供应商。OrcaRouter在200+个模型上正是这样做的,因此服务商对新开放权重模型的降价当天就会在我们这边生效。而对于一个除了供应商基准测试之外别无他物的模型,故障转移的论点最为关键:路由层让你将测试路径指向一个全新模型,并在它一停顿时回退到经过验证的模型——无需将生产路径押注在一个未经证实的发布上。
还缺少什么
• 没有托管的 API。如果你想将 Ornith-1.5 作为服务使用,它还不存在;所有选项都是自托管或本地部署。
• 没有独立评估。BenchLM 使该系列保持未排名状态;没有实验室发布过受控运行。
• 无需考虑定价。没有令牌费率,因此“廉价开放前沿”的情况完全取决于你自己的GPU经济性。
• 这些评测框架是混合的。Terminal-Bench 有多个变体,而报告自己的数据也横跨这些变体:397B 的 86.1 是基于 Terminus-2 评测框架,35B 的 68.5 则是基于 Claude Code 评测框架。不同的评测框架就像不同的游戏,这使得同类比较比标题表格所暗示的要困难得多。
接下来看什么
持久的故事不是“开源模型击败Claude Opus 4.8”——那只是一个诞生一天的、未经审计的说法。真正重要的是,某家实验室在自生成训练数据上完成了闭环,并把权重公之于众供人审视,这才是值得关注的部分。要让这次发布从“有前景”变成“可信赖”,需要的条件包括:在SWE-bench Verified上对397B进行首次独立运行,同时配合修复后的Terminal-Bench测试框架;评估代码真正随附发布;以及出现托管路线,使35B-A3B的成本概况能够与其宣称的数据对照验证。如果数据站得住脚,Ornith-1.5-35B-A3B就是本季度开源权重中的性价比标杆。如果站不住,那些诚实的部分——自我改进方法和MIT权重——无论如何都依然成立。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
