
Ornith-1.5:開放權重模型系列,能自行編寫訓練課程——並宣稱擊敗 Claude Opus 4.8
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 218 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 123 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 931 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 101 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Ornith-1.5 是 Ornith AI 推出的開源權重模型系列,號稱在四項基準測試中勝過 Claude Opus 4.8,於 2026 年 8 月 19 日正式發布——而真正值得駐足細看的,是它的訓練迴圈,而非參數量。該系列包含三個模型:Ornith-1.5-397B,一款 3970 億參數的混合專家(MoE)旗艦;Ornith-1.5-35B-A3B,一款 350 億參數的 MoE,每個 token 僅啟動 30 億參數;以及 Ornith-1.5-9B,一款 90 億參數的稠密模型,配備量化行動端建置版本。這裡每一項搶眼的分數都是供應商自行回報的:數據來自 Ornith AI 自家評測,取五次平均;而唯一為其建立檔案頁面的第三方追蹤平台 BenchLM,則將全部 18 列基準測試結果標註為供應商回報,在獨立第三方評測出現之前,不讓該系列參與排名。以下就是實際發布的內容、「自我改進」的真正意義,以及你現在就能執行的事。
發佈內容:三個量表,MIT 授權,無 API
Ornith AI——開放權重 Ornith-1.0 背後的團隊,同時也是 DeepReinforce 在競賽程式設計多智能體系統(GrandCode)與 GPU 核心最佳化(CUDA-L2)相關工作的參與者——已於 Hugging Face 上以 MIT 授權發布該系列模型,除原始檢查點外,另提供 FP8、GGUF、MLX 與 NVFP4 量化版本。該系列全數支援 256K 上下文視窗(262,144 個 token)。此發布未附帶官方託管 API,亦無 token 定價;這是一次自架或本機執行環境的發布,發布報告也明確如此說明。
這三個量表針對三種不同的現實:
• Ornith-1.5-397B ——「開放前沿的角逐者」:一個 397B 參數的 MoE 模型,旨在挑戰代理型(agentic)與程式編寫(coding)工作負載上的閉源前沿。
• Ornith-1.5-35B-A3B — 一款 35B MoE 模型,每個 token 僅啟用 3B 參數,主打中間地帶:只需密集 35B 模型每 token 推論成本的一小部分,就能獲得接近旗艦級的能力。
• Ornith-1.5-9B — 一款專為本機與裝置端使用而設計的密集 9B 模型,另附量化版本的 Ornith-1.5-9B-Mobile 建置,供應商表示已可部署於 iPhone 與 Android。

上面的發布頁面就是完整的公告:這是一份技術報告,而非行銷貼文,這與該實驗室的定位一致。
解碼自我提升的說法
Ornith-1.0 於 2026 年 6 月發布,教導模型生成編碼任務周圍的脚手架——即測試框架、任務分解與編排。Ornith-1.5 將此循環擴展至任務生成本身。在訓練中,模型現在執行三件事:
• 提出新的、更困難的訓練任務。
• 生成用於解決和評估這些任務的特定任務支架。
• 產生解決方案展開,作為其下一輪的訓練資料。
獎勵流經所有三個階段,並透過 GRPO 進行聯合優化。每個提議的任務會依據有效性(必須可執行且可驗證)、前沿難度(目標解決成功率設定為 0.2——即模型通常失敗但仍能從中學習的任務)以及新穎性(與已見內容的多樣性差異)來評分。支架(scaffold)因其對齊性、獎勵保真度以及對獎勵駭客攻擊的抵抗力而獲得自身獎勵,且該流程包含反駭客攻擊保障措施:限制接觸測試環境、監控受限路徑的存取,以及一個凍結的裁決模型來覆寫異常結果。
重要的警示在於「自我改進」這個詞:它描述的是訓練過程,而非產物。下載的模型不會在你的筆電上重新訓練自己。你得到的是這樣一個模型:它的訓練資料非同尋常地由更早版本的自身所產生——這正是那種在成為教條之前值得檢驗的主張。
該基準測試的宣稱,已如實標示
本節中的所有數字均為 Ornith AI 自行提供,來自發布報告,並在五次運行中取平均值,且未經獨立重現。旗艦產品宣稱對 Claude Opus 4.8 的四項勝出:
• Terminal-Bench 2.1(Terminus-2 測試框架):Ornith-1.5-397B 86.1 對比 Claude Opus 4.8 85.0
• SWE-bench Verified:86.0 對比 85.8
• WideSearch:80.8 對比 72.9
• BrowseComp:86.6 對 84.3
將這些視為廠商說法,而非事實。Ornith AI 未宣稱勝出的唯一旗艦基準是 DeepSWE,56.0 對上 Claude Opus 4.8 的 59.0——報告將其描述為「持平」,這是誠實解讀敗績的方式。同一份報告中的其他旗艦數據:HLE 未使用工具為 44.6,使用工具為 56.1;GPQA Diamond 92.8;SWE-bench Pro 65.1。
較小的兩款在紙面上也很強勁:Ornith-1.5-35B-A3B 報告 SWE-bench Verified 79.0、Terminal-Bench 2.1(Claude Code 測試框架)68.5,而 Ornith-1.5-9B 報告 SWE-bench Verified 70.6、Terminal-Bench 2.1 47.0。在同一份報告中,與其他開放權重模型相比,Ornith AI 將 397B 的 86.1 Terminal-Bench / 56.0 DeepSWE 與 DeepSeek-V4-Flash-0731 的 82.7 / 54.4 及 GLM-5.2 的 81.0 / 46.2 進行比較。

唯一的那個獨立記分板——以及為何它仍然只是暫時的
BenchLM 上 Ornith-1.5-397B 的個人資料頁面,是目前唯一關於該模型的第三方頁面。其標題資訊為:公開分數 68.5 分(滿分 100),在 221 個模型中排名第 20,其中 Agentic 是最強類別,排名第 13。但請仔細閱讀細則,因為這確實有其意義——全部 18 個基準測試列都標記為「供應商回報」,且該個人資料頁面聲明此模型「尚無足夠的來源涵蓋範圍以獲得經認證的排名」。在經認證清單上未獲排名,並非對該模型的負面評價;而是表明目前尚無任何人獨立對其進行測試,而這正是對於發布僅數日的模型所應有的預期。

這就是本文中兩個數字之間的差距:{{1}}廠商的 Terminal-Bench 86.1{{/1}}是{{2}}一項宣稱{{/2}},而{{3}}BenchLM 的 68.5{{/3}}是{{4}}完全基於廠商回報之資料列的分數{{/4}}。兩者皆非獨立量測。第一個將{{5}}Ornith-1.5-397B{{/5}}放上公開測試框架執行的實驗室——在受控測試集上執行{{6}}SWE-bench Verified{{/6}},在固定框架版本上執行{{7}}Terminal-Bench{{/7}}——將產生{{8}}第一個真正算數的數字{{/8}}。
你今天實際能運行什麼
這是一個開放權重版本,所以「執行它」意味著拉取權重。Ollama 目錄中已經列出了 ornith-1.5:9b(約 6.6 GB 的版本)和 ornith-1.5:35b(約 23 GB 的版本),兩者都支援 256K 上下文;9B 版本在目錄條目中還帶有影像輸入支援。397B 則是另一類問題:一個 397B 參數的 MoE 不是筆電等級的模型,任何認真的部署都意味著多張 GPU 和真正的編排協調。
對大多數團隊而言,最實際的甜蜜點是 Ornith-1.5-35B-A3B:每個 token 只需 3B 個活躍參數,就能以密集式 35B 模型每 token 成本的一小部分,獲得 MoE 的效能;而 23 GB 的 Ollama 版本可在一張高 VRAM 顯示卡或小型叢集上執行。9B 版本則是你放在手機上的選擇。
「3B active」這個屬性也是路由經濟效益變得有趣的地方。活化參數的MoE定價遠低於其總參數規模,而當供應商採用這類模型時,每token的價格往往會快速下跌——透過路由器購買正是這種情況,路由器以0%加成直接轉傳供應商的牌價,而不是跟單一供應商一次性議價。OrcaRouter在200多個模型上正是如此運作,因此供應商對新款開放權重模型的降價,當天就會在我們這邊生效。而對於一個發布時只有供應商基準測試數據的模型來說,故障轉移的論點最為重要:路由層讓你將測試路徑指向一個全新模型,並在它一出現停滯時就回退到經過驗證的模型——如此便能嘗試未經驗證的版本,而不必拿生產路徑做賭注。
還缺少什麼
• 沒有託管的 API。如果您想要將 Ornith-1.5 作為服務使用,目前尚不存在;所有選項都是自行託管或本機。
• 沒有獨立評估。BenchLM 讓該系列保持未排名;沒有實驗室發表過受控運行。
• 無需考慮定價。沒有 token 費率,因此「廉價開放前沿」的情況完全取決於您自己的 GPU 經濟效益。
• 這些評測框架並不統一。Terminal-Bench 有多個變體,而報告自己的數字就橫跨這些變體:397B 的 86.1 分是在 Terminus-2 框架上,35B 的 68.5 分則是在 Claude Code 框架上。不同的框架就是不同的遊戲,這讓同基準比較比標題表格所暗示的更困難。
接下來要看什麼
真正持久的看點,不在於「開源模型擊敗 Claude Opus 4.8」——那只不過是未經審核、一天前才出現的說法。真正的重點是,某個實驗室在自我生成的訓練資料上形成了閉環,並將權重公開供外界檢視——這才是值得關注的部分。要讓這次發布從「有潛力」變成「可信賴」,需要看到:397B 在 SWE-bench Verified 上的首次獨立評測、修正後的 Terminal-Bench 測試框架;評估程式碼確實隨附發布;以及出現託管服務,使 35B-A3B 的成本表現能與其宣稱相互對照。如果這些數字經得起考驗,Ornith-1.5-35B-A3B 就是本季度開源權重的性價比代表作;如果經不起考驗,那些誠實的部分——自我改進方法與 MIT 授權的權重——無論如何都會留存下來。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
