
Ornith-1.5: la famiglia di modelli open-weight che scrive il proprio curriculum di addestramento — e sostiene di superare Claude Opus 4.8
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
Ornith-1.5, la famiglia open-weight di Ornith AI che sostiene di battere Claude Opus 4.8 su quattro benchmark, è stata rilasciata il 19 agosto 2026 — e la cosa che merita attenzione è il ciclo di addestramento, non il numero di parametri. La famiglia comprende tre modelli: Ornith-1.5-397B, un modello di punta mixture-of-experts da 397 miliardi di parametri; Ornith-1.5-35B-A3B, un MoE da 35B che attiva 3 miliardi di parametri per token; e Ornith-1.5-9B, un modello dense da 9B con build mobile quantizzata. Ogni punteggio in primo piano qui è dichiarato dal fornitore: i numeri provengono dalle valutazioni interne di Ornith AI, mediati su cinque esecuzioni, e l'unico tracker di terze parti con un profilo — BenchLM — etichetta tutte le 18 righe dei suoi benchmark come riportate dal fornitore e mantiene la famiglia non classificata finché non esiste una copertura indipendente. Ecco cosa è stato effettivamente rilasciato, cosa significa davvero "auto-miglioramento" e cosa puoi eseguire oggi.
Cosa è stato rilasciato: tre scale, licenza MIT, nessuna API.
Ornith AI — il gruppo dietro i pesi aperti di Ornith-1.0 e associato al lavoro DeepReinforce sui sistemi multi-agente per la programmazione competitiva (GrandCode) e sull'ottimizzazione dei kernel GPU (CUDA-L2) — ha pubblicato la famiglia su Hugging Face con licenza MIT, con quantizzazioni FP8, GGUF, MLX e NVFP4 insieme ai checkpoint grezzi. Una finestra di contesto di 256K token (262.144 token) si applica a tutta la famiglia. Non esiste un'API hosted di prima parte né un prezzo per token; si tratta di un rilascio self-host o per runtime locale, e il report di lancio lo afferma chiaramente.
Le tre scale mirano a tre realtà differenti:
• Ornith-1.5-397B — l'«offerta open-frontier»: un MoE da 397B mirato alla frontiera chiusa su carichi di lavoro agentici e di programmazione.
• Ornith-1.5-35B-A3B — a 35B MoE activating only 3B parameters per token, for the middle ground: near-flagship capability with a fraction of a dense 35B's per-token inference cost.
• Ornith-1.5-9B — a dense 9B for local and on-device use, plus a quantized Ornith-1.5-9B-Mobile build the vendor says is ready to deploy on iPhone and Android.

La pagina di lancio qui sopra è l'intero annuncio: un rapporto tecnico piuttosto che un post di marketing, il che è coerente con il profilo del laboratorio.
L'affermazione sul miglioramento personale, decodificata
Ornith-1.0, released in June 2026, taught a model to generate the scaffolding around coding tasks — the harness, the decomposition, the orchestration. Ornith-1.5 extends that loop to task generation itself. In training, the model now does three things:
• Proponi nuovi compiti di addestramento più difficili.
• Generate the task-specific scaffold used to solve and evaluate those tasks.
• Produce rollout di soluzioni che diventano il suo prossimo ciclo di dati di addestramento.
Il reward fluisce attraverso tutte e tre le fasi, ottimizzato congiuntamente con GRPO. Ogni task proposto viene valutato in base a validità (deve essere eseguibile e verificabile), difficoltà di frontiera (il tasso di successo target è fissato a 0.2 — task che il modello di solito fallisce ma da cui può comunque imparare), e novità (diversità rispetto a tutto ciò che è già stato visto). Lo scaffold riceve un proprio reward per allineamento, fedeltà del reward e resistenza al reward hacking, e la pipeline include salvaguardie anti-hacking: restrizioni sull'accesso all'ambiente di test, monitoraggio dell'accesso a percorsi riservati e un modello di giudizio congelato che sovrascrive i risultati anomali.
L'avvertenza importante sta nella parola "auto-miglioramento": descrive la procedura di addestramento, non l'artefatto. Il modello scaricato non si riaddestra da solo sul tuo laptop. Ciò che ottieni è un modello i cui dati di addestramento sono stati, insolitamente, generati da versioni precedenti di sé stesso — che è esattamente il tipo di affermazione che vale la pena verificare prima che diventi un dogma.
Il benchmark afferma, etichettato onestamente
Tutti i numeri in questa sezione sono di Ornith AI, dal rapporto di lancio, mediati su cinque esecuzioni, e non riprodotti in modo indipendente. Le quattro vittorie dichiarate del modello di punta su Claude Opus 4.8:
• Terminal-Bench 2.1 (harness Terminus-2): Ornith-1.5-397B 86.1 vs Claude Opus 4.8 85.0
• SWE-bench Verified: 86.0 vs 85.8
• WideSearch: 80.8 vs 72.9
• BrowseComp: 86.6 vs 84.3
Leggeteli come affermazioni del fornitore, non fatti. L'unico benchmark di punta in cui Ornith AI non dichiara una vittoria è DeepSWE, 56.0 contro il 59.0 di Claude Opus 4.8 — il rapporto lo presenta come "alla pari", che è il modo onesto di leggere una sconfitta. Altre cifre di punta dello stesso rapporto: HLE 44.6 senza strumenti e 56.1 con essi, GPQA Diamond 92.8 e SWE-bench Pro 65.1.
I due più piccoli sono forti anche sulla carta: Ornith-1.5-35B-A3B riporta SWE-bench Verified 79.0 e Terminal-Bench 2.1 (Claude Code harness) 68.5, mentre Ornith-1.5-9B riporta SWE-bench Verified 70.6 e Terminal-Bench 2.1 47.0. Rispetto ad altri modelli open-weights nello stesso report, Ornith AI confronta l'86.1 Terminal-Bench / 56.0 DeepSWE del 397B con l'82.7 / 54.4 di DeepSeek-V4-Flash-0731 e l'81.0 / 46.2 di GLM-5.2.

L'unico tabellone indipendente — e perché è ancora provvisorio
Il profilo di BenchLM per Ornith-1.5-397B è attualmente l'unica pagina di terze parti sul modello. Il suo titolo: un punteggio pubblico di 68,5 su 100, classificato al 20° posto su 221, con Agentic come categoria più forte al 13° posto. Ma leggete le clausole in piccolo, perché sta facendo un lavoro reale — tutte le 18 righe dei benchmark sono contrassegnate come riportate dal fornitore, e il profilo afferma che il modello "non ha ancora abbastanza copertura basata su fonti per una posizione verificata." Una posizione non classificata nella lista verificata non è un verdetto contro il modello; è un'affermazione che nessuno lo ha ancora eseguito in modo indipendente, che è esattamente ciò che ci si aspetterebbe per un rilascio di pochi giorni fa.

Questo è il divario tra i due numeri in questo articolo: l'86.1 Terminal-Bench del fornitore è un'affermazione, e il 68.5 di BenchLM è un punteggio costruito interamente su righe dichiarate dal fornitore. Nessuno dei due è una misurazione indipendente. Il primo laboratorio che eseguirà Ornith-1.5-397B attraverso un harness pubblico — SWE-bench Verified su un set controllato, Terminal-Bench su una versione fissa dell'harness — produrrà il primo numero che conta.
Cosa puoi effettivamente eseguire oggi
Questa è una release open-weights, quindi "eseguirlo" significa scaricare i pesi. Il catalogo Ollama elenca già ornith-1.5:9b (una build di ~6,6 GB) e ornith-1.5:35b (una build di ~23 GB), entrambi con contesto a 256K; la build 9B include anche il supporto per l'input di immagini nella voce del catalogo. La 397B è un'altra categoria di problema: un MoE con 397B di parametri non è un modello da laptop, e qualsiasi distribuzione seria richiede più GPU e una vera orchestrazione.
Il punto ottimale pratico per la maggior parte dei team è l'Ornith-1.5-35B-A3B: 3B di parametri attivi per token offre le capacità di un MoE a una frazione del costo per token di un denso 35B, e la build Ollama da 23 GB gira su una singola scheda ad alta VRAM o su un piccolo cluster. Il 9B è quello che metti su un telefono.
La proprietà "3B active" è anche il punto in cui l'economia del routing diventa interessante. I MoE a parametri attivi costano molto meno della loro dimensione totale e quando i provider adottano un modello simile, il prezzo per token tende a scendere rapidamente — che è il caso dell'acquisto tramite un router che trasmette i prezzi di listino dei provider con margine dello 0%, invece di un unico vendor con cui negozi una volta sola. OrcaRouter fa esattamente questo su oltre 200 modelli, quindi un taglio di prezzo da parte di un provider su un nuovo modello open-weights è attivo dal nostro lato lo stesso giorno. E per un modello arrivato sul mercato solo con i benchmark del vendor, l'argomento del failover è quello che conta di più: un layer di routing ti permette di indirizzare un percorso di test verso un modello nuovissimo e di ripiegare su uno collaudato nel momento in cui si blocca — provando una release non testata senza scommetterci un percorso di produzione.
Cosa manca ancora
• No hosted API. If you want Ornith-1.5 as a service, it does not exist yet; every option is self-host or local.
• Nessuna valutazione indipendente. BenchLM mantiene la famiglia non classificata; nessun laboratorio ha pubblicato un'esecuzione controllata.
• No pricing to reason about. There is no token rate, so the "cheap open frontier" case is entirely about your own GPU economics.
• Gli harness sono misti. Terminal-Bench ha molteplici varianti, e i numeri del report li attraversano tutti: l'86.1 del 397B proviene dall'harness Terminus-2, il 68.5 del 35B dall'harness Claude Code. Harness diversi sono giochi diversi, il che rende il confronto alla pari più difficile di quanto suggerisca la tabella principale.
Cosa guardare dopo
The durable story is not "open model beats Claude Opus 4.8" — that is an unaudited claim a day old. It is that a lab has closed the loop on self-generated training data and published the weights for scrutiny, and that is the part worth watching. The things that would turn this from a promising release into a trusted one: a first independent run of the 397B on SWE-bench Verified and a fixed Terminal-Bench harness; the evaluation code actually shipping; and a hosted route appearing so the 35B-A3B's cost profile can be measured against its claims. If the numbers hold, Ornith-1.5-35B-A3B is the open-weights price/performance story of the quarter. If they do not, the honest part — the self-improvement method and the MIT weights — survives either way.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
