
Ornith-1.5: De modelfamilie met open gewichten die haar eigen trainingscurriculum schrijft — en beweert Claude Opus 4.8 te verslaan
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 218 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 123 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 931 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 101 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Ornith-1.5, de open-gewichtfamilie van Ornith AI die beweert Claude Opus 4.8 te verslaan op vier benchmarks, werd uitgebracht op 19 augustus 2026 — en waar je echt bij stil moet staan is de trainingslus, niet het aantal parameters. De familie bestaat uit drie modellen: Ornith-1.5-397B, een vlaggenschip met 397 miljard parameters en een mixture-of-experts-architectuur; Ornith-1.5-35B-A3B, een 35B-MoE die 3 miljard parameters per token activeert; en Ornith-1.5-9B, een dense 9B-model met een gekwantiseerde mobiele build. Alle opvallende scores hier zijn door de leverancier gerapporteerd: de cijfers komen uit Ornith AI's eigen evaluatieruns, gemiddeld over vijf runs, en de enige externe tracker met een profiel — BenchLM — bestempelt alle 18 benchmarkrijen als leveranciersgerapporteerd en houdt de familie ongeklasseerd totdat er onafhankelijke dekking is. Hier is wat er daadwerkelijk is uitgebracht, wat 'zelfverbeterend' echt betekent, en wat je vandaag kunt draaien.
Wat er is uitgebracht: drie schalen, MIT-licentie, geen API
Ornith AI — de groep achter de open-gewichten Ornith-1.0 en gelieerd aan het DeepReinforce-werk rond multi-agent systemen voor competitief programmeren (GrandCode) en GPU-kerneloptimalisatie (CUDA-L2) — heeft de familie op Hugging Face uitgebracht onder een MIT-licentie, met FP8-, GGUF-, MLX- en NVFP4-kwantificeringen naast de ruwe checkpoints. Een contextvenster van 256K (262.144 tokens) geldt voor de gehele familie. Er is geen eigen gehoste API en geen tokenprijs; dit is een self-host- of lokale-runtime-release, en dat staat duidelijk in het lanceringsrapport.
De drie schalen richten zich op drie verschillende realiteiten:
• Ornith-1.5-397B — het "open-frontier bod": een 397B MoE gericht op de gesloten frontier voor agentische en codeer-workloads.
• Ornith-1.5-35B-A3B — een 35B MoE die slechts 3B parameters per token activeert, voor het midden: bijna-vlaggenschipcapaciteit tegen een fractie van de inferentiekosten per token van een dichte 35B.
• Ornith-1.5-9B — een dense 9B voor lokaal en on-device gebruik, plus een gekwantificeerde Ornith-1.5-9B-Mobile build waarvan de leverancier zegt dat deze klaar is voor implementatie op iPhone en Android.

De bovenstaande lanceerpagina is de volledige aankondiging: een technisch rapport in plaats van een marketingbericht, wat consistent is met het profiel van het lab.
De zelfverbeteringsclaim, ontcijferd.
Ornith-1.0, uitgebracht in juni 2026, leerde een model om het raamwerk rond codeertaken te genereren — de harness, de decompositie, de orchestratie. Ornith-1.5 breidt die lus uit naar de taakgeneratie zelf. Tijdens de training doet het model nu drie dingen:
• Stel nieuwe, moeilijkere trainingstaken voor.
• Genereer de taakspecifieke scaffold die wordt gebruikt om die taken op te lossen en te evalueren.
• Produceer oplossingsrollouts die de volgende ronde trainingsdata worden.
Beloning stroomt door alle drie de fasen, gezamenlijk geoptimaliseerd met GRPO. Elke voorgestelde taak wordt beoordeeld op geldigheid (deze moet uitvoerbaar en verifieerbaar zijn), frontier-moeilijkheid (het beoogde slagingspercentage is vastgesteld op 0.2 — taken waar het model meestal op faalt maar toch van kan leren), en nieuwigheid (diversiteit ten opzichte van alles wat al gezien is). Het scaffold ontvangt een eigen beloning voor afstemming, getrouwheid van de beloning en weerstand tegen reward hacking, en de pijplijn bevat anti-hacking-beveiligingen: beperkingen op het aanraken van de testomgeving, monitoring van toegang tot beperkte paden, en een bevroren beoordelingsmodel dat afwijkende resultaten overruled.
De belangrijke kanttekening zit in het woord "zelfverbetering": het beschrijft de trainingsprocedure, niet het artefact. Het gedownloade model traint zichzelf niet opnieuw op je laptop. Wat je krijgt is een model waarvan de trainingsgegevens ongebruikelijk werden gegenereerd door eerdere versies van zichzelf — wat precies het soort bewering is dat het testen waard is voordat het dogma wordt.
De beweringen van de benchmark, eerlijk gelabeld
Alle cijfers in deze sectie zijn afkomstig van Ornith AI zelf, uit het lanceringsrapport, gemiddeld over vijf runs, en niet onafhankelijk gereproduceerd. De vier geclaimde overwinningen van het vlaggenschip op Claude Opus 4.8:
• Terminal-Bench 2.1 (Terminus-2 harness): Ornith-1.5-397B 86.1 vs Claude Opus 4.8 85.0
SWE-bench Verified: 86,0 versus 85,8
• WideSearch: 80.8 tegen 72.9
• BrowseComp: 86.6 vs 84.3
Beschouw die als leveranciersclaims, niet als feiten. De enige vlaggenschipbenchmark waar Ornith AI geen overwinning claimt, is DeepSWE, 56.0 tegenover 59.0 van Claude Opus 4.8 — het rapport omschrijft het als 'op gelijke hoogte', wat de eerlijke manier is om een verlies te lezen. Andere vlaggenschipcijfers uit hetzelfde rapport: HLE 44.6 zonder tools en 56.1 met tools, GPQA Diamond 92.8 en SWE-bench Pro 65.1.
De twee kleinere zijn op papier ook sterk: Ornith-1.5-35B-A3B rapporteert 79.0 op SWE-bench Verified en 68.5 op Terminal-Bench 2.1 (Claude Code harness), terwijl Ornith-1.5-9B 70.6 op SWE-bench Verified en 47.0 op Terminal-Bench 2.1 rapporteert. Tegenover andere open-weights modellen in hetzelfde rapport vergelijkt Ornith AI de 397B (86.1 Terminal-Bench / 56.0 DeepSWE) met DeepSeek-V4-Flash-0731 (82.7 / 54.4) en GLM-5.2 (81.0 / 46.2).

Het enige onafhankelijke scorebord — en waarom het nog steeds voorlopig is
Het profiel van BenchLM voor Ornith-1.5-397B is momenteel de enige externe pagina over het model. De kop: een publieke score van 68,5 van de 100, op #20 van de 221, met Agentic als sterkste categorie op #13. Maar lees de kleine lettertjes, want het doet echt werk — alle 18 benchmarkrijen zijn gemarkeerd als provider-reported, en het profiel stelt dat het model "nog niet genoeg met bronnen onderbouwde dekking heeft voor een geverifieerde positie." Een niet-gerangschikte positie op de geverifieerde lijst is geen oordeel tegen het model; het is een verklaring dat niemand het nog onafhankelijk heeft gedraaid, wat precies is wat je zou verwachten voor een release van een paar dagen oud.

Dat is de kloof tussen de twee getallen in dit artikel: de 86.1 Terminal-Bench van de leverancier is een bewering, en de 68.5 van BenchLM is een score die volledig is gebouwd op door de leverancier gerapporteerde rijen. Geen van beide is een onafhankelijke meting. Het eerste lab dat Ornith-1.5-397B door een publieke testopstelling draait — SWE-bench Verified op een gecontroleerde set, Terminal-Bench op een vaste versie van de testopstelling — zal het eerste getal produceren dat telt.
Wat je vandaag daadwerkelijk kunt uitvoeren
Dit is een release met open gewichten, dus "draaien" betekent de gewichten ophalen. De Ollama-catalogus vermeldt al ornith-1.5:9b (een build van circa 6,6 GB) en ornith-1.5:35b (een build van circa 23 GB), beide met 256K context; de 9B-build ondersteunt in de catalogus ook beeldinvoer. De 397B is een probleem van een andere categorie: een MoE met 397B parameters is geen laptopmodel, en een serieuze implementatie vereist meerdere GPU's en echte orkestratie.
Voor de meeste teams is de Ornith-1.5-35B-A3B de praktische sweet spot: 3B actieve parameters per token levert de prestaties van een MoE op tegen een fractie van de kosten per token van een dichte 35B, en de 23 GB Ollama-build draait op een enkele kaart met veel VRAM of een klein cluster. De 9B is degene die je op een telefoon zet.
Die "3B active"-eigenschap is ook waar de routeringseconomie interessant wordt. De prijs van MoE's met actieve parameters ligt ver onder hun totale omvang, en wanneer providers zo'n model adopteren, daalt de prijs per token doorgaans snel — wat het geval is bij aankoop via een router die de catalogusprijzen van providers met 0% opslag doorgeeft, in plaats van via één leverancier waar je één keer mee onderhandelt. OrcaRouter doet precies dat bij 200+ modellen, dus een prijsverlaging door een provider op een nieuw open-weights-model is dezelfde dag al live bij ons. En voor een model dat op de markt kwam met niets anders dan leveranciersbenchmarks, weegt het failover-argument het zwaarst: een routeringslaag laat je een testpad naar een gloednieuw model leiden en terugvallen op een bewezen model zodra het hapert — een onbewezen release uitproberen zonder er een productiepad aan te wagen.
Wat ontbreekt er nog?
Geen gehoste API. Als je Ornith-1.5 als dienst wilt, bestaat dat nog niet; elke optie is self-host of lokaal.
• Geen onafhankelijke evaluatie. BenchLM houdt de familie ongeplaatst; geen enkel laboratorium heeft een gecontroleerde run gepubliceerd.
• Geen prijzen om over na te denken. Er is geen tokentarief, dus de 'goedkope open frontier'-casus draait volledig om je eigen GPU-economie.
De testomgevingen zijn gemengd. Terminal-Bench heeft meerdere varianten, en de cijfers in het rapport beslaan ze allemaal: de 86,1 van de 397B is op de Terminus-2-testomgeving, de 68,5 van de 35B op de Claude Code-testomgeving. Verschillende testomgevingen zijn verschillende spellen, wat een appels-met-appels-vergelijking lastiger maakt dan de hoofdtabel suggereert.
Wat nu te kijken
Het blijvende verhaal is niet "open model verslaat Claude Opus 4.8" — dat is een niet-gecontroleerde claim van een dag oud. Het is dat een lab de lus van zelf gegenereerde trainingsdata heeft gesloten en de gewichten ter inspectie heeft gepubliceerd, en dat is het deel dat de moeite waard is om in de gaten te houden. De dingen die dit van een veelbelovende release in een vertrouwde zouden veranderen: een eerste onafhankelijke run van de 397B op SWE-bench Verified en een opgeloste Terminal-Bench-harness; de evaluatiecode die daadwerkelijk wordt meegeleverd; en een gehoste route die verschijnt zodat het kostenprofiel van de 35B-A3B tegen de claims kan worden afgemeten. Als de cijfers standhouden, is Ornith-1.5-35B-A3B het prijs/prestatieverhaal van dit kwartaal voor open gewichten. Als ze dat niet doen, overleeft het eerlijke deel — de zelfverbeteringsmethode en de MIT-gewichten — hoe dan ook.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
