
Ornith-1.5: Modellfamiljen med öppna vikter som skriver sin egen träningsplan — och hävdar sig slå Claude Opus 4.8
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 218 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 123 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 931 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 101 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Ornith-1.5, familjen med öppna vikter från Ornith AI som enligt uppgift slår Claude Opus 4.8 på fyra benchmarks, släpptes den 19 augusti 2026 – och det som är värt att stanna upp för är träningsloopen, inte antalet parametrar. Familjen består av tre modeller: Ornith-1.5-397B, en flaggskeppsmodell med 397 miljarder parametrar och mixture-of-experts; Ornith-1.5-35B-A3B, en 35B MoE som aktiverar 3 miljarder parametrar per token; och Ornith-1.5-9B, en 9B tät modell med en kvantiserad mobilversion. Alla rubriksiffror här är leverantörsrapporterade: siffrorna kommer från Ornith AI:s egna utvärderingskörningar, genomsnitt av fem, och den enda tredjepartsspårare som har en profil – BenchLM – märker alla 18 av sina benchmarkrader som leverantörsrapporterade och håller familjen utan rankning tills oberoende bevakning finns. Här är vad som faktiskt släpptes, vad ”självförbättrande” egentligen betyder, och vad du kan köra idag.
Vad som släpptes: tre skalor, MIT-licens, inget API.
Ornith AI — gruppen bakom open-weights-modellen Ornith-1.0 och associerad med DeepReinforce-arbetet kring multiagentsystem för tävlingsprogrammering (GrandCode) och GPU-kerneloptimering (CUDA-L2) — släppte familjen på Hugging Face under en MIT-licens, med FP8-, GGUF-, MLX- och NVFP4-kvantiseringar tillsammans med de råa checkpoints. Ett 256K-kontextfönster (262 144 token) gäller för hela familjen. Det finns inget förstapartshanterat API och inget tokenpris; detta är en self-host- eller lokal-runtime-release, och lanseringsrapporten säger det tydligt.
De tre skalorna riktar sig mot tre olika verkligheter:
• Ornith-1.5-397B — "open-frontier-budet": en 397B MoE riktad mot den stängda frontlinjen för agentiska och kodningsarbetsbelastningar.
• Ornith-1.5-35B-A3B — en 35B MoE som aktiverar endast 3B parametrar per token, för mellanvägen: nästan flaggskeppsförmåga till en bråkdel av en tät 35B:s inferenskostnad per token.
• Ornith-1.5-9B — en tät 9B-modell för lokalt bruk och användning på enheten, plus en kvantiserad Ornith-1.5-9B-Mobile-bygge som leverantören uppger är redo att distribueras på iPhone och Android.

Lanseringssidan ovan är hela tillkännagivandet: en teknisk rapport snarare än ett marknadsföringsinlägg, vilket är i linje med labbets profil.
Självförbättringspåståendet, avkodat
Ornith-1.0, som släpptes i juni 2026, lärde en modell att generera stödstrukturen kring kodningsuppgifter – harneshet, nedbrytningen och orkestreringen. Ornith-1.5 utökar den loopen till själva uppgiftsgenereringen. Under träningen gör modellen nu tre saker:
• Föreslå nya, svårare träningsuppgifter.
Generera den uppgiftsspecifika stommen som används för att lösa och utvärdera dessa uppgifter.
• Producera lösningssekvenser som blir dess nästa omgång av träningsdata.
Belöning flödar genom alla tre steg, gemensamt optimerad med GRPO. Varje föreslagen uppgift poängsätts utifrån validitet (den måste vara utförbar och verifierbar), gränssvårighet (målframgångsfrekvensen sätts till 0,2 — uppgifter som modellen vanligtvis misslyckas med men ändå kan lära sig av) och nyhet (mångfald gentemot allt som redan setts). Byggställningen får sin egen belöning för anpassning, belöningstrohet och motståndskraft mot belöningshackning, och pipelinen inkluderar skyddsåtgärder mot hackning: begränsningar för att röra testmiljön, övervakning av åtkomst till begränsade sökvägar och en fryst bedömningsmodell som åsidosätter avvikande resultat.
Det viktiga förbehållet ligger i ordet "självförbättring": det beskriver träningsproceduren, inte artefakten. Den nedladdade modellen tränar inte om sig själv på din bärbara dator. Vad du får är en modell vars träningsdata, ovanligt nog, genererades av tidigare versioner av sig själv — vilket är precis den typen av påstående som är värt att testa innan det blir dogm.
Benchmarken hävdar, ärligt märkt.
Alla siffror i detta avsnitt är Ornith AIs egna, hämtade från lanseringsrapporten, beräknade som genomsnitt över fem körningar, och inte oberoende reproducerade. Flaggskeppets fyra påstådda vinster över Claude Opus 4.8:
• Terminal-Bench 2.1 (Terminus-2-testmiljö): Ornith-1.5-397B 86.1 mot Claude Opus 4.8 85.0
• SWE-bench Verified: 86.0 mot 85.8
• WideSearch: 80.8 mot 72.9
• BrowseComp: 86.6 vs 84.3
Läs dessa som leverantörspåståenden, inte fakta. Det enda flaggskeppsriktmärket där Ornith AI inte gör anspråk på en seger är DeepSWE, 56.0 mot Claude Opus 4.8:s 59.0 – rapporten framställer det som "i paritet", vilket är det ärliga sättet att tolka en förlust. Övriga flaggskeppssiffror från samma rapport: HLE 44.6 utan verktyg och 56.1 med dem, GPQA Diamond 92.8 och SWE-bench Pro 65.1.
De två mindre är också starka på pappret: Ornith-1.5-35B-A3B rapporterar SWE-bench Verified 79,0 och Terminal-Bench 2.1 (Claude Code-harness) 68,5, medan Ornith-1.5-9B rapporterar SWE-bench Verified 70,6 och Terminal-Bench 2.1 47,0. Mot andra open-weights-modeller i samma rapport jämför Ornith AI 397B:ns 86,1 Terminal-Bench / 56,0 DeepSWE med DeepSeek-V4-Flash-0731:s 82,7 / 54,4 och GLM-5.2:s 81,0 / 46,2.

Den enda oberoende poängtavlan — och varför den fortfarande är provisorisk
BenchLMs profil för Ornith-1.5-397B är för närvarande den enda tredjepartssidan om modellen. Dess rubrik: ett offentligt resultat på 68,5 av 100, rankad #20 av 221, med Agentic som starkaste kategori på #13. Men läs det finstilta, för det gör ett verkligt arbete — alla 18 benchmark-rader är markerade som leverantörsrapporterade, och profilen anger att modellen ”ännu inte har tillräcklig källdokumentation för en verifierad position”. En orankad position på den verifierade listan är ingen dom mot modellen; det är ett uttalande om att ingen ännu har kört den oberoende, vilket är precis vad du kan förvänta dig av en release som bara är några dagar gammal.

Det är gapet mellan de två siffrorna i den här artikeln: leverantörens 86.1 i Terminal-Bench är ett påstående, och BenchLM:s 68.5 är ett resultat som helt bygger på leverantörsrapporterade rader. Ingen av dem är en oberoende mätning. Det första labbet som kör Ornith-1.5-397B genom en publik testmiljö — SWE-bench Verified på en kontrollerad uppsättning, Terminal-Bench på en fast harnessversion — kommer att producera den första siffran som räknas.
Vad du faktiskt kan köra idag
Detta är en release med öppna vikter, så "köra den" innebär att ladda ner vikterna. Ollama-katalogen listar redan ornith-1.5:9b (en ~6,6 GB-build) och ornith-1.5:35b (en ~23 GB-build), båda med 256K kontext; 9B-builden har också stöd för bildinmatning i katalogposten. 397B är en annan kategori av problem: en MoE med 397B parametrar är inte en laptopmodell, och varje seriös driftsättning innebär flera GPU:er och riktig orkestrering.
Den praktiska sweet spoten för de flesta team är Ornith-1.5-35B-A3B: 3B aktiva parametrar per token ger en MoE:s kapacitet till en bråkdel av en tät 35B:s kostnad per token, och 23 GB Ollama-bygget körs på ett enda kort med hög VRAM eller ett litet kluster. 9B är den man stoppar i en telefon.
Den där "3B active"-egenskapen är också där routingekonomin blir intressant. MoE:er med aktiva parametrar prissätts långt under sin totala storlek, och när leverantörer antar en sådan modell tenderar priset per token att falla snabbt – vilket är fallet när man köper via en router som skickar vidare leverantörernas listpriser med 0 % påslag, snarare än från en enda leverantör som du förhandlar med en gång. OrcaRouter gör precis det över 200+ modeller, så en prissänkning från en leverantör på en ny open-weights-modell är live hos oss samma dag. Och för en modell som levererades med ingenting annat än leverantörsbenchmarks är failover-argumentet viktigast: ett routinglager låter dig peka en testväg mot en helt ny modell och falla tillbaka på en beprövad sådan i samma ögonblick som den stannar – att prova en obeprövad release utan att satsa en produktionsväg på den.
Vad saknas fortfarande
• Inget värdbaserat API. Om du vill ha Ornith-1.5 som en tjänst, så finns det inte ännu; varje alternativ är självhostat eller lokalt.
• Ingen oberoende utvärdering. BenchLM lämnar familjen utan rang; inget labb har publicerat en kontrollerad körning.
• Ingen prissättning att fundera över. Det finns ingen tokenavgift, så handlar fallet "billig öppen frontlinje" helt om din egen GPU-ekonomi.
• Harnessarna är blandade. Terminal-Bench har flera varianter, och rapportens egna siffror spänner över dem: 397B:ns 86,1 är på Terminus-2-harnessen, 35B:ns 68,5 på Claude Code-harnessen. Olika harnessar är olika spel, vilket gör det svårare att jämföra äpplen med äpplen än vad rubriktabellen antyder.
Vad du ska titta på härnäst
Den bestående historien är inte ”öppen modell slår Claude Opus 4.8” — det är ett ogranskat påstående som är en dag gammalt. Det är att ett labb har stängt loopen för självgenererad träningsdata och publicerat vikterna för granskning, och det är den delen som är värd att bevaka. Det som skulle förvandla detta från en lovande release till en pålitlig sådan: en första oberoende körning av 397B på SWE-bench Verified och en fixad Terminal-Bench-harness; att utvärderingskoden faktiskt skickas med; och en hostad rutt som dyker upp så att 35B-A3B:s kostnadsprofil kan mätas mot dess påståenden. Om siffrorna håller är Ornith-1.5-35B-A3B kvartalets pris/prestanda-story för öppna vikter. Om de inte gör det överlever den ärliga delen — självförbättringsmetoden och MIT-vikterna — oavsett.
