Tytułowa karta bohatera dla explainera premiery Ornith-1.5, z tytułem „Ornith-1.5 — Open Weights, Self-Improving", podtytułem „Rodzina modeli, która pisze własny program treningowy — 397B MoE · 35B-A3B · 9B" oraz trzema chipami modeli połączonymi okrągłą strzałką pętli sugerującą cykl samodoskonalenia, z logotypem OrcaRouter wkomponowanym w rogu.
Guides & Insights

Ornith-1.5: Rodzina modeli o otwartych wagach, która sama pisze swój program treningowy — i twierdzi, że pokonuje Claude Opus 4.8

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ornith-1.5, rodzina modeli o otwartych wagach od Ornith AI, która twierdzi, że pokonuje Claude Opus 4.8 w czterech benchmarkach, została wydana 19 sierpnia 2026 roku — a tym, nad czym warto się zatrzymać, jest pętla treningowa, a nie liczba parametrów. Rodzina składa się z trzech modeli: Ornith-1.5-397B, flagowego modelu mixture-of-experts o 397 miliardach parametrów; Ornith-1.5-35B-A3B, modelu MoE o 35B, który aktywuje 3 miliardy parametrów na token; oraz Ornith-1.5-9B, gęstego modelu o 9B ze skwantyzowaną wersją mobilną. Wszystkie podane wyniki pochodzą od producenta: liczby pochodzą z własnych przebiegów ewaluacyjnych Ornith AI, uśrednione po pięciu przebiegach, a jedyny zewnętrzny tracker z profilem — BenchLM — oznacza wszystkie 18 wierszy benchmarków jako zgłoszone przez dostawcę i pozostawia rodzinę bez rankingu do czasu niezależnych testów. Oto, co faktycznie zostało wydane, co naprawdę oznacza „samo-ulepszanie” i co możesz uruchomić już dziś.

Co wydano: trzy skale, licencja MIT, brak API.

Ornith AI — grupa stojąca za open-weights Ornith-1.0 i powiązana z pracami DeepReinforce nad wieloagentowymi systemami do programowania konkursowego (GrandCode) oraz optymalizacją jąder GPU (CUDA-L2) — opublikowała rodzinę modeli na Hugging Face na licencji MIT, wraz z kwantyzacjami FP8, GGUF, MLX i NVFP4 obok surowych punktów kontrolnych. Okno kontekstu o rozmiarze 256K (262 144 tokenów) obowiązuje w całej rodzinie. Nie ma oficjalnego hostowanego API ani ceny za tokeny; to wydanie przeznaczone do samodzielnego hostingu lub lokalnego uruchomienia, a raport z premiery mówi o tym wprost.

Trzy skale dotyczą trzech różnych rzeczywistości:

• Ornith-1.5-397B — „pretendent do otwartej granicy”: model MoE o 397B parametrów, celujący w zamkniętą granicę w zadaniach agentowych i programistycznych.

• Ornith-1.5-35B-A3B — model MoE 35B aktywujący tylko 3B parametrów na token, stanowiący złoty środek: możliwości niemal flagowe przy ułamku kosztu inferencji na token w porównaniu z gęstym modelem 35B.

• Ornith-1.5-9B — gęsty model 9B do użytku lokalnego i na urządzeniu, a także skwantowana wersja Ornith-1.5-9B-Mobile, którą dostawca określa jako gotową do wdrożenia na iPhone i Androida.

A screenshot of the Ornith AI launch page for Ornith-1.5, titled 'Ornith-1.5: From Self-Scaffolding to Self-Improvement', showing the three model scales 397b-moe, 35b-moe and 9b-dense and the opening paragraph describing the end-to-end self-improvement loop.

Powyższa strona startowa to całe ogłoszenie: raport techniczny, a nie post marketingowy, co jest spójne z profilem laboratorium.

Twierdzenie o samodoskonaleniu, rozszyfrowane

Ornith-1.0, wydana w czerwcu 2026 roku, nauczyła model generowania szkieletu wokół zadań programistycznych — środowiska uruchomieniowego, dekompozycji, orkiestracji. Ornith-1.5 rozszerza tę pętlę na samo generowanie zadań. Podczas treningu model wykonuje teraz trzy rzeczy:

• Zaproponuj nowe, trudniejsze zadania treningowe.

• Wygeneruj szkielet specyficzny dla zadania, używany do rozwiązywania i oceniania tych zadań.

• Generuj rozwinięcia rozwiązań, które staną się kolejną rundą danych treningowych.

Nagroda przepływa przez wszystkie trzy etapy, wspólnie optymalizowane za pomocą GRPO. Każde proponowane zadanie jest oceniane pod kątem poprawności (musi być wykonywalne i weryfikowalne), trudności granicznej (docelowy wskaźnik sukcesu rozwiązania ustala się na 0,2 — zadania, które model zwykle zawodzi, ale nadal może się z nich uczyć) oraz nowości (różnorodności względem wszystkiego, co już widziano). Scaffold otrzymuje własną nagrodę za zgodność, wierność nagrody i odporność na hakowanie nagród, a potok obejmuje zabezpieczenia przed hakowaniem: ograniczenia dotyczące dotykania środowiska testowego, monitorowanie dostępu do ścieżek zastrzeżonych oraz zamrożony model orzekający, który nadpisuje anomalne wyniki.

Ważne zastrzeżenie kryje się w słowie „samodoskonalenie”: opisuje ono procedurę treningu, a nie artefakt. Pobrany model nie trenuje się ponownie na twoim laptopie. Otrzymujesz model, którego dane treningowe — co niezwykłe — zostały wygenerowane przez wcześniejsze wersje jego samego — co jest dokładnie tego rodzaju twierdzeniem, które warto przetestować, zanim stanie się dogmatem.

Twierdzenia benchmarku, uczciwie oznaczone

Wszystkie liczby w tej sekcji są danymi własnymi Ornith AI, pochodzącymi z raportu premierowego, uśrednionymi na podstawie pięciu przebiegów i nie zostały niezależnie odtworzone. Cztery deklarowane zwycięstwa flagowego modelu nad Claudem Opus 4.8:

• Terminal-Bench 2.1 (Terminus-2 harness): Ornith-1.5-397B 86.1 vs Claude Opus 4.8 85.0

• SWE-bench Verified: 86.0 vs 85.8

• WideSearch: 80.8 vs 72.9

• BrowseComp: 86.6 vs 84.3

Traktuj te wyniki jako deklaracje producenta, a nie fakty. Jedynym flagowym benchmarkiem, w którym Ornith AI nie deklaruje zwycięstwa, jest DeepSWE: 56.0 wobec 59.0 Claude'a Opusa 4.8 — raport przedstawia to jako „wyrównany poziom", co jest uczciwym sposobem odczytania porażki. Pozostałe flagowe liczby z tego samego raportu: HLE 44.6 bez narzędzi i 56.1 z nimi, GPQA Diamond 92.8 oraz SWE-bench Pro 65.1.

Te dwa mniejsze również dobrze wypadają na papierze: Ornith-1.5-35B-A3B raportuje SWE-bench Verified 79.0 i Terminal-Bench 2.1 (Claude Code harness) 68.5, podczas gdy Ornith-1.5-9B raportuje SWE-bench Verified 70.6 i Terminal-Bench 2.1 47.0. W porównaniu z innymi modelami o otwartych wagach w tym samym raporcie, Ornith AI zestawia wyniki modelu 397B – 86.1 Terminal-Bench / 56.0 DeepSWE – z wynikami DeepSeek-V4-Flash-0731 (82.7 / 54.4) i GLM-5.2 (81.0 / 46.2).

A single-column scoreboard for Ornith-1.5-397B listing: Size 397B MoE (open weights), Context 262K tokens, Terminal-Bench 2.1 86.1 (vendor), SWE-bench Verified 86.0 (vendor), License MIT, API none — self-hosted, with a footer noting all figures are vendor-reported and no independent scores yet exist.

Jedyna niezależna tablica wyników — i dlaczego wciąż jest tymczasowa

Profil BenchLM dla Ornith-1.5-397B jest obecnie jedyną stroną zewnętrzną dotyczącą tego modelu. Jego nagłówek: publiczny wynik 68,5 na 100, miejsce #20 z 221, z kategorią Agentic jako najsilniejszą na #13. Ale przeczytajcie drobny druk, bo robi on prawdziwą robotę — wszystkie 18 wierszy benchmarków jest oznaczonych jako zgłoszone przez dostawcę, a profil stwierdza, że model „nie ma jeszcze wystarczającego pokrycia źródłowego dla zweryfikowanej pozycji". Nieklasyfikowana pozycja na liście zweryfikowanej nie jest werdyktem przeciwko modelowi; to stwierdzenie, że nikt jeszcze go niezależnie nie uruchomił, czego dokładnie można oczekiwać po wydaniu sprzed kilku dni.

A screenshot of the BenchLM profile for Ornith-1.5-397B, showing the release date of August 18 2026, a score of 68.5 out of 100 and rank #20 of 221, with Agentic ranked #13, and a note that the profile lacks enough sourced coverage for a verified position.

To jest różnica między tymi dwiema liczbami w tym artykule: wynik 86.1 Terminal-Bench dostawcy to deklaracja, a wynik 68.5 BenchLM to wynik zbudowany w całości na wierszach zgłoszonych przez dostawcę. Żadna z nich nie jest niezależnym pomiarem. Pierwsze laboratorium, które przepuści Ornith-1.5-397B przez publiczny harness — SWE-bench Verified na kontrolowanym zestawie, Terminal-Bench na stałej wersji harnessu — wygeneruje pierwszą liczbę, która się liczy.

Co faktycznie możesz uruchomić już dziś

To wydanie z otwartymi wagami, więc „uruchomienie” oznacza pobranie wag. Katalog Ollama już zawiera ornith-1.5:9b (wersja ~6,6 GB) oraz ornith-1.5:35b (wersja ~23 GB), obie z kontekstem 256K; wersja 9B ma też wsparcie dla wejścia obrazowego w wpisie katalogowym. Wersja 397B to inna kategoria problemu: MoE z 397B parametrów to nie model na laptopa, a każde poważne wdrożenie oznacza wiele GPU i prawdziwą orkiestrację.

Praktycznym złotym środkiem dla większości zespołów jest Ornith-1.5-35B-A3B: 3B aktywnych parametrów na token zapewnia możliwości MoE przy ułamku kosztu na token gęstego modelu 35B, a wersja Ollama o rozmiarze 23 GB działa na pojedynczej karcie z dużą pamięcią VRAM lub na małym klastrze. Model 9B to ten, który umieszczasz w telefonie.

Ta właściwość „{{1}}3B active{{/1}}" jest również tym, co czyni ekonomię routingu interesującą. MoE z aktywnymi parametrami kosztują znacznie mniej, niż wynosiłby ich całkowity rozmiar, a gdy dostawcy przyjmują taki model, cena za token zwykle szybko spada — {{2}}co ma miejsce w przypadku zakupów przez router, który przekazuje ceny katalogowe dostawców z zerową marżą, zamiast u pojedynczego dostawcy, z którym negocjujesz jednorazowo{{/2}}. OrcaRouter robi dokładnie to na ponad 200 modelach, więc obniżka ceny dostawcy na nowy model o otwartych wagach jest u nas widoczna tego samego dnia. A w przypadku modelu, który trafił na rynek wyłącznie z benchmarkami dostawcy, argument o przełączaniu awaryjnym jest najważniejszy: {{3}}warstwa routingu pozwala skierować ścieżkę testową na zupełnie nowy model i wrócić do sprawdzonego w momencie, gdy ten się zaciągnie{{/3}} — można w ten sposób wypróbować niezweryfikowane wydanie, nie stawiając na nie ścieżki produkcyjnej.

Czego jeszcze brakuje?

• Brak hostowanego API. Jeśli chcesz Ornith-1.5 jako usługę, to jeszcze nie istnieje; każda opcja to self-host lub lokalna.

• Brak niezależnej oceny. BenchLM pozostawia rodzinę bez rankingu; żadne laboratorium nie opublikowało kontrolowanego przebiegu.

• Brak jakichkolwiek cen do rozważania. Nie ma stawki za tokeny, więc przypadek „taniej otwartej granicy” sprowadza się wyłącznie do Twojej własnej ekonomii GPU.

• Harnessy są pomieszane. Terminal-Bench ma wiele wariantów, a liczby w raporcie pochodzą z różnych z nich: 86.1 dla 397B uzyskano na harnessie Terminus-2, a 68.5 dla 35B na harnessie Claude Code. Różne harnessy to różne gry, co sprawia, że porównanie jabłek z jabłkami jest trudniejsze, niż sugerowałaby tabela w nagłówku.

Co obejrzeć dalej

„Trwały przekaz nie brzmi: „otwarty model bije Claude Opus 4.8" — to niezweryfikowane twierdzenie sprzed jednego dnia. Sedno jest takie, że laboratorium domknęło pętlę samodzielnie generowanych danych treningowych i opublikowało wagi do publicznej weryfikacji — i na to warto zwracać uwagę. Rzeczy, które zamieniłyby to wydanie z obiecującego w zaufane: pierwszy niezależny przebieg modelu 397B na SWE-bench Verified i naprawiony harness Terminal-Bench; kod ewaluacyjny faktycznie dołączony do wydania; oraz pojawienie się hostowanego endpointu, dzięki któremu profil kosztów 35B-A3B będzie można porównać z deklaracjami. Jeśli liczby się obronią, Ornith-1.5-35B-A3B to historia stosunku ceny do wydajności wśród otwartych wag tego kwartału. Jeśli nie, uczciwa część — metoda samodoskonalenia i wagi na licencji MIT — przetrwa tak czy inaczej.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie