
Ornith-1.5: Rodzina modeli o otwartych wagach, która sama pisze swój program treningowy — i twierdzi, że pokonuje Claude Opus 4.8
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 218 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 123 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 931 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 101 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Ornith-1.5, rodzina modeli o otwartych wagach od Ornith AI, która twierdzi, że pokonuje Claude Opus 4.8 w czterech benchmarkach, została wydana 19 sierpnia 2026 roku — a tym, nad czym warto się zatrzymać, jest pętla treningowa, a nie liczba parametrów. Rodzina składa się z trzech modeli: Ornith-1.5-397B, flagowego modelu mixture-of-experts o 397 miliardach parametrów; Ornith-1.5-35B-A3B, modelu MoE o 35B, który aktywuje 3 miliardy parametrów na token; oraz Ornith-1.5-9B, gęstego modelu o 9B ze skwantyzowaną wersją mobilną. Wszystkie podane wyniki pochodzą od producenta: liczby pochodzą z własnych przebiegów ewaluacyjnych Ornith AI, uśrednione po pięciu przebiegach, a jedyny zewnętrzny tracker z profilem — BenchLM — oznacza wszystkie 18 wierszy benchmarków jako zgłoszone przez dostawcę i pozostawia rodzinę bez rankingu do czasu niezależnych testów. Oto, co faktycznie zostało wydane, co naprawdę oznacza „samo-ulepszanie” i co możesz uruchomić już dziś.
Co wydano: trzy skale, licencja MIT, brak API.
Ornith AI — grupa stojąca za open-weights Ornith-1.0 i powiązana z pracami DeepReinforce nad wieloagentowymi systemami do programowania konkursowego (GrandCode) oraz optymalizacją jąder GPU (CUDA-L2) — opublikowała rodzinę modeli na Hugging Face na licencji MIT, wraz z kwantyzacjami FP8, GGUF, MLX i NVFP4 obok surowych punktów kontrolnych. Okno kontekstu o rozmiarze 256K (262 144 tokenów) obowiązuje w całej rodzinie. Nie ma oficjalnego hostowanego API ani ceny za tokeny; to wydanie przeznaczone do samodzielnego hostingu lub lokalnego uruchomienia, a raport z premiery mówi o tym wprost.
Trzy skale dotyczą trzech różnych rzeczywistości:
• Ornith-1.5-397B — „pretendent do otwartej granicy”: model MoE o 397B parametrów, celujący w zamkniętą granicę w zadaniach agentowych i programistycznych.
• Ornith-1.5-35B-A3B — model MoE 35B aktywujący tylko 3B parametrów na token, stanowiący złoty środek: możliwości niemal flagowe przy ułamku kosztu inferencji na token w porównaniu z gęstym modelem 35B.
• Ornith-1.5-9B — gęsty model 9B do użytku lokalnego i na urządzeniu, a także skwantowana wersja Ornith-1.5-9B-Mobile, którą dostawca określa jako gotową do wdrożenia na iPhone i Androida.

Powyższa strona startowa to całe ogłoszenie: raport techniczny, a nie post marketingowy, co jest spójne z profilem laboratorium.
Twierdzenie o samodoskonaleniu, rozszyfrowane
Ornith-1.0, wydana w czerwcu 2026 roku, nauczyła model generowania szkieletu wokół zadań programistycznych — środowiska uruchomieniowego, dekompozycji, orkiestracji. Ornith-1.5 rozszerza tę pętlę na samo generowanie zadań. Podczas treningu model wykonuje teraz trzy rzeczy:
• Zaproponuj nowe, trudniejsze zadania treningowe.
• Wygeneruj szkielet specyficzny dla zadania, używany do rozwiązywania i oceniania tych zadań.
• Generuj rozwinięcia rozwiązań, które staną się kolejną rundą danych treningowych.
Nagroda przepływa przez wszystkie trzy etapy, wspólnie optymalizowane za pomocą GRPO. Każde proponowane zadanie jest oceniane pod kątem poprawności (musi być wykonywalne i weryfikowalne), trudności granicznej (docelowy wskaźnik sukcesu rozwiązania ustala się na 0,2 — zadania, które model zwykle zawodzi, ale nadal może się z nich uczyć) oraz nowości (różnorodności względem wszystkiego, co już widziano). Scaffold otrzymuje własną nagrodę za zgodność, wierność nagrody i odporność na hakowanie nagród, a potok obejmuje zabezpieczenia przed hakowaniem: ograniczenia dotyczące dotykania środowiska testowego, monitorowanie dostępu do ścieżek zastrzeżonych oraz zamrożony model orzekający, który nadpisuje anomalne wyniki.
Ważne zastrzeżenie kryje się w słowie „samodoskonalenie”: opisuje ono procedurę treningu, a nie artefakt. Pobrany model nie trenuje się ponownie na twoim laptopie. Otrzymujesz model, którego dane treningowe — co niezwykłe — zostały wygenerowane przez wcześniejsze wersje jego samego — co jest dokładnie tego rodzaju twierdzeniem, które warto przetestować, zanim stanie się dogmatem.
Twierdzenia benchmarku, uczciwie oznaczone
Wszystkie liczby w tej sekcji są danymi własnymi Ornith AI, pochodzącymi z raportu premierowego, uśrednionymi na podstawie pięciu przebiegów i nie zostały niezależnie odtworzone. Cztery deklarowane zwycięstwa flagowego modelu nad Claudem Opus 4.8:
• Terminal-Bench 2.1 (Terminus-2 harness): Ornith-1.5-397B 86.1 vs Claude Opus 4.8 85.0
• SWE-bench Verified: 86.0 vs 85.8
• WideSearch: 80.8 vs 72.9
• BrowseComp: 86.6 vs 84.3
Traktuj te wyniki jako deklaracje producenta, a nie fakty. Jedynym flagowym benchmarkiem, w którym Ornith AI nie deklaruje zwycięstwa, jest DeepSWE: 56.0 wobec 59.0 Claude'a Opusa 4.8 — raport przedstawia to jako „wyrównany poziom", co jest uczciwym sposobem odczytania porażki. Pozostałe flagowe liczby z tego samego raportu: HLE 44.6 bez narzędzi i 56.1 z nimi, GPQA Diamond 92.8 oraz SWE-bench Pro 65.1.
Te dwa mniejsze również dobrze wypadają na papierze: Ornith-1.5-35B-A3B raportuje SWE-bench Verified 79.0 i Terminal-Bench 2.1 (Claude Code harness) 68.5, podczas gdy Ornith-1.5-9B raportuje SWE-bench Verified 70.6 i Terminal-Bench 2.1 47.0. W porównaniu z innymi modelami o otwartych wagach w tym samym raporcie, Ornith AI zestawia wyniki modelu 397B – 86.1 Terminal-Bench / 56.0 DeepSWE – z wynikami DeepSeek-V4-Flash-0731 (82.7 / 54.4) i GLM-5.2 (81.0 / 46.2).

Jedyna niezależna tablica wyników — i dlaczego wciąż jest tymczasowa
Profil BenchLM dla Ornith-1.5-397B jest obecnie jedyną stroną zewnętrzną dotyczącą tego modelu. Jego nagłówek: publiczny wynik 68,5 na 100, miejsce #20 z 221, z kategorią Agentic jako najsilniejszą na #13. Ale przeczytajcie drobny druk, bo robi on prawdziwą robotę — wszystkie 18 wierszy benchmarków jest oznaczonych jako zgłoszone przez dostawcę, a profil stwierdza, że model „nie ma jeszcze wystarczającego pokrycia źródłowego dla zweryfikowanej pozycji". Nieklasyfikowana pozycja na liście zweryfikowanej nie jest werdyktem przeciwko modelowi; to stwierdzenie, że nikt jeszcze go niezależnie nie uruchomił, czego dokładnie można oczekiwać po wydaniu sprzed kilku dni.

To jest różnica między tymi dwiema liczbami w tym artykule: wynik 86.1 Terminal-Bench dostawcy to deklaracja, a wynik 68.5 BenchLM to wynik zbudowany w całości na wierszach zgłoszonych przez dostawcę. Żadna z nich nie jest niezależnym pomiarem. Pierwsze laboratorium, które przepuści Ornith-1.5-397B przez publiczny harness — SWE-bench Verified na kontrolowanym zestawie, Terminal-Bench na stałej wersji harnessu — wygeneruje pierwszą liczbę, która się liczy.
Co faktycznie możesz uruchomić już dziś
To wydanie z otwartymi wagami, więc „uruchomienie” oznacza pobranie wag. Katalog Ollama już zawiera ornith-1.5:9b (wersja ~6,6 GB) oraz ornith-1.5:35b (wersja ~23 GB), obie z kontekstem 256K; wersja 9B ma też wsparcie dla wejścia obrazowego w wpisie katalogowym. Wersja 397B to inna kategoria problemu: MoE z 397B parametrów to nie model na laptopa, a każde poważne wdrożenie oznacza wiele GPU i prawdziwą orkiestrację.
Praktycznym złotym środkiem dla większości zespołów jest Ornith-1.5-35B-A3B: 3B aktywnych parametrów na token zapewnia możliwości MoE przy ułamku kosztu na token gęstego modelu 35B, a wersja Ollama o rozmiarze 23 GB działa na pojedynczej karcie z dużą pamięcią VRAM lub na małym klastrze. Model 9B to ten, który umieszczasz w telefonie.
Ta właściwość „{{1}}3B active{{/1}}" jest również tym, co czyni ekonomię routingu interesującą. MoE z aktywnymi parametrami kosztują znacznie mniej, niż wynosiłby ich całkowity rozmiar, a gdy dostawcy przyjmują taki model, cena za token zwykle szybko spada — {{2}}co ma miejsce w przypadku zakupów przez router, który przekazuje ceny katalogowe dostawców z zerową marżą, zamiast u pojedynczego dostawcy, z którym negocjujesz jednorazowo{{/2}}. OrcaRouter robi dokładnie to na ponad 200 modelach, więc obniżka ceny dostawcy na nowy model o otwartych wagach jest u nas widoczna tego samego dnia. A w przypadku modelu, który trafił na rynek wyłącznie z benchmarkami dostawcy, argument o przełączaniu awaryjnym jest najważniejszy: {{3}}warstwa routingu pozwala skierować ścieżkę testową na zupełnie nowy model i wrócić do sprawdzonego w momencie, gdy ten się zaciągnie{{/3}} — można w ten sposób wypróbować niezweryfikowane wydanie, nie stawiając na nie ścieżki produkcyjnej.
Czego jeszcze brakuje?
• Brak hostowanego API. Jeśli chcesz Ornith-1.5 jako usługę, to jeszcze nie istnieje; każda opcja to self-host lub lokalna.
• Brak niezależnej oceny. BenchLM pozostawia rodzinę bez rankingu; żadne laboratorium nie opublikowało kontrolowanego przebiegu.
• Brak jakichkolwiek cen do rozważania. Nie ma stawki za tokeny, więc przypadek „taniej otwartej granicy” sprowadza się wyłącznie do Twojej własnej ekonomii GPU.
• Harnessy są pomieszane. Terminal-Bench ma wiele wariantów, a liczby w raporcie pochodzą z różnych z nich: 86.1 dla 397B uzyskano na harnessie Terminus-2, a 68.5 dla 35B na harnessie Claude Code. Różne harnessy to różne gry, co sprawia, że porównanie jabłek z jabłkami jest trudniejsze, niż sugerowałaby tabela w nagłówku.
Co obejrzeć dalej
„Trwały przekaz nie brzmi: „otwarty model bije Claude Opus 4.8" — to niezweryfikowane twierdzenie sprzed jednego dnia. Sedno jest takie, że laboratorium domknęło pętlę samodzielnie generowanych danych treningowych i opublikowało wagi do publicznej weryfikacji — i na to warto zwracać uwagę. Rzeczy, które zamieniłyby to wydanie z obiecującego w zaufane: pierwszy niezależny przebieg modelu 397B na SWE-bench Verified i naprawiony harness Terminal-Bench; kod ewaluacyjny faktycznie dołączony do wydania; oraz pojawienie się hostowanego endpointu, dzięki któremu profil kosztów 35B-A3B będzie można porównać z deklaracjami. Jeśli liczby się obronią, Ornith-1.5-35B-A3B to historia stosunku ceny do wydajności wśród otwartych wag tego kwartału. Jeśli nie, uczciwa część — metoda samodoskonalenia i wagi na licencji MIT — przetrwa tak czy inaczej.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
