
Ujawniono Ox Alpha: Z.AI udostępnia go jako model open-weight GLM-5.3-Flash
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 144 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Wieczorem w środę, 26 sierpnia, zagadka zakończyła się tak, jak przewidziały analizy kryminalistyczne. Firma Z.AI — pekińskie laboratorium stojące za serią GLM — opublikowała model, który testowała pod maską, jako produkt o otwartych wagach, pod nazwą GLM-5.3-Flash, dokładnie tę podnazwę, na którą zgodnie wskazywały analizy tokenizera i rynki predykcyjne. Ox Alpha, anonimowy model, który od chwili pojawienia się 20 sierpnia nieprzerwanie znajduje się na szczycie rankingów użycia, jest teraz opublikowanym modelem, który można hostować samodzielnie: licencja MIT, 320 mld parametrów łącznie z 18 mld aktywnych na token, okno kontekstowe o długości 1 048 576 tokenów oraz obsługa tekstu, obrazu i wideo, jaką reklamowano w ogłoszeniu, a także wagi na Hugging Face. Ujawnienie odpowiadało też na największą zagadkę anonimowego tygodnia — jak model, którego nikt nie posiadał, mógł przetwarzać 100 bilionów tokenów dziennie: Z.AI twierdzi, że serwowanie działało w całości na około 100 000 rodzimych chińskich chipów AI, po raz pierwszy, gdy chiński krzem obsłużył globalny ruch na skalę graniczną. Skala ta zrodziła też najpopularniejszy błędny domysł tygodnia — przy takiej skali wielu obserwatorów, zachęconych enigmatycznymi wpisami badaczy z Google DeepMind, twierdziło, że Ox Alpha musi być Gemini działającym na sprzęcie NVIDIA; ujawnienie skorygowało i to. Tej samej nocy firma Alibaba wypuściła Qwen3.8-Flash-Next, czyli wersję zapoznawczą o otwartych wagach swojej architektury Qwen4 — jednego wieczoru dwie czołowe premiery o otwartych wagach z chińskich laboratoriów. Wszystkie cztery anonimowe premiery sprzed Ox Alpha zostały ostatecznie przypisane chińskim laboratoriom: Zhipu AI – GLM-5, Xiaomi – MiMo-V2-Pro, Ant Group – Lingxi Ling-2.6-flash, a Meituan – LongCat-2.0. Ox Alpha nie jest już eksperymentem dostępnym wyłącznie na platformie; to model, który programiści mogą hostować samodzielnie.
Każda liczba w tym tekście to własna deklaracja operatora, dane z listingu samej platformy, publiczne ogłoszenie lub społecznościowe fingerprinting. Liczby DeepSWE to społecznościowe pomiary niezależnego badacza Bena Davisa — pełny przebieg 113 zadań, a nie oficjalny wpis na liście rankingowej, choć wartość ~63% jest teraz zbliżona do deklarowanego przez Z.AI wyniku DeepSWE v1.1, który wynosi 63,4. Kwestia tożsamości jest zamknięta: 26 sierpnia Z.AI wydało Ox Alpha jako model o otwartych wagach pod nazwą GLM-5.3-Flash — licencja MIT, 320B parametrów łącznie, z czego 18B aktywnych — potwierdzając człon nazwy, na którym zbiegły się analizy tokenizatora i enkodera wideo. Architektura, liczba parametrów i cennik są teraz publikowane przez firmę; tym, co pozostaje jedynie deklaracją dostawcy, a nie wynikiem niezależnej weryfikacji, jest zestaw benchmarków oraz twierdzenie Z.AI, że serwowanie w anonimowym tygodniu działało na około 100 000 rodzimych chińskich chipach AI, przy koszcie na token porównywalnym z tym na mainstreamowym sprzęcie NVIDIA — to twierdzenie firmy, powtórzone już przez wiele portali, a nie liczba potwierdzona audytem. Wczesna hipoteza Gemini — którą zrodziła przepustowość 100 T tokenów dziennie, a podsycały enigmatyczne wpisy badaczy Google DeepMind — była błędna, a wydanie modelu ją rozstrzygnęło. Ocena jakości przypisywana analitykowi teortaxesTex — oraz jego sugestia, że dalej trenowany Ox Alpha mógłby być koniem pociągowym dla mocniejszego GLM 5.5 — to własna ocena tego analityka z wpisu w mediach społecznościowych, a nie niezależny pomiar ani oświadczenie Zhipu. Opisana poniżej demonstracja zapętlonej animacji to również doniesienie społeczności — wpis dewelopera na X, powtórzony na chińskich forach deweloperskich — a nie deklaracja możliwości ze strony dostawcy; operator nie ogłosił żadnej takiej funkcji.
Co wiemy — a czego nie
Szybka wersja:
Operator opisuje Ox Alpha jako „model z czołówki stworzony do wydajnego kodowania, ciągłej pracy agentowej i rzeczywistych zastosowań produkcyjnych” — model rozumowania przeznaczony do długoterminowej inżynierii oprogramowania i przepływów pracy łączących tekst z kontekstem wizualnym.
• Ma okno kontekstu o wielkości 1 048 576 tokenów (1M), limit wyjściowy wynoszący 131 072 tokeny oraz przyjmuje na wejściu tekst, obrazy i wideo — jako pierwsze z anonimowych wydań reklamuje wejście wideo, a wydanie GLM-5.3-Flash potwierdza tę możliwość jako natywną, a nie doczepioną.
• Przez tydzień był darmowy: 0 USD za milion tokenów w obie strony, a operator twierdził, że oferuje „hojne limity szybkości, niemal nieograniczone użytkowanie” i 100 bilionów tokenów dziennej przepustowości serwowania — przepustowości, którą według późniejszego ujawnienia zapewniono na bazie około 100 000 rodzimych chińskich układów.
• Potwierdzone: 26 sierpnia Z.AI wypuściło Ox Alpha jako model o otwartych wagach pod nazwą GLM-5.3-Flash — licencja MIT, 320B parametrów łącznie, z czego 18B aktywnych — dokładnie to, na co zbiegły się analiza tokenizera podnazwy, enkodera wideo, kryminalistyka kodów błędów oraz rynki predykcyjne. Niezależny analityk teortaxesTex ocenia go na mniej więcej poziom GLM-5.3, pomijając wizję, i sugeruje, że dalej trenowany Ox Alpha może być koniem roboczym stojącym za znacznie silniejszym GLM 5.5.
Interpretacja flash-multimodalna ma teraz za sobą demo: poproszony o wygenerowanie zapętlonej animacji pelikana jadącego na rowerze i otwierającego telefon, który odtwarza tę samą animację, Ox Alpha odpowiedział samowystarczalną zapętloną animacją w postaci pojedynczego pliku HTML/SVG — demo społecznościowe, a nie deklaracja producenta.
• Wczesne dane dotyczące aktywności na platformie już pokazują rzeczywisty ruch produkcyjny, w tym agenta kodującego od Nous Research oraz edytor Zed.
• Firma już go dostarczyła — 26 sierpnia Z.AI udostępniło Ox Alpha jako GLM-5.3-Flash z otwartymi wagami na licencji MIT, kończąc za jednym razem pytania o tożsamość, specyfikację i cenę: 320 mld parametrów łącznie przy 18 mld aktywnych, natywnie multimodalny, z ceną katalogową Z.AI wynoszącą 0,15 USD za wejście / 0,50 USD za wyjście za milion tokenów oraz 50-procentową promocją premierową, która miała obowiązywać wyłącznie do 9 września — data ta minęła już osiem dni temu, a nadal obsługiwana jest stawka z rabatem. Z.AI ujawniło również, że anonimowe serwowanie na poziomie 100 bln tokenów dziennie w tamtym tygodniu odbywało się na około 100 000 krajowych chińskich chipów — pierwszy raz na taką skalę. Czego jednak nie ujawniono, to niezależny benchmark — karta wyników modelu jest raportowana przez dostawcę — więc najbardziej reprezentatywną niezależną liczbą pozostaje pełny przebieg 113 zadań DeepSWE Bena Davisa na poziomie około 63%, na równi z GPT-5.6 Sol mid.
Czym jest Ox Alpha
Opis na platformie określa Ox Alpha jako „model rozumowania zaprojektowany do kodowania, ciągłej pracy agentowej i obciążeń produkcyjnych — długoterminowej inżynierii oprogramowania, złożonego rozumowania oraz przepływów pracy łączących tekst z kontekstem wizualnym”. To konkretne pozycjonowanie: model jest zbudowany do długotrwałych pętli agentowych i do kodu, a nie do ogólnego czatu. Kontekst 1M jest tutaj kluczową wskazówką — to wystarczająco dużo miejsca na wielogodzinną sesję agenta lub duże repozytorium — a limit 131K na wyjście pozwala na długie pojedyncze generacje. Obsługuje wywoływanie narzędzi i funkcji oraz strukturalne wyjście JSON, co stanowi resztę checklisty agentowej.

Wejście wideo to najbardziej charakterystyczny element na arkuszu. Żaden z wcześniejszych anonimowych modeli tego nie wymieniał, a model, który może przyjmować klatki wideo, a także tekst i obrazy, jest ukierunkowany na inną klasę obciążeń niż wydania dostrojone do czatu, które go poprzedzały. To także, jak później wykazały analizy, jeden z najmocniejszych wskaźników tożsamości, jakie model może przenosić. Wszystko to — opis, specyfikacje, wartości szybkości — pochodziło od operatora oraz z wykazu platformy. Wydanie GLM-5.3-Flash potwierdziło główne specyfikacje (320B-A18B, natywna multimodalność); liczby dotyczące szybkości i pojemności pozostają deklaracjami producenta.
Historia multimodalności zyskała w tym tygodniu konkretne demo. Deweloper Chetaslua — którego sondy serwerowe są częścią śladu fingerprintingu — opublikował test, w którym poprosił Ox Alpha o stworzenie pętli z pelikanem jadącym na rowerze i otwierającym telefon, który odtwarza tę samą animację: samoodnoszącą się pętlę wewnątrz pętli. W jego raporcie model dostarcza jednoplikową animację HTML/SVG — pelikana z dwusegmentowymi nogami, które naprawdę pedałują, prędkość kół zsynchronizowaną z prędkością podłoża, tło z paralaksą i efekt telefonu w pętli. Chińskie fora deweloperskie osobno uruchomiły własne prompty z pelikanem na rowerze i dyskutowały o wyniku, więc to demo nie jest pojedynczym niezweryfikowanym twierdzeniem. Ponieważ wynikiem jest kod, jest to zgodne ze specyfikacją platformy ograniczoną do tekstu: rozumienie multimodalne i kreatywne generowanie kodu działające razem, a nie natywna synteza wideo. Wniosek Chetaslui — że to jest efekt multimodalności i że zdolny model open-source pojawi się wraz z nią — to jego własna prognoza, a nie oświadczenie producenta; operator niczego nie ogłosił.
Oferta darmowa przez tydzień
Promocja była agresywna. Przez tydzień, gdy trwała, była darmowa, oferowała »hojne limity szybkości, niemal nieograniczone wykorzystanie« oraz deklarowaną przepustowość 100 bilionów tokenów dziennie, a operator dodawał zaproszenie dla użytkowników, by »zobaczyli, co potraficie«. W dosłownym ujęciu 100 T tokenów dziennie plasowałoby tego operatora wśród największych dostawców inferencji na świecie — to stwierdzenie brzmi mniej jak specyfikacja, a bardziej jak wyzwanie typu stress-test, co pasuje do wzorca: anonimowe wydania to sposób, w jaki laboratorium zdobywa ruch na światową skalę, nie podpisując się pod nim. Potwierdzona interpretacja uczyniła deklarację o skali konkretną, a nie tylko łatwiejszą do pogodzenia: Z.AI ujawniło, że serwis obsługujący 100 T tokenów dziennie działał na około 100 000 krajowych chińskich układów AI — po raz pierwszy wydanie klasy granicznej było obsługiwane na taką skalę bez sprzętu NVIDIA. To ujawnienie wciąż jest jednak tylko deklaracją firmy, powtarzaną już przez wiele portali, ale niepoddaną niezależnemu audytowi, i niesie ze sobą drugie, łagodniejsze twierdzenie producenta: Z.AI podaje, że koszt tokena w klastrze krajowym jest porównywalny do kosztu na standardowych procesorach graficznych NVIDIA.
Drugą stroną „darmowego przez tydzień” był fakt, że cena, która miała po nim nastąpić, pozostawała nieznana — ujawnienie odpowiedziało na to pytanie. Publikowana cena katalogowa Z.AI za GLM-5.3-Flash to $0.15 za milion tokenów wejściowych, $0.50 za milion tokenów wyjściowych i $0.03 za milion tokenów wejściowych z pamięci podręcznej. Ogłoszono, że promocja premierowa z 50% zniżką potrwa do 9 września 2026 r., obniżając te stawki do $0.075 / $0.25. Osiem dni po tej dacie wciąż obowiązuje stawka promocyjna: ponownie odczytana 17 września 2026 r. strona modelu z-ai/glm-5.3-flash wycenia wejście na $0.075, wyjście na $0.25, a odczyty z pamięci podręcznej na $0.0173 za milion tokenów — bez żadnej etykiety promocyjnej. W zestawieniu z katalogowymi $1.40 / $4.40 dla GLM-5.3 to mniej więcej jedna dwudziesta. Praktyczna konsekwencja jest taka, że data zakończenia 9 września jest nieaktualna, a nie wiążąca — deweloper planujący budżet w oparciu o $0.15 / $0.50 opiera się na kwocie, której obecnie nikomu nie naliczono. Czego strony z cennikiem nie rozstrzygają, to przyczyny. Własna lista modeli Z.AI wciąż podaje $0.15 / $0.50 dla GLM-5.3-Flash, więc nie jesteśmy w stanie ustalić źródłowo, czy promocja została przedłużona, uczyniona stałą, czy po prostu pozostawiona włączona; stawka ze zniżką jest zaobserwowanym faktem na tę datę, a przyczyna pozostaje otwarta.
Pierwszy pełny benchmark — i wypada na równi z GPT-5.6 Sol mid
Ox Alpha wciąż nie ma wpisu w niezależnych zestawieniach, takich jak Artificial Analysis czy LMArena — słowo „frontier” jest wyłącznie twierdzeniem operatora, a wyniki benchmarków, które Z.AI opublikowało wraz z wydaniem GLM-5.3-Flash (DeepSWE v1.1 63,4, AutomationBench 48,8, Artificial Analysis Intelligence Index na poziomie 57), są raportowane przez producenta, a nie niezależne wyniki. Od premiery zmieniło się tyle, że w obiegu zaczynają pojawiać się wyniki mierzone przez społeczność — a obraz się zawęził. Na Kingbench wczesne uruchomienia plasują Ox Alpha na 87,5, tuż poniżej 91,25 GLM-5.3. Na DeepSWE niezależny badacz Ben Davis najpierw uruchomił podzbiór 10 zadań i podał 80% Pass@1, wyprzedzając Claude Fable 5 (65%), GLM-5.3 i Grok 4.6 (62%) oraz GPT-5.6 Sol (52%). Od tego czasu ukończył pełny przebieg na całym zestawie 113 zadań DeepSWE, a skorygowany wynik to mniej więcej 63% — mniej więcej na poziomie GPT-5.6 Sol mid. Wynik 80% na podzbiorze był liczbą rzucającą się w oczy, ale dziesięć zadań to mniej niż 9% benchmarku; sam Davis wskazał wynik dla pełnego zestawu jako ten, który „ma znacznie więcej sensu”. To wyniki mierzone przez społeczność, a nie benchmark producenta ani oficjalny wynik z leaderboardu — ale pełny przebieg jest najbardziej reprezentatywną liczbą, jaką ktokolwiek uzyskał z tego modelu, i obecnie pokrywa się ściśle z raportowanym przez Z.AI wynikiem DeepSWE v1.1 wynoszącym 63,4 — to użyteczna weryfikacja krzyżowa, nawet jeśli liczba firmy jest twierdzeniem, a nie pomiarem.
Jedno porównanie ma teraz większe znaczenie niż w momencie premiery. DeepSeek V4 Pro 0813 — wydana 13 sierpnia wersja GA flagowego modelu DeepSeek — raportuje wynik DeepSWE na poziomie 62,7 na własnej karcie benchmarkowej DeepSeek, wobec 12,8 dla wcześniejszego DeepSeek V4 Pro Preview. Obie wartości podaje producent; na moment powstawania tego tekstu nie zostały odtworzone przez niezależne laboratorium. W zestawieniu z wynikiem ~63% uzyskanym przez GLM-5.3-Flash w pełnym, społecznościowym uruchomieniu benchmarku oraz z własnym wynikiem Z.AI w DeepSWE v1.1 (63,4), deklarowana przez DeepSeek wartość 62,7 plasuje oba najlepiej znane chińskie wyniki w kategorii agentów kodowania w tym samym przedziale niskiej sześćdziesiątki. Dziesięciopunktowa przewaga, która wyglądała na znak rozpoznawczy Ox Alpha, została zmierzona względem DeepSeek V4 Flash 0731, tańszego małego modelu. W porównaniu z flagowcem DeepSeek to GLM-5.3-Flash wypada na równi, a nie dziesięć punktów lepiej.
Kolejna lekcja dotyczy samej liczby. Analityk teortaxesTex — który śledzi te szacunki od anonimowego tygodnia — zauważa, że pierwszy raport o Ox Alpha również podawał 80% DeepSWE: to był efektowny podzbiór 10 zadań Davisa, a końcowy wynik na pełnym zestawie 113 zadań wyniósł 63%. Przy oficjalnym wyniku DeepSeek V4 Pro 0813 wynoszącym 62,7 w tym samym przedziale, jego obserwacja jest taka, że nic nie zbliżyło się jeszcze do wiarygodnie odtworzonego poziomu 80% — liczba 80% pojawia się wcześnie w publicznym życiu modelu, a potem osiada w okolicach niskich 60., gdy uruchomi się pełny zestaw. To jest jego analityczna interpretacja, nie pomiar, ale to właściwa perspektywa dla kolejnego nagłówka o DeepSWE, w tym jakiegokolwiek dotyczącego samego GLM-5.3-Flash.

Istnieje również faktyczne użycie. Dane aktywności platformy pokazują realny ruch produkcyjny w pierwszych godzinach — w tym Hermes Agent, agentowy projekt kodowania od Nous Research, oraz edytor Zed. Oba to dokładnie przypadki „długotrwałej pracy agentowej i kodowania”, do których model jest pozycjonowany. To nie wynik, ale sygnał: deweloperzy z realnymi obciążeniami pracy uznali, że darmowy, klasy frontier, anonimowy hazard był wart podłączenia. Zanim pełny przebieg DeepSWE został opublikowany, ta wczesna adopcja była jedynym dowodem; wynik ~63% na pełnym zestawie daje teraz modelowi punkt odniesienia do porównania z tamtym sygnałem.
Drobny druk dotyczący retencji danych
Ogłoszenie o darmowym tygodniu reklamuje „zerową retencję danych”. Opis modelu na platformie przedstawia bardziej zniuansowaną historię: prompty i odpowiedzi są przechowywane przez dostawcę, ale nie są wykorzystywane do trenowania, zgodnie z warunkami platformy dla modeli stealth. Ta różnica ma znaczenie, jeśli zamierzasz wkleić zastrzeżony kod do okna kontekstowego o pojemności 1M tokenów, należącego do dostawcy, który pozostawał anonimowy, dopóki Z.AI nie ujawniło się 26 sierpnia. Traktuj „zerową retencję danych” jako marketing, dopóki Z.AI nie opublikuje warunków, które wprost to potwierdzą — i kieruj wszystko, czego nie chcesz mieć w logach, do osobnego, identyfikowalnego modelu.
Podręcznik modelu anonimowego
Ox Alpha to piąte anonimowe wydanie w ciągu sześciu miesięcy, a poprzednie cztery zakończyły się w ten sam sposób — anonimowy debiut, przypływ darmowego ruchu, a następnie firma wychodząca na jaw:
• Pony Alpha (luty 2026) — potwierdzony przez Zhipu AI około pięciu dni po premierze jako GLM-5, flagowy model MoE z 744 miliardami parametrów.
• Hunter Alpha (11 marca) — darmowy model o bilionie parametrów i kontekście 1M, który stał się tematem spekulacji wiosny, powszechnie uznawany za DeepSeek V4; ujawniony jako Xiaomi MiMo-V2-Pro, a towarzyszący mu Healer Alpha zidentyfikowany jako MiMo-V2-Omni.
Elephant Alpha (kwiecień) — darmowy, nastawiony na wydajność model tekstowy, który Ant Group określiło jako Lingxi Ling-2.6-flash około dwa tygodnie po jego pojawieniu się.
• Owl Alpha (koniec kwietnia) — model zorientowany na agentów z natywnym wywoływaniem narzędzi i kontekstem ~1M, który Meituan potwierdził jako LongCat-2.0 30 czerwca, pierwszy model o bilionie parametrów wytrenowany i serwowany w całości na rodzimych chińskich chipach.
• Ox Alpha (20 sierpnia) — ujawniony 26 sierpnia jako GLM-5.3-Flash, model o otwartych wagach na licencji MIT (320B-A18B); tożsamość, licencja i specyfikacje były oficjalne tego samego dnia, w którym zdjęto maskę.

Dlaczego wypuszczać dobry model w masce? Standardowa interpretacja, którą skonkretyzował cykl Hunter Alpha, mówi, że anonimowość eliminuje stronniczość marki z ocen, a darmowe użytkowanie – dzięki crowdsourcingowi – gromadzi dane z ocen w rzeczywistych warunkach na skalę frontier, podczas gdy wszyscy spierają się o właściciela. Jak ujęła to jedna z analiz tego wzorca: „brak marki jest marketingiem”. Dodatkowym atutem jest szybkość: anonimowy model może w ciągu godzin dotrzeć do globalnej publiczności deweloperów, bez wydarzenia premierowego, a sama tajemnica staje się dystrybucją.
Kim jest Ox Alpha?
Do premiery 26 sierpnia żadna firma nie przyznała się do niego, a Zhipu AI nic nie powiedziało — ale sytuacja z twardymi dowodami zmieniła się w ciągu 48 godzin od debiutu modelu, a poniższe analizy pokazują, dlaczego ujawnienie — jako GLM-5.3-Flash — spotkało się z tak małym zaskoczeniem. Wskaźnik wydajności przez chwilę działał na niekorzyść analiz: 100 bilionów tokenów dziennie wyglądało na sygnaturę laboratorium z najwyższej półki na układach NVIDIA, a teoria, że Ox Alpha to nowy Gemini — podsycana zagadkowymi wpisami badaczy z Google DeepMind — miała realny impet, dopóki dowód z tokenizatora, a potem własne wydanie Z.AI, jej nie zamknął. Najmocniejszym sygnałem jest tokenizer. Stworzone przez społeczność narzędzie do pobierania odcisków palców, modelprint, przeprowadziło dziewięć sond infrastrukturalnych wobec Ox Alpha i wykazało, że w sześciu z dziewięciu przypadków odpowiada ono modelowi GLM-5.3 firmy Z.ai, przy czym wszystkie cztery znormalizowane liczby tokenów pasują do rodziny GLM, podczas gdy najlepszy kandydat spoza GLM uzyskał dwa na cztery. Niezależny badacz Ben Davis poinformował, że liczby tokenów Ox Alpha dokładnie odpowiadają modelowi GLM-5.3 w 25 testowych promptach, z jedyną stałą różnicą +75 tokenów, którą przypisał ukrytemu wrapperowi. Dopasowanie tokenizatora to najtrudniejszy do podrobienia sygnał tożsamości — model nie może zmienić sposobu segmentacji tekstu bez ponownego treningu.
Ścieżka wideo to druga sygnatura. Zużycie tokenów wideo przez Ox Alpha dokładnie odpowiadało GLM-5V-Turbo w czterech kontrolowanych próbkach — te same mechanizmy próbkowania klatek, skalowania czasu trwania i rozdzielczości — podczas gdy MiMo v2.5, Qwen 3.8 Max i GLM-4.6V wszystkie odbiegały. To mocna wskazówka: obsługa wideo jest głęboko w modelu, a nie doczepką. Reszta zestawu sygnatur potwierdza ten sam obraz: Ox Alpha odrzuca wejście audio tak jak GLM-5V, dzieli z GLM charakterystyczny kod błędu „1301", emituje podobny styl wyjściowy (około 1,3 emoji na 1000 znaków), niesie tę samą ograniczoną konfigurację parametrów i API, która pojawiła się w wykazie GLM-5.3 na platformie dwa dni przed premierą Ox Alpha, i ma granicę wiedzy w okolicach listopada 2025.
Identyfikacja ma precedens w praktyce samego Zhipu: Pony Alpha, anonimowe wydanie z lutego, okazało się modelem GLM-5, co ogłoszono około pięciu dni po premierze. Interpretacja krążąca w tym tygodniu — że Ox Alpha to GLM-5.3, prawdopodobnie model Flash — została powtórzona przez Pliny the Liberator, który stwierdził, że jego agent potwierdził, iż "Ox-alpha pochodzi od Zai, rodzina GLM-5.X". Niezależny analityk teortaxesTex wydaje tę samą ocenę jakości i dodaje uwagę o czasie: szacuje, że Ox Alpha jest mniej więcej na poziomie GLM-5.3, pomijając wizję, i za najbardziej uderzający uważa czas realizacji — skompresowanie tekstowego GLM-5.3 i wydanie go z działającą wizją w ciągu kilku dni od premiery 14 sierpnia. To ocena jednego analityka, nie niezależny wynik, i twierdzi on, że powinna dać do myślenia zwolennikom narracji o tym, że "Chiny wypuszczają modele prosto z pieca". Jego najnowszy post nakłada na tę interpretację przypuszczenie co do roadmapy: cykl aktualizacji GLM-5 może być krótki; Ox Alpha jest na tyle blisko GLM-5.3, że używanie go jako podagenta ma niewielki sens — "po prostu uruchom ox @4" to jego skrót na bezpośrednie uruchamianie modelu; a dotrenowany Ox Alpha miałby dużo sensu jako koń roboczy, jak to ujął, "zwierzę pociągowe", dla znacznie silniejszego GLM 5.5. To spekulacje jednego analityka na temat roadmapy, nie oświadczenie Zhipu. Kwestia dodatkowego członu nazwy jest natomiast rozstrzygnięta: 26 sierpnia Z.AI wydał Ox Alpha jako GLM-5.3-Flash. Zgrzyt, który niegdyś utrzymywał etykietę Flash po stronie "domniemanej" — GLM-5.3 wystartował 14 sierpnia jako model wyłącznie tekstowy, podczas gdy Ox Alpha reklamuje wejście wideo — został rozwiązany właśnie przez tę premierę: GLM-5.3-Flash to odrębny, natywnie multimodalny model, a nie ten sam tekstowy. Alternatywne teorie — zespół MiMo Xiaomi, DeepSeek — były wysuwane i w dużej mierze odrzucone na podstawie dowodów z tokenizera i wideo, a premiera ostatecznie rozstrzyga kwestię rodziny.Argument Davisa, że etykieta Flash ma znaczenie, okazał się mieć praktyczny wymiar: ponieważ Ox Alpha rzeczywiście jest GLM-5.3-Flash działającym na poziomie GPT-5.6 Sol mid, można go teraz uruchamiać lokalnie — wagi są na Hugging Face, a SGLang, vLLM i TokenSpeed go obsługują — co zamienia średniopółkowy model kodujący na jednorazowy koszt sprzętu zamiast rachunku za tokeny dla każdego, kto zechce go hostować.
Geopolityczne ramy narzucają analitycy, nie dowody: „To wywiera jeszcze większą presję na amerykańskie Frontier Labs, a dystans do Chin maleje". To interpretacja tego, co darmowy model klasy Zhipu działający w skali frontier oznacza dla porządku konkurencyjnego — a ujawnienie specyfikacji sprzętowej daje jej przewagę, której analitycy nie mieli. Obsługiwanie 100 bilionów tokenów dziennie na około 100 000 rodzimych układów to pierwsza zakrojona na szeroką skalę demonstracja, że chiński stack bez układów NVIDIA może udźwignąć ruch wnioskowania na poziomie frontier — scenariusz, przed którym ostrzegał dyrektor generalny NVIDIA Jensen Huang w podcaście Dwarkesh tej wiosny, gdy argumentował, że kontrola eksportu przyspieszy rozwój niezależnego od NVIDIA chińskiego stacku, a model frontier działający najlepiej na rodzimym chińskim sprzęcie byłby „okropnym wynikiem" dla Stanów Zjednoczonych. Wskaźnik parytetu kosztów Z.AI to wciąż deklaracja dostawcy, ale samo wydarzenie jest realne. Tego samego wieczoru kwestia ta zyskała konkretny wymiar także po stronie modeli: gdy Z.AI wypuścił GLM-5.3-Flash, Alibaba udostępnił Qwen3.8-Flash-Next, swoją zapowiedź architektury Qwen4 z otwartymi wagami. Dwie chińskie premiery modeli klasy frontier z otwartymi wagami w jedną noc to konkretny kształt tego, co obserwatorzy nazwali „wielkim dniem chińskiego open source".
Czy powinieneś na tym budować w tym tygodniu?
Darmowy tydzień się skończył, ale test nadal jest tani: stawka faktycznie stosowana 17 września to 0,075 USD na wejściu / 0,25 USD na wyjściu za milion tokenów, a nie cena katalogowa 0,15 USD / 0,50 USD — 50-procentowa promocja premierowa, która miała zakończyć się 9 września, nadal obowiązuje osiem dni później. Jeśli prowadzisz pracę agentową o długim horyzoncie, piszesz kod w długich kontekstach albo uruchamiasz potoki intensywnie wykorzystujące wideo, to jest dokładnie to przecięcie, na którym pozycjonowany jest Ox Alpha — a ponieważ wagi są otwarte, możesz przeprowadzić test na własnym sprzęcie, a nie na łasce anonimowej platformy. Dwie przestrogi. Po pierwsze, etykieta „frontier” wciąż jest twierdzeniem: karta wyników GLM-5.3-Flash jest raportowana przez dostawcę, a jedyny solidny niezależny wynik — ok. 63% z przeprowadzonego przez Davisa testu DeepSWE — jest mocny, ale daleko mu do viralowego 80% z wczesnego podzbioru 10 zadań. Po drugie, cena 0 USD była ograniczona czasowo, a ujawnienie wyceniło to, co przychodzi później — tanio jak na tę możliwość, ale już nie za darmo. To, co usuwa wydanie z otwartymi wagami, to zależność: pliki są już dostępne, więc model można hostować samodzielnie, a nie wynajmować. Taki jest kształt testu, a nie zależności.
Bezpiecznym dla produkcji sposobem na przeprowadzenie takiego testu jest łańcuch awaryjny: model eksperymentalny odpowiada, gdy jest zdrowy, a żądanie przechodzi do sprawdzonego modelu w momencie, gdy ten się zatnie, zgłosi błąd lub zniknie. Po to właśnie jest warstwa routingu. Ujawnienie sprawia, że wybór opcji awaryjnej jest trywialny: Ox Alpha to GLM-5.3-Flash, a sam model jest dostępny na OrcaRouter pod swoją prawdziwą nazwą w cenie $0.075 za wejście / $0.25 za wyjście za milion tokenów, z odczytami z pamięci podręcznej po $0.0173 — stawka promocyjna -50% na start, która miała obowiązywać do 9 września, a na dzień 17 września wciąż jest ceną na stronie, a nie kwotą z cennika $0.15 / $0.50. Jest przekazywany z 0% marży, jedno API obejmujące ponad 200 modeli, z automatycznym przełączaniem awaryjnym, dzięki czemu skok ruchu w tygodniu premiery nie staje się Twoją awarią. Przetestuj nowy model na czele, mając za nim sprawdzony model awaryjny w łańcuchu; gdy zmieni się cena, liczba, którą widzisz na OrcaRouter, jest kwotą, którą płacisz, tego samego dnia. Albo całkowicie pomiń API — wagi są otwarte, więc samodzielny hosting GLM-5.3-Flash za tym samym łańcuchem również wchodzi w grę.
Co obejrzeć
Sześć rzeczy pozwoli dopowiedzieć resztę tej historii. Niezależny benchmark: karta wyników GLM-5.3-Flash jest raportowana przez dostawcę, ~63-procentowy wynik Davisa w DeepSWE to jak dotąd jedyna solidna niezależna liczba, oficjalny wynik 62,7 DeepSeek V4 Pro 0813 plasuje się teraz w tym samym przedziale, a wpis w Artificial Analysis lub LMArena — albo niezależne starcie bezpośrednie — byłby ostatecznym sprawdzeniem, czy „frontier” to fakt, czy slogan. Trajektoria cen: pytanie o cenę w stanie ustalonym ma odpowiedź na podstawie dotychczasowych dowodów — promocja 50% miała zakończyć się 9 września, a jednak 17 września nadal serwowana jest obniżona stawka 0,075 USD / 0,25 USD, więc to kwota promocyjna, a nie cena katalogowa 0,15 USD / 0,50 USD, jest liczbą, na której należy opierać budżet; nierozstrzygnięta pozostaje przyczyna, ponieważ własna cena katalogowa Z.AI się nie zmieniła. Twierdzenie o sprzęcie: Z.AI mówi, że anonimowy tydzień działał na około 100 000 krajowych chipów przy parytecie kosztów z NVIDIA — pierwszym publicznym testem tego na taką skalę jest to, czy twierdzenie przetrwa niezależną weryfikację oraz czy krajowy stos technologiczny stanie się domyślny dla linii GLM. Rachunek adopcji: czy ruch, który Ox Alpha przyciągnął pod maską i który wyniósł ten model na szczyty platform, przełoży się na wdrożenia self-hosted i API, teraz, gdy ma nazwę, licencję i cenę. Ciąg dalszy: czy GLM-5.3-Flash czyni z Ox Alpha odskocznię — wskazówka teortaxesTex jest taka, że wersja poddana dalszemu treningowi stanie się koniem roboczym znacznie mocniejszego GLM 5.5, co uczyniłoby to wydanie fundamentem następnego GLM. A reakcja: gdy Qwen3.8-Flash-Next debiutuje tej samej nocy, a za nim stoi ujawnienie krajowego chipa, presja spoczywa na amerykańskich laboratoriach frontier — i na debacie o kontroli eksportu — by dać odpowiedź; obserwuj, czy szybkie dogonienie, ruch cenowy albo reakcja polityczna wylądują po drugiej stronie luki.
Szczery werdykt: Ox Alpha był niezwykle tanim eksperymentem w obie strony. Platforma sprawdziła, czy anonimowy model klasy frontier po cenie 0 USD mógł w ciągu tygodnia zdobyć prawdziwy ruch produkcyjny — udało się, i to wystarczająco przekonująco, że Z.AI nie tylko ujawniło się szóstego dnia, ale tej samej nocy udostępniło wagi jako model otwarty. Teraz możesz sprawdzić, czy model zasługuje na miejsce w twoim stacku, już bez ryzyka anonimowości: GLM-5.3-Flash to nazwany, licencjonowany na MIT, możliwy do samodzielnego hostowania model w opublikowanej cenie, a pytanie o sprzęt również otrzymało odpowiedź — Z.AI twierdzi, że obsługa 100T tokenów/dzień działała na około 100 000 krajowych chińskich chipów, co podaje firma, ale co jest obecnie szeroko relacjonowane. Pozostaje ustalić, czy „frontier” przetrwa niezależny pomiar, czy twierdzenie Z.AI o parytecie kosztów na krajowych chipach utrzyma się w skali, dlaczego promocja startowa -50% wciąż jest ceną, po której świadczona jest usługa, osiem dni po podanej dacie zakończenia 9 września, oraz czy ujawnienie obsadza GLM-5.3-Flash w roli konia roboczego dla silniejszego GLM 5.5, jak sugeruje teortaxesTex. Przeprowadź eksperyment, ale prowadź go z fallbackiem pod spodem.
Porównane w tym artykule4
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
