Wygenerowana karta tytułowa z napisem „GLM-5.3-Flash Revealed” i podtytułem „Otwarty multimodalny model graniczny Zhipu był anonimowym Ox Alpha — teraz w cenie jednej dziesiątej ceny GLM-5.3”, z płaskimi ikonami liniowymi: chipu z błyskawicą, plakietki MIT oraz ikony obrazu-wideo.
Guides & Insights

GLM-5.3-Flash ujawniony: anonimowy „Ox Alpha” przez cały czas był otwartym multimodalnym modelem granicznym Zhipu

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Model, który przez tydzień zajmował pierwsze miejsce na listach użycia zewnętrznych platform programistycznych, wreszcie ma nazwę i cenę. 26 sierpnia 2026 roku Zhipu AI potwierdziło, że darmowy model „Ox Alpha”, z którego programiści intensywnie korzystali od 20 sierpnia, to GLM-5.3-Flash — model mixture-of-experts o łącznej liczbie 320 miliardów parametrów i 18 miliardach aktywnych (320B-A18B), pierwsze natywnie multimodalne wydanie z serii GLM-5 i jeden z najtańszych modeli z najwyższej półki w momencie premiery w jakimkolwiek cenniku. Zhipu wycenia GLM-5.3-Flash na jedną dziesiątą stawki API swojego flagowego modelu GLM-5.3, a na jedną dwudziestą w ramach ograniczonej czasowo promocji; otwarte wagi — na licencji MIT — trafiły tego samego dnia do Hugging Face. W przeciwieństwie do GLM-5.3, którego wagi wciąż mają się pojawić pod koniec miesiąca, ten model możesz hostować samodzielnie już w tym tygodniu, a nie w następnym.

Oto krótka wersja: Zhipu udostępniło jako open source swój najtańszy jak dotąd duży model, który bije własnego GLM-5.2 w benchmarkach, mimo że działa na ułamku aktywnych parametrów, a producent podaje jego wynik w Artificial Analysis Intelligence Index na 57 — co dorównuje Claude Opus 4.8, według materiałów startowych Zhipu. Wszystkie wyniki benchmarków związane z tą premierą pochodzą od producenta i nie zostały niezależnie odtworzone na dzień pisania tego tekstu; ceny i liczby parametrów są aktualnymi faktami.

Co faktycznie zostało wydane

GLM-5.3-Flash to MoE o łącznej liczbie 320B parametrów i 18B aktywnych, z 45 warstwami, co oznacza, że jego aktywny obszar to nieco ponad połowa aktywnych parametrów GLM-5.2 (~32B). Główną cechą jest modalność: natywnie przyjmuje wejście tekstowe, obrazowe i wideo — jako pierwszy model GLM-5 — zamiast kierować widzenie przez osobny adapter. Kontekst sięga 1 miliona tokenów, a Zhipu twierdzi, że koszt obsługi długiego kontekstu wynosi około jednej trzeciej kosztów GLM-5.3.

Po stronie architektury Zhipu opisuje go jako pierwszy otwartoźródłowy model graniczny wykorzystujący hybrydowy projekt łączący rzadką uwagę z liniową uwagą, w parze z Manifold-Constrained Hyper-Connections (mHC) do skalowania oraz mechanizmem IndexPool, który kompresuje cztery wektory kluczy indeksera do jednej ważonej puli, aby zmniejszyć opóźnienia w długich kontekstach. Pretraining prowadzono na multimodalnym korpusie liczącym 30 bilionów tokenów. Żadne z tych twierdzeń nie zostało jeszcze niezależnie zweryfikowane — to opis modelu autorstwa samego Zhipu — ale deklaracje dotyczące wydajności serwowania są wystarczająco konkretne, by je przetestować, gdy wagi trafią do otwartoźródłowego stosu wnioskowania.

Specyfikacja z dnia premiery w skrócie:

• Parametry — 320B łącznie / 18B aktywne, 45 warstw, MoE.

• Modalność — natywne wejście tekstu, obrazu i wideo; wyjście tekstowe.

• Okno kontekstu — do 1 000 000 tokenów.

• Licencja — MIT, otwarte wagi dostępne na Hugging Face w momencie premiery.

• Cena — $0.15 / $0.50 za milion tokenów (wejście / wyjście), $0.03 za milion tokenów wejściowych z pamięci podręcznej; promocja z 50% zniżką do 9 września 2026 r. obniża to do $0.075 / $0.25 / $0.015. W cenie katalogowej to mniej więcej jedna dziesiąta ceny modelu GLM-5.3 wynoszącej $1.40 / $4.40.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

Tydzień Ox Alpha

To ujawnienie kończy tydzień spekulacji. 20 sierpnia anonimowy model pojawił się na zewnętrznej platformie API AI z oknem kontekstowym o długości 1 miliona tokenów, obsługą wejścia tekstowego, obrazowego i wideo oraz zerową ceną, i szybko stał się najczęściej wywoływanym modelem na tygodniowych listach platformy. Społeczność w ciągu 48 godzin ustaliła, że pochodzi on z rodziny GLM firmy Zhipu — ten sam schemat „najpierw anonimowo, potem potwierdzenie”, który wcześniej identyfikował modele innych chińskich laboratoriów — a analitycy powszechnie typowali wariant Flash modelu GLM-5.3. Ogłoszenie z 26 sierpnia potwierdziło te przypuszczenia i dodało szczegół, że darmowy tydzień był celowym testem: Zhipu twierdzi, że anonimowe uruchomienie ustanowiło rekordy wolumenu wywołań na platformach programistycznych, na których było oferowane, a cały ruch był obsługiwany przez rodzime chińskie chipy.

Kontekst darmowego tygodnia ma znaczenie dla oczekiwań cenowych. Model rozdawany za 0 dolarów przez tydzień, a potem oferowany za jedną dziesiątą stawki flagowca z ograniczonym czasowo rabatem do jednej dwudziestej ceny, to celowy ruch budujący rynek w segmencie budżetowym — a określenie „ograniczony czasowo” to element, na który warto uważać. Rabat to decyzja cenowa, którą można wycofać; otwartych wag MIT nie da się wycofać.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

Ile to kosztuje w rzeczywistych dolarach

Cennik Zhipu jest już dostępny w rzeczywistych dolarach, nie tylko w proporcjach: {{1}}0,15 USD za milion tokenów wejściowych, 0,50 USD za milion tokenów wyjściowych i 0,03 USD za milion tokenów wejściowych z pamięci podręcznej.{{/1}} W porównaniu z opublikowanymi cenami GLM-5.3 wynoszącymi 1,40 / 4,40 USD, daje to mniej więcej jedną dziesiątą ceny katalogowej, a promocja startowa z 50% zniżką obowiązująca do 9 września 2026 r. obniża je do 0,075 / 0,25 / 0,015 USD — mniej więcej jedną dwudziestą. {{2}}Zhipu szacuje również koszt modelu przypadający na zadanie w indeksie AA Intelligence Index na około 0,045 USD, według danych dostawcy,{{/2}} co jest liczbą stojącą za sformułowaniem „1/40 of Opus 4.8”. {{3}}W przypadku modelu, który osiąga wyniki w tym samym przedziale co modele wycenione 10–40 razy wyżej, główne wskaźniki ekonomiczne są realne;{{/3}} drobnym drukiem jest to, że promocyjna zniżka ma charakter tymczasowy, a koszt przypadający na zadanie zależy od tego, jak rozwlekły okaże się model w produkcji.

{{1}}To właśnie w wydajności Zhipu upatruje źródła przewagi kosztowej. W porównaniu z GLM-5.3 dostawca raportuje 3,0-krotnie niższe obliczenia atencji i 4,4-krotnie mniejszą pamięć podręczną KV, a także twierdzi, że spośród porównywanych modeli z niższej półki — GLM-5.3, DeepSeek V4 Flash i Kimi K3 — ma najniższe obliczenia atencji, przyznając jednocześnie, że jego pamięć podręczna KV jest nadal nieco większa niż w DeepSeek V4 Flash i Kimi K3. Po stronie serwowania Zhipu raportuje 3-krotną poprawę wydajności end-to-end względem bazowej na rodzimych chińskich chipach, osiągając koszt na token, który określa jako porównywalny z kosztami na mainstreamowych GPU NVIDIA. Wszystkie te dane pochodzą od dostawcy i żadna z nich nie została jeszcze niezależnie zweryfikowana; to właśnie te liczby należy sprawdzić względem otwartych wag.{{/1}}

Dlaczego ujawnienie ma znaczenie

Odłóżmy na bok benchmarki, a premiera i tak zmienia krajobraz otwartych modeli na dwa sposoby. Po pierwsze, to multimodalny model o otwartych wagach z czołówki w budżetowej cenie — połączenie licencji MIT, kontekstu 1M, natywnego wejścia obrazu/wideo i kosztu rzędu pojedynczych centów za zadanie nie ma bezpośredniego odpowiednika w amerykańskich laboratoriach z czołówki, których odpowiednie modele multimodalne kosztują o rząd wielkości więcej i są udostępniane jako zamknięte. Po drugie, podcina własny flagowy model Zhipu: GLM-5.3 to model 743B, który w tym miesiącu uzyskał niezależnie zmierzony wynik 60 w indeksie AA Intelligence Index, a GLM-5.3-Flash jest pozycjonowany jako „frontier intelligence, flash cost” wobec tej samej rodziny. Zhipu opowiada historię, że mniejszy, tańszy model może przejąć większość możliwości flagowca — co, jeśli twierdzenia producenta o kodowaniu i zdolnościach agentowych się utrzymają, jest tym samym argumentem o ekonomii po treningu, wokół którego branża krąży przez cały rok.

Jedno zastrzeżenie trzyma to w perspektywie. Wynik GLM-5.3-Flash w indeksie AA wynoszący 57 pochodzi z materiałów premierowych Zhipu, a jeszcze nie z listy rankingowej Artificial Analysis, a porównanie kodowania z Claude Opus 4.8 to wewnętrzna ocena Zhipu w Z.ai Code Bench. Traktuj 57 i parytet w kodowaniu jako deklaracje, dopóki nie pojawią się niezależne pomiary — model był szeroko testowany anonimowo, więc liczby od stron trzecich powinny pojawić się szybko.

Wypróbuj to i sprawdź, jak pasuje warstwa routingu.

Dostęp od pierwszego dnia odbywa się przez własne API Zhipu, otwarte wagi na Hugging Face (zai-org/GLM-5.3-Flash, MIT) oraz produkty programistyczne Zhipu — ZCode i GLM Coding Plan, który obejmuje pakiet codziennych kart doświadczeń. W przypadku samodzielnego hostingu licencja MIT oraz wsparcie vLLM i SGLang oznaczają, że powyższe deklaracje dotyczące wydajności serwowania można bezpośrednio zweryfikować.

Po stronie routingu sam GLM-5.3-Flash nie znajduje się jeszcze na liście OrcaRouter w tej aktualizacji. Reszta rodziny GLM wygląda następująco: GLM-5.3 wystartował po naszej stronie tego samego dnia, w którym otwarto API Zhipu, w cenie katalogowej Zhipu z 0% narzutu. Taki pass-through to dokładnie mechanizm, który ma znaczenie przy takiej premierze — zmiana ceny dostawcy, niezależnie od tego, czy rabat się utrzyma, czy cennik zmieni się później, pojawia się po naszej stronie tego samego dnia, bez ponownych negocjacji. Jeśli chcesz uruchomić Flasha wraz z resztą linii GLM na jednym kluczu, gdy tylko się pojawi, to jest właśnie ta konfiguracja; do tego czasu wagi na Hugging Face to najszybszy sposób, aby przetestować go samodzielnie.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

Co obejrzeć dalej

Trzy rzeczy rozstrzygną prawdziwą historię w ciągu najbliższych kilku tygodni. Po pierwsze, niezależny pomiar Artificial Analysis modelu 57 — model działał już w środowisku produkcyjnym jako Ox Alpha, więc ranking powinien szybko go dogonić. Po drugie, czy promocja 50% zniżki — obecnie zaplanowana na koniec 9 września 2026 — zostanie przedłużona po tę datę, ponieważ to zdecyduje o koszcie stałym Flasha. Po trzecie, wagi GLM-5.3, wciąż obiecane na około 28 sierpnia — w tym samym tygodniu, w którym opublikowano wagi MIT Flasha, co dałoby społeczności otwartych wag dwie warstwy tej samej rodziny do porównania naraz.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube