Karta tytułowa hero dla GLM-5.3-FlashX z podtytułem „Te same wagi, 2,5× wyższa cena”, z plakietkami „Do 200 tok/s (według dostawcy)”, „$0,37 / $1,25 za 1 mln” i „kontekst 1 mln” oraz wierszem stopki „Poziom usług uruchomiony 18 września 2026”.
Guides & Insights

GLM-5.3-FlashX debiutuje w cenie 2,5 razy wyższej niż model, na którym działa

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Liczba, którą warto zauważyć, to nie 200. To 2,5. 18 września 2026 r. Z.ai udostępnił GLM-5.3-FlashX w swoim API z przepustowością do 200 tokenów wyjściowych na sekundę — i wycenił go na 2,5× tego, co pobiera za GLM-5.3-Flash, model z otwartymi wagami, na którym został zbudowany. Jeśli chodzi o sam model, nic się nie zmieniło. Te same wagi, ten sam szkielet mixture-of-experts 320B-A18B, ten sam kontekst 1 mln tokenów, ta sama natywna obsługa tekstu, obrazów, wideo i plików. Zmienił się stos obsługi pod nim oraz to, ile Z.ai teraz pobiera za przywilej bycia bliżej czoła kolejki.

To czyni FlashX rzadkością na rynku modeli: premierę bez dołączonego benchmarku. Z.ai nie opublikowało żadnej oceny specyficznej dla FlashX, ponieważ nie ma nowego modelu do oceny. Wszystkie dane dotyczące możliwości odnoszące się do GLM-5.3-Flash odnoszą się również tutaj, w tym te, które są mniej pochlebne, niż sugerowały materiały premierowe.

Cała delta, w jednym przebiegu

• Szybkość — GLM-5.3-FlashX do 200 tok/s (szczytowy wynik podawany przez producenta) vs GLM-5.3-Flash przy 98 tok/s zmierzonych przez Artificial Analysis na własnym API Z.aibr> • Cena — 0,37 USD za 1 mln tokenów wejściowych / 1,25 USD za 1 mln tokenów wyjściowych vs 0,15 / 0,50 USD z cennikabr> • Wejście z pamięci podręcznej — 0,075 USD za 1 mln vs 0,03 USD za 1 mlnbr> • Inteligencja — identyczna; FlashX dziedziczy wyniki modelu bazowegobr> • Kontekst — 1 mln tokenów w obu modelachbr> • Wagi — GLM-5.3-Flash to otwarte wagi na licencji MIT; FlashX to warstwa hostowana i nie ma własnych

Liczby 200 i 98 nie są tym samym rodzajem liczby i warto powiedzieć to bez ogródek. Jedna z nich to górna granica, którą według dostawcy usługa może osiągnąć. Druga to wynik, który niezależne laboratorium zmierzyło na rzeczywistych żądaniach. Użytkownik, który decyduje, czy zapłacić 2,5× więcej, powinien potraktować 200 jako reklamę i samodzielnie zmierzyć własne obciążenie.

A single-column scoreboard titled 'GLM-5.3-FlashX - the scoreboard' with rows reading 'Speed: up to 200 tok/s (vendor peak)', 'Measured speed: 98 tok/s (base model)', 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Context: 1M tokens' and 'Weights: hosted tier only', with a footer reading 'Speed is a vendor-reported peak; base-model figures per Artificial Analysis.'

To, co mówi Z.ai, wykonuje pracę.

Przyspieszenie wynika z infrastruktury, a nie z matematyki. Z.ai opisuje FlashX jako działający na klastrze około 100 000 rodzimych chińskich akceleratorów ze specjalnie zaprojektowanym stosem serwowania: silnikiem wnioskowania opartym na SGLang, kwantyzacją W8A8, mieszaną kwantyzacją pamięci podręcznej INT8/FP8/BF16 oraz zdezagregowaną architekturą encode–prefill–decode, która oddziela etap kodowania multimodalnego od etapów generowania tokenów, dzięki czemu żaden nie blokuje drugiego. Firma donosi o około 3× większej przepustowości usługi end-to-end w porównaniu z początkowym poziomem bazowym na tym samym sprzęcie i twierdzi, że agent infrastrukturalny oparty na GLM-5.3 pomógł dostroić ten stos.

Wszystko to jest raportowane przez dostawcę i jak dotąd nie zostało odtworzone przez nikogo spoza Z.ai. Jest to także najbardziej wiarygodna część tej historii: premiery poziomu serwowania takie jak ta są zwykle sukcesami inżynieryjnymi, a opisane wybory architektoniczne to standardowy zestaw narzędzi do dokładnie tego rodzaju zysku. Nie są one jednak gwarancją. Wartość 200 tok/s to szczyt, a szczyty osiąga się przy krótkich wyjściach, rozgrzanych pamięciach podręcznych i nieobciążonym klastrze. Długokontekstowe żądania multimodalne — obciążenie, na które FlashX jest wprost ukierunkowany — mają najmniejsze szanse, by go osiągnąć.

Cena jest faktyczną decyzją produktową

W cenniku katalogowym GLM-5.3-FlashX kosztuje 0,37 USD za milion tokenów wejściowych i 1,25 USD za milion tokenów wyjściowych, przy czym wejście z pamięci podręcznej kosztuje 0,075 USD, a przechowywanie w pamięci podręcznej jest bezpłatne przez ograniczony czas. W krajowym cenniku Z.ai to 2 ¥ za wejście i 7 ¥ za wyjście, wobec 0,8 ¥ i 2,8 ¥ dla bazowej wersji Flash — ten sam stosunek 2,5×, podany w walucie, w której Z.ai sprzedaje u siebie.

A screenshot of Z.ai's official pricing documentation page (captured September 19, 2026) showing the 'Latest Models' table with GLM-5.3-Flash at $0.15 input, $0.03 cached input and $0.50 output per 1M tokens, and GLM-5.3-FlashX at $0.37, $0.075 and $1.25.

Arytmetyka szybko staje się niewygodna w kierunku, który ludzie rzadko sprawdzają. Tokeny wyjściowe to miejsce, w którym mnożnik kąsa najdotkliwiej, ponieważ wyjście jest drogą stroną w każdym modelu z tej rodziny: wyjście FlashX to 2,5× wyjścia Flash, a wyjście już kosztuje ~3,4× więcej niż wejście w obu przypadkach. Zadanie wsadowe generujące milion tokenów wyjściowych dziennie przechodzi z $0,50 na $1,25 — różnica $274 rocznie w przypadku obciążenia, na które z definicji nikt nie czeka.

Tam, gdzie się to opłaca, chodzi o opóźnienie, które można amortyzować. Pętla agenta wykonująca dziesięć sekwencyjnych wywołań oszczędza różnicę przypadającą na wywołanie dziesięć razy, a jeśli ta różnica wynosi dwie lub trzy sekundy, odzyskujesz pół minuty czasu zegarowego na zadanie. W przypadku interaktywnego uzupełniania kodu, dialogu w czasie rzeczywistym lub dowolnego potoku, w którym człowiek lub usługa nadrzędna jest zablokowana w oczekiwaniu na następny token, taki kompromis jest zwykle właściwy. Z.ai również wyraźnie zaznacza, że model nie wchodzi obecnie w skład GLM Coding Plan, więc użytkownicy subskrypcji nie otrzymują FlashX w pakiecie — płacą za niego za każdy token.

Jeśli Twój stack już obsługuje więcej niż jednego dostawcę, przełączenie to zmiana ciągu modelu i nic więcej. To jest praktyczny powód, dla którego routing istnieje jako warstwa: w OrcaRouter cena katalogowa dostawcy jest przekazywana z 0% marży, więc zmiana ceny Z.ai lub obniżka promocyjna wchodzi w życie tego samego dnia, w którym następuje po stronie dostawcy, a pojedynczy endpoint przed ponad 200 modelami oznacza, że porównanie FlashX z Flash to edycja konfiguracji, a nie projekt integracyjny. Przełączanie awaryjne również ma tu znaczenie — zupełnie nowa warstwa serwowania na zupełnie nowym klastrze to dokładnie ten rodzaj zależności, za którym warto mieć mechanizm awaryjny.

Co się nie zmieniło i dlaczego ma to większe znaczenie

FlashX dziedziczy w pełni profil możliwości GLM-5.3-Flash, a ten profil jest węższy, niż sugerowały relacje z premiery. Materiały Z.ai stawiają model bazowy na poziomie Claude Opus 4.8 w Artificial Analysis Intelligence Index. Sam Artificial Analysis obecnie umieszcza GLM-5.3-Flash z wynikiem 42 w tym indeksie, zmierzonym na własnym API Z.ai — to solidny wynik, znacznie powyżej mediany dla modeli z otwartymi wagami w tej klasie i daleko mu do poziomu czołówki, na który wskazuje porównanie dostawcy. Oba stwierdzenia są prawdziwe; to po prostu nie to samo stwierdzenie, a różnica między nimi jest powodem, dla którego ten blog oznacza liczby dostawców jako liczby dostawców.

Model bazowy jest naprawdę zdolny i naprawdę otwarty. GLM-5.3-Flash został wydany 26 sierpnia 2026 r. na licencji MIT z wagami na Hugging Face, a jego hybrydowa konstrukcja uwagi liniowej i rzadkiej — kompresja IndexPool, hiperpołączenia z ograniczeniami rozmaitości — redukuje obliczenia uwagi około 3× i pamięć podręczną KV około 4,4× względem GLM-5.3, co sprawia, że model 320B z 18B aktywnych parametrów jest w ogóle wystarczająco tani w obsłudze. Dane wyjściowe są ograniczone do 131 072 tokenów. Jest szybki jak na swoją cenę, ale nie szybki jak na swoją klasę: Artificial Analysis zmierzyło 98 tokenów na sekundę przy medianie konkurentów powyżej 70, ale poniżej najszybszych modeli w zestawieniu.

FlashX nie zmienia żadnej z tych rzeczy. Zmienia to, jak długo na to czekasz.

Uczciwa ocena

Kup FlashX, jeśli Twoje obciążenie jest ograniczane opóźnieniami i jeśli już zdecydowałeś, że GLM-5.3-Flash to właściwy model — agent łańcuchujący wywołania, edytor dopełniający tekst w miejscu, interfejs głosowy lub czatowy, w którym pauza jest produktem. Zostań przy GLM-5.3-Flash albo przy otwartych wagach, które możesz hostować samodzielnie, jeśli Twoja praca jest wsadowa, offline lub ograniczana przepustowością, a nie opóźnieniami. Inteligencja, za którą płacisz 2,5× więcej, to inteligencja, którą już miałeś.

Otwartym pytaniem pozostaje, co niezależny pomiar mówi o 200. Nikt poza Z.ai nie opublikował jeszcze liczb przepustowości FlashX i dopóki ktoś tego nie zrobi, uczciwe stanowisko jest takie, że FlashX to obiecujący poziom usług sprzedawany na podstawie szczytowego wyniku. Jest to także, co warte uwagi, test komercyjny: laboratorium, które przez rok udostępniało model bliski czołówki za jedną dziesiątą ceny swojego flagowego produktu, pyta teraz, czy programiści zapłacą za szybkość samą w sobie. Odpowiedź wpłynie na to, jak zostanie wyceniony następny poziom.

A screenshot of the OrcaRouter models catalogue (captured September 19, 2026) showing the header '199 models - 15 providers - one API key, one bill', the filter chips for input modalities, context length, input price, status, series and supported parameters, and the 'How to call any model' panel with the POST https://api.orcarouter.ai/v1/chat/completions endpoint.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie