Karta tytułowa hero dla GLM-5.3-FlashX vs GLM-5.3-Flash, z podtytułem „Te same wagi, dwie metki z ceną”, z plakietkami o treści „200 vs 98 tok/s”, „$0.37 / $1.25 vs $0.15 / $0.50” i „Identyczna inteligencja” oraz wierszem stopki „Premiera GLM-5.3-FlashX 18 września 2026”.
Guides & Insights

GLM-5.3-FlashX vs GLM-5.3-Flash: te same wagi, 2,5× wyższa cena, jedna inna liczba

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Nie można kupić GLM-5.3-FlashX i dostać lepszego modelu. To nie zarzut — na tym polega cała idea. GLM-5.3-FlashX, udostępniony w API Z.ai 18 września 2026 r., działa na identycznych wagach co GLM-5.3-Flash: ten sam szkielet mixture-of-experts o łącznej liczbie 320 mld parametrów i 18 mld aktywnych, ten sam kontekst 1 mln tokenów, to samo natywne wejście tekstowe, obrazowe, wideo i plikowe, ten sam limit wyjścia 131 072 tokenów. Z.ai nie opublikował żadnego benchmarku FlashX, bo nie ma tu nic nowego do testowania. Różni się to, jak szybko pojawiają się tokeny i ile kosztują, a te dwie liczby to jedyne, nad czym kupujący musi się zastanowić.

To czystsza decyzja niż większość porównań modeli i trudniejsza, bo nie można ukryć się za opowieścią o możliwościach. Albo opóźnienie jest dla ciebie warte 2,5×, albo nie.

Jeden model, dwie ceny

• Czym jest FlashX — warstwa serwowania, a nie wydanie modelu; te same wagi, te same wyniki, te same limitybr> • Cena wejścia — 0,37 USD za 1 mln tokenów w FlashX vs 0,15 USD za 1 mln w Flash według cennikabr> • Cena wyjścia — 1,25 USD za 1 mln vs 0,50 USD za 1 mln, mnożnik, który faktycznie wpływa na rachunekbr> • Wejście z pamięci podręcznej — 0,075 USD za 1 mln vs 0,03 USD za 1 mlnbr> • Szybkość — do 200 tokenów wyjściowych na sekundę (szczyt podawany przez dostawcę) vs 98 tok/s zmierzone niezależnie przez Artificial Analysisbr> • Dostęp w ramach subskrypcji — GLM-5.3-Flash jest objęty planem GLM Coding Plan firmy Z.ai z 3× przydziałem; FlashX nie jest objętybr> • Hostowanie własne — GLM-5.3-Flash to otwarte wagi na licencji MIT na Hugging Face; FlashX nie ma wag do pobrania

A two-column scoreboard titled 'GLM-5.3-FlashX vs GLM-5.3-Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: hosted tier only'; the GLM-5.3-Flash column reads 'Price: $0.15 / $0.50 per 1M', 'Cached input: $0.03 per 1M', 'Speed: 98 tok/s (measured)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: MIT open weights'; the footer reads 'Same weights and same scores; only serving speed and price differ.'

Na rodzimym rynku Z.ai ten sam stosunek podaje się wprost: ¥2 za wejście i ¥7 za wyjście dla FlashX wobec ¥0,8 i ¥2,8 dla Flash. Wiele chińskich serwisów opisuje premierę w ten sam sposób — 5× większa prędkość przy 2,5× wyższej cenie — a każdy z nich zauważa, że inteligencja się nie zmieniła.

Latencja to pozycja rozliczeniowa i nie jest wyceniana za token.

To, że 2,5× nie jest automatycznie złym interesem, wynika z tego, że cena tokena i koszt zadania to różne wielkości. Zadanie wsadowe, które przez noc wygeneruje milion tokenów wyjściowych, płaci 0,50 USD w przypadku Flash i 1,25 USD w przypadku FlashX wyłącznie za wyjście, a za dodatkowe 0,75 USD nie dostaje nic w zamian, bo nikt nie czeka. Pętla agenta wykonująca dziesięć kolejnych wywołań płaci tę samą dopłatę za token, ale każde wywołanie zwraca wynik szybciej, a oszczędności przekładają się na czas zegarowy, a nie na fakturę. Jeśli FlashX rzeczywiście zwraca wynik w ułamku czasu, dziesięć tur może zaoszczędzić dziesiątki sekund opóźnienia na zadanie — a jeśli to zadanie blokuje człowieka lub usługę nadrzędną, te sekundy są warte więcej niż tokeny.

Samo pozycjonowanie Z.ai wpisuje się dokładnie w tę linię. Kieruje ono FlashX do programowania o wysokiej współbieżności, wieloetapowych wywołań agentów, dialogu w czasie rzeczywistym, uzupełniania kodu i pracy multimodalnej z długim kontekstem, a obciążenia wrażliwe na cenę i niewrażliwe na opóźnienia — przetwarzanie wsadowe offline, masowe generowanie, wszystko, co zaplanowane — kieruje z powrotem do bazowego Flasha. To właściwy podział i warto zauważyć, że to dostawca go wyznacza.

Rozumowanie załamuje się na poziomie przepustowości. 200 tokenów na sekundę w FlashX to szczytowy wynik podawany przez dostawcę; 98 w modelu bazowym to mediana zmierzona przez niezależne laboratorium. Szczyty osiąga się przy krótkich odpowiedziach, z rozgrzanymi pamięciami podręcznymi i bezczynnym klastrem. Długokontekstowe żądanie multimodalne — dokładnie ten rodzaj obciążenia, na który FlashX jest ukierunkowany — najrzadziej się do niego zbliży, a nikt poza Z.ai nie opublikował liczb, które rozstrzygnęłyby tę kwestię. Jeśli twoje obciążenie jest ograniczone przepustowością, a nie opóźnieniem, liczba szczytowa mówi ci bardzo niewiele o tym, co faktycznie otrzymasz.

Wyjście awaryjne, którego FlashX nie ma

W tym porównaniu istnieje trzecia opcja i istnieje ona tylko dlatego, że model bazowy jest otwarty. GLM-5.3-Flash został wydany 26 sierpnia 2026 r. na licencji MIT, z wagami na Hugging Face i ModelScope, a dziś obsługują go stosy inferencyjne, w tym SGLang, vLLM, TokenSpeed i KTransformers. Jeśli Twój wolumen jest wystarczająco duży, by uzasadnić sprzęt, uczciwe porównanie nie polega na zestawieniu Flash z FlashX — chodzi o 1,25 USD za milion tokenów wyjściowych w FlashX w porównaniu z Twoim własnym zamortyzowanym kosztem na token na Twoich własnych akceleratorach.

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 19, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input, a 2026-08-26 release date by Z.ai, the 320B total / 18B active parameter line, and the billing row reading $0.07 per 1M input and $0.25 per 1M output tokens with a 6.68-second p50 time to first token.

Ta opcja ma realną cenę wejścia. Wydanie FP8 wymaga do obsługi rzędu 328 GB pamięci GPU, co dla większości zespołów oznacza wdrożenie wielowęzłowe, a dla pozostałych jest od razu wykluczone. Warto to jednak powiedzieć, ponieważ to właśnie asymetria sprawia, że cennik FlashX jest celowym testem, a nie nieuchronnością: Z.ai pobiera dopłatę za konfigurację serwowania, którą w przypadku modelu bazowego klienci mogą co do zasady zbudować sami. Dopłata jest za wygodę, nie za możliwości, a wygoda ma rynkową stawkę, która z czasem spada.

O co tak naprawdę chodzi ze zmianą ceny

Ekonomika stojąca za premierą jest niezwykle czytelna. GLM-5.3-Flash wydano w cenie stanowiącej jedną dziesiątą ceny GLM-5.3 — w połowie tej kwoty podczas promocji premierowej — i był intensywnie używany, w tym przez pewien okres anonimowych testów przedpremierowych, które Z.ai od tego czasu potwierdziło. FlashX to pierwszy raz, gdy ta rodzina ruszyła w przeciwnym kierunku: ten sam model, wyżej wyceniony. Analitycy cytowani w chińskiej prasie finansowej odczytują to jako celowy test komercyjny tego, czy deweloperzy będą płacić za samą szybkość, po roku kupowania udziału w rynku za pomocą możliwości niemal czołowych w stawce w cenach produktu masowego.

Dwa szczegóły wspierają tę interpretację. FlashX jest wykluczony z planu GLM Coding, podczas gdy podstawowy Flash jest objęty potrójnym limitem, więc użytkownicy subskrypcji nie mogą włączyć nowego poziomu do istniejącego zobowiązania — płacą za token. A cena jest stała, bez zniżki poza godzinami szczytu, w przeciwieństwie do struktury zależnej od pory dnia, którą niektórzy konkurenci stosują, by zapełnić niewykorzystane moce. Stała stawka 2,5× za poziom szybkości to cena dla ludzi, którzy nie mogą czekać, a Z.ai przekonuje się, ilu ich jest.

Wybór między nimi

Wybierz FlashX, jeśli człowiek lub usługa jest zablokowana na kolejnym tokenie, a sam model jest już właściwym wyborem — uzupełnianie w treści, agenci interaktywni, czat w czasie rzeczywistym, cokolwiek, gdzie pauza jest produktem. Wybierz GLM-5.3-Flash do pracy wsadowej, offline i masowej, do wszystkiego, co można zaplanować, oraz do każdego obciążenia, w którym płacisz za ilość danych wyjściowych, a nie za opóźnienie ich generowania. Jeśli Twój wolumen jest duży, a Twój zespół może uruchamiać akceleratory, wyceń samodzielnie hostowane wagi bazowe, zanim wycenisz FlashX; porównanie wypada korzystniej, niż sugerują stawki za tokeny.

Niezależnie od tego, którą drogę wybierzesz, traktuj oba rozwiązania jako wymienne w miejscu wywołania. Przyjmują te same prompty, zwracają ten sam format i dają tę samą jakość — jedyne, co się zmienia, to ciąg znaków modelu, czyli najtańszy rodzaj testu A/B do przeprowadzenia. Na OrcaRouter cena katalogowa dostawcy jest przekazywana z 0% marży, więc zmiana cennika Z.ai lub promocja obowiązuje od dnia, w którym pojawi się u dostawcy, a oba poziomy są dostępne za pośrednictwem jednego punktu końcowego obsługującego ponad 200 modeli. W przypadku decyzji, która w całości opiera się na zmierzonej latencji, możliwość przełączania się między nimi w trakcie eksperymentu bez ingerencji w integrację to większość pracy.

Werdykt jest węższy niż w typowym porównaniu modeli i właśnie o to chodzi. FlashX nie jest lepszym modelem i nie udaje, że nim jest. To ten sam model z krótszą kolejką, sprzedawany w cenie, która ma sens tylko wtedy, gdy kolejka była Twoim problemem. Zmierz własny czas do pierwszego tokenu w obu przypadkach, zanim się zdecydujesz — 200 podane przez dostawcę to górny limit, Twoje obciążenie to jedyny benchmark, który się liczy, a różnica między tymi dwoma poziomami to zaledwie jedna zmiana konfiguracji.

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 19, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, $0.15 per 1M input and $0.50 per 1M output tokens, and a measured 98 output tokens per second against an average of 71.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie