
GLM-5.3-FlashX vs GLM-5.3-Flash: te same wagi, 2,5× wyższa cena, jedna inna liczba
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Nie można kupić GLM-5.3-FlashX i dostać lepszego modelu. To nie zarzut — na tym polega cała idea. GLM-5.3-FlashX, udostępniony w API Z.ai 18 września 2026 r., działa na identycznych wagach co GLM-5.3-Flash: ten sam szkielet mixture-of-experts o łącznej liczbie 320 mld parametrów i 18 mld aktywnych, ten sam kontekst 1 mln tokenów, to samo natywne wejście tekstowe, obrazowe, wideo i plikowe, ten sam limit wyjścia 131 072 tokenów. Z.ai nie opublikował żadnego benchmarku FlashX, bo nie ma tu nic nowego do testowania. Różni się to, jak szybko pojawiają się tokeny i ile kosztują, a te dwie liczby to jedyne, nad czym kupujący musi się zastanowić.
To czystsza decyzja niż większość porównań modeli i trudniejsza, bo nie można ukryć się za opowieścią o możliwościach. Albo opóźnienie jest dla ciebie warte 2,5×, albo nie.
Jeden model, dwie ceny
• Czym jest FlashX — warstwa serwowania, a nie wydanie modelu; te same wagi, te same wyniki, te same limitybr> • Cena wejścia — 0,37 USD za 1 mln tokenów w FlashX vs 0,15 USD za 1 mln w Flash według cennikabr> • Cena wyjścia — 1,25 USD za 1 mln vs 0,50 USD za 1 mln, mnożnik, który faktycznie wpływa na rachunekbr> • Wejście z pamięci podręcznej — 0,075 USD za 1 mln vs 0,03 USD za 1 mlnbr> • Szybkość — do 200 tokenów wyjściowych na sekundę (szczyt podawany przez dostawcę) vs 98 tok/s zmierzone niezależnie przez Artificial Analysisbr> • Dostęp w ramach subskrypcji — GLM-5.3-Flash jest objęty planem GLM Coding Plan firmy Z.ai z 3× przydziałem; FlashX nie jest objętybr> • Hostowanie własne — GLM-5.3-Flash to otwarte wagi na licencji MIT na Hugging Face; FlashX nie ma wag do pobrania

Na rodzimym rynku Z.ai ten sam stosunek podaje się wprost: ¥2 za wejście i ¥7 za wyjście dla FlashX wobec ¥0,8 i ¥2,8 dla Flash. Wiele chińskich serwisów opisuje premierę w ten sam sposób — 5× większa prędkość przy 2,5× wyższej cenie — a każdy z nich zauważa, że inteligencja się nie zmieniła.
Latencja to pozycja rozliczeniowa i nie jest wyceniana za token.
To, że 2,5× nie jest automatycznie złym interesem, wynika z tego, że cena tokena i koszt zadania to różne wielkości. Zadanie wsadowe, które przez noc wygeneruje milion tokenów wyjściowych, płaci 0,50 USD w przypadku Flash i 1,25 USD w przypadku FlashX wyłącznie za wyjście, a za dodatkowe 0,75 USD nie dostaje nic w zamian, bo nikt nie czeka. Pętla agenta wykonująca dziesięć kolejnych wywołań płaci tę samą dopłatę za token, ale każde wywołanie zwraca wynik szybciej, a oszczędności przekładają się na czas zegarowy, a nie na fakturę. Jeśli FlashX rzeczywiście zwraca wynik w ułamku czasu, dziesięć tur może zaoszczędzić dziesiątki sekund opóźnienia na zadanie — a jeśli to zadanie blokuje człowieka lub usługę nadrzędną, te sekundy są warte więcej niż tokeny.
Samo pozycjonowanie Z.ai wpisuje się dokładnie w tę linię. Kieruje ono FlashX do programowania o wysokiej współbieżności, wieloetapowych wywołań agentów, dialogu w czasie rzeczywistym, uzupełniania kodu i pracy multimodalnej z długim kontekstem, a obciążenia wrażliwe na cenę i niewrażliwe na opóźnienia — przetwarzanie wsadowe offline, masowe generowanie, wszystko, co zaplanowane — kieruje z powrotem do bazowego Flasha. To właściwy podział i warto zauważyć, że to dostawca go wyznacza.
Rozumowanie załamuje się na poziomie przepustowości. 200 tokenów na sekundę w FlashX to szczytowy wynik podawany przez dostawcę; 98 w modelu bazowym to mediana zmierzona przez niezależne laboratorium. Szczyty osiąga się przy krótkich odpowiedziach, z rozgrzanymi pamięciami podręcznymi i bezczynnym klastrem. Długokontekstowe żądanie multimodalne — dokładnie ten rodzaj obciążenia, na który FlashX jest ukierunkowany — najrzadziej się do niego zbliży, a nikt poza Z.ai nie opublikował liczb, które rozstrzygnęłyby tę kwestię. Jeśli twoje obciążenie jest ograniczone przepustowością, a nie opóźnieniem, liczba szczytowa mówi ci bardzo niewiele o tym, co faktycznie otrzymasz.
Wyjście awaryjne, którego FlashX nie ma
W tym porównaniu istnieje trzecia opcja i istnieje ona tylko dlatego, że model bazowy jest otwarty. GLM-5.3-Flash został wydany 26 sierpnia 2026 r. na licencji MIT, z wagami na Hugging Face i ModelScope, a dziś obsługują go stosy inferencyjne, w tym SGLang, vLLM, TokenSpeed i KTransformers. Jeśli Twój wolumen jest wystarczająco duży, by uzasadnić sprzęt, uczciwe porównanie nie polega na zestawieniu Flash z FlashX — chodzi o 1,25 USD za milion tokenów wyjściowych w FlashX w porównaniu z Twoim własnym zamortyzowanym kosztem na token na Twoich własnych akceleratorach.

Ta opcja ma realną cenę wejścia. Wydanie FP8 wymaga do obsługi rzędu 328 GB pamięci GPU, co dla większości zespołów oznacza wdrożenie wielowęzłowe, a dla pozostałych jest od razu wykluczone. Warto to jednak powiedzieć, ponieważ to właśnie asymetria sprawia, że cennik FlashX jest celowym testem, a nie nieuchronnością: Z.ai pobiera dopłatę za konfigurację serwowania, którą w przypadku modelu bazowego klienci mogą co do zasady zbudować sami. Dopłata jest za wygodę, nie za możliwości, a wygoda ma rynkową stawkę, która z czasem spada.
O co tak naprawdę chodzi ze zmianą ceny
Ekonomika stojąca za premierą jest niezwykle czytelna. GLM-5.3-Flash wydano w cenie stanowiącej jedną dziesiątą ceny GLM-5.3 — w połowie tej kwoty podczas promocji premierowej — i był intensywnie używany, w tym przez pewien okres anonimowych testów przedpremierowych, które Z.ai od tego czasu potwierdziło. FlashX to pierwszy raz, gdy ta rodzina ruszyła w przeciwnym kierunku: ten sam model, wyżej wyceniony. Analitycy cytowani w chińskiej prasie finansowej odczytują to jako celowy test komercyjny tego, czy deweloperzy będą płacić za samą szybkość, po roku kupowania udziału w rynku za pomocą możliwości niemal czołowych w stawce w cenach produktu masowego.
Dwa szczegóły wspierają tę interpretację. FlashX jest wykluczony z planu GLM Coding, podczas gdy podstawowy Flash jest objęty potrójnym limitem, więc użytkownicy subskrypcji nie mogą włączyć nowego poziomu do istniejącego zobowiązania — płacą za token. A cena jest stała, bez zniżki poza godzinami szczytu, w przeciwieństwie do struktury zależnej od pory dnia, którą niektórzy konkurenci stosują, by zapełnić niewykorzystane moce. Stała stawka 2,5× za poziom szybkości to cena dla ludzi, którzy nie mogą czekać, a Z.ai przekonuje się, ilu ich jest.
Wybór między nimi
Wybierz FlashX, jeśli człowiek lub usługa jest zablokowana na kolejnym tokenie, a sam model jest już właściwym wyborem — uzupełnianie w treści, agenci interaktywni, czat w czasie rzeczywistym, cokolwiek, gdzie pauza jest produktem. Wybierz GLM-5.3-Flash do pracy wsadowej, offline i masowej, do wszystkiego, co można zaplanować, oraz do każdego obciążenia, w którym płacisz za ilość danych wyjściowych, a nie za opóźnienie ich generowania. Jeśli Twój wolumen jest duży, a Twój zespół może uruchamiać akceleratory, wyceń samodzielnie hostowane wagi bazowe, zanim wycenisz FlashX; porównanie wypada korzystniej, niż sugerują stawki za tokeny.
Niezależnie od tego, którą drogę wybierzesz, traktuj oba rozwiązania jako wymienne w miejscu wywołania. Przyjmują te same prompty, zwracają ten sam format i dają tę samą jakość — jedyne, co się zmienia, to ciąg znaków modelu, czyli najtańszy rodzaj testu A/B do przeprowadzenia. Na OrcaRouter cena katalogowa dostawcy jest przekazywana z 0% marży, więc zmiana cennika Z.ai lub promocja obowiązuje od dnia, w którym pojawi się u dostawcy, a oba poziomy są dostępne za pośrednictwem jednego punktu końcowego obsługującego ponad 200 modeli. W przypadku decyzji, która w całości opiera się na zmierzonej latencji, możliwość przełączania się między nimi w trakcie eksperymentu bez ingerencji w integrację to większość pracy.
Werdykt jest węższy niż w typowym porównaniu modeli i właśnie o to chodzi. FlashX nie jest lepszym modelem i nie udaje, że nim jest. To ten sam model z krótszą kolejką, sprzedawany w cenie, która ma sens tylko wtedy, gdy kolejka była Twoim problemem. Zmierz własny czas do pierwszego tokenu w obu przypadkach, zanim się zdecydujesz — 200 podane przez dostawcę to górny limit, Twoje obciążenie to jedyny benchmark, który się liczy, a różnica między tymi dwoma poziomami to zaledwie jedna zmiana konfiguracji.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
