
GLM-5.3-FlashX debiutuje w cenie 2,5 razy wyższej niż model, na którym działa
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Liczba, którą warto zauważyć, to nie 200. To 2,5. 18 września 2026 r. Z.ai udostępnił GLM-5.3-FlashX w swoim API z przepustowością do 200 tokenów wyjściowych na sekundę — i wycenił go na 2,5× tego, co pobiera za GLM-5.3-Flash, model z otwartymi wagami, na którym został zbudowany. Jeśli chodzi o sam model, nic się nie zmieniło. Te same wagi, ten sam szkielet mixture-of-experts 320B-A18B, ten sam kontekst 1 mln tokenów, ta sama natywna obsługa tekstu, obrazów, wideo i plików. Zmienił się stos obsługi pod nim oraz to, ile Z.ai teraz pobiera za przywilej bycia bliżej czoła kolejki.
To czyni FlashX rzadkością na rynku modeli: premierę bez dołączonego benchmarku. Z.ai nie opublikowało żadnej oceny specyficznej dla FlashX, ponieważ nie ma nowego modelu do oceny. Wszystkie dane dotyczące możliwości odnoszące się do GLM-5.3-Flash odnoszą się również tutaj, w tym te, które są mniej pochlebne, niż sugerowały materiały premierowe.
Cała delta, w jednym przebiegu
• Szybkość — GLM-5.3-FlashX do 200 tok/s (szczytowy wynik podawany przez producenta) vs GLM-5.3-Flash przy 98 tok/s zmierzonych przez Artificial Analysis na własnym API Z.aibr> • Cena — 0,37 USD za 1 mln tokenów wejściowych / 1,25 USD za 1 mln tokenów wyjściowych vs 0,15 / 0,50 USD z cennikabr> • Wejście z pamięci podręcznej — 0,075 USD za 1 mln vs 0,03 USD za 1 mlnbr> • Inteligencja — identyczna; FlashX dziedziczy wyniki modelu bazowegobr> • Kontekst — 1 mln tokenów w obu modelachbr> • Wagi — GLM-5.3-Flash to otwarte wagi na licencji MIT; FlashX to warstwa hostowana i nie ma własnych
Liczby 200 i 98 nie są tym samym rodzajem liczby i warto powiedzieć to bez ogródek. Jedna z nich to górna granica, którą według dostawcy usługa może osiągnąć. Druga to wynik, który niezależne laboratorium zmierzyło na rzeczywistych żądaniach. Użytkownik, który decyduje, czy zapłacić 2,5× więcej, powinien potraktować 200 jako reklamę i samodzielnie zmierzyć własne obciążenie.

To, co mówi Z.ai, wykonuje pracę.
Przyspieszenie wynika z infrastruktury, a nie z matematyki. Z.ai opisuje FlashX jako działający na klastrze około 100 000 rodzimych chińskich akceleratorów ze specjalnie zaprojektowanym stosem serwowania: silnikiem wnioskowania opartym na SGLang, kwantyzacją W8A8, mieszaną kwantyzacją pamięci podręcznej INT8/FP8/BF16 oraz zdezagregowaną architekturą encode–prefill–decode, która oddziela etap kodowania multimodalnego od etapów generowania tokenów, dzięki czemu żaden nie blokuje drugiego. Firma donosi o około 3× większej przepustowości usługi end-to-end w porównaniu z początkowym poziomem bazowym na tym samym sprzęcie i twierdzi, że agent infrastrukturalny oparty na GLM-5.3 pomógł dostroić ten stos.
Wszystko to jest raportowane przez dostawcę i jak dotąd nie zostało odtworzone przez nikogo spoza Z.ai. Jest to także najbardziej wiarygodna część tej historii: premiery poziomu serwowania takie jak ta są zwykle sukcesami inżynieryjnymi, a opisane wybory architektoniczne to standardowy zestaw narzędzi do dokładnie tego rodzaju zysku. Nie są one jednak gwarancją. Wartość 200 tok/s to szczyt, a szczyty osiąga się przy krótkich wyjściach, rozgrzanych pamięciach podręcznych i nieobciążonym klastrze. Długokontekstowe żądania multimodalne — obciążenie, na które FlashX jest wprost ukierunkowany — mają najmniejsze szanse, by go osiągnąć.
Cena jest faktyczną decyzją produktową
W cenniku katalogowym GLM-5.3-FlashX kosztuje 0,37 USD za milion tokenów wejściowych i 1,25 USD za milion tokenów wyjściowych, przy czym wejście z pamięci podręcznej kosztuje 0,075 USD, a przechowywanie w pamięci podręcznej jest bezpłatne przez ograniczony czas. W krajowym cenniku Z.ai to 2 ¥ za wejście i 7 ¥ za wyjście, wobec 0,8 ¥ i 2,8 ¥ dla bazowej wersji Flash — ten sam stosunek 2,5×, podany w walucie, w której Z.ai sprzedaje u siebie.

Arytmetyka szybko staje się niewygodna w kierunku, który ludzie rzadko sprawdzają. Tokeny wyjściowe to miejsce, w którym mnożnik kąsa najdotkliwiej, ponieważ wyjście jest drogą stroną w każdym modelu z tej rodziny: wyjście FlashX to 2,5× wyjścia Flash, a wyjście już kosztuje ~3,4× więcej niż wejście w obu przypadkach. Zadanie wsadowe generujące milion tokenów wyjściowych dziennie przechodzi z $0,50 na $1,25 — różnica $274 rocznie w przypadku obciążenia, na które z definicji nikt nie czeka.
Tam, gdzie się to opłaca, chodzi o opóźnienie, które można amortyzować. Pętla agenta wykonująca dziesięć sekwencyjnych wywołań oszczędza różnicę przypadającą na wywołanie dziesięć razy, a jeśli ta różnica wynosi dwie lub trzy sekundy, odzyskujesz pół minuty czasu zegarowego na zadanie. W przypadku interaktywnego uzupełniania kodu, dialogu w czasie rzeczywistym lub dowolnego potoku, w którym człowiek lub usługa nadrzędna jest zablokowana w oczekiwaniu na następny token, taki kompromis jest zwykle właściwy. Z.ai również wyraźnie zaznacza, że model nie wchodzi obecnie w skład GLM Coding Plan, więc użytkownicy subskrypcji nie otrzymują FlashX w pakiecie — płacą za niego za każdy token.
Jeśli Twój stack już obsługuje więcej niż jednego dostawcę, przełączenie to zmiana ciągu modelu i nic więcej. To jest praktyczny powód, dla którego routing istnieje jako warstwa: w OrcaRouter cena katalogowa dostawcy jest przekazywana z 0% marży, więc zmiana ceny Z.ai lub obniżka promocyjna wchodzi w życie tego samego dnia, w którym następuje po stronie dostawcy, a pojedynczy endpoint przed ponad 200 modelami oznacza, że porównanie FlashX z Flash to edycja konfiguracji, a nie projekt integracyjny. Przełączanie awaryjne również ma tu znaczenie — zupełnie nowa warstwa serwowania na zupełnie nowym klastrze to dokładnie ten rodzaj zależności, za którym warto mieć mechanizm awaryjny.
Co się nie zmieniło i dlaczego ma to większe znaczenie
FlashX dziedziczy w pełni profil możliwości GLM-5.3-Flash, a ten profil jest węższy, niż sugerowały relacje z premiery. Materiały Z.ai stawiają model bazowy na poziomie Claude Opus 4.8 w Artificial Analysis Intelligence Index. Sam Artificial Analysis obecnie umieszcza GLM-5.3-Flash z wynikiem 42 w tym indeksie, zmierzonym na własnym API Z.ai — to solidny wynik, znacznie powyżej mediany dla modeli z otwartymi wagami w tej klasie i daleko mu do poziomu czołówki, na który wskazuje porównanie dostawcy. Oba stwierdzenia są prawdziwe; to po prostu nie to samo stwierdzenie, a różnica między nimi jest powodem, dla którego ten blog oznacza liczby dostawców jako liczby dostawców.
Model bazowy jest naprawdę zdolny i naprawdę otwarty. GLM-5.3-Flash został wydany 26 sierpnia 2026 r. na licencji MIT z wagami na Hugging Face, a jego hybrydowa konstrukcja uwagi liniowej i rzadkiej — kompresja IndexPool, hiperpołączenia z ograniczeniami rozmaitości — redukuje obliczenia uwagi około 3× i pamięć podręczną KV około 4,4× względem GLM-5.3, co sprawia, że model 320B z 18B aktywnych parametrów jest w ogóle wystarczająco tani w obsłudze. Dane wyjściowe są ograniczone do 131 072 tokenów. Jest szybki jak na swoją cenę, ale nie szybki jak na swoją klasę: Artificial Analysis zmierzyło 98 tokenów na sekundę przy medianie konkurentów powyżej 70, ale poniżej najszybszych modeli w zestawieniu.
FlashX nie zmienia żadnej z tych rzeczy. Zmienia to, jak długo na to czekasz.
Uczciwa ocena
Kup FlashX, jeśli Twoje obciążenie jest ograniczane opóźnieniami i jeśli już zdecydowałeś, że GLM-5.3-Flash to właściwy model — agent łańcuchujący wywołania, edytor dopełniający tekst w miejscu, interfejs głosowy lub czatowy, w którym pauza jest produktem. Zostań przy GLM-5.3-Flash albo przy otwartych wagach, które możesz hostować samodzielnie, jeśli Twoja praca jest wsadowa, offline lub ograniczana przepustowością, a nie opóźnieniami. Inteligencja, za którą płacisz 2,5× więcej, to inteligencja, którą już miałeś.
Otwartym pytaniem pozostaje, co niezależny pomiar mówi o 200. Nikt poza Z.ai nie opublikował jeszcze liczb przepustowości FlashX i dopóki ktoś tego nie zrobi, uczciwe stanowisko jest takie, że FlashX to obiecujący poziom usług sprzedawany na podstawie szczytowego wyniku. Jest to także, co warte uwagi, test komercyjny: laboratorium, które przez rok udostępniało model bliski czołówki za jedną dziesiątą ceny swojego flagowego produktu, pyta teraz, czy programiści zapłacą za szybkość samą w sobie. Odpowiedź wpłynie na to, jak zostanie wyceniony następny poziom.

Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
