Karta tytułowa hero dla GLM-5.3-FlashX vs DeepSeek V4.1 Flash, z podtytułem „Poziom szybkości, który jest wolniejszy niż tani model”, plakietkami: „200 vs 214,7 tok/s”, „$0,37 / $1,25 vs $0,15 / $0,60” i „AA 42 vs 40” oraz wierszem stopki „GLM-5.3-FlashX zadebiutował 18 września 2026 r.”.
Guides & Insights

GLM-5.3-FlashX kontra DeepSeek V4.1 Flash: poziom szybkości, który jest wolniejszy niż tani model

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najwyższa, premiumowa półka szybkościowa Z.ai ma problem, a nazywa się DeepSeek V4.1 Flash. Kiedy Z.ai wprowadziło GLM-5.3-FlashX 18 września 2026 r., sprzedawało nową półkę jedną liczbą: do 200 tokenów wyjściowych na sekundę, czyli około pięć razy większą przepustowość niż GLM-5.3-Flash, na którym jest oparte, za 2,5× wyższą cenę. Niezależne pomiary już lokują budżetowy model DeepSeek na poziomie 214,7 tokenów na sekundę przy 1,15 sekundy do pierwszego tokena — szybciej pod oboma względami niż maksimum, które reklamuje Z.ai, i w cenie, do której FlashX nawet się nie zbliża. Jeśli kupujesz szybkość, rynek zmienił się, zanim FlashX się pojawił.

To ujęcie jest niesprawiedliwe wobec FlashX pod jednym konkretnym względem, a sprawiedliwe pod każdym innym. Oba modele to pochodne open-weight z kontekstem 1M, zaprojektowane z myślą o kosztach, i oba są naprawdę dobre w tym, do czego zostały stworzone. Zostały jednak stworzone do różnych połówek tego samego problemu, a dzieląca je różnica cen jest teraz tak duża, że „który jest lepszy” ma jednowersową odpowiedź dla większości obciążeń.

Gdzie każdy z nich faktycznie ma przewagę

Cena katalogowa — GLM-5.3-FlashX $0,37 / $1,25 za 1 mln tokenów wejściowych/wyjściowych vs DeepSeek V4.1 Flash $0,15 / $0,60 poza szczytem, $0,30 / $1,20 w szczyciebr> • Wejście z pamięci podręcznej — FlashX $0,075 za 1 mln vs DeepSeek $0,003 poza szczytem, 25× różnica, która mocno kumuluje się w pętlach agentowychbr> • Zmierzona przepustowość — FlashX do 200 tok/s (szczyt deklarowany przez dostawcę, brak opublikowanych niezależnych danych) vs DeepSeek 214,7 tok/s (Artificial Analysis, na API DeepSeek)br> • Czas do pierwszego tokena — nie podano dla FlashX vs 1,15 s zmierzony dla DeepSeek V4.1 Flashbr> • Niezależna inteligencja — FlashX dziedziczy wynik 42 modelu GLM-5.3-Flash w Indeksie Inteligencji Artificial Analysis vs DeepSeek V4.1 Flash z wynikiem 40br> • Architektura — MoE 320B łącznie / 18B aktywnych vs 552B łącznie z ok. 8B aktywnych przy prefillu i 16B przy dekodowaniubr> • Modalność wejściowa — tekst, obraz, wideo i pliki vs tekst i obrazbr> • Limit tokenów wyjściowych — 131 072 tokenów vs około 384 000br> • Otwarte wagi — GLM-5.3-Flash ma licencję MIT; FlashX to warstwa hostowana bez własnych wag, a DeepSeek V4.1 Flash ma licencję MIT

A two-column scoreboard titled 'GLM-5.3-FlashX vs DeepSeek V4.1 Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'AA Index: 42', 'Context: 1M tokens', 'Output cap: 131,072'; the DeepSeek V4.1 Flash column reads 'Price: $0.15 / $0.60 off-peak', 'Cached input: $0.003 per 1M', 'Speed: 214.7 tok/s (measured)', 'AA Index: 40', 'Context: 1M tokens', 'Output cap: 384,000'; the footer reads 'FlashX speed is vendor-reported; DeepSeek figures per Artificial Analysis.'

Przeczytaj tę listę dwa razy, ponieważ jej kształt jest sednem historii. FlashX wygrywa dokładnie dwa wiersze i oba są wąskie: dwupunktową przewagę w niezależnym indeksie inteligencji oraz wejście wideo. DeepSeek wygrywa cenę, cenę z pamięci podręcznej, zmierzoną szybkość, długość odpowiedzi i szerokość modalności w tym sensie, który ma znaczenie — przyjmuje obrazy i generuje długie odpowiedzi. Dwupunktowa różnica w indeksie mieści się w szumie pojedynczego przebiegu testu porównawczego i nie powinna być tym, co decyduje o twojej architekturze.

Poziom szybkości, który jest wolniejszy niż tani model

To jest część, nad którą warto się pochylić. Z.ai zbudował FlashX, aby rozwiązać realny problem: GLM-5.3-Flash jest wolny. Artificial Analysis zmierzyło go na 98 tokenów wyjściowych na sekundę, co jest powyżej mediany wśród modeli o otwartych wagach tej wielkości, ale daleko mu do interaktywności. Rozwiązaniem firmy była przebudowa stosu serwowania — około 100 000 krajowych akceleratorów, silnik oparty na SGLang, kwantyzacja W8A8, pamięć podręczna KV o mieszanej precyzji oraz rozdzielona architektura encode–prefill–decode — a firma raportuje około 3× wyższą przepustowość end-to-end niż w przypadku swojego baseline’u na tym samym sprzęcie.

DeepSeek rozwiązał ten sam problem na poziomie architektury i zrobił to pierwszy. Podział Causal Encoder–Decoder w V4.1 Flash aktywuje około 8 mld parametrów podczas prefillu i 16 mld podczas dekodowania, a nie stałą wartość, a Compressed Sparse Attention 2 z buforowaniem KV w FP4 zmniejsza globalny cache do 890 bajtów na token — około jednej czwartej pamięci HBM i jednej ósmej pamięci SSD, jakiej potrzebował jego poprzednik. Efektem jest model, który działa z szybkością 214,7 tokena na sekundę według pomiarów niezależnego laboratorium, za pośrednictwem tego samego API dostawcy, bez konieczności wykupywania planu premium.

Wynik 200 dla Z.ai to szczytowa wartość podana przez dostawcę, a 214,7 dla DeepSeek to niezależna mediana, co stanowi najmniej korzystne z możliwych porównań dla Z.ai i powód, by traktować je z dystansem. Jest całkiem możliwe, że FlashX pokonuje DeepSeek przy ciepłym żądaniu z krótkim wyjściem i bez przeciążenia. Nie można tego stwierdzić, ponieważ nikt spoza Z.ai nie opublikował liczb przepustowości FlashX. To, co dziś można wiedzieć, to że oba modele mieszczą się w tym samym przedziale prędkości, a jeden z nich kosztuje jedną trzecią tego, co drugi.

A screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash at max effort (captured September 19, 2026), showing an Intelligence Index score of 40, a measured 215 output tokens per second, $0.30 per 1M input and $1.20 per 1M output tokens, a 1M-token context window, 552B total parameters with 16B active, an MIT licence and weights on Hugging Face.

Gdzie przewaga cenowa DeepSeek staje się strukturalna

DeepSeek V4.1 Flash pobiera 0,15 USD za milion tokenów wejściowych i 0,60 USD za milion tokenów wyjściowych poza godzinami szczytu, a stawki te podwajają się do 0,30 USD i 1,20 USD w dwóch oknach dni roboczych (01:00–04:00 i 06:00–10:00 UTC). FlashX ma stałe stawki 0,37 USD i 1,25 USD. Zestaw to ze sobą, a stałe ceny, które wyglądają na zaletę, w rzeczywistości są droższą strukturą dla każdego, kto może zaplanować pracę.

Pozycja dotycząca buforowanego wejścia to ta, która decyduje o obciążeniach agentów. DeepSeek pobiera 0,003 USD za milion buforowanych tokenów wejściowych poza godzinami szczytu; FlashX pobiera 0,075 USD, czyli dwadzieścia pięć razy więcej. Agent, który przy każdym kroku ponownie wysyła długi prompt systemowy i schemat narzędzi, płaci tę różnicę przy każdym kroku, a to właśnie ta jedna pozycja najprawdopodobniej zdominuje rzeczywisty rachunek. Z.ai podaje przechowywanie pamięci podręcznej jako bezpłatne przez ograniczony czas, co jest rabatem na przechowywanie, a nie na odczyty, które faktycznie się kumulują.

Istnieje przeciwwaga — uczciwość co do tego, ile kosztują własne wyniki DeepSeek. Ewaluacje przeprowadzone przez dostawcę, stojące za sztandarowymi wynikami V4.1 Flash, powstały przy maksymalnym wysiłku rozumowania, a DeepSeek dokumentuje, że przejście z wysiłku 25 na wysiłek 100 podnosi DeepSWE v1.1 z 66,0 do 74,2, zużywając przy tym około 2,5× więcej tokenów wyjściowych. Przy 2,5× większej liczbie tokenów rzeczywisty koszt konfiguracji o wysokim wysiłku jest znacznie bliższy FlashX, niż sugeruje metka — a dokumentacja opisuje model jako bardzo gadatliwy: generuje on 250 mln tokenów wyjściowych w Intelligence Index wobec mediany 130 mln. Tania stawka za token w przypadku gadatliwego modelu to nie to samo co tanie zadanie. Każdy, kto porównuje te dwa modele pod względem ceny, powinien porównywać koszt na ukończone zadanie, a nie koszt za milion tokenów, i powinien raczej mierzyć niż szacować.

Jak konkretnie zdecydować

Jeśli Twoim obciążeniem jest długotrwale działający agent ze stabilnym prefiksem, DeepSeek V4.1 Flash jest właściwym wyborem, a o wyborze przesądza wyłącznie współczynnik danych wejściowych z pamięci podręcznej. Jeśli potrzebujesz rozumienia wideo lub wprowadzania plików w tym samym wywołaniu, FlashX jako jedyny z tej dwójki je obsługuje — to autentyczna różnica w możliwościach, a nie tylko w specyfikacji. Jeśli potrzebujesz długich generowanych danych wyjściowych, limit wyjściowy DeepSeek wynoszący około 384K w porównaniu z 131 072 w FlashX ma znaczenie przy generowaniu raportów, długich plików kodu i wszystkiego, co raczej syntetyzuje, niż udziela odpowiedzi. Jeśli potrzebujesz najwyższego niezależnego wyniku w pojedynczym indeksie benchmarkowym, wynik FlashX 42 kontra 40 jest realny, ale zbyt mały, by na nim budować.

Oba modele są dostępne z jednego punktu końcowego, jeśli Twój stack jest już zroutowany, co jest najtańszym sposobem, aby to rozstrzygnąć. W OrcaRouter cena katalogowa dostawcy jest przekazywana z 0% marży, więc zniżka DeepSeek poza godzinami szczytu i każda przyszła zmiana ceny Z.ai pojawiają się tego samego dnia, w którym następują, a przełączanie między nimi to zmiana ciągu modelu, a nie integracja. Automatyczne przełączanie awaryjne szczególnie warto mieć w przypadku FlashX: to trzytygodniowy poziom obsługi na nowym klastrze, a tryb awarii, przed którym się zabezpieczasz, to limit przepustowości, a nie model, który przestaje działać.

Krótko i bez owijania w bawełnę: DeepSeek V4.1 Flash to lepszy domyślny wybór w większości produkcyjnych zastosowań — tańszy za token, tańszy za token z pamięci podręcznej, mierzalnie szybszy i zdolny do dłuższych odpowiedzi. GLM-5.3-FlashX to właściwy wybór w węższym zakresie, gdy potrzebujesz wejścia wideo lub plikowego i chcesz mieć za nim nieco wyższy niezależny wskaźnik. Z.ai wyceniło poziom szybkości z premią i wprowadziło go na rynek, na którym szybki i tani model już istniał. To całe porównanie.

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash (deepseek/deepseek-v4.1-flash, captured September 19, 2026) showing the model header, a 384K max output, text and image input, an MIT licence by DeepSeek with a 2026-09-10 release date, and the billing row reading $0.15 per 1M input and $0.60 per 1M output tokens with a 1.33-second p50 time to first token.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie