Ett hero-titelkort för GLM-5.3-FlashX vs DeepSeek V4.1 Flash, med undertexten 'Hastighetsklassen som är långsammare än den billiga modellen', med chips som det står '200 vs 214.7 tok/s', '$0.37 / $1.25 vs $0.15 / $0.60' och 'AA 42 vs 40', och en sidfotsrad 'GLM-5.3-FlashX lanserades 18 september 2026'.
Guides & Insights

GLM-5.3-FlashX vs DeepSeek V4.1 Flash: Hastighetsnivån som är långsammare än den billiga modellen

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Z.ai:s premiumnivå för hastighet har ett problem, och den kallas DeepSeek V4.1 Flash. När Z.ai lanserade GLM-5.3-FlashX den 18 september 2026 sålde man in den nya nivån med en enda siffra: upp till 200 utdatatokens per sekund, ungefär fem gånger genomströmningen hos GLM-5.3-Flash som den är byggd från, för 2,5× priset. Oberoende mätning placerar redan DeepSeeks budgetmodell på 214,7 tokens per sekund med 1,15 sekunders tid till första token – snabbare på båda punkterna än det tak Z.ai annonserar, och till ett pris som FlashX inte är i närheten av. Om du köper hastighet hade marknaden redan rört sig innan FlashX anlände.

Den framställningen är orättvis mot FlashX på ett specifikt sätt, och rättvis i alla andra avseenden. Båda modellerna är derivat med öppna vikter och 1M-kontext som konstruerades för kostnadseffektivitet, och båda är genuint bra på det de byggdes för. Men de byggdes för olika halvor av samma problem, och prisgapet mellan dem är nu tillräckligt stort för att "vilken är bättre" har ett svar på en rad för de flesta arbetsbelastningar.

Där var och en faktiskt ligger före

• Pris, listpris — GLM-5.3-FlashX 0.37 $ / 1.25 $ per 1 miljon input/output mot DeepSeek V4.1 Flash 0.15 $ / 0.60 $ off-peak, 0.30 $ / 1.20 $ vid högtrafikbr> • Cachad input — FlashX 0.075 $ per 1 miljon mot DeepSeek 0.003 $ off-peak, en 25× skillnad som förstärks kraftigt i agentlooparbr> • Uppmätt genomströmning — FlashX upp till 200 tok/s (leverantörens toppvärde, ingen oberoende siffra publicerad) mot DeepSeek 214.7 tok/s (Artificial Analysis, på DeepSeeks API)br> • Tid till första token — inte publicerad för FlashX mot 1.15 s uppmätt för DeepSeek V4.1 Flashbr> • Oberoende intelligens — FlashX ärver GLM-5.3-Flashs 42 på Artificial Analysis Intelligence Index mot DeepSeek V4.1 Flash på 40br> • Arkitektur — 320B totalt / 18B aktiva MoE mot 552B totalt med ungefär 8B aktiva vid prefill och 16B vid decodebr> • Inputmodalitet — text, bild, video och filer mot text och bildbr> • Gräns för utdata — 131 072 tokens mot ungefär 384 000br> • Öppna vikter — GLM-5.3-Flash är MIT-licensierad; FlashX är en hostad nivå utan egna vikter, och DeepSeek V4.1 Flash är MIT-licensierad

A two-column scoreboard titled 'GLM-5.3-FlashX vs DeepSeek V4.1 Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'AA Index: 42', 'Context: 1M tokens', 'Output cap: 131,072'; the DeepSeek V4.1 Flash column reads 'Price: $0.15 / $0.60 off-peak', 'Cached input: $0.003 per 1M', 'Speed: 214.7 tok/s (measured)', 'AA Index: 40', 'Context: 1M tokens', 'Output cap: 384,000'; the footer reads 'FlashX speed is vendor-reported; DeepSeek figures per Artificial Analysis.'

Läs den listan två gånger, för formen på den är själva berättelsen. FlashX vinner exakt två rader, och båda är snäva: en tvåpunktsfördel på ett oberoende intelligensindex, och videoinmatning. DeepSeek vinner pris, cachat pris, uppmätt hastighet, utdatalängd och modalitetsbredd i det avseende som spelar roll – den tar emot bilder och producerar långa svar. Gapet på två punkter i indexet ligger inom bruset för en enda benchmarkkörning och bör inte vara det som avgör din arkitektur.

Den hastighetsnivå som är långsammare än den billiga modellen

Det här är delen som är värd att uppehålla sig vid. Z.ai byggde FlashX för att lösa ett verkligt problem: GLM-5.3-Flash är långsam. Artificial Analysis mätte den till 98 genererade token per sekund, vilket ligger över medianen bland jämförbara modeller med öppna vikter i samma storlek men långt ifrån interaktivt. Företagets lösning var en ombyggnad av serveringsstacken – ungefär 100 000 inhemska acceleratorer, en SGLang-baserad motor, W8A8-kvantisering, KV-cache med blandad precision och en disaggregerad arkitektur för encode–prefill–decode – och den rapporterar ungefär 3× genomströmning från ände till ände jämfört med sin baslinje på samma hårdvara.

DeepSeek löste samma problem på arkitekturnivå och var först med det. V4.1 Flashs uppdelning i Causal Encoder–Decoder aktiverar omkring 8B parametrar vid prefill och 16B vid decode i stället för en enhetlig siffra, och Compressed Sparse Attention 2 med FP4 KV-cachning minskar den globala cachen till 890 byte per token – ungefär en fjärdedel av HBM-minnet och en åttondel av SSD-lagringen som föregångaren behövde. Resultatet är en modell som körs i 214,7 tokens per sekund enligt mätning av ett neutralt labb, via samma förstaparts-API, utan att någon premiumnivå krävs.

Z.ais 200 är en leverantörstopp och DeepSeeks 214,7 är en oberoende median, vilket är den minst gynnsamma möjliga jämförelsen för Z.ai och skälet att inte fästa alltför stor vikt vid den. Det är fullt möjligt att FlashX slår DeepSeek vid en varm, kort utdata och icke överbelastad förfrågan. Det går inte att veta, eftersom ingen utanför Z.ai har publicerat genomströmningssiffror för FlashX. Vad som går att veta i dag är att de två modellerna ligger i samma hastighetsintervall, och att en av dem kostar en tredjedel så mycket.

A screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash at max effort (captured September 19, 2026), showing an Intelligence Index score of 40, a measured 215 output tokens per second, $0.30 per 1M input and $1.20 per 1M output tokens, a 1M-token context window, 552B total parameters with 16B active, an MIT licence and weights on Hugging Face.

Där DeepSeeks prisfördel blir strukturell

DeepSeek V4.1 Flash tar 0,15 USD per miljon indatatoken och 0,60 USD per miljon utdatatoken utanför högtrafik, vilket fördubblas till 0,30 USD och 1,20 USD under två vardagsfönster (01:00–04:00 och 06:00–10:00 UTC). FlashX ligger på 0,37 USD och 1,25 USD oavsett tid. Ställer man det mot varandra är det fasta priset som ser ut som en fördel i själva verket den dyrare strukturen för alla som kan schemalägga sitt arbete.

Posten för cachad indata är den som avgör agentarbetslaster. DeepSeek tar 0,003 USD per miljon cachade indatatoken utanför högtrafik; FlashX tar 0,075 USD, tjugofem gånger mer. En agent som skickar om en lång systemprompt och ett verktygsschema vid varje steg betalar den skillnaden vid varje steg, och det är den enskilda post som sannolikt kommer att dominera en verklig räkning. Z.ai listar cachelagring som gratis under en begränsad tid, vilket är en rabatt på lagring snarare än på de läsningar som faktiskt ackumuleras.

Det finns en motvikt, och det är ärlighet om vad DeepSeeks egna siffror kostar. De leverantörsutförda utvärderingarna bakom V4.1 Flashs toppsiffror togs fram vid maximal resonemangsansträngning, och DeepSeek dokumenterar att en förflyttning från ansträngning 25 till ansträngning 100 lyfter DeepSWE v1.1 från 66,0 till 74,2 och samtidigt förbrukar ungefär 2,5× utdatatokens. Vid 2,5× tokens är den effektiva kostnaden för konfigurationen med hög ansträngning mycket närmare FlashX än vad prislappen antyder – och modellen dokumenteras som mycket ordrik, med 250M utdatatokens på Intelligence Index jämfört med en median på 130M. En billig per-token-taxa för en pratsam modell är inte samma sak som en billig uppgift. Den som jämför dessa två på pris bör jämföra kostnaden per slutförd uppgift, inte kostnaden per miljon tokens, och bör förvänta sig att mäta i stället för att uppskatta.

Hur man beslutar, konkret

Om din arbetsbelastning är en långvarig agent med ett stabilt prefix är DeepSeek V4.1 Flash valet, och enbart andelen cachad indata avgör det. Om du behöver videoförståelse eller filinmatning i samma anrop är FlashX den enda av de två som tar emot dem – det är en genuin kapacitetsskillnad, inte en skillnad på specifikationsbladet. Om du behöver långa genererade utdata spelar DeepSeeks tak på ungefär 384K utdata jämfört med FlashX:s 131 072 roll för rapportgenerering, långa kodfiler och allt som syntetiserar snarare än svarar. Om du behöver den starkaste oberoende poängen på ett enda benchmarkindex är FlashX:s 42 mot 40 verklig, men för liten att bygga på.

Båda modellerna är åtkomliga från en och samma endpoint om din stack redan är routad, vilket är det billigaste sättet att avgöra saken. På OrcaRouter förs leverantörens listpris vidare med 0 % påslag, så DeepSeeks rabatt utanför högtrafik och varje framtida prisändring från Z.ai slår igenom samma dag de sker, och att växla mellan de två är en modellsträng i stället för en integration. Automatisk failover är värt att ha just för FlashX: det är en tre veckor gammal serving-nivå i ett nytt kluster, och det felscenario du försäkrar dig mot är ett kapacitetstak, inte en modell som slutar fungera.

Den raka sammanfattningen: DeepSeek V4.1 Flash är det bättre standardvalet för de flesta produktionsarbeten — billigare per token, billigare per cachad token, uppmätt snabbare och kapabel till längre utdata. GLM-5.3-FlashX är rätt val i ett snävare band där du behöver video- eller filinmatning och vill ha ett marginellt högre oberoende index bakom det. Z.ai prissatte en hastighetsnivå med premium och släppte den på en marknad där den snabba billiga modellen redan fanns. Det är hela jämförelsen.

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash (deepseek/deepseek-v4.1-flash, captured September 19, 2026) showing the model header, a 384K max output, text and image input, an MIT licence by DeepSeek with a 2026-09-10 release date, and the billing row reading $0.15 per 1M input and $0.60 per 1M output tokens with a 1.33-second p50 time to first token.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen