Een hero-titelkaart voor GLM-5.3-FlashX vs DeepSeek V4.1 Flash, met als ondertitel 'De snelheidsklasse die langzamer is dan het goedkope model', met chips met de tekst '200 vs 214.7 tok/s', '$0.37 / $1.25 vs $0.15 / $0.60' en 'AA 42 vs 40', en een voettekstregel 'GLM-5.3-FlashX gelanceerd op 18 september 2026'.
Guides & Insights

GLM-5.3-FlashX vs DeepSeek V4.1 Flash: De snelheidsklasse die trager is dan het goedkope model

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het premium snelheidsniveau van Z.ai heeft een probleem, en het heet DeepSeek V4.1 Flash. Toen Z.ai GLM-5.3-FlashX op 18 september 2026 lanceerde, verkocht het bedrijf het nieuwe niveau met één getal: tot 200 outputtokens per seconde, ongeveer vijf keer de doorvoer van de GLM-5.3-Flash waarop het is gebaseerd, voor 2,5× de prijs. Uit onafhankelijke metingen blijkt dat het budgetmodel van DeepSeek al op 214,7 tokens per seconde zit, met een tijd tot het eerste token van 1,15 seconde — op beide punten sneller dan het plafond dat Z.ai adverteert, en tegen een prijs waar FlashX niet bij in de buurt komt. Als je snelheid koopt, is de markt al opgeschoven voordat FlashX arriveerde.

Die framing is op één specifiek punt onrechtvaardig tegenover FlashX, en op alle andere punten terecht. Beide modellen zijn open-weight-afgeleiden met een context van 1M die op kosten zijn geëngineerd, en beide zijn oprecht goed in waar ze voor gebouwd zijn. Maar ze zijn gebouwd voor verschillende helften van hetzelfde probleem, en de prijskloof tussen hen is nu breed genoeg dat "wat is beter" voor de meeste workloads een antwoord van één regel heeft.

Waar elk daadwerkelijk vooroploopt

• Prijs, lijst — GLM-5.3-FlashX $0,37 / $1,25 per 1M input/output vs DeepSeek V4.1 Flash $0,15 / $0,60 buiten piek, $0,30 / $1,20 tijdens piekbr> • Gecachte input — FlashX $0,075 per 1M vs DeepSeek $0,003 buiten piek, een gat van 25× dat zich stevig opstapelt in agent-loopsbr> • Gemeten doorvoer — FlashX tot 200 tok/s (leverancierspiek, geen onafhankelijk cijfer gepubliceerd) vs DeepSeek 214,7 tok/s (Artificial Analysis, op de API van DeepSeek)br> • Tijd tot eerste token — niet gepubliceerd voor FlashX vs 1,15 s gemeten voor DeepSeek V4.1 Flashbr> • Onafhankelijke intelligentie — FlashX erft de 42 van GLM-5.3-Flash op de Artificial Analysis Intelligence Index vs DeepSeek V4.1 Flash met 40br> • Architectuur — 320B totaal / 18B actief MoE vs 552B totaal met ongeveer 8B actief bij prefill en 16B bij decodebr> • Inputmodaliteit — tekst, afbeelding, video en bestanden vs tekst en afbeeldingbr> • Uitvoerlimiet — 131.072 tokens vs ongeveer 384.000br> • Open gewichten — GLM-5.3-Flash heeft een MIT-licentie; FlashX is een gehoste tier zonder eigen gewichten, en DeepSeek V4.1 Flash heeft een MIT-licentie

A two-column scoreboard titled 'GLM-5.3-FlashX vs DeepSeek V4.1 Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'AA Index: 42', 'Context: 1M tokens', 'Output cap: 131,072'; the DeepSeek V4.1 Flash column reads 'Price: $0.15 / $0.60 off-peak', 'Cached input: $0.003 per 1M', 'Speed: 214.7 tok/s (measured)', 'AA Index: 40', 'Context: 1M tokens', 'Output cap: 384,000'; the footer reads 'FlashX speed is vendor-reported; DeepSeek figures per Artificial Analysis.'

Lees die lijst twee keer, want de vorm ervan is het verhaal. FlashX wint precies twee rijen, en beide zijn nipt: een voorsprong van twee punten op een onafhankelijke intelligentie-index, en video-invoer. DeepSeek wint op prijs, gecachete prijs, gemeten snelheid, uitvoerlengte en breedte van modaliteiten in de zin die ertoe doet — het neemt afbeeldingen aan en produceert lange antwoorden. Het verschil van twee punten op de index valt binnen de ruis van één enkele benchmarkrun en zou niet het ding moeten zijn dat je architectuur bepaalt.

Het snelheidsniveau dat langzamer is dan het goedkope model

Dit is het deel dat het waard is om bij stil te staan. Z.ai bouwde FlashX om een echt probleem op te lossen: GLM-5.3-Flash is traag. Artificial Analysis mat 98 outputtokens per seconde, wat boven de mediaan van vergelijkbare open-weightmodellen van die grootte ligt, maar verre van interactief is. De oplossing van het bedrijf was een herbouw van de servingstack — ongeveer 100.000 binnenlandse accelerators, een op SGLang gebaseerde engine, W8A8-kwantisatie, een gemengde-precisie-KV-cache en een gedisaggregeerde encode-prefill-decode-architectuur — en het bedrijf meldt ongeveer 3× end-to-enddoorvoer ten opzichte van zijn baseline op dezelfde hardware.

DeepSeek lost hetzelfde probleem op architectuurniveau op, en was er als eerste. De Causal Encoder–Decoder-split van V4.1 Flash activeert ongeveer 8B parameters bij prefill en 16B bij decode in plaats van een vast getal, en Compressed Sparse Attention 2 met FP4 KV-caching verkleint de globale cache tot 890 bytes per token — ongeveer een kwart van de HBM en een achtste van de SSD-opslag die zijn voorganger nodig had. Het resultaat is een model dat 214,7 tokens per seconde draait, gemeten door een neutraal lab, op dezelfde first-party-API, zonder dat een premiumlaag nodig is.

De 200 van Z.ai is een piek van de leverancier en de 214,7 van DeepSeek is een onafhankelijke mediaan, wat de minst gunstige vergelijking is die mogelijk is voor Z.ai en de reden om er niet te veel waarde aan te hechten. Het is heel goed mogelijk dat FlashX DeepSeek verslaat bij een warm verzoek met korte output en zonder congestie. Het is niet mogelijk om dat te weten, omdat niemand buiten Z.ai FlashX-doorvoercijfers heeft gepubliceerd. Wat vandaag wel te weten valt, is dat de twee modellen in dezelfde snelheidsband zitten, en dat een van hen een derde zo veel kost.

A screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash at max effort (captured September 19, 2026), showing an Intelligence Index score of 40, a measured 215 output tokens per second, $0.30 per 1M input and $1.20 per 1M output tokens, a 1M-token context window, 552B total parameters with 16B active, an MIT licence and weights on Hugging Face.

Waar het prijsvoordeel van DeepSeek structureel wordt

DeepSeek V4.1 Flash rekent $0,15 per miljoen inputtokens en $0,60 per miljoen outputtokens buiten de piekuren, en verdubbelt naar $0,30 en $1,20 tijdens twee tijdvensters op weekdagen (01:00–04:00 en 06:00–10:00 UTC). FlashX rekent een vast tarief van $0,37 en $1,25. Zet die naast elkaar en de vaste prijs die als een voordeel oogt, is eigenlijk de duurdere structuur voor iedereen die zijn werk kan inplannen.

De regel voor gecachte invoer is bepalend voor agentworkloads. DeepSeek rekent buiten piekuren $0,003 per miljoen gecachte invoertokens; FlashX rekent $0,075, vijfentwintig keer zoveel. Een agent die bij elke stap een lange systeemprompt en een toolschema opnieuw verzendt, betaalt dat verschil bij elke stap, en het is de afzonderlijke kostenpost die het meest waarschijnlijk een echte factuur domineert. Z.ai vermeldt cacheopslag voor beperkte tijd als gratis, wat een korting op opslag is, niet op de leesbewerkingen die zich daadwerkelijk opstapelen.

Er is een tegenwicht, en dat is eerlijkheid over wat de eigen cijfers van DeepSeek kosten. De door de leverancier uitgevoerde evaluaties achter de aandachtstrekkende scores van V4.1 Flash werden geproduceerd bij maximale redeneerinspanning, en DeepSeek documenteert dat het gaan van inspanning 25 naar inspanning 100 DeepSWE v1.1 van 66,0 naar 74,2 tilt, terwijl het ongeveer 2,5× zoveel outputtokens verbruikt. Bij 2,5× de tokens ligt de effectieve kosten van de hoog-inspanning-configuratie veel dichter bij FlashX dan het prijskaartje suggereert — en het model staat gedocumenteerd als zeer wijdlopig, met 250M outputtokens op de Intelligence Index tegenover een mediaan van 130M. Een laag tarief per token voor een praatgraag model is niet hetzelfde als een goedkope taak. Wie deze twee op prijs vergelijkt, moet de kosten per voltooide taak vergelijken, niet de kosten per miljoen tokens, en moet verwachten te meten in plaats van te schatten.

Hoe beslis je, concreet?

Als je werklast een langlopende agent met een stabiele prefix is, is DeepSeek V4.1 Flash de keuze, en alleen de verhouding gecachte invoer is al beslissend. Als je videobegrip of bestandsinvoer in dezelfde aanroep nodig hebt, is FlashX de enige van de twee die deze ondersteunt — dat is een echt verschil in mogelijkheden, niet een verschil op een specsheet. Als je lange gegenereerde uitvoer nodig hebt, is de limiet van ongeveer 384K uitvoer van DeepSeek tegenover de 131.072 van FlashX van belang voor het genereren van rapporten, lange codebestanden en alles wat synthetiseert in plaats van antwoordt. Als je de sterkste onafhankelijke score op één benchmarkindex nodig hebt, is de 42 van FlashX tegenover 40 echt, maar te klein om op voort te bouwen.

Beide modellen zijn bereikbaar vanaf één endpoint als je stack al is gerouteerd, wat de goedkoopste manier is om dit te beslechten. Op OrcaRouter wordt de adviesprijs van de leverancier doorgegeven met 0% markup, dus DeepSeek's dalurenkorting en elke toekomstige prijswijziging van Z.ai komen dezelfde dag door dat ze gebeuren, en wisselen tussen de twee is een model-string in plaats van een integratie. Automatische failover is specifiek voor FlashX de moeite waard: het is een serverlaag van drie weken oud op een nieuw cluster, en de storingsmodus waartegen je je indekt is een capaciteitsplafond, niet een model dat ermee ophoudt.

De botte samenvatting: DeepSeek V4.1 Flash is de betere standaard voor de meeste productiewerkzaamheden — goedkoper per token, goedkoper per gecachte token, gemeten sneller, en in staat tot langere outputs. GLM-5.3-FlashX is de juiste keuze in een smallere band waarin je video- of bestandsinvoer nodig hebt en er een marginaal hogere onafhankelijke index achter wilt. Z.ai hing een premiumprijs aan een snelheidsniveau en bracht het uit op een markt waar het snelle, goedkope model al bestond. Dat is de hele vergelijking.

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash (deepseek/deepseek-v4.1-flash, captured September 19, 2026) showing the model header, a 384K max output, text and image input, an MIT licence by DeepSeek with a 2026-09-10 release date, and the billing row reading $0.15 per 1M input and $0.60 per 1M output tokens with a 1.33-second p50 time to first token.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt