
GLM-5.3-FlashX is verkrijgbaar voor 2,5x de prijs van het model waarop het draait
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Het getal dat opvalt is niet 200. Het is 2,5. Op 18 september 2026 zette Z.ai GLM-5.3-FlashX op zijn API met maximaal 200 outputtokens per seconde — en zette er een prijs op van 2,5× wat het rekent voor GLM-5.3-Flash, het open-weightsmodel waarop het is gebaseerd. Aan het model zelf is niets veranderd. Dezelfde gewichten, dezelfde 320B-A18B mixture-of-experts-backbone, dezelfde context van 1M tokens, dezelfde native verwerking van tekst, afbeeldingen, video en bestanden. Wat is veranderd, is de servingstack eronder, en wat Z.ai nu vraagt voor het voorrecht om dichter bij de voorkant van de wachtrij te zitten.
Dat maakt FlashX een zeldzaamheid op de modelmarkt: een lancering zonder bijbehorende benchmark. Z.ai heeft geen FlashX-specifieke evaluatie gepubliceerd, omdat er geen nieuw model is om te evalueren. Elk capaciteitscijfer dat op GLM-5.3-Flash van toepassing is, geldt hier ook, inclusief de cijfers die minder flatteus zijn dan de lanceringsberichtgeving suggereerde.
De hele delta, in één doorgang
• Snelheid — GLM-5.3-FlashX tot 200 tok/s (door de leverancier opgegeven piek) vs GLM-5.3-Flash met 98 tok/s zoals gemeten door Artificial Analysis op Z.ai's eigen APIbr> • Prijs — $0,37 per 1M input / $1,25 per 1M output vs $0,15 / $0,50 volgens de lijstprijsbr> • Gecachte input — $0,075 per 1M vs $0,03 per 1Mbr> • Intelligentie — identiek; FlashX erft de scores van het basismodelbr> • Context — 1M tokens bij beidebr> • Gewichten — GLM-5.3-Flash is MIT-gelicenseerde open gewichten; FlashX is een gehoste tier en heeft er geen eigen
De 200 en de 98 zijn niet hetzelfde soort getal, en het loont om daar bot over te zijn. De ene is een bovengrens waarvan de leverancier zegt dat de dienst die kan bereiken. De andere is wat een onafhankelijk lab heeft gemeten bij echte verzoeken. Een gebruiker die overweegt 2,5× te betalen, zou 200 als reclame moeten beschouwen en de eigen werkbelasting moeten gaan meten.

Wat Z.ai zegt het werk te doen
De versnelling is infrastructuur, niet wiskunde. Z.ai beschrijft FlashX als draaiend op een cluster van ongeveer 100.000 binnenlandse Chinese accelerators met een speciaal gebouwde servingstack: een inferentie-engine op basis van SGLang, W8A8-kwantisatie, gemengde INT8/FP8/BF16-cachekwantisatie, en een gedisaggregeerde encode-prefill-decode-architectuur die de multimodale encoderingsfase scheidt van de tokengeneratiefasen, zodat ze elkaar niet blokkeren. Het bedrijf rapporteert ongeveer 3× de end-to-end servicedoorvoer ten opzichte van zijn oorspronkelijke baseline op dezelfde hardware, en zegt dat een infrastructuuragent aangedreven door GLM-5.3 hielp de stack af te stemmen.
Dat alles is door de leverancier gerapporteerd en tot nu toe door niemand buiten Z.ai gereproduceerd. Het is ook het meest plausibele deel van het verhaal: dit soort serving-tier-lanceringen zijn meestal technische successen, en de beschreven architectuurkeuzes zijn het standaardinstrumentarium voor precies dit soort winst. Wat ze niet zijn, is een garantie. Een waarde van 200 tok/s is een piek, en pieken worden bereikt bij korte outputs, warme caches en een niet-overbelaste cluster. Long-context multimodale verzoeken — de werklast waarop FlashX expliciet is gericht — zijn het minst waarschijnlijk om die piek te halen.
De prijs is de werkelijke productbeslissing
Volgens de lijstprijs kost GLM-5.3-FlashX $0,37 per miljoen inputtokens en $1,25 per miljoen outputtokens, met gecachte input tegen $0,075 en cacheopslag tijdelijk gratis. In de binnenlandse prijsstelling van Z.ai is dat ¥2 in en ¥7 uit, tegenover ¥0,8 en ¥2,8 voor de basis-Flash — dezelfde verhouding van 2,5×, uitgedrukt in de valuta waarin Z.ai thuis verkoopt.

De rekensom wordt al snel ongemakkelijk in de richting die mensen zelden controleren. Outputtokens zijn waar de vermenigvuldigingsfactor het hardst toeslaat, want output is bij elk model in deze familie de dure kant: FlashX-output is 2,5× de Flash-output, en output is bij beide al ~3,4× de prijs van input. Een batchtaak die dagelijks een miljoen outputtokens genereert, gaat van $0,50 naar $1,25 — een verschil van $274 per jaar voor een workload waar, per definitie, niemand op zit te wachten.
Waar het loont, is latentie die je kunt amortiseren. Een agent-lus die tien opeenvolgende aanroepen doet, bespaart het verschil per aanroep tien keer, en als dat verschil twee of drie seconden is, heb je een halve minuut kloktijd per taak teruggewonnen. Voor interactieve codeaanvulling, realtime dialoog of elke pijplijn waarin een mens of een upstreamservice wacht op het volgende token, is die afweging meestal juist. Z.ai is ook expliciet dat het model momenteel geen deel uitmaakt van zijn GLM Coding Plan, dus abonnees krijgen FlashX niet meegeleverd — ze betalen er per token voor.
Als je stack al met meer dan één provider praat, is de overstap een kwestie van de model-string aanpassen en niets meer. Dat is de praktische reden waarom routing als laag bestaat: bij OrcaRouter wordt de lijstprijs van de leverancier met 0% marge doorgegeven, dus een prijswijziging of promotiekorting van Z.ai komt op dezelfde dag door als upstream, en één endpoint voor 200+ modellen betekent dat het vergelijken van FlashX met Flash een configuratiewijziging is in plaats van een integratieproject. Failover is hier ook belangrijk — een gloednieuwe serving-tier op een gloednieuw cluster is precies het soort afhankelijkheid waar je een fallback achter wilt hebben.
Wat niet is veranderd, en waarom dat meer uitmaakt
FlashX erft het volledige capaciteitsprofiel van GLM-5.3-Flash, en dat profiel is smaller dan de berichtgeving rond de lancering deed vermoeden. De materialen van Z.ai plaatsen het basismodel op hetzelfde niveau als Claude Opus 4.8 op de Artificial Analysis Intelligence Index. Artificial Analysis zelf vermeldt GLM-5.3-Flash momenteel op 42 in die index, gemeten via Z.ai's eigen API — een solide score, ruim boven de mediaan voor open-weightmodellen van deze klasse, en ver verwijderd van het frontierniveau dat de leveranciersvergelijking suggereert. Beide beweringen zijn waar; het zijn alleen niet dezelfde bewering, en de kloof ertussen is de reden dat deze blog leverancierscijfers als leverancierscijfers bestempelt.
Het basismodel is echt capabel en echt open. GLM-5.3-Flash kwam op 26 augustus 2026 uit onder de MIT-licentie, met gewichten op Hugging Face, en het hybride lineair-plus-sparse attention-ontwerp — IndexPool-compressie, manifold-beperkte hyperconnections — verlaagt de attention-berekening met ruwweg 3× en de KV-cache met ruwweg 4,4× ten opzichte van GLM-5.3, wat een 320B-model met 18B actieve parameters goedkoop genoeg maakt om überhaupt te serveren. De output is beperkt tot 131.072 tokens. Het is snel voor zijn prijs, niet snel voor zijn klasse: Artificial Analysis mat 98 tokens per seconde tegen een mediaan van vakgenoten boven de 70, maar onder de snelste modellen op het bord.
FlashX verandert niets daaraan. Het verandert hoe lang je erop moet wachten.
De eerlijke lezing
Koop FlashX als je workload latency-gebonden is en je al hebt besloten dat GLM-5.3-Flash het juiste model is — een agent die calls aan elkaar rijgt, een editor die inline aanvult, een spraak- of chatinterface waar de pauze het product is. Blijf op GLM-5.3-Flash, of op de open weights die je zelf kunt hosten, als je werk gebatcht, offline of throughput-gebonden is in plaats van latency-gebonden. De intelligentie waarvoor je 2,5× betaalt, is de intelligentie die je al had.
De open vraag is wat onafhankelijke metingen over de 200 zeggen. Niemand buiten Z.ai heeft tot nu toe doorvoercijfers van FlashX gepubliceerd, en totdat iemand dat doet, is de eerlijke positie dat FlashX een veelbelovende servingtier is die op een piekcijfer wordt verkocht. Het is ook, opmerkelijk genoeg, een commerciële test: een lab dat een jaar lang een bijna-frontiermodel weggegeven heeft voor een tiende van de prijs van zijn vlaggenschip, vraagt zich nu af of ontwikkelaars voor snelheid op zich willen betalen. Het antwoord zal bepalen hoe de volgende tier geprijsd wordt.

Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
