Ett hero-titelkort för GLM-5.3-FlashX, med underrubriken "Samma vikter, 2,5 gånger priset", med chips med texten "Upp till 200 tok/s (leverantör)", "$0,37 / $1,25 per 1M" och "1M kontext", samt en sidfotsrad: "Serving-nivån lanserades den 18 september 2026".
Guides & Insights

GLM-5.3-FlashX släpps till 2,5 gånger priset för modellen den körs på

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Siffran att lägga märke till är inte 200. Den är 2,5. Den 18 september 2026 lade Z.ai ut GLM-5.3-FlashX på sitt API med upp till 200 output-tokens per sekund – och prissatte den till 2,5× vad man tar för GLM-5.3-Flash, modellen med öppna vikter som den är byggd från. Ingenting hos själva modellen förändrades. Samma vikter, samma 320B-A18B mixture-of-experts-stomme, samma kontext på 1M token, samma inbyggda hantering av text, bilder, video och filer. Det som förändrades är serving-stacken under den, och vad Z.ai nu tar betalt för privilegiet att sitta närmare fronten av kön.

Det gör FlashX till en sällsynt företeelse på modellmarknaden: en lansering utan något benchmark kopplat till sig. Z.ai har inte publicerat någon FlashX-specifik utvärdering, eftersom det inte finns någon ny modell att utvärdera. Varje kapacitetssiffra som gäller GLM-5.3-Flash gäller här, inklusive de som är mindre smickrande än vad lanseringsbevakningen antydde.

Hela deltat, i ett svep

• Hastighet — GLM-5.3-FlashX upp till 200 tok/s (leverantörens uppgivna toppnotering) jämfört med GLM-5.3-Flash på 98 tok/s enligt mätningar från Artificial Analysis på Z.ai:s eget APIbr> • Pris — $0,37 per 1M indata / $1,25 per 1M utdata jämfört med $0,15 / $0,50 enligt listprisbr> • Cachad indata — $0,075 per 1M jämfört med $0,03 per 1Mbr> • Intelligens — identisk; FlashX ärver basmodellens resultatbr> • Kontext — 1M tokens för bådabr> • Vikter — GLM-5.3-Flash är öppna vikter med MIT-licens; FlashX är en hostad nivå och har inga egna

200 och 98 är inte samma sorts tal, och det är värt att vara tydlig med det. Det ena är ett tak som leverantören säger att tjänsten kan nå. Det andra är vad ett oberoende labb uppmätte över verkliga förfrågningar. En användare som överväger att betala 2,5× bör betrakta 200 som en annons och gå och mäta sin egen arbetsbelastning.

A single-column scoreboard titled 'GLM-5.3-FlashX - the scoreboard' with rows reading 'Speed: up to 200 tok/s (vendor peak)', 'Measured speed: 98 tok/s (base model)', 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Context: 1M tokens' and 'Weights: hosted tier only', with a footer reading 'Speed is a vendor-reported peak; base-model figures per Artificial Analysis.'

Det som Z.ai säger gör jobbet

Prestandaökningen beror på infrastruktur, inte matematik. Z.ai beskriver FlashX som att det körs på ett kluster med cirka 100 000 inhemska kinesiska acceleratorer med en specialbyggd serveringsstack: en inferensmotor baserad på SGLang, W8A8-kvantisering, blandad INT8/FP8/BF16-cachekvantisering och en disaggregerad arkitektur för encode–prefill–decode som separerar det multimodala kodningssteget från token-genereringsstegen så att ingen av dem blockerar den andra. Företaget rapporterar en end-to-end-genomströmning för tjänsten på ungefär 3× jämfört med den ursprungliga baslinjen på samma hårdvara, och säger att en infrastrukturagent som drivs av GLM-5.3 hjälpte till att trimma stacken.

Allt detta är leverantörsrapporterat och har hittills inte kunnat reproduceras av någon utanför Z.ai. Det är också den mest troliga delen av historien: lanseringar på serving-nivå som den här är vanligtvis tekniska segrar, och de arkitekturval som beskrivs är standardverktygslådan för precis den här typen av prestandavinst. Vad de inte är, är en garanti. En siffra på 200 tok/s är ett toppvärde, och toppvärden nås vid korta utdata, varma cachar och ett icke överbelastat kluster. Långkontextuella multimodala förfrågningar – den arbetsbelastning som FlashX uttryckligen riktar sig mot – är de som minst sannolikt når upp till det.

Priset är det egentliga produktbeslutet.

Enligt listpris kostar GLM-5.3-FlashX $0.37 per miljon indatatoken och $1.25 per miljon utdatatoken, med cachad indata på $0.075 och cache-lagring gratis under en begränsad tid. I Z.ai:s inhemska prissättning är det ¥2 in och ¥7 ut, mot ¥0.8 och ¥2.8 för basmodellen Flash — samma 2,5×-förhållande, uttryckt i valutan som Z.ai säljer i hemma.

A screenshot of Z.ai's official pricing documentation page (captured September 19, 2026) showing the 'Latest Models' table with GLM-5.3-Flash at $0.15 input, $0.03 cached input and $0.50 output per 1M tokens, and GLM-5.3-FlashX at $0.37, $0.075 and $1.25.

Aritmetiken blir snabbt obehaglig i den riktning folk sällan kontrollerar. Utdatatokens är där multiplikatorn biter hårdast, eftersom utdata är den dyra sidan hos alla modeller i den här familjen: FlashX-utdata är 2,5× Flash-utdata, och utdata är redan ~3,4× priset för indata i båda fallen. Ett batchjobb som genererar en miljon utdatatokens per dag går från 0,50 $ till 1,25 $ — en skillnad på 274 $ per år för en arbetsbelastning som per definition ingen väntar på.

Där det lönar sig är latens som du kan amortera. En agentloop som gör tio sekventiella anrop sparar skillnaden per anrop tio gånger, och om den skillnaden är två eller tre sekunder har du köpt tillbaka en halv minut av väggklockstid per uppgift. För interaktiv kodkomplettering, realtidsdialog eller vilken pipeline som helst där en människa eller en uppströms tjänst blockeras på nästa token är den avvägningen vanligtvis korrekt. Z.ai är också tydliga med att modellen för närvarande inte ingår i deras GLM Coding Plan, så prenumerationsanvändare får inte FlashX inkluderat — de betalar per token för det.

Om din stack redan talar med mer än en leverantör är bytet en ändring av modellsträngen och inget annat. Det är det praktiska skälet till att routning finns som ett lager: på OrcaRouter förs leverantörens listpris vidare med 0 % påslag, så en prisändring från Z.ai eller en kampanjsänkning slår igenom samma dag som den sker uppströms, och en enda slutpunkt framför 200+ modeller gör att utvärdering av FlashX mot Flash är en konfigurationsändring snarare än ett integrationsprojekt. Failover spelar roll här också – en splitterny serving-nivå på ett splitternytt kluster är precis den typ av beroende som är värt att ha en fallback bakom.

Det som inte har förändrats, och varför det spelar större roll

FlashX ärver GLM-5.3-Flashs kapacitetsprofil i sin helhet, och den profilen är snävare än vad lanseringsbevakningen antydde. Z.ai:s material placerar basmodellen i nivå med Claude Opus 4.8 på Artificial Analysis Intelligence Index. Artificial Analysis själva listar för närvarande GLM-5.3-Flash på 42 i det indexet, mätt via Z.ai:s eget API — en stabil poäng, väl över medianen för modeller med öppna vikter i dess klass, och långt ifrån den frontlinjenivå som leverantörsjämförelsen antyder. Båda påståendena är sanna; de är bara inte samma påstående, och gapet mellan dem är anledningen till att den här bloggen märker leverantörssiffror som leverantörssiffror.

Basmodellen är genuint kapabel och genuint öppen. GLM-5.3-Flash släpptes den 26 augusti 2026 under MIT-licensen med vikter på Hugging Face, och dess hybriddesign för linjär plus gles attention – IndexPool-komprimering, mångfaldsbegränsade hyperanslutningar – minskar beräkningsbehovet för attention med ungefär 3× och KV-cachen med ungefär 4,4× jämfört med GLM-5.3, vilket är det som gör en 320B-modell med 18B aktiva parametrar billig nog att kunna betjäna överhuvudtaget. Utdata är begränsad till 131 072 tokens. Den är snabb för sitt pris, inte snabb för sin klass: Artificial Analysis uppmätte 98 tokens per sekund, jämfört med en median bland jämbördiga på över 70 men under de snabbaste modellerna på listan.

FlashX ändrar inte något av det. Det ändrar hur länge du väntar på det.

Den ärliga läsningen

Köp FlashX om din arbetsbelastning är latensbunden och du redan har bestämt att GLM-5.3-Flash är rätt modell – en agent som kedjar anrop, en editor som kompletterar inline, en röst- eller chatyta där pausen är produkten. Stanna kvar på GLM-5.3-Flash, eller på de öppna vikter du kan hosta själv, om ditt arbete är batchat, offline eller genomströmningsbundet snarare än latensbundet. Intelligensen du betalar 2,5× för är intelligensen du redan hade.

Den öppna frågan är vad oberoende mätningar säger om 200. Ingen utanför Z.ai har ännu publicerat genomströmningssiffror för FlashX, och tills någon gör det är den ärliga hållningen att FlashX är en lovande serving-nivå som säljs med en toppsiffra som argument. Det är också, anmärkningsvärt nog, ett kommersiellt test: ett labb som under ett år gav bort en nästan frontlinjemodell för en tiondel av priset för sin flaggskeppsmodell frågar nu om utvecklare är villiga att betala för hastigheten i sig. Svaret kommer att forma hur nästa nivå prissätts.

A screenshot of the OrcaRouter models catalogue (captured September 19, 2026) showing the header '199 models - 15 providers - one API key, one bill', the filter chips for input modalities, context length, input price, status, series and supported parameters, and the 'How to call any model' panel with the POST https://api.orcarouter.ai/v1/chat/completions endpoint.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen