Ett hero-titelkort för GLM-5.3-FlashX vs GLM-5.3-Flash, med underrubriken "Samma vikter, två prislappar", med chips som visar "200 vs 98 tok/s", "$0.37 / $1.25 vs $0.15 / $0.50" och "Identisk intelligens", samt en sidfotsrad "GLM-5.3-FlashX lanserades 18 september 2026".
Guides & Insights

GLM-5.3-FlashX vs GLM-5.3-Flash: Samma vikter, 2,5× priset, ett annat nummer

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Du kan inte köpa GLM-5.3-FlashX och få en bättre modell. Det är inte en kritik – det är hela premissen. GLM-5.3-FlashX, som lanserades på Z.ai:s API den 18 september 2026, kör med identiska vikter som GLM-5.3-Flash: samma 320B totalt, 18B aktiva mixture-of-experts-stomme, samma 1M-tokenkontext, samma inbyggda text-, bild-, video- och filinmatning, samma utgångstak på 131 072 tokens. Z.ai har inte publicerat någon FlashX-benchmark eftersom det inte finns något nytt att benchmarka. Det som skiljer är hur snabbt tokens kommer ut och vad de kostar, och dessa två siffror är det enda en köpare behöver förhålla sig till.

Det är ett renare beslut än de flesta modelljämförelser, och ett svårare, för det finns ingen historia om förmågor att gömma sig bakom. Antingen är latensen värd 2,5× för dig, eller så är den inte det.

En modell, två prislappar

• Vad FlashX är — en serving-nivå, inte ett modellsläpp; samma vikter, samma poäng, samma gränserbr> • Indatapris — 0,37 USD per 1M tokens på FlashX mot 0,15 USD per 1M på Flash enligt listprisbr> • Utdatapris — 1,25 USD per 1M mot 0,50 USD per 1M, multiplikatorn som faktiskt påverkar fakturanbr> • Cachad indata — 0,075 USD per 1M mot 0,03 USD per 1Mbr> • Hastighet — upp till 200 utdata-tokens per sekund (leverantörens rapporterade toppnotering) mot 98 tok/s uppmätt oberoende av Artificial Analysisbr> • Prenumerationsåtkomst — GLM-5.3-Flash ingår i Z.ai:s GLM Coding Plan med 3× kvot; FlashX ingår intebr> • Egen hosting — GLM-5.3-Flash är MIT-licensierade öppna vikter på Hugging Face; FlashX har inga vikter att ladda ner

A two-column scoreboard titled 'GLM-5.3-FlashX vs GLM-5.3-Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: hosted tier only'; the GLM-5.3-Flash column reads 'Price: $0.15 / $0.50 per 1M', 'Cached input: $0.03 per 1M', 'Speed: 98 tok/s (measured)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: MIT open weights'; the footer reads 'Same weights and same scores; only serving speed and price differ.'

På Z.ai:s hemmamarknad anges samma förhållande rakt ut: ¥2 in och ¥7 ut för FlashX mot ¥0,8 och ¥2,8 för Flash. Flera kinesiska medier beskriver lanseringen på samma sätt – 5× hastigheten till 2,5× priset – och varenda en av dem konstaterar att intelligensen är oförändrad.

Latens är en radpost, och den prissätts inte per token

Anledningen till att 2,5× inte automatiskt är en dålig affär är att tokenpris och uppgiftskostnad är olika storheter. Ett batchjobb som genererar en miljon utdatatokens över natten betalar $0,50 på Flash och $1,25 på FlashX bara för utdata, och får ingenting tillbaka för de extra $0,75 eftersom ingen väntar. En agentloop som gör tio sekventiella anrop betalar samma premie per token, men varje anrop återkommer snabbare, och besparingen hamnar i väggklockstid snarare än i fakturan. Om FlashX verkligen återkommer på en bråkdel av tiden kan tio turer ge tillbaka tiotals sekunder av latens per uppgift — och om den uppgiften blockerar en människa eller en uppströms tjänst är sekunderna värda mer än tokensen.

Z.ai:s egen positionering följer exakt den här linjen. Den riktar FlashX mot kodning med hög samtidighet, agentanrop i flera steg, realtidsdialog, kodkomplettering och multimodalt arbete med lång kontext, och riktar priskänsliga, latensokänsliga arbetsbelastningar — offlinebatch, massgenerering, allt schemalagt — tillbaka till bas-Flash. Det är den korrekta uppdelningen, och det är värt att notera att det är leverantören som gör den.

Där resonemanget brister är vid genomströmningsdelen. FlashX:s 200 tokens per sekund är en toppnotering som leverantören rapporterar; basmodellens 98 är ett medianvärde som ett oberoende labb uppmätt. Toppnoteringar nås vid korta utdata med varma cachar och ett ledigt kluster. En multimodal begäran med lång kontext – den exakta arbetsbelastning som FlashX riktar sig mot – är minst sannolik att närma sig den, och ingen utanför Z.ai har publicerat siffror som kan avgöra frågan. Om din arbetsbelastning är genomströmningsbunden snarare än latensbunden säger en toppnotering dig väldigt lite om vad du faktiskt kommer att få.

Nödutgången som FlashX inte har

Det finns ett tredje alternativ i den här jämförelsen, och det finns bara eftersom basmodellen är öppen. GLM-5.3-Flash släpptes den 26 augusti 2026 under MIT-licensen, med vikter på Hugging Face och ModelScope, och den serveras i dag av inferensstackar som bland annat SGLang, vLLM, TokenSpeed och KTransformers. Om din volym är tillräckligt hög för att motivera hårdvaran är den ärliga jämförelsen inte Flash mot FlashX — utan FlashX:s $1,25 per miljon utdatatokens mot din egen amorterade kostnad per token på dina egna acceleratorer.

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 19, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input, a 2026-08-26 release date by Z.ai, the 320B total / 18B active parameter line, and the billing row reading $0.07 per 1M input and $0.25 per 1M output tokens with a 6.68-second p50 time to first token.

Det alternativet har ett verkligt inträdespris. FP8-släppet kräver i storleksordningen 328 GB GPU-minne för att kunna serva, vilket är en distribution över flera noder för de flesta team och inte ett alternativ för resten. Men det är värt att påpeka, eftersom det är asymmetrin som gör FlashX prissättning till ett avsiktligt test snarare än en oundviklighet: Z.ai tar ett överpris för en serveringskonfiguration som kunderna, för basmodellen, i princip själva kan bygga. Överpriset gäller bekvämlighet, inte förmåga, och bekvämlighet har ett marknadspris som sjunker med tiden.

Vad prisändringen egentligen handlar om

Ekonomin bakom lanseringen är ovanligt lättbegriplig. GLM-5.3-Flash släpptes till en tiondel av priset för GLM-5.3 – hälften av det under en lanseringskampanj – och användes flitigt, inklusive en period av anonym förhandstestning före lansering som Z.ai sedan har bekräftat. FlashX är första gången den här familjen rör sig i den andra riktningen: samma modell, med högre pris. Analytiker som citeras i den kinesiska finanspressen tolkar det som ett medvetet kommersiellt test av huruvida utvecklare är villiga att betala för snabbhet i sig, efter ett år av att köpa marknadsandelar med kapacitet nära den absoluta framkanten till låga priser.

Två detaljer stöder den tolkningen. FlashX är utesluten från GLM Coding Plan medan basmodellen Flash ingår med trippel kvot, så prenumeranter kan inte absorbera den nya nivån i ett befintligt åtagande – de betalar per token. Och priset är fast, utan rabatt under lågtrafik, till skillnad från den tidsstyrda struktur som vissa konkurrenter använder för att fylla ledig kapacitet. En fast 2,5× på en hastighetsnivå är ett pris för människor som inte kan vänta, och Z.ai håller på att ta reda på hur många sådana det finns.

Att välja mellan dem

Välj FlashX om en människa eller en tjänst blockeras på nästa token och modellen själv redan är rätt val – inline-komplettering, interaktiva agenter, realtidschatt, allt där pausen är produkten. Välj GLM-5.3-Flash för batch-, offline- och massarbete, för allt du kan schemalägga och för alla arbetsbelastningar där du betalar för utdatavolym snarare än utdatasvarstid. Om din volym är stor och ditt team kan köra acceleratorer bör du prissätta de självhostade basvikterna innan du prissätter FlashX; jämförelsen är mer fördelaktig än tokenpriserna antyder.

Hur du än väljer att gå till väga bör du behandla de två som utbytbara på anropsplatsen. De tar samma prompter, returnerar samma format och ger samma kvalitet — det enda som ändras är en modellsträng, vilket är den billigaste typen av A/B-test att köra. På OrcaRouter förs leverantörens listpris vidare med 0 % påslag, så en prisförändring från Z.ai eller en kampanj gäller samma dag som den lanseras uppströms, och båda nivåerna ligger bakom en enda slutpunkt framför 200+ modeller. För ett beslut som hänger helt och hållet på uppmätt latens är möjligheten att växla mellan dem mitt i ett experiment utan att röra din integration det mesta av arbetet.

Domen är snävare än en vanlig modelljämförelse, och det är poängen. FlashX är inte en bättre modell och låtsas inte vara det heller. Det är samma modell med en kortare kö, såld till ett pris som bara är vettigt om kön var ditt problem. Mät din egen tid till första token på båda innan du bestämmer dig – leverantörens 200 är ett tak, din arbetsbelastning är det enda benchmark som spelar roll, och skillnaden mellan de två nivåerna är bara en konfigurationsändring bort.

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 19, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, $0.15 per 1M input and $0.50 per 1M output tokens, and a measured 98 output tokens per second against an average of 71.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen