Een hero-titelkaart voor GLM 5.3 Prime met de tekst 'GLM 5.3 Prime: twee keer de prijs, dezelfde gewichten', met als ondertitel 'GLM-5.3, augustus 2026, in september doorverkocht als een snellere serving-lane', met drie chips met de tekst 'Invoer / 1M: $2,80 vs $1,40', 'Uitvoer / 1M: $8,80 vs $4,40' en 'Vermenigvuldiger: precies 2,0x', en een voettekstregel 'Dezelfde gewichten, dezelfde context, dezelfde benchmarks - de prijs is het enige verschil.'
Guides & Insights

GLM 5.3 Prime: Dezelfde GLM-5.3-gewichten, tegen exact het dubbele van de tariefkaart

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

GLM 5.3 Prime kost $2,80 per miljoen invoertokens en $8,80 per miljoen uitvoertokens. GLM-5.3, het model waarop het draait, kost $1,40 en $4,40. Dat is geen afrondingsverschil of promotionele marge — het is exact 2,0× op beide regels, en het is het enige waarover de twee producten van mening verschillen. GLM 5.3 Prime is geen nieuw model. Het bevat de eigen gewichten van GLM-5.3, de gewichten die Z.ai op 25 augustus 2026 opende, achter een snellere servingstack. GLM-5.3 zelf werd op 14 augustus 2026 aangekondigd en bereikte de API op 18 augustus. Er veranderde niets aan het onderliggende model toen de Prime-ID eind september verscheen. Wat veranderde, is dat iemand er een tweede prijskaartje aan hing.

Als je dit leest omdat een modellenlijst je een onbekende naam naast een bekende liet zien, is het korte antwoord: je kijkt naar een serveerniveau, niet naar een release. Het langere antwoord is twee minuten waard, want de rekensom is ongewoon helder en de herkomst is ongewoon troebel.

Wat een "Prime"-niveau is, in één alinea.

Een serving-tier is een tweede product-ID dat naar dezelfde gewichten wijst, afgestemd op doorvoer in plaats van op kosten. Je krijgt geen groter model, geen langere context, geen betere redeneermodus en geen breder tooloppervlak. Je krijgt tokens sneller de deur uit, en je betaalt voor dat voorrecht op elke token in plaats van op de kloktijd die je hebt bespaard. Die ruil is reëel en soms terecht — een agentlus met meerdere stappen die tien sequentiële aanroepen doet, heeft er echt baat bij dat elke aanroep sneller terugkomt — maar het is een aankoop van latentie, geen aankoop van capaciteit, en als zodanig zou het geprijsd moeten worden.

De leveranciersbeschrijving voor GLM 5.3 Prime zegt het onuitgesproken deel ronduit: het is "de hogesnelheidsvariant van GLM-5.3 van Z.ai, die de volledige capaciteiten ervan erft en via inferentieversnelling 1,5–2× de uitvoerdoorvoer levert." Volledige capaciteiten. Hetzelfde contextvenster van 1.000.000 tokens. Hetzelfde uitvoerplafond van 131.072 tokens. Tekst in, tekst uit. Redeneren is verplicht, met laag, hoog en max als inspanningsniveaus en max als standaard — identiek aan het basismodel.

De tariefkaart, naast elkaar

• Invoer — GLM 5.3 Prime $2,80 per 1 mln. vs GLM-5.3 $1,40 per 1 mln.
• Uitvoer — GLM 5.3 Prime $8,80 per 1 mln. vs GLM-5.3 $4,40 per 1 mln.
• Gecachte invoer — GLM 5.3 Prime $0,56 per 1 mln. vs GLM-5.3 $0,26 per 1 mln.
• Vermenigvuldigingsfactor — 2,0× op alle drie de regels, in beide richtingen
• Context — 1.000.000 tokens bij beide
• Max. uitvoer — 131.072 tokens bij beide
• Redeneervermogen — verplicht bij beide, dezelfde drie inspanningsniveaus, dezelfde standaardinstelling

De cache-regel is degene die mensen over het hoofd zien. Een cache-read is het goedkoopste token dat je ooit bij een frontier-model zult kopen, en het is waar agentworkloads hun budget daadwerkelijk aan uitgeven — de systeemprompt, de tooldefinities en het groeiende transcript worden bij elke beurt opnieuw gelezen. Het verdubbelen van het cachetarief verdubbelt de grootste kostenpost in een lange agentsessie, wat betekent dat de effectieve meerprijs op een echte workload dichter bij 2× ligt dan het aangekondigde verschil op nieuwe inputtokens doet vermoeden. Als je hoopte dat de snelle route in de praktijk goedkoper zou zijn omdat je agressief cachet, dan is dat niet het geval.

Wie verkoopt het eigenlijk?

Dit is waar de listing interessant wordt, en waar een oplettende lezer even pas op de plaats moet maken. In Z.ai's eigen documentatie, het modeloverzicht en de gepubliceerde prijzenpagina staat geen Prime-SKU. Zoek in de model-ID's van de leverancier naar glm-5.3-prime en je vindt niets. Z.ai's eigen snelheidsklasse is een heel ander product op een heel andere lijn — GLM-5.3-FlashX, dat in de goedkopere Flash-familie zit, werd gelanceerd op 18 september 2026 en kost $0,37 en $1,25 per miljoen tokens.

Dus Prime is een product aan de platformzijde, gebouwd op de gewichten van Z.ai. Twee details wijzen erop wiens platform het is. Het eerste is de formulering "1,5–2× outputdoorvoer", dezelfde bewoording die een grote cloudprovider gebruikt voor zijn eigen versnelde servingmodus — een modus die je inschakelt door de model-ID te wijzigen, waarbij mogelijkheden en gebruikslimieten expliciet ongewijzigd blijven. Het tweede is dat de vermelding precies één upstreamprovider achter het endpoint noemt. Eén enkele provider achter een fast-tier-SKU is niet hoe een open-weightsmodel wordt geserveerd; het is hoe de eigen versnelde deployment van een platform er van buitenaf uitziet.

Niets daarvan maakt GLM 5.3 Prime een slecht product. Het maakt er een product met één leverancier van, en dat is een vraag over veerkracht die je je moet stellen voordat je productieverkeer erdoorheen leidt.

Wat de snelheidsclaim waard is

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3-FlashX - the two speed tiers'. The GLM 5.3 Prime column reads 'Input / 1M: $2.80', 'Output / 1M: $8.80', 'Cached input: $0.56', 'Runs on: GLM-5.3 weights', 'Weights: none, hosted lane', 'Price vs GLM-5.3: 2.0x'; the GLM-5.3-FlashX column reads 'Input / 1M: $0.37', 'Output / 1M: $1.25', 'Cached input: not listed', 'Runs on: Flash family weights', 'Weights: none, hosted lane', 'Price vs GLM-5.3: under 0.3x'; the footer reads 'Both are serving tiers, not models. Prime per its tier listing; FlashX per the vendor rate card.'

Het cijfer van 1,5–2× is een doorvoerclaim die onder de eigen omstandigheden van de leverancier is gemeten, en doorvoer is de maatstaf die het gevoeligst is voor die omstandigheden. Outputtokens per seconde op een warme cache met een korte prompt en een inactief cluster is niet het aantal dat een agent met een lange context ziet. Uit onafhankelijke meting van het basismodel blijkt dat GLM-5.3 op ongeveer 61 outputtokens per seconde uitkomt en GLM-5.3-Flash op circa 46, op een set waar het klassegemiddelde 67 is — dus de goedkopere variant is ook de langzamere, wat het tegenovergestelde is van wat de namen suggereren. Dat zijn medianen over een gestandaardiseerde evaluatieset, geen pieken.

Er is ook een subtielere kostenpost. De standaardwaarde voor reasoning effort op beide ID's is max, de instelling die de langste gedachteketens oplevert. Snelheid en breedsprakigheid trekken hier tegen elkaar in: een snelle tier die ook op maximale lengte redeneert, kan bij een moeilijk probleem end-to-end nog steeds traag zijn, omdat de bottleneck het aantal tokens is dat het model besluit te genereren, niet de snelheid waarmee het ze genereert. Als je workload veel reasoning vereist, verlaag dan naar high of low voordat je 2× betaalt voor acceleratie — het effortniveau zal je latency meer beïnvloeden dan de serving-tier dat zal doen.

Drie manieren om hetzelfde model te kopen

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 24, 2026) showing the 1M-token context badge, a 128K max output, text input and text output with tools, JSON and reasoning, a 2026-08-18 date beside 'Public benchmarks by Z.ai', a p50 time to first token of 3.91 seconds, and a stat strip reading $1.26 input, $3.96 output, 3.91 s p50 TTFT, 10.00 s p95 TTFT and 1,733.9M tokens.

GLM-5.3 bestaat nu in drie aan te schaffen vormen, en het zijn geen drie modellen:

• GLM-5.3 voor $1,40 / $4,40 — de basisprijskaart, volledige capaciteit, de versie met gepubliceerde open gewichten die je zelf kunt hosten
• GLM 5.3 Prime voor $2,80 / $8,80 — dezelfde gewichten via een versnelde stack, één upstreamleverancier, geen gewichten in het spel
• GLM-5.3-FlashX voor $0,37 / $1,25 — helemaal geen GLM-5.3, maar de snelheidslaag op de goedkopere Flash-familie, en veruit de goedkoopste manier om latentie te kopen

Die derde regel is er een die het waard is om bij stil te staan. Als wat je eigenlijk wilt snellere tokens zijn en je flexibel bent over van welke GLM je ze krijgt, levert FlashX versnelling op een model dat al ongeveer een tiende van het vlaggenschip kost, voor minder dan de helft van wat het vlaggenschip ongeaccelereerd kost. Prime is alleen zinvol als je specifiek de redeneerkwaliteit van GLM-5.3 nodig hebt en die specifiek eerder nodig hebt.

Waar dit aan onze kant ligt

A tall screenshot of the same OrcaRouter model page for GLM 5.3 (captured September 24, 2026) showing the PRICING block reading $1.26 per 1M input tokens, $3.96 per 1M output tokens and $0.234 per 1M cache read in USD, a token and cost estimator, and a PERFORMANCE panel for the last 7 days reading p50 TTFT 3.91 s, output speed 73.6 tokens per second, p95 TTFT 10.00 s and an error rate of 0.14%.

We moeten duidelijk zijn over één ding: OrcaRouter host GLM 5.3 Prime niet, en we hosten GLM-5.3-FlashX ook niet. Beide modelpagina's geven een 404 op onze site. Als je de versnelde laag wilt, moet je die kopen bij het platform dat die verkoopt, of via de eigen API van de leverancier voor het basismodel.

Wat wij hosten is GLM-5.3 en GLM-5.3-Flash, tegen de lijstprijs van de provider, zonder enige opslag van onze kant — dezelfde $1,40 en $4,40 die je op Z.ai's eigen tariefkaart ziet, doorgegeven in plaats van herprijsd. Dat is belangrijker dan het klinkt voor een model waarvan de prijs in zes weken twee keer is gewijzigd. Omdat wij geen spread toevoegen, is een prijswijziging van de leverancier bij ons dezelfde dag live als bij hen, zonder migratie of supportticket. Beide ID's zitten achter één API-sleutel, naast meer dan 200 andere modellen, dus een A/B tussen GLM-5.3 en GLM-5.3-Flash is een wijziging van de modelnaam in één regel in plaats van een tweede contract, en automatische failover dekt je als één enkele upstream-provider verslechtert — wat precies het risico is dat een snelle tier bij één enkele leverancier met zich meebrengt.

Moet je de 2× betalen?

Betaal het als een mens of een upstream-service geblokkeerd is op de respons, de workload latency-gebonden is in plaats van throughput-gebonden, en je al hebt bevestigd dat reasoning effort de echte oorzaak is van je latency. Betaal het niet als je 's nachts batchgeneratie draait, als je volume hoog genoeg is dat een 2× tokenpremie de kloktijd die je bespaart overtreft, of als je hoopte dat de tier stilletjes een beter model zou zijn. Dat is het niet. Het is GLM-5.3 met een lopende stopwatch, en de stopwatch rekent per token af.

De eerlijke framing voor de hele GLM-5.3-familie op dit moment is dat Z.ai in augustus één model heeft uitgebracht en dat de markt september heeft besteed aan het herverpakken ervan tegen vier verschillende prijzen. GLM 5.3 Prime is het duurste van die pakketten. Het is ook het model met het dunste papieren spoor, omdat het bedrijf waarvan de naam op de gewichten staat, het niet vermeldt. Dat is geen reden om het te vermijden. Het is een reden om precies te weten wat je koopt voordat je het op een productiepad zet.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt