Een gegenereerde titelkaart met de tekst 'GLM-5.3-Flash Onthuld' en als ondertitel 'Zhipu's open multimodale frontiermodel was het anonieme Ox Alpha — nu voor een tiende van de prijs van GLM-5.3', met platte lijnpictogrammen van een bliksemchip, een MIT-badge en een afbeelding-video-pictogram.
Guides & Insights

GLM-5.3-Flash onthuld: de anonieme 'Ox Alpha' was al die tijd Zhipu's open multimodale frontiermodel

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het model dat een week lang bovenaan de gebruiksgrafieken van externe codeerplatforms stond, heeft eindelijk een naam en een prijs. Op 26 augustus 2026 bevestigde Zhipu AI dat het gratis 'Ox Alpha'-model waar ontwikkelaars sinds 20 augustus op los waren gegaan, GLM-5.3-Flash is — een mixture-of-experts-model met in totaal 320 miljard parameters en 18 miljard actieve parameters (320B-A18B), de eerste native multimodale release in de GLM-5-serie, en bij de lancering een van de goedkoopste frontier-grade modellen op elke prijslijst. Zhipu rekent voor GLM-5.3-Flash een tiende van het API-tarief van zijn vlaggenschip GLM-5.3, of een twintigste tijdens een tijdelijke kortingsactie, en de open gewichten — onder MIT-licentie — gingen dezelfde dag naar Hugging Face. In tegenstelling tot GLM-5.3, waarvan de gewichten nog worden verwacht tegen het einde van de maand, kun je dit model deze week al self-hosten, niet pas volgende week.

Hier is de korte versie: Zhipu heeft zijn goedkoopste grote model tot nu toe als open source uitgebracht. Het verslaat zijn eigen GLM-5.2 op benchmarks, ondanks dat het slechts een fractie van de actieve parameters gebruikt, en de leverancier stelt de Artificial Analysis Intelligence Index-score op 57 — gelijk aan Claude Opus 4.8, volgens Zhipu's lancermateriaal. Elk benchmarkcijfer dat aan deze lancering is gekoppeld, is door de leverancier gerapporteerd en niet onafhankelijk gereproduceerd op het moment van schrijven; de prijzen en het aantal parameters zijn actuele feiten.

Wat er daadwerkelijk is uitgebracht

GLM-5.3-Flash is een MoE met 320B totaal / 18B actieve parameters en 45 lagen, wat de actieve voetafdruk op iets meer dan de helft van de ~32B actieve parameters van GLM-5.2 brengt. De belangrijkste capaciteit is modaliteit: het neemt native tekst-, beeld- en video-invoer — het eerste GLM-5-model dat dit doet — in plaats van visie via een aparte adapter te routeren. De context gaat tot 1 miljoen tokens, en Zhipu claimt dat de kosten voor het serveren van lange context ongeveer een derde bedragen van die van GLM-5.3.

Aan de architectuurkant beschrijft Zhipu het als het eerste open-source frontier-model dat gebruikmaakt van een hybride sparse-attention-plus-linear-attention-ontwerp, gecombineerd met Manifold-Constrained Hyper-Connections (mHC) voor het opschalen en een IndexPool-mechanisme dat vier indexer-key-vectoren comprimeert tot één gewogen pool om de long-context-latentie te verminderen. De pretraining draaide op een multimodale corpus van 30 biljoen tokens. Geen van dit is nog onafhankelijk geaudit — het is Zhipu's beschrijving van zijn eigen model — maar de claims over serveerefficiëntie zijn specifiek genoeg om te testen zodra de weights voor de open-source-inferencestack liggen.

De specificaties voor de lanceringsdag, in één oogopslag:

• Parameters — 320B totaal / 18B actief, 45 lagen, MoE.

• Modaliteit — native tekst-, afbeelding- en video-invoer; tekstuitvoer.

• Contextvenster — tot 1.000.000 tokens.

• Licentie — MIT, open gewichten live op Hugging Face bij lancering.

• Price — $0.15 / $0.50 per million tokens (input / output), $0.03 per million cached input; a 50%-off promo through September 9, 2026 cuts that to $0.075 / $0.25 / $0.015. At list that is roughly a tenth of GLM-5.3's $1.40 / $4.40.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

De Ox Alpha week

De onthulling sluit een week van speculatie af. Op 20 augustus verscheen een anoniem model op een AI-API-platform van een derde partij, met een contextvenster van 1 miljoen tokens, invoer van tekst, beeld en video, en een prijs van nul, en het werd al snel het meest aangeroepen model op de wekelijkse hitlijsten van het platform. De community herleidde het binnen 48 uur via vingerafdrukken tot Zhipu's GLM-familie — hetzelfde patroon van eerst anoniem, later opgeëist, dat eerder modellen van andere Chinese labs had geïdentificeerd — en de meeste analisten gokten op een Flash-variant van GLM-5.3. De aankondiging van 26 augustus bevestigde dat vermoeden en voegde het detail toe dat de gratis week een bewuste test was: Zhipu zegt dat de anonieme run op de codeerplatforms waar het werd aangeboden records vestigde op het gebied van oproepvolume, waarbij al het verkeer via binnenlandse Chinese chips werd afgehandeld.

Die context van de gratis week is belangrijk voor de prijsverwachtingen. Een model dat een week lang voor $0 wordt weggegeven en vervolgens wordt gelanceerd tegen een tiende van het tarief van het vlaggenschip, met een tijdelijke korting tot een twintigste van de prijs, is een bewuste marktcreërende zet in het budgetsegment — en het kwalificatiewoord 'tijdelijk' is waar je op moet letten. De korting is een prijsbeslissing die kan worden teruggedraaid; de MIT open gewichten niet.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

Wat het kost, in echte dollars

Zhipu's rate card is out in actual dollars, not just ratios: $0.15 per million input tokens, $0.50 per million output tokens, and $0.03 per million cached input tokens. Against GLM-5.3's published $1.40 / $4.40, that lands at roughly a tenth at list, and a 50%-off launch promo running through September 9, 2026 brings it to $0.075 / $0.25 / $0.015 — roughly a twentieth. Zhipu also puts the model's cost per AA Intelligence Index task at about $0.045, vendor-reported, which is the number behind the "1/40 of Opus 4.8" framing. For a model that scores in the same band as models priced 10–40x higher, the headline economics are real; the fine print is that the launch discount is temporary and per-task cost depends on how verbose the model turns out to be in production.

{{1}}Het efficiëntieverhaal is waar Zhipu beweert dat het kostenvoordeel vandaan komt.{{/1}} {{2}}Ten opzichte van GLM-5.3 meldt de leverancier een 3,0x lagere attention-compute en een 4,4x lagere KV-cache, en claimt het de laagste attention-compute van de vergeleken budgetmodellen — GLM-5.3, DeepSeek V4 Flash en Kimi K3 — terwijl het toegeeft dat de KV-cache nog steeds iets groter is dan die van DeepSeek V4 Flash en Kimi K3.{{/2}} {{3}}Op het gebied van serving meldt Zhipu een 3x verbetering in end-to-end servingprestaties ten opzichte van de basislijn op binnenlandse Chinese chips, waarmee het een prijs per token bereikt die het vergelijkbaar noemt met gangbare NVIDIA-GPU's.{{/3}} {{4}}Dat zijn allemaal cijfers van de leverancier en geen ervan is onafhankelijk gereproduceerd; het zijn de juiste cijfers om te controleren tegen de open gewichten.{{/4}}

Waarom de onthulling ertoe doet

Strip the benchmarks away and the launch still changes the open-model landscape in two ways. First, it is an open-weights multimodal model in the frontier band at a budget price — the combination of MIT license, 1M context, native image/video input, and single-digit-cent per-task cost has no direct equivalent from the US frontier labs, whose equivalent multimodal models cost an order of magnitude more and ship closed. Second, it undercuts Zhipu's own flagship: GLM-5.3 is the 743B model that scored an independently measured 60 on the AA Intelligence Index this month, and GLM-5.3-Flash is positioned as "frontier intelligence, flash cost" against that same family. Zhipu's story is that a smaller, cheaper model can capture most of the flagship's capability — which, if the vendor's coding and agentic claims hold up, is the same post-training-economy argument the industry has been circling all year.

Eén kanttekening houdt dit in perspectief. De AA Index-score van 57 voor GLM-5.3-Flash komt uit Zhipu's eigen lanceringsmateriaal, nog niet van de Artificial Analysis-ranglijst, en de codeervergelijking met Claude Opus 4.8 is Zhipu's interne Z.ai Code Bench-evaluatie. Beschouw de 57 en de codeerpariteit als claims totdat onafhankelijke metingen verschijnen — het model werd breed anoniem getest, dus externe cijfers zouden snel moeten komen.

Probeer het, en hoe de routinglaag past

Toegang vanaf dag één verloopt via Zhipu's eigen API, de open gewichten op Hugging Face (zai-org/GLM-5.3-Flash, MIT), en Zhipu's codeerproducten — ZCode en het GLM Coding Plan, dat een reeks dagelijkse ervaringskaarten omvat. Voor self-hosting betekent de MIT-licentie plus ondersteuning voor vLLM en SGLang dat de bovenstaande claims over serveerefficiëntie direct controleerbaar zijn.

On the routing side, GLM-5.3-Flash itself is not on OrcaRouter's roster yet as of this update. The rest of the GLM family is: GLM-5.3 went live on our side the same day Zhipu's API opened, at Zhipu's list price with 0% markup passed through. That pass-through is exactly the mechanism that matters for a launch like this one — a vendor price change, whether the discount sticks or the rate card moves later, shows up on our side the same day, no renegotiation. If you want to run the Flash against the rest of the GLM line on one key once it lands, that is the setup; until then the weights on Hugging Face are the fastest way to test it yourself.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

Wat nu te kijken

Three things settle the real story in the next couple of weeks. First, an independent Artificial Analysis measurement of the 57 — the model was already running in the wild as Ox Alpha, so the leaderboard should catch up fast. Second, whether the 50%-off promo — currently set to end September 9, 2026 — is extended past that date, since that decides the Flash's steady-state cost. Third, the GLM-5.3 weights, still promised for around August 28 — the same week the Flash's MIT weights went live, which would give the open-weights community two tiers of the same family to compare at once.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube