Hero-titelkaart voor het artikel 'Ox Alpha', met de ondertitel 'De canonieke referentiepagina voor het stealth-alias achter Z.ai's GLM-5.3-Flash', chips met de tekst 'In preview als Ox Alpha vanaf 20 augustus 2026', 'Onthuld op 26 augustus 2026', '320B totaal / 18B actief, 1M context' en 'MIT-licentie, open weights', en een voettekst met de tekst 'Envelope, modaliteiten, tariefkaart, endpoint-oppervlak en benchmarks - geverifieerd op 2026-09-28'. Het OrcaRouter-logo is in de rechteronderhoek samengesteld.
Guides & Insights

Ox Alpha: Het volledige specificatieblad voor het stealthmodel dat nu wordt geleverd als GLM-5.3-Flash

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Ox Alpha is de anonieme naam waaronder GLM-5.3-Flash werd gepreviewd; het werd onthuld op 26 augustus 2026, en het is geen model dat je vandaag kunt aanroepen. De previewvermelding die de Ox Alpha-naam droeg, levert dat model niet meer; het model daarachter heeft een leverancierspagina, onder MIT-licentie vrijgegeven gewichten, een gepubliceerde tariefkaart en een gedocumenteerd API-oppervlak, allemaal van Z.ai. Deze pagina is de referentie voor dat model — de envelop, de modaliteiten, de tariefkaart, het endpoint-oppervlak, elk gepubliceerd benchmarkcijfer met de bijbehorende revisie of harness, en, omdat de alias nog steeds een mager en verwarrend zoekresultaat oplevert, een duidelijke uiteenzetting van wat nergens is gedocumenteerd. Alles hieronder is op 2026-09-28 gelezen uit de eigen modeldocumentatie en prijspagina van Z.ai, uit de Z.ai-modelkaart op Hugging Face, uit Artificial Analysis en uit onze eigen catalogus; cijfers die de leverancier publiceert en cijfers die een onafhankelijke partij meet, zijn apart gelabeld, en niets hier is afgeleid uit een gelijkenis.

Waar de naam Ox Alpha tegenwoordig naar verwijst

De alias is buiten gebruik gesteld, en de leverancier is degene die hem buiten gebruik heeft gesteld. De eigen documentatie van Z.ai voor GLM-5.3-Flash stelt dat het model vóór de release anoniem onder de naam ox-alpha werd getest, om gebruikersfeedback te verzamelen, en dat de anonieme run het populairste model van die week werd. De dateerbare ankerpunten zijn kort en specifiek: de stealth-vermelding toonde Ox Alpha als uitgebracht op 20 augustus 2026, en de onthulling vond plaats op 26 augustus — dezelfde datum die de documentatiepagina van Z.ai vermeldt en dezelfde releasedatum die onze eigen catalogus voor z-ai/glm-5.3-flash registreert.

Daaruit volgen twee dingen, en beide zijn van belang voor een lezer die naar de naam heeft gezocht.

• De alias is geen route. Onze catalogus geeft "model not found" terug voor een stealth/ox-alpha-opzoeking, uitgelezen op 2026-09-28. Er is niets om onder die naam aan te roepen, omdat het product van de leverancier de naam van de leverancier draagt.

• Er is evenmin een door de leverancier beheerde gewichtenrepository onder de alias. Een zoekopdracht op Hugging Face naar ox-alpha levert community-uploads op die tijdens het stealth-venster eind augustus 2026 zijn gemaakt, plus een alleen-kaart-repository van 27 september 2026 die geen gewichten bevat en verwijst naar de officiële release van Z.ai. Een repositorynaam is een label dat de uploader heeft gekozen; het is geen documentatie van wat dan ook. Z.ai's eigen organisatie publiceert het model als zai-org/GLM-5.3-Flash, waarbij de repository op 2026-08-25 in UTC is aangemaakt.

De vraag over de provider die de anonieme week domineerde, is beslecht, en wel op de gebruikelijke manier: een lab stapte naar voren en zette zijn naam op het model. Wat overblijft is een specificatie, en dat is wat deze pagina behandelt. Het ontdekkingsverhaal — de fingerprinting die aan de onthulling voorafging, de anonieme-modellenlijn waartoe het behoort, en de bekendmaking van de servinghardware die ermee gepaard ging — staat in ons eerdere stuk over het Ox Alpha-onderzoek, en deze pagina behandelt niets daarvan opnieuw.

De envelop, zoals de leverancier deze documenteert

A screenshot of Z.ai's official developer documentation page for GLM-5.3-Flash, showing the Model Overview section with the four spec rows on the right reading Input Modality 'Video / Image / Text / File', Output Modality 'Text', Context Length '1M' and Maximum Output Tokens '128K', alongside vendor-stated architecture notes describing 320B total parameters with 18B activated and a hybrid sparse-and-linear attention design that reduces attention computation and KV cache by 3.01x and 4.44x versus GLM-5.3.

Dit zijn door Z.ai gerapporteerde cijfers, gelezen van de eigen documentatiepagina van de leverancier op 28-09-2026, en drie van de vier dimensies van het specificatiekader worden onafhankelijk bevestigd — het modelrecord van Artificial Analysis bevat dezelfde 320B totaal, 18B actief, context van 1.000.000 tokens en MIT-licentie, en onze eigen cataloguskaart bevat de context- en uitvoerlimieten.

• Contextvenster — 1.000.000 tokens (Z.ai-documentatie; Artificial Analysis; onze eigen cataloguskaart, die 1.000.000 vermeldt)

• Maximale uitvoer — 128K tokens (Z.ai-documentatie); onze kaart vermeldt 128.000

• Invoer — tekst, afbeelding, video en bestand (Z.ai-documentatie, geraadpleegd op 2026-09-28); onze kaart vermeldt tekst, afbeelding en video, en claimt geen bestandsinvoer

Uitvoer — alleen tekst, voor elke bron

• Parameters — 320B totaal, met 18B geactiveerd per token (Z.ai-documentatie en modelkaart; Artificial Analysis registreert onafhankelijk 320B en 18B)

• Licentie — MIT, met gewichten gepubliceerd op Hugging Face (modelkaart van de leverancier; Artificial Analysis classificeert het model als open gewichten onder een permissieve licentie)

• Architectuur — een hybride van sparse en lineaire attention, die Z.ai beschrijft als het eerste open-source frontiermodel dat de twee combineert, waardoor de attention-berekening met 3,01× en de KV-cache met 4,44× afneemt ten opzichte van GLM-5.3, plus een IndexPool-stap die bij een lange context vier indexer-sleutelvectoren tot één comprimeert, en Manifold-Constrained Hyper-Connections voor schaalefficiëntie. Allemaal door de leverancier opgegeven; er is geen onafhankelijke architectuuraudit om naar te verwijzen.

• Pretraining — een multimodaal corpus van 30 biljoen tokens (volgens Z.ai). De leverancier publiceert geen totaalcijfer voor trainingscompute en geen uitsplitsing van parameters per laag buiten de 320B/18B-hoofdcijfers.

Eén claim over de omvang is sinds de lancering kleiner geworden, en de huidige documentatie is de versie die je moet citeren. De openbaarmaking over de serverhardware die in augustus circuleerde, stelde de capaciteit van de anonieme week op ongeveer 100.000 binnenlandse Chinese chips. De documentatie van Z.ai zoals die er vandaag uitziet, zegt dat het model werd geserveerd "op tienduizenden in eigen land ontwikkelde accelerators", met een 3× end-to-end verbetering van de serving ten opzichte van de eigen baseline van de leverancier op dezelfde hardware en een kostprijs per token die de leverancier omschrijft als vergelijkbaar met die van gangbare NVIDIA-GPU's. Tienduizenden is wat de pagina nu zegt; het grotere cijfer is dat uit de lanceerperiode. Beide zijn claims van het bedrijf, geen van beide is onafhankelijk gecontroleerd, en de richting van de bijstelling is neerwaarts.

De tariefkaart, en waarom het uitgeleverde aantal het aantal is dat ertoe doet.

De prijspagina van Z.ai vermeldt GLM-5.3-Flash tegen $0,15 per miljoen invoertokens, $0,03 per miljoen gecachete invoertokens en $0,50 per miljoen uitvoertokens, en de zustertier FlashX tegen $0,37 / $0,075 / $1,25. Dat is de lijstprijs van de leverancier, afgelezen van de eigen pagina van de leverancier op 2026-09-28.

Het tarief dat vandaag daadwerkelijk op onze route wordt gehanteerd, is lager, en dat is het praktische punt van deze sectie. Op 2026-09-28 lezen we dat de OrcaRouter-kaart voor z-ai/glm-5.3-flash input prijst op $0.075 per miljoen tokens, output op $0.25 per miljoen en cache-reads op $0.0173 per miljoen. Dat is de helft van het lijsttarief van de leverancier, voor hetzelfde model, op dezelfde dag — het gereduceerde tarief in plaats van het hoofdtarief, zonder promotielabel op de kaart. Onze eerdere berichtgeving over dit model constateerde dezelfde kloof nadat het aangegeven promotievenster was gesloten; de observatie geldt vandaag nog steeds, en we kunnen de oorzaak nog steeds niet achterhalen, dus we rapporteren het gehanteerde aantal en laten de oorzaak open.

Gecachte invoer is het punt waarop de drie bronnen zichtbaar van elkaar afwijken, wat een nuttige herinnering is dat een "$0.03" in een tabel niet noodzakelijk een prijs is die iemand betaalt. De pagina van de leverancier vermeldt $0.03 per miljoen gecachte invoertokens; het modelrecord van Artificial Analysis bevat een cachehitprijs van $0.026; onze route levert cachereads tegen $0.0173. Alle drie uitgelezen op of kort vóór 2026-09-28, alle drie gerapporteerd door de leverancier of het platform. Wij vermelden het lijstcijfer van de leverancier als het lijstcijfer en het geleverde cijfer als wat een aanroeper daadwerkelijk in rekening wordt gebracht.

Voer de berekening uit voor een representatieve agenttaak — 100.000 inputtokens en 10.000 outputtokens, geen cache-hits:

• Tegen het tarief op de leverancierslijst — 100.000 tokens × $0,15/1M = $0,015, plus 10.000 × $0,50/1M = $0,005, dus $0,020 per aanroep

• Tegen het tarief dat onze route vandaag hanteert — $0,0075 plus $0,0025, dus $0,010 per oproep, precies de helft

Dat is de hele reden om de daadwerkelijk aangeboden prijs te controleren in plaats van de lijstprijs voordat je de omvang van een workload bepaalt: bij een agent met een lange horizon die duizenden calls per dag uitvoert, is het verschil tussen die twee getallen het verschil tussen twee budgetten. OrcaRouter geeft de lijstprijs van de provider door met 0% opslag, en daarom is de korting die de leverancier aanbiedt zichtbaar op onze factuur in plaats van ergens in het midden te worden geabsorbeerd.

Modaliteiten en endpoint-oppervlak

De leverancier documenteert één interfacevorm en twee modelcodes: glm-5.3-flash en glm-5.3-flashx, beide aangeboden via de Chat Completion API. Afbeeldingen worden ingevoegd als een contentblok met type image_url in de content-array van het bericht, waarbij u ofwel een URL gebruikt — wat de leverancier aanbeveelt — ofwel een base64-data-URL, en er kunnen meerdere afbeeldingsblokken in één bericht worden verzonden. Streaming wordt ondersteund, en Z.ai raadt aan om stream en tool_stream samen in te schakelen voor streamingverzoeken. Tool calling, contextcaching en gestructureerde JSON-uitvoer zijn allemaal gedocumenteerde mogelijkheden; thinking wordt ondersteund, maar is, zoals de volgende sectie uitlegt, niet optioneel.

FlashX is een aparte serving-tier van hetzelfde model, niet een aparte capaciteit: Z.ai documenteert het op 200 tokens per seconde, en stelt dat het nog niet beschikbaar is in het GLM Coding Plan. Het is niet de tier die in onze catalogus staat, en het is niet wat de cijfers op deze pagina beschrijven.

Op onze route is het endpointoppervlak beperkter en het is de moeite waard om het exact te vermelden. De kaart voor z-ai/glm-5.3-flash biedt POST /v1/chat/completions — alleen chat completions, zonder een tweede protocol-endpoint — en accepteert reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens en stop. De capaciteitschips op de kaart zijn vision, tools, JSON en reasoning. De context bedraagt 1.000.000 tokens en de maximale uitvoer 128.000, in overeenstemming met de documentatie van de leverancier.

Inspanning en denken: de instellingen die elk benchmarkcijfer vastpinnen

Dit is het deel van de specificatie dat het meest van invloed is op hoe je de scores leest, en de leverancier documenteert dit nauwkeurig. GLM-5.3-Flash accepteert een reasoning_effort-parameter met drie niveaus — low, high en max — en deze valt standaard terug op max als je niets doorgeeft, of als je iets doorgeeft dat niet low of high is. Denken kan niet worden uitgeschakeld: de leverancier stelt dat thinking.type alleen enabled ondersteunt. De clear_thinking-vlag van de chatsjabloon staat standaard op false, en Z.ai raadt aan deze expliciet op true te zetten voor chatscenario's. De door de leverancier aanbevolen sampling-instellingen zijn temperature 1 en top_p 0.95, en er staat ronduit dat bij het reproduceren van benchmarks en leaderboards de standaard max-inspanning moet worden aangehouden.

Lees die twee feiten samen, en de consequentie voor iedereen die cijfers vergelijkt is onvermijdelijk: een score die zonder inspanningsniveau wordt genoemd, is geen volledige meting, omdat de instellingen low, high en max verschillende werkpunten van hetzelfde model zijn, en de standaardinstelling de duurste van de drie is. Onze kaart biedt reasoning en reasoning_effort aan onder de ondersteunde parameters, dus de instelling is via de route bereikbaar, niet alleen via de leverancier.

Het benchmarkblad, met de revisie bijgevoegd.

Z.ai publiceert een benchmarktabel voor GLM-5.3-Flash, en die is volledig door de leverancier gerapporteerd — de onafhankelijke registratie van Artificial Analysis reproduceert deze rijen niet. De belangrijkste codeer- en agentic-cijfers van de leverancier zijn DeepSWE v1.1 met 63,4 tegenover 46,2 van GLM-5.2, en AutomationBench v1.0.6 met 48,8 tegenover 26,2 van GLM-5.2. De rest van het blad, zoals onze eigen catalogus het vermeldt met Z.ai als genoemde bron: Humanity's Last Exam with tools 55,3, Agents' Last Exam 26,3, NL2Repo 56,3, Chartography with tools 78, CharXiv reasoning with tools 89,4, en aan de visiekant MMVU 80,5, MVBench 77,8 en BabyVision 53,4.

Twee leveranciersrijen verdienen het dat hun voetnoten in de zin worden meegenomen, want dit zijn juist de regels die een lezer het vaakst zonder die voetnoten zou citeren. Z.ai's interne codeerevaluatie, Z.ai Code Bench v1.0, zet GLM-5.3-Flash op 29,0 bij maximale inspanning tegenover Claude Opus 4.8 op 29,5 — een bijna-gelijkspel op de eigen testomgeving van de leverancier, uitgevoerd op Claude Code 2.1.207, gerapporteerd door de leverancier. Dat is geen onafhankelijke vergelijking en het is geen vergelijking met gelijke inspanning uitgevoerd door een derde partij; het is Z.ai dat zijn model tegen een concurrent benchmarkt op zijn eigen evaluatie. En de leverancier citeert een Artificial Analysis Intelligence Index van 57 bij $0,045 per taak, waarbij de revisie wordt aangeduid als v4.1.1.

Dat laatste cijfer moet worden losgekoppeld van wat Artificial Analysis vandaag publiceert, omdat de twee niet naast elkaar kunnen worden geplaatst als een beweging. De eigen pagina van Artificial Analysis voor GLM-5.3-Flash, gelezen op 2026-09-28, vermeldt een Intelligence Index van 41.8 op Index v4.3.2, geregistreerd bij maximale inspanning. v4.3.2 omvat tien evaluaties — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience en AA-LCR v1.1 — en v4.1.1 niet. Twee indexrevisies, twee takenreeksen, twee cijfers. Geen van beide is fout; het zijn niet dezelfde metingen, en het citeren van de 57 naast de 41.8 alsof het model was opgeschoven, zou in beide richtingen een fout zijn.

Wat de onafhankelijke registratie wél bevestigt, zijn de specificaties en niet de scores: Artificial Analysis registreert onafhankelijk 320B totale parameters, 18B geactiveerd, een contextvenster van 1.000.000 tokens, MIT-licentie, open weights en een releasedatum van 2026-08-26, en vermeldt leveranciersprijzen van $0,15 in en $0,50 uit per miljoen tokens, met een cache-hitprijs van $0,026. Waar de leverancier een score publiceert en de onafhankelijke partij niet, zeggen we dat; waar de onafhankelijke partij een specificatie bevestigt, is dat de sterkste categorie feiten op deze pagina.

Er is hier geen sprake van een gelijkwaardige head-to-head, en dat zeggen is nuttiger dan er een te produceren. Niemand heeft een run van GLM-5.3-Flash tegen Claude Opus 4.8, GPT-6 Sol of Grok 4.7 gepubliceerd bij een vermelde effort op een gedeelde harness — de eigen vergelijking van Z.ai is op zijn eigen bench, op maximale effort, tegen de standaardinstelling van een concurrent. Totdat dat verandert, is de eerlijke vergelijking tussen dit model en al het andere op prijs, envelope en endpoint-oppervlak, de drie dingen op deze pagina die iedereen uit dezelfde cijfers kan aflezen.

Wat niet gedocumenteerd is, simpelweg gezegd

Een referentiepagina voor een model met een beperkt informatieoppervlak is alleen nuttig als deze eerlijk is over de hiaten, en deze pagina heeft er verschillende.

• Geen door de leverancier opgegeven kennisafsluitdatum. De documentatie van Z.ai en de modelkaart van Hugging Face vermelden er geen, en het record van Artificial Analysis laat het veld null. Schattingen uit het stealthvenster zijn werk van de community, geen leverancierscijfer, en deze pagina herhaalt er geen alsof het wel een leverancierscijfer was.

• Geen voetnoten over de harness voor het grootste deel van het benchmarkblad. De modelkaart bevat wel voetnoten voor de HLE-run met tools — temperatuur 1.0, top_p 0.95, een maximale generatielengte van 163.840 tokens, evaluatie bij een context van maximaal 300.000 tokens met een contextbeheerstrategie, en GPT-5.6 Luna op medium effort als judge-model — en voor NL2Repo en DeepSWE, waarvan de leverancier zegt dat ze met de mini-swe-agent-harness zijn uitgevoerd. De overige rijen zijn kale percentages zonder vermelding van harness of effort.

• Geen uitleg over het prijsverschil bij gecachte invoer. Drie cijfers voor dezelfde hoeveelheid bij hetzelfde model, en geen enkele bron vermeldt waarom ze verschillen.

• Geen onafhankelijke benchmark van de anonieme serveerperiode. De stealth-vermelding is verdwenen; wat er ook gemeten is, kan niet opnieuw worden gemeten, en geen enkele derde partij publiceerde een run tegen de alias terwijl die live was.

• Geen vergelijking met derden bij gelijke inspanning, om de hierboven gegeven reden.

• Geen bevestiging van de leverancier van het aantal chips ten tijde van de lancering. De documentatie vermeldt tienduizenden binnenlandse accelerators; het getal van 100.000 staat niet op de pagina.

Bij deze: wat onze catalogus biedt, vandaag geverifieerd

A single-column reference scoreboard titled 'GLM-5.3-Flash, the model behind Ox Alpha', with six rows reading 'Context: 1,000,000 tokens', 'Max output: 128K tokens', 'Input / output: text, image, video in / text out', 'Parameters: 320B total, 18B active, MIT licence', 'Vendor list price: $0.15 in / $0.50 out per 1M, $0.03 cached', and 'Served on OrcaRouter: $0.075 in / $0.25 out per 1M'. A footer line reads 'Z.ai-reported envelope and list price; OrcaRouter card read 2026-09-28; Artificial Analysis independently confirms 320B/18B, 1M context and MIT.' The OrcaRouter logo is composited in the bottom-right corner.

Het model achter Ox Alpha staat live in onze catalogus onder zijn eigen naam, vandaag gecontroleerd in plaats van aangenomen. Een uitlezing van de OrcaRouter-model-API voor z-ai/glm-5.3-flash op 2026-09-28 gaf de modelkaart volledig terug: context van 1.000.000 tokens, maximale uitvoer van 128.000, tekst-, afbeeldings- en video-invoer met tekstuitvoer, de mogelijkhedenchips vision, tools, JSON en reasoning, een releasedatum van 2026-08-26, niet afgeschaft en niet uit de catalogus verwijderd, geprijsd op $0,075 per miljoen invoertokens, $0,25 per miljoen uitvoertokens en $0,0173 per miljoen gecachte invoertokens, via het enkele endpoint POST /v1/chat/completions.

Onze eigen zeven{{1}} playgroundmeting op die kaart, voor dezelfde periode, bedraagt 61,8 outputtokens per seconde, een p50-tijd tot het eerste token van 7,39 seconden en een foutpercentage van 1,47%. Dat zijn first-partycijfers over onze serving, geen leverancierscijfers en geen onafhankelijke benchmarks, en daarom zijn het de enige snelheidscijfers op deze pagina.

De alias zelf staat niet op de route. Als je hier terechtkomt omdat je naar Ox Alpha hebt gezocht, is het model dat je moet aanroepen z-ai/glm-5.3-flash, en de vorm van het verzoek is degene die hierboven is beschreven. Het zit op dezelfde sleutel als al het andere in de catalogus — één API voor meer dan 200 modellen, de prijs van de provider doorgegeven zonder opslag erbovenop, en automatische failover als een provider hapert, zodat een model dat je aan het uitproberen bent niet het model hoeft te zijn waarvan je productiepad afhankelijk is.

A screenshot of the OrcaRouter model page for Z.ai GLM-5.3-Flash (z-ai/glm-5.3-flash), showing the model name and provider, a 1M-token context window with 128K maximum output, text, image and video input with text output, a stat strip reading $0.075 input and $0.25 output per million tokens, the capability chips Vision, Tools, JSON and Reasoning, a release date of 2026-08-26 and a supported-endpoint line reading POST /v1/chat/completions, with a code sample against the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

Eén verduidelijking over wat deze pagina is, aangezien een lezer die via de eigen modelnaam binnenkomt die verdient. Dit is een referentiepagina voor een model dat al in de catalogus staat, geen lanceringsrapport: GLM-5.3-Flash is van 26 augustus 2026, en de plek die het hier heeft, berust op het feit dat op de naam Ox Alpha blijft worden gezocht zonder een eigen pagina om op terecht te komen, niet op de actualiteit van de release. De datum hierboven wordt gebruikt om het model te dateren, niet als nieuws. Wat deze pagina zou veranderen, is een van vier dingen — een onafhankelijke benchmarkrun met een opgegeven inspanning, een door de leverancier opgegeven kennisafsluitdatum, een wijziging in het gehanteerde tarief, of een beslissing van Z.ai om te vermelden wat het aantal chips in de lanceerperiode werkelijk was. Totdat een van die dingen zich aandient, is de specificatie hierboven alles wat de leverancier documenteert, en de hiaten die in de vorige sectie worden genoemd, zijn net zozeer deel van het antwoord als de cijfers.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt