Een hero-titelkaart voor Ox Alpha, het anonieme frontier-model, met een vraagtekenvormige modelchip, waarbij tekst-, beeld- en video-invoer binnenstroomt en tokenblokken uitstromen, met drie pillen die '1M tokencontext', 'Eén week gratis' en 'Maker onbekend' vermelden, en het OrcaRouter-logo rechtsonder in de hoek gecomponeerd.
Guides & Insights

Ox Alpha Onthuld: Z.AI brengt het open-weight uit als GLM-5.3-Flash

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op de avond van woensdag 26 augustus eindigde het mysterie zoals de forensische analyse had voorspeld. Z.AI — het laboratorium in Peking achter de GLM-serie — bracht het model dat het onder een masker had getest uit als een product met open gewichten, onder de naam GLM-5.3-Flash, precies de subnaam waar de forensische tokenizeranalyse en de voorspellingsmarkten op waren uitgekomen. Ox Alpha, het anonieme model dat sinds zijn verschijning op 20 augustus bovenaan de gebruikersstatistieken staat, is nu een gepubliceerd, zelf-hostbaar model: MIT-licentie, 320B totale parameters met 18B actieve parameters per token, het contextvenster van 1.048.576 tokens en de tekst-/beeld-/video-invoer die het op de vermelding adverteerde, en gewichten op Hugging Face. De onthulling beantwoordde ook de grootste puzzel van de anonieme week — hoe een model dat niemand bezat 100 biljoen tokens per dag kon verwerken: Z.AI zegt dat het serveren volledig draaide op ongeveer 100.000 binnenlandse Chinese AI-chips, de eerste keer dat Chinese silicium wereldwijd verkeer op frontierschaal heeft gedragen. Die capaciteit had ook de meest populaire foute gok van de week voortgebracht — op die schaal beweerden veel waarnemers, aangemoedigd door cryptische berichten van Google DeepMind-onderzoekers, dat Ox Alpha een Gemini moest zijn die op NVIDIA-hardware draaide; de onthulling corrigeerde ook dat. Diezelfde avond verzond Alibaba Qwen3.8-Flash-Next, een open-weight preview van zijn Qwen4-architectuur — op één avond twee open-weight-releases van frontierklasse uit Chinese laboratoria. De vier anonieme releases vóór Ox Alpha werden uiteindelijk allemaal opgeëist door Chinese laboratoria: Zhipu AI's GLM-5, Xiaomi's MiMo-V2-Pro, Ant Group's Lingxi Ling-2.6-flash, en Meituan's LongCat-2.0. Ox Alpha is geen platformexclusief experiment meer; het is een model dat ontwikkelaars zelf kunnen hosten.

Elk cijfer in dit stuk is de eigen bewering van de operator, gegevens uit de eigen vermelding van het platform, een openbare aankondiging of community-vingerafdrukken. De DeepSWE-cijfers zijn community-metingen van de onafhankelijke onderzoeker Ben Davis — een volledige run van 113 taken, geen officiële leaderboard-notering, hoewel het cijfer van ~63% nu nauw aansluit bij de door Z.AI zelf gerapporteerde DeepSWE v1.1-score van 63,4. De identiteitsvraag is gesloten: op 26 augustus bracht Z.AI Ox Alpha uit als een open-gewichtenmodel onder de naam GLM-5.3-Flash — MIT-licentie, 320B totale parameters met 18B actief — waarmee de subnaam werd bevestigd waarop tokenizer- en video-encoderforensisch onderzoek was uitgekomen. Architectuur, parameteraantal en prijsstelling zijn nu door het bedrijf gepubliceerd; wat door de leverancier wordt gesteld maar niet onafhankelijk is geverifieerd, is de benchmarksuite en de bewering van Z.AI dat de anonieme week werd gedraaid op ruwweg 100.000 binnenlandse Chinese AI-chips tegen een kostprijs per token die vergelijkbaar is met gangbare NVIDIA-hardware — een bedrijfsbewering die meerdere nieuwskanalen inmiddels hebben herhaald, geen gecontroleerd cijfer. De vroege Gemini-hypothese — die was ontstaan door de capaciteit van 100T tokens per dag en werd aangemoedigd door cryptische berichten van Google DeepMind-onderzoekers — was onjuist, en de release beslechtte dit. De kwaliteitsbeoordeling die wordt toegeschreven aan analist teortaxesTex — en zijn suggestie dat een verder getraind Ox Alpha het werkpaard zou kunnen zijn voor een sterker GLM 5.5 — is die analist zijn eigen inschatting uit een social media-bericht, geen onafhankelijke meting of een verklaring van Zhipu. De hieronder beschreven demo met loop-animatie is eveneens een community-rapport — een bericht van een ontwikkelaar op X, herhaald op Chinese ontwikkelaarsforums — geen claim over de mogelijkheden van de leverancier, en de operator heeft een dergelijke functie niet aangekondigd.

Wat we weten — en wat we niet weten.

De snelle versie:

De operator beschrijft Ox Alpha als "een grensverleggend model dat is gebouwd voor efficiënt coderen, aanhoudend agentisch werk en productiegebruik in de echte wereld" — een redeneringsmodel gericht op software-engineering over lange termijn en workflows die tekst met visuele context combineren.

Het heeft een contextvenster van 1.048.576 tokens (1M), een outputlimiet van 131.072 tokens, en verwerkt tekst-, beeld- en video-invoer — de eerste van de anonieme releases die video-invoer adverteert, en een mogelijkheid die de GLM-5.3-Flash-release bevestigt als native in plaats van aangeplakt.

Het was een week lang gratis: $0 per miljoen tokens in en uit, waarbij de operator beweerde "royale snelheidslimieten, bijna onbeperkt gebruik" en 100 biljoen tokens per dag aan servercapaciteit — capaciteit waarvan de onthulling later zou zeggen dat die was voorzien op ongeveer 100.000 binnenlandse Chinese chips.

• Bevestigd: op 26 augustus heeft Z.AI Ox Alpha uitgebracht als een open-gewichtenmodel onder de naam GLM-5.3-Flash — MIT-licentie, 320B totale parameters met 18B actief — de exacte sub-naam tokenizer, video-encoder en foutcode-forensica plus voorspellingsmarkten waarop was geconvergeerd. Onafhankelijk analist teortaxesTex schat het op ongeveer het niveau van GLM-5.3, afgezien van visie, en suggereert dat een verder getrainde Ox Alpha het werkpaard zou kunnen zijn achter een veel sterkere GLM 5.5.

Er zit nu een demo achter het flash-multimodale lezen: gevraagd om een lusanimatie te genereren van een pelikaan die op een fiets rijdt en een telefoon opent die dezelfde animatie afspeelt, antwoordde Ox Alpha met een op zichzelf staande lusanimatie als één HTML/SVG-bestand — een communitydemo, geen leveranciersclaim.

• Vroege activiteitsgegevens op het platform tonen al echte productieverkeer, waaronder een codeeragent van Nous Research en de Zed-editor.

• Het bedrijf heeft het nu uitgebracht — op 26 augustus bracht Z.AI Ox Alpha uit als het open-weight GLM-5.3-Flash onder de MIT-licentie, waarmee de vragen over identiteit, specificaties en prijs in één klap werden beëindigd: 320B totale parameters met 18B actief, native multimodaal, met een Z.AI-listprijs van $0,15 in / $0,50 uit per miljoen tokens en een lanceringspromotie van 50% die naar verluidt alleen tot 9 september zou lopen — een datum die nu acht dagen verstreken is, terwijl het kortingstarief nog steeds het tarief is dat wordt gehanteerd. Z.AI onthulde ook dat de anonieme week waarin 100T tokens per dag werden geserveerd, op ongeveer 100.000 binnenlandse Chinese chips draaide, een primeur op die schaal. Wat de onthulling niet bevatte, is een onafhankelijke benchmark — de scorekaart van het model is door de leverancier gerapporteerd — dus het meest representatieve onafhankelijke cijfer blijft Ben Davis' volledige DeepSWE-run van 113 taken op ongeveer 63%, op hetzelfde niveau als GPT-5.6 Sol mid.

Wat Ox Alpha is

De vermelding op het platform beschrijft Ox Alpha als "een redenerend model ontworpen voor coderen, langdurig agentisch werk en productieworkloads — software-engineering over een lange tijdshorizon, complex redeneren en workflows die tekst combineren met visuele context." Dat is een specifieke positionering: het is gebouwd voor langlopende agent-loops en voor code, niet voor algemene chat. De 1M-context is de weggever — dat is genoeg ruimte voor een agentsessie van meerdere uren of een grote repository — en de outputlimiet van 131K maakt lange afzonderlijke generaties mogelijk. Het ondersteunt tool- en function calling en gestructureerde JSON-output, wat de rest van de agentische checklist is.

A single-column scoreboard for Ox Alpha listing: context window 1M (1,048,576) tokens, max output 131,072 tokens, input text/image/video, independent benchmarks none yet, price free for one week, throughput 56 tokens/s (P50, platform-measured), with a footer reading 'Operator + platform-reported; no independent scores yet', and the OrcaRouter logo in the bottom-right corner.

De video-invoer is het meest onderscheidende item op het blad. Geen van de eerdere anonieme modellen adverteerde ermee, en een model dat naast tekst en afbeeldingen ook videoframes kan verwerken, is gericht op een andere klasse workloads dan de chat-afgestemde releases die eraan voorafgingen. Het is ook, zoals de forensische analyse later zou aantonen, een van de sterkste identiteitsaanwijzingen die een model kan dragen. Dit alles — de beschrijving, de specificaties, de snelheidscijfers — kwam van de operator en de vermelding op het platform. De GLM-5.3-Flash-release bevestigde de belangrijkste specificaties (320B-A18B, native multimodaal); de snelheids- en capaciteitscijfers blijven claims van de leverancier.

Het multimodale verhaal kreeg deze week een concrete demo. Ontwikkelaar Chetaslua — wiens server-side probes deel uitmaken van het fingerprinting-spoor — plaatste een test waarin hij Ox Alpha vroeg om een loop te maken van een pelikaan die op een fiets rijdt en een telefoon opent die dezelfde animatie terug afspeelt: een zelfreferentiële loop in de loop. Zijn verslag toont dat het model een single-file HTML/SVG-animatie oplevert — een pelikaan met tweedelige poten die echt trappen, wielsnelheid gesynchroniseerd met de grondsnelheid, een parallax-achtergrond, en de clou van de telefoon-in-de-loop. Chinese ontwikkelaarsforums draaiden afzonderlijk hun eigen pelikaan-fiets-prompts en bespraken het resultaat, dus de demo is niet een enkele onverifieerbare claim. Omdat de output code is, is dit consistent met de text-output-only-specificatie van het platform: multimodaal begrip en creatieve codegeneratie werken samen, geen native videosynthese. De conclusie van Chetaslua — dat dit de payoff van multimodaliteit is, en dat er een capabel opensource-model zal komen dat daarover beschikt — is zijn eigen voorspelling, geen verklaring van de leverancier; de operator heeft niets aangekondigd.

Het gratis-voor-een-week-aanbod

De promotie was agressief: gratis gedurende de week dat hij liep, met 'royale limieten, vrijwel onbeperkt gebruik', een geclaimde capaciteit van 100 biljoen tokens per dag, en de opmerking van de operator die gebruikers uitnodigde om te 'zien wat je kunt doen'. Letterlijk genomen zou 100 biljoen tokens per dag deze operator bij de grootste inference-providers ter wereld plaatsen — de claim leest minder als een specificatie en meer als een uitdaging voor een stresstest, wat past in het patroon: anonieme releases zijn de manier waarop een lab productieverkeer op frontierschaal krijgt zonder zijn naam aan de deur te hangen. De bevestigde lezing maakte de schaalclaim concreet in plaats van alleen maar makkelijker te rijmen: Z.AI onthulde dat de infrastructuur voor 100 biljoen tokens per dag draaide op ongeveer 100.000 binnenlandse Chinese AI-chips — de eerste keer dat een release van frontierklasse op die schaal draaide zonder NVIDIA-hardware. Die onthulling is nog steeds een bedrijfsclaim, inmiddels herhaald door meerdere media maar niet onafhankelijk gecontroleerd, en die gaat gepaard met een tweede, zachtere leveranciersbewering: Z.AI zegt dat de kosten per token op het binnenlandse cluster vergelijkbaar zijn met reguliere NVIDIA-GPU's.

De andere kant van "een week gratis" was dat de prijs die erop volgde onbekend was — de onthulling gaf daar antwoord op. De gepubliceerde lijstprijs van Z.AI voor GLM-5.3-Flash is $0,15 per miljoen invoertokens, $0,50 per miljoen uitvoertokens en $0,03 per miljoen gecachte invoer. Er werd gezegd dat een introductieactie met 50% korting zou lopen tot en met 9 september 2026, waardoor dat naar $0,075 / $0,25 ging. Acht dagen na die datum is het kortingstarief nog steeds het tarief dat wordt gehanteerd: bij herlezing op 17 september 2026 prijst de modelpagina van z-ai/glm-5.3-flash invoer op $0,075, uitvoer op $0,25 en cache-leesacties op $0,0173 per miljoen tokens, zonder promotielabel erop. Afgezet tegen de lijstprijs van GLM-5.3 van $1,40 / $4,40 is dat ongeveer een twintigste. De praktische consequentie is dat de einddatum van 9 september achterhaald is in plaats van bindend — een ontwikkelaar die begroot op $0,15 / $0,50 begroot op een bedrag dat niemand op dit moment betaalt. Wat de prijspagina's niet oplossen, is waarom. De eigen modellenlijst van Z.AI vermeldt nog steeds $0,15 / $0,50 voor GLM-5.3-Flash, dus of de promo is verlengd, permanent is gemaakt of simpelweg is blijven lopen, kunnen we niet onderbouwen; het kortingstarief is het waargenomen feit op deze datum, en de oorzaak blijft open.

De eerste volledige benchmark — en die komt op gelijke hoogte met GPT-5.6 Sol mid.

Ox Alpha heeft nog steeds geen vermelding op onafhankelijke trackers zoals Artificial Analysis of LMArena — het woord 'frontier' komt van de operator zelf, en de benchmarkcijfers die Z.AI bij de release van GLM-5.3-Flash publiceerde (DeepSWE v1.1 63,4, AutomationBench 48,8, een Artificial Analysis Intelligence Index van 57) zijn door de leverancier gerapporteerd, geen onafhankelijke scores. Wat er sinds de lancering is veranderd, is dat door de community gemeten cijfers beginnen te circuleren — en het beeld is scherper geworden. Op Kingbench kwamen vroege runs uit op 87,5 voor Ox Alpha, net onder de 91,25 van GLM-5.3. Op DeepSWE voerde onafhankelijk onderzoeker Ben Davis eerst een subset van 10 taken uit en rapporteerde 80% Pass@1, vóór Claude Fable 5 (65%), GLM-5.3 en Grok 4.6 (62%), en GPT-5.6 Sol (52%). Sindsdien heeft hij een volledige run uitgevoerd op de gehele DeepSWE-set van 113 taken, en het gecorrigeerde resultaat is ruwweg 63% — min of meer op gelijke hoogte met GPT-5.6 Sol mid. De 80%-subset was het opvallende getal, maar tien taken is minder dan 9% van de benchmark; Davis zelf wees het cijfer van de volledige set aan als het cijfer dat 'veel meer zin heeft'. Dit zijn door de community gemeten cijfers, geen leveranciersbenchmark en geen officiële leaderboard-score — maar de volledige run is het meest representatieve getal dat iemand uit het model heeft gehaald, en het sluit nu nauw aan bij Z.AI's eigen door de leverancier gerapporteerde DeepSWE v1.1-score van 63,4 — een nuttige kruiscontrole, ook al is het cijfer van het bedrijf een bewering in plaats van een meting.

Eén vergelijking is nu belangrijker dan bij de lancering. DeepSeek V4 Pro 0813 — de GA-build van DeepSeeks vlaggenschip dat op 13 augustus uitkwam — rapporteert een DeepSWE van 62,7 op DeepSeeks eigen benchmarkkaart, tegen 12,8 voor de eerdere DeepSeek V4 Pro Preview. Beide cijfers zijn door de leverancier opgegeven en zijn op het moment van schrijven niet door een onafhankelijk laboratorium gereproduceerd. Gelezen naast GLM-5.3-Flash's ~63% community full-set run en Z.AI's eigen DeepSWE v1.1 van 63,4, plaatst DeepSeeks 62,7 de twee bekendste Chinese coding-agent-claims in dezelfde band van lage zestig. De kloof van tien punten die op Ox Alpha's visitekaartje leek, werd gemeten tegen DeepSeek V4 Flash 0731, het goedkopere kleine model; tegen DeepSeeks vlaggenschip komt GLM-5.3-Flash gelijk uit, niet tien punten voor.

De andere les gaat over het getal zelf. Analist teortaxesTex — die deze schattingen sinds de anonieme week bijhoudt — merkt op dat het eerste rapport over Ox Alpha ook 80% DeepSWE meldde: dat was Davis' opvallende subset van 10 taken, en het eindresultaat op de volledige set van 113 taken was 63%. Met de officiële 62,7 van DeepSeek V4 Pro 0813 in dezelfde bandbreedte is zijn observatie dat nog niets in de buurt is gekomen van een legitiem gereproduceerde 80% — de 80%-waarde blijft vroeg in het publieke leven van een model opduiken en blijft uitkomen op de lage 60 zodra de volledige set wordt gedraaid. Dat is zijn lezing als analist, geen meting, maar het is de juiste lens voor de volgende DeepSWE-kop, inclusief die over GLM-5.3-Flash zelf.

A screenshot of the Artificial Analysis models leaderboard as of August 21, 2026, showing the Intelligence section led by Claude Opus 5 and Claude Fable 5, the largest context-window highlights, and the output-speed rankings — a frontier leaderboard Ox Alpha has no independent score on yet.

Wat er ook is, is gebruik. De activiteitsgegevens van het platform tonen reëel productieverkeer binnen de eerste uren — waaronder Hermes Agent, het agentische codeerproject van Nous Research, en de Zed-editor. Beide zijn precies de use cases van 'aanhoudend agentisch werk en coderen' waar het model voor is gepositioneerd. Het is geen score, maar het is een signaal: ontwikkelaars met echte workloads vonden het de moeite waard om een gratis, frontier-klasse, anonieme gok aan te sluiten. Voordat de volledige DeepSWE-run was voltooid, was die vroege adoptie het enige bewijs; het cijfer van ~63% voor de volledige set geeft het model nu een benchmarkanker om tegen af te wegen.

De kleine lettertjes over gegevensbewaring

De aankondiging van de gratis week pronkt met "zero data retention." De vermelding van het model op het platform vertelt een genuanceerder verhaal: prompts en completies worden door de aanbieder bewaard, maar niet gebruikt voor training, onder de stealth-modelvoorwaarden van het platform. Dat verschil is van belang als u op het punt staat eigen code te plakken in een venster van 1M tokens dat eigendom is van een aanbieder die anoniem was totdat Z.AI zich op 26 augustus naar voren stapte. Beschouw "zero data retention" als marketing totdat Z.AI voorwaarden publiceert die dat met zoveel woorden zeggen — en leid alles wat u niet wilt laten loggen via een afzonderlijk, herleidbaar model.

Het draaiboek voor het anonieme model

Ox Alpha is de vijfde anonieme release in zes maanden, en de vorige vier eindigden op dezelfde manier — een anoniem debuut, een uitbarsting van gratis verkeer, en dan een bedrijf dat naar voren stapt:

• Pony Alpha (februari 2026) — bevestigd door Zhipu AI ongeveer vijf dagen na de lancering als GLM-5, het MoE-vlaggenschip met 744B parameters.

• Hunter Alpha (11 maart) — een gratis model met een biljoen parameters en een 1M context, dat het speculatieverhaal van de lente werd, waarvan algemeen werd vermoed dat het Deep​Seek V4 was; onthuld als Xiaomi's MiMo-V2-Pro, met de begeleidende Healer Alpha geïdentificeerd als MiMo-V2-Omni.

• Elephant Alpha (April) — een gratis, op efficiëntie gericht tekstmodel dat Ant Group ongeveer twee weken na zijn verschijning claimde als Lingxi Ling-2.6-flash.

• Owl Alpha (eind april) — een agentgericht model met native tool calling en een ~1M context die Meituan op 30 juni bevestigde als LongCat-2.0, het eerste model met een biljoen parameters dat volledig op binnenlandse Chinese chips is getraind en ingezet.

• Ox Alpha (20 augustus) — onthuld op 26 augustus als GLM-5.3-Flash, een open-gewicht, MIT-gelicenseerd 320B-A18B-model; de identiteit, licentie en specificaties waren allemaal officieel op dezelfde dag dat het masker eraf ging.

A two-column scorecard titled 'The anonymous models — and their reveals', listing Pony Alpha revealed as GLM-5 by Zhipu AI, Hunter Alpha as MiMo-V2-Pro by Xiaomi, Elephant Alpha as Lingxi Ling-2.6-flash by Ant Group, Owl Alpha as LongCat-2.0 by Meituan, and Ox Alpha marked '??? — unclaimed', with a footer noting reveals per each lab's public announcement and Ox Alpha unclaimed as of August 21, 2026, and the OrcaRouter logo in the bottom-right corner.

Waarom een goed model achter een masker lanceren? De gangbare lezing, die de Hunter Alpha-cyclus concreet maakte, is dat anonimiteit merkvooroordeel uit evaluaties weghaalt, en het gratis gebruik crowdsourcet evaluatiedata uit de echte wereld op frontierschaal, terwijl iedereen discussieert over de eigenaar. Zoals een analyse van het patroon het stelde: "het ontbreken van een merk is de marketing." Het extra voordeel is snelheid: een anoniem model kan binnen enkele uren een wereldwijd ontwikkelaarspubliek bereiken zonder lanceerevent, en het mysterie zelf wordt de distributie.

Wie is Ox Alpha?

Tot aan de release van 26 augustus {{1}}had geen enkel bedrijf het opgeëist en Zhipu AI had niets gezegd{{/1}} — maar {{2}}de situatie rond hard bewijs veranderde binnen 48 uur na het debuut van het model{{/2}}, en {{3}}de onderstaande forensische bevindingen zijn de reden dat de onthulling — als GLM-5.3-Flash — met zo weinig verrassing landde{{/3}}. {{4}}Het capaciteitscijfer werkte even tegen de forensische bevindingen{{/4}}: {{5}}100 biljoen tokens per dag leken de handtekening van een toplab op NVIDIA-silicon{{/5}}, en {{6}}de theorie dat Ox Alpha een nieuwe Gemini was{{/6}} — {{7}}aangemoedigd door cryptische posts van Google DeepMind-onderzoekers{{/7}} — {{8}}had echt momentum tot aan het tokenizer-bewijs{{/8}}, en vervolgens {{9}}sloot de eigen release van Z.AI het af{{/9}}. {{10}}Het sterkste signaal is de tokenizer{{/10}}. {{11}}Een door de community gebouwde fingerprinting-tool, modelprint, voerde negen infrastructuurprobes uit tegen Ox Alpha{{/11}} en {{12}}ontdekte dat het op zes overeenkwam met GLM-5.3 van Z.ai{{/12}}, {{13}}waarbij alle vier genormaliseerde tokenizer-tellingen overeenkwamen met de GLM-familie{{/13}} terwijl {{14}}de beste niet-GLM-kandidaat twee van de vier haalde{{/14}}. {{15}}Onafhankelijk onderzoeker Ben Davis rapporteerde dat de token-tellingen van Ox Alpha bij 25 testprompts exact overeenkwamen met GLM-5.3{{/15}}, {{16}}met slechts een constant verschil van +75 tokens dat hij toeschreef aan een verborgen wrapper{{/16}}. {{17}}Tokenizer-matching is het moeilijkste identiteitssignaal om te vervalsen{{/17}} — {{18}}een model kan niet veranderen hoe het tekst segmenteert zonder hertraining{{/18}}.

Het videopad is de tweede handtekening. Het videotokenverbruik van Ox Alpha kwam in vier gecontroleerde steekproeven exact overeen met dat van GLM-5V-Turbo — dezelfde mechanismen voor frame-sampling, duursschaling en resolutie — terwijl MiMo v2.5, Qwen 3.8 Max en GLM-4.6V allemaal afweken. Dat is een sterke aanwijzing: videoverwerking zit diep in het model ingebakken, het is geen achteraf toegevoegde module. De rest van de vingerafdruk-stack sluit aan bij dezelfde conclusie: Ox Alpha verwerpt audio-invoer net als GLM-5V, deelt de karakteristieke "1301"-foutcode van GLM, produceert een vergelijkbare outputstijl (ongeveer 1,3 emoji's per 1.000 tekens), heeft dezelfde beperkte parameter- en API-configuratie die twee dagen vóór de lancering van Ox Alpha op de GLM-5.3-pagina van het platform verscheen, en heeft een kennisafsluitdatum rond november 2025.

De identificatie kent een precedent in Zhipu's eigen draaiboek: Pony Alpha, de anonieme release van februari, bleek GLM-5 te zijn — een claim die ongeveer vijf dagen na de lancering werd gedaan. De interpretatie die deze week onder analisten de ronde doet — dat Ox Alpha GLM-5.3 is, vermoedelijk het Flash-model — vond weerklank bij Pliny the Liberator, die zei dat zijn agent had bevestigd dat "Ox-alpha van Zai komt, GLM-5.X-familie." De onafhankelijke analist teortaxesTex komt tot dezelfde conclusie over de kwaliteit en voegt een claim over de timing toe: hij beoordeelt Ox Alpha op ongeveer het niveau van GLM-5.3, afgezien van de visie, en vindt de snelle ommekeer het meest opvallende deel — het comprimeren van de tekst-only GLM-5.3 en het binnen enkele dagen na de lancering van 14 augustus uitbrengen ervan met werkende visie. Dat is de beoordeling van één analist, geen onafhankelijke score, en hij stelt dat dit het narratief dat "China modellen vers van de pers uitbrengt" aan het denken zou moeten zetten. Zijn nieuwste post stapelt een gok over de roadmap bovenop die lezing: de GLM-5-updatecyclus zou kort kunnen zijn; Ox Alpha ligt dicht genoeg bij GLM-5.3 dat het gebruik ervan als subagent nauwelijks zin heeft — "draai gewoon ox @4 in plaats daarvan" is zijn verkorte aanduiding voor het direct draaien van het model; en een verder getraind Ox Alpha zou veel zin hebben als werkpaard, in zijn woorden een "lastdier", voor een veel sterker GLM 5.5. Dat is speculatie van één analist over een roadmap, geen verklaring van Zhipu. De subnaamkwestie is daarentegen beslecht: op 26 augustus bracht Z.AI Ox Alpha uit als GLM-5.3-Flash. De complicatie die het Flash-label ooit aan de "vermoedelijke" kant hield — GLM-5.3 werd op 14 augustus gelanceerd als tekst-only model, terwijl Ox Alpha met video-invoer adverteert — is precies wat de release heeft opgelost: GLM-5.3-Flash is een afzonderlijk, native multimodaal model in plaats van hetzelfde tekst-only model. Alternatieve theorieën — Xiaomi's MiMo-team, DeepSeek — zijn geopperd en grotendeels afgedaan op basis van het tokenizer- en videobewijs, en de release beslecht de familievraag ronduit.Davis' argument om belang te hechten aan het Flash-label bleek het praktische te zijn: omdat Ox Alpha werkelijk GLM-5.3-Flash is dat presteert op middenniveau van GPT-5.6 Sol, kan het nu lokaal draaien — de gewichten staan op Hugging Face en SGLang, vLLM en TokenSpeed ondersteunen het — wat een middenklasse frontier-codemodel verandert in eenmalige hardwarekosten in plaats van een rekening per token voor iedereen die bereid is het te hosten.

De geopolitieke framing is die van de analisten, niet die van het bewijs: "Dit legt nog veel meer enorme druk op US Frontier Labs, en de kloof met China wordt kleiner." Dat is een interpretatie van wat een gratis model op Zhipu-niveau dat op frontierverschaal draait, betekent voor de concurrentieorde — en de hardware-onthulling geeft het een voorsprong die de analisten niet hadden. Het dagelijks serveren van 100 biljoen tokens op ruwweg 100.000 binnenlandse chips is de eerste grootschalige demonstratie dat een Chinese stack zonder NVIDIA-silicium frontier-inferentieverkeer kan dragen — het scenario waar NVIDIA-CEO Jensen Huang dit voorjaar voor waarschuwde op de Dwarkesh Podcast, toen hij betoogde dat exportcontroles de NVIDIA-onafhankelijke stack van China zouden versnellen en dat een frontiermodel dat het beste draait op binnenlandse Chinese hardware een "vreselijke uitkomst" zou zijn voor de Verenigde Staten. Het kostpariteitscijfer van Z.AI is nog steeds een leveranciersclaim, maar het evenement zelf is echt. Dezelfde avond maakte het punt ook aan de modelkant concreet: terwijl Z.AI GLM-5.3-Flash uitbracht, leverde Alibaba Qwen3.8-Flash-Next, zijn open-weight-preview van de Qwen4-architectuur. Twee Chinese open-weight-releases van frontierklasse in één nacht is de concrete vorm van wat waarnemers "een grote dag voor Chinese open source" noemden.

Zou je er deze week op moeten voortbouwen?

De gratis week is voorbij, maar de test is nog steeds goedkoop: het tarief dat op 17 september daadwerkelijk werd gehanteerd, is $0,075 in / $0,25 uit per miljoen tokens, niet de lijstprijs van $0,15 / $0,50 — de 50% lanceerpromo waarvan werd gezegd dat die op 9 september zou eindigen, geldt acht dagen later nog steeds. Als je agentisch werk met een lange horizon doet, codeert in lange contexten of videointensieve pipelines draait, is dat precies het snijvlak waarop Ox Alpha zich positioneert — en met de gewichten open kun je de test op je eigen hardware draaien in plaats van op het goedvinden van een anoniem platform. Twee waarschuwingen. Ten eerste is het label "frontier" nog steeds een claim: de scorekaart van GLM-5.3-Flash is door de leverancier gerapporteerd, en het enige solide onafhankelijke cijfer — Davis' ~63%-DeepSWE-run — is sterk, maar een heel eind verwijderd van de virale 80% van de vroege subset van 10 taken. Ten tweede was de prijs van $0 tijdgebonden, en de onthulling beprijsde wat daarna komt — goedkoop voor de capaciteit, maar niet langer gratis. Wat de open-weight-release wegneemt, is de afhankelijkheid: de bestanden zijn uit, dus het model kan zelf worden gehost in plaats van gehuurd. Dat is de vorm van een test, niet van een afhankelijkheid.

De productie-veilige manier om zo'n test uit te voeren is een fallback-keten: het experimentele model antwoordt wanneer het gezond is, en het verzoek schuift door naar een bewezen model op het moment dat het hapert, fouten geeft of verdwijnt. Daar is een routeringslaag voor bedoeld. De onthulling maakt de fallbackkeuze triviaal: Ox Alpha is GLM-5.3-Flash, en het model zelf staat live op OrcaRouter onder zijn echte naam tegen $0,075 in / $0,25 uit per miljoen tokens, met cachereads tegen $0,0173 — het lanceringstarief met 50% korting waarvan was aangegeven dat het op 9 september zou eindigen en dat op 17 september nog steeds de prijs op de pagina is in plaats van het listtarief van $0,15 / $0,50. Het wordt doorgegeven met 0% opslag, één API voor 200+ modellen, met automatische failover, zodat een verkeerspiek in de lanceringsweek niet jouw storing wordt. Probeer het nieuwe model vooraan uit, met een bewezen fallback erachter in de keten; wanneer een prijs verandert, is het bedrag dat je op OrcaRouter ziet het bedrag dat je dezelfde dag betaalt. Of sla de API helemaal over — de gewichten zijn open, dus self-hosting van GLM-5.3-Flash achter dezelfde keten ligt ook op tafel.

Wat te kijken

Zes dingen zullen de rest van het verhaal vertellen. De onafhankelijke benchmark: de scorekaart van GLM-5.3-Flash is door de leverancier gerapporteerd, Davis' ~63%-DeepSWE-run is tot nu toe het enige solide onafhankelijke cijfer, de officiële 62,7 van DeepSeek V4 Pro 0813 zit nu in dezelfde band, en een vermelding in Artificial Analysis of LMArena — of een onafhankelijke head-to-head — zou de definitieve toets zijn of "frontier" een feit of een slogan is. De prijsontwikkeling: de vraag wat de stabiele situatie is, heeft op basis van de tot nu toe beschikbare aanwijzingen een antwoord — de 50%-promo zou volgens opgave op 9 september eindigen, maar op 17 september wordt het kortingstarief van $0,075 / $0,25 nog steeds aangeboden, dus het promobedrag en niet de lijstprijs van $0,15 / $0,50 is het bedrag waarop je moet begroten; wat onopgelost blijft, is de oorzaak, aangezien de eigen lijstprijs van Z.AI niet is veranderd. De hardwareclaim: Z.AI zegt dat de anonieme week draaide op ongeveer 100.000 binnenlandse chips tegen kostenpariteit met NVIDIA — de eerste publieke test daarvan op schaal is of de claim onafhankelijke kritische toetsing doorstaat, en of de binnenlandse stack de standaard wordt voor de GLM-lijn. De adoptierekensom: of het verkeer dat Ox Alpha onder het masker naar de top van de platforms trok, zich nu het een naam, een licentie en een prijs heeft, omzet in self-hosted en API-implementaties. Het vervolg: of GLM-5.3-Flash Ox Alpha als tussenstap neerzet — de hint van teortaxesTex is dat een verder getrainde versie het werkpaard wordt voor een veel sterkere GLM 5.5, wat deze release tot de basis van de volgende GLM zou maken. En de reactie: nu Qwen3.8-Flash-Next dezelfde nacht uitkomt en er een onthulling over binnenlandse chips achter zit, ligt de druk bij Amerikaanse frontier-labs — en bij het debat over exportcontroles — om te antwoorden; kijk of een snelle follow-up, een prijsaanpassing of een beleidsreactie aan de andere kant van de kloof landt.

Het eerlijke oordeel: Ox Alpha was een ongewoon goedkoop experiment in beide richtingen. Het platform testte of een anoniem model van frontierklasse voor $0 binnen een week echt productieverkeer kon winnen — dat lukte, overtuigend genoeg dat Z.AI zich niet alleen op de zesde dag kenbaar maakte, maar dezelfde nacht nog de gewichten als open model uitbracht. Jij kunt testen of het model een plek in je stack verdient, nu zonder het anonimiteitsrisico: GLM-5.3-Flash is een model met een naam, MIT-gelicentieerd, zelf te hosten, tegen een gepubliceerde prijs, en ook de hardwarevraag kreeg een antwoord — Z.AI zegt dat de 100T-token/dag-serving op ongeveer 100.000 binnenlandse Chinese chips draaide, volgens het bedrijf, maar inmiddels breed gerapporteerd. Wat nog moet blijken is of "frontier" onafhankelijke meting overleeft, of Z.AI's claim van kostenpariteit met binnenlandse chips standhoudt op schaal, waarom de lanceringspromo van 50% nog steeds de prijs is die wordt gerekend, acht dagen na de vermelde einddatum van 9 september, en of de onthulling GLM-5.3-Flash neerzet als het werkpaard voor een sterker GLM 5.5, zoals teortaxesTex suggereert. Voer het experiment uit, maar met een fallback eronder.

Vergeleken in dit artikel4

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt