GLM-5.3-Flash onthuld — de anonieme 'Ox Alpha' was al die tijd Zhipu's open multimodale frontiermodel. Geregenereerde illustratie.
Guides & Insights

GLM-5.3-Flash, vijf weken later: een Independent 42, een exploit-run op Mythos-niveau, en de GLM Agent die zijn eigen servingstack herbouwde

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

GLM-5.3-Flash verwerkt al vijf weken productieverkeer, en op 17 september 2026 zei Zhipu AI iets over waar: het bedrijf onthulde dat elke productieaanvraag voor GLM-5.3-Flash nu draait op een vloot van meer dan 100.000 in eigen land geproduceerde Chinese AI-accelerators, dat het binnen twee weken van de eerste opstart op die hardware naar het dragen van zijn volledige live workload ging, en dat de end-to-end doorvoer in dezelfde periode met een factor 3,2 steeg. Het deel dat het verst reikte, is wie het werk deed. Veel ervan werd niet gedaan door het infrastructuurteam, maar door een door GLM-5.3 zelf aangestuurde agent, die knelpunten las, oplossingen voorstelde en code voor inferentiesystemen schreef, terwijl ingenieurs doelstellingen bepaalden, de feedbackomgeving bouwden en alles beoordeelden wat numerieke semantiek, gelijktijdigheid of productierisico raakte. GLM-5.3-Flash is het multimodale model met 320 miljard totaal en 18 miljard actief (320B-A18B) dat Zhipu op 26 augustus 2026 lanceerde en open source maakte — de anonieme "Ox Alpha" die het bedrijf die dag onthulde — en zijn grotere broer GLM-5.3 is het 743B-vlaggenschip waartegen het qua prijs werd gepositioneerd. Geen van de drie getallen in de openbaarmaking van vandaag is van ons of van iemand anders afkomstig: ze zijn van Zhipu zelf. Het vlaggenschip is ook niet langer de enige vergelijking die ertoe doet: op ExploitBench, een onafhankelijke evaluatie van hoe ver een model een echte Chrome-exploitladder beklimt, is GLM-5.3-Flash nu op hetzelfde niveau gemeten als Claude Mythos Preview, het gesloten frontiermodel dat zijn ontwikkelaar alleen aan gescreende verdedigers vrijgaf, tegen een fractie van de kosten per poging.

Dat is het goede nieuws, en het is echt, maar het is een leveranciersopgave. Drie andere dingen zijn veranderd sinds dit bericht op de dag van de lancering voor het eerst verscheen, en twee ervan werken de andere kant op. Artificial Analysis heeft nu zijn eigen meting van het model gepubliceerd, en dat cijfer is niet dat van Zhipu. De lanceringskorting waardoor dit het goedkoopste capabele model op de markt was, verliep volgens schema op 9 september en werd niet verlengd. En een externe evaluatieorganisatie, Generality Labs, heeft zijn eigen ExploitBench-run gepubliceerd waarin GLM-5.3-Flash hoger scoorde dan het gemiddelde over drie runs van Claude Mythos Preview op dezelfde ladder — voor ongeveer zes cent per dollar. Voor iedereen die dit model eind augustus als 'de goedkope' heeft gebookmarkeerd, is de rekensom vandaag anders dan toen, en de eerlijke kop is gemengd: de serveereconomie is echt verbeterd, de prijs ging omhoog omdat een promotie afliep, het veelgeciteerde intelligentiecijfer overleefde het eerste contact met een onafhankelijke testomgeving niet, en de capaciteitsvergelijking die wél in het voordeel van het model uitviel, is één enkele run zonder peerreview waarvan de auteurs zelf zeggen dat die niet te veel moet worden geïnterpreteerd.

Zhipu is de enige bron voor de clustergrootte, de tijdlijn van twee weken en de 3,2x — er is geen onafhankelijke audit van een van deze, en het bedrijf zelf zegt dat het geen recursieve zelfverbetering heeft bereikt, en beschrijft het resultaat als een lus op minimale schaal in plaats van het echte werk. Wat gecontroleerd kon worden, hebben we gecontroleerd: het enige concrete artefact in het verslag dat buiten de muren van Zhipu bestaat — een precisiecorrectie in een Flash Linear Attention-kernel — is daadwerkelijk upstream samengevoegd, en we hebben het bevestigd. Waar een cijfer hieronder van Zhipu afkomstig is, staat dat erbij. Waar het van Artificial Analysis afkomstig is, staat dat er in plaats daarvan. Waar het van Generality Labs afkomstig is — de veiligheidsevaluatie-organisatie achter de exploitcijfers in dit bericht — staat dat erbij, samen met de kanttekeningen die de auteurs er zelf bij plaatsten: één run, 41 bugs, een zelfgepubliceerde methode, geen reproductie door derden, en een contaminatievraag die ze op eigen initiatief aan de orde stellen. Waar een cijfer van Anthropic is — de enige cijfers hier die afkomstig zijn van een lab met een concurrerend belang bij het antwoord — staat in de tekst welk model daadwerkelijk is gemeten, omdat niet alle cijfers dit model betreffen.

Wat er daadwerkelijk is uitgebracht

GLM-5.3-Flash is een mixture-of-experts-model met in totaal 320B / 18B actief en 45 lagen, waardoor de actieve voetafdruk iets meer dan de helft bedraagt van de ongeveer 32B van GLM-5.2. De belangrijkste capaciteit is modaliteit: het accepteert native tekst-, beeld- en video-invoer — het eerste GLM-5-model dat dit doet — in plaats van visie via een aparte adapter te routeren. De context reikt tot 1 miljoen tokens, en Zhipu beweert dat de kosten voor het serveren van lange context ongeveer een derde bedragen van die van GLM-5.3.

Wat de architectuur betreft, beschrijft Zhipu het als het eerste opensource-frontiermodel dat hybride sparse-plus-lineaire attention combineert met Manifold-Constrained Hyper-Connections (mHC) voor schaling, en een IndexPool-mechanisme dat vier key-vectoren van de indexer comprimeert tot één gewogen pool om de latentie bij lange context te verlagen. De pretraining vond plaats op een multimodaal corpus van 30 biljoen tokens. Niets daarvan is onafhankelijk geauditeerd — het is Zhipu dat zijn eigen model beschrijft — maar de beweringen over serveerefficiëntie zijn specifiek genoeg om nu te testen, nu de gewichten voor de opensource-inferentiestack staan, en het verslag van 17 september voegt het eerste gedetailleerde beeld toe van hoe de serveerkant daadwerkelijk is gebouwd.

De specificaties voor de lanceringsdag, in één oogopslag:

• Parameters — 320B totaal / 18B actief, 45 lagen, MoE.

• Modaliteit — native tekst-, afbeeldings- en video-invoer; tekstuitvoer.

• Contextvenster — tot 1.000.000 tokens.

• Licentie — MIT, open gewichten op Hugging Face sinds de lanceringsdag.

• Prijs — $0,15 / $0,50 per miljoen tokens (invoer / uitvoer), $0,03 per miljoen gecachte invoer.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

Die kaart is een momentopname van de lanceringsdag, en twee van de rijen zijn sinds 26 augustus gewijzigd. Het AA Index-cijfer is nog steeds een bewering van Zhipu zelf en wordt nu tegengesproken door onafhankelijke metingen — meer daarover hieronder. De kortingsprijs die erop staat, is verdwenen; de promotie eindigde op 9 september. De parameteraantallen, het contextvenster, de licentie en de modaliteit zijn ongewijzigde, actuele feiten, en daar is de afbeelding vooral voor bedoeld.

De Ox Alpha-week, en wat de gratis weggeefactie werkelijk testte

De onthulling sloot een week van speculatie af. Op 20 augustus verscheen een anoniem model op een AI-API-platform van een derde partij met een contextvenster van 1 miljoen tokens, tekst-, afbeeldings- en video-invoer en een prijs van nul, en het werd snel het meest aangeroepen model in de wekelijkse ranglijsten van dat platform. De community herleidde het binnen 48 uur aan de hand van vingerafdrukken tot de GLM-familie van Zhipu — hetzelfde patroon van eerst anoniem en dan opgeëist waarmee eerder modellen van andere Chinese labs werden geïdentificeerd — en analisten gokten in brede kring op een Flash-variant van GLM-5.3. De aankondiging van 26 augustus bevestigde die gok: de gratis week was een bewuste test, en het bedrijf zegt dat de anonieme run in zes dagen meer dan 62 biljoen tokens heeft verwerkt op de coderingsplatforms waar het werd aangeboden, allemaal geleverd vanaf binnenlandse Chinese chips.

Die laatste clausule leek destijds een voetnoot. Achteraf bleek ze de kern te zijn. De gratis week was in de eerste plaats geen marketingstunt en zelfs geen loadtest van het model; het was een loadtest van de acceleratorvloot eronder, uitgevoerd op een schaal waarop falen publiekelijk en gratis zou zijn geweest. Drie weken later beschrijft Zhipu dezelfde vloot als goed voor 100% van het productieverkeer van het model.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

De prijslogica van die week geldt nog steeds, met één correctie. Een model dat een week lang voor $0 werd weggegeven en daarna werd gelanceerd tegen een tiende van het tarief van het vlaggenschip, met nog eens 50% korting, was een bewuste marktmakende zet in het budgetsegment, en de kwalificatie 'tijdelijk' was altijd het onderdeel om op te letten. We hebben het gemarkeerd als iets dat kon worden teruggedraaid. Het werd volgens schema teruggedraaid — wat de moeite waard is om ronduit te zeggen, want het aflopen van de korting is de enige verandering in dit verhaal die op een factuur terug te zien is.

De servingstack die een agent herbouwde

Het technische verslag van Zhipu van 17 september is de eerste gedetailleerde beschrijving van hoe GLM-5.3-Flash op Chinese silicium wordt geserveerd, en de centrale bewering is dat een model hielp bij het optimaliseren van het systeem waarop het draait. Het bedrijf noemt het mechanisme dense feedback: correctheidstests, uitvoeringslogs, traces, microbenchmarks en end-to-end metrics werden met elkaar verbonden, zodat een agent een hypothese lokaal kon valideren in plaats van na elke wijziging te wachten op een volledige uitrol en loadtest. Om dat te laten werken, zegt Zhipu, moest de feedback lokaal, goedkoop en objectief controleerbaar zijn — gebonden aan een specifieke kernel of code path, snel genoeg om op te itereren, en waar of onwaar zonder menselijke tussenkomst.

Met die lus op zijn plaats ontdekte en verhielp de agent drie dingen die het bedrijf in detail heeft beschreven:

• Een context-parallel pad in de KDA-kernel verloor precisie naarmate sequenties groeiden, omdat tl.dot standaard TF32 gebruikte ondanks FP32-invoer, waardoor de afrondingsfout zich met de contextlengte opstapelde. De oplossing zet de invoerprecisie vast op tf32x3, met een terugval naar ieee op platforms zonder TF32-ondersteuning. Deze is van de drie het interessantst, omdat het de enige bewering in het verslag is die Zhipu's eigen infrastructuur verlaat: de wijziging is upstream samengevoegd in Flash Linear Attention als PR #1180, waarvan we hebben gecontroleerd en bevestigd dat deze op 27 augustus 2026 is samengevoegd.

• KV-transfer overlapte niet met de planning van DeepEP. In de gebruikte DeepEP-versie gaf noch intranode dispatch, noch intranode combine de Python GIL vrij, waardoor de transferthread erachter kwam vast te zitten; Engelstalige en Chineestalige verslagen van hetzelfde artikel schatten de resulterende overhead op respectievelijk meer dan 20% en meer dan 30%. Na de fix zegt Zhipu dat het verschil met zijn prefill-only baseline onder de 1% is gedaald.

Een decode-kernel herberekende dezelfde FP32-normalisatie en gating vier keer, één keer per V-dimensietegel. Het opsplitsen van het delingswerk verminderde de kerneltijd met 9,6%, en het samenvoegen van de tegels tot één thread block — zodat de normalisatie één keer draait — leverde een snelheidsverbetering van 1,71x op.

Rondom die oplossingen bevinden zich de structurele veranderingen: ReplaySSM, dat rekenkracht inruilt voor on-chipgeheugen omdat de accelerators daarvan minder hebben dan de GPU's waarvoor de stack oorspronkelijk is geschreven; tensorparallellisme binnen een node om dezelfde druk te verlichten; gemengde INT8-, FP8- en BF16-caching om de capaciteit op te rekken; en een gedisaggregeerde Encode-Prefill-Decode-architectuur die de drie inferentiefasen afzonderlijk plant in plaats van als één pijplijn. Zhipu benoemt de beperkingen ook eerlijk — beperkt on-chipgeheugen en interconnect-bandbreedte, onvolwassen software, onvolledige kerneldekking en summiere documentatie — en zegt dat het geen recursieve zelfverbetering heeft bereikt, en beschrijft het resultaat als een lus op minimale schaal.

Lees het verslag sceptisch, want de prikkels zijn duidelijk. Zhipu wil niet zeggen hoeveel van het werk de agent deed versus hoeveel de ingenieurs deden, en er is geen externe audit van het doorvoercijfer, de tijdlijn van twee weken of de clustergrootte. De dense-feedbackframing is ook op een specifieke manier in het eigen voordeel: ze laat de meest indrukwekkend klinkende bewering ("ons model heeft zichzelf verbeterd") rusten op het minst controleerbare bewijs (een interne lus die niemand kan inspecteren). Wat het verhaal ervan weerhoudt pure marketing te zijn, is dat zijn meest concrete bewering falsifieerbaar is en waar blijkt te zijn — de tf32x3-kernelfix zit echt in de upstream-repository, gedateerd 27 augustus, drie weken voor de perscyclus eromheen.

Wat het kost, in echte dollars

De tariefkaart is van Zhipu, en is eenvoudig: $0,15 per miljoen inputtokens, $0,50 per miljoen outputtokens en $0,03 per miljoen gecachte inputtokens. Dat is de lijstprijs per vandaag. De introductiepromotie met 50% korting liep tot en met 9 september 2026 en werd niet verlengd, dus de bedragen van $0,075 / $0,25 / $0,015 die eind augustus op grote schaal circuleerden, zijn niet langer beschikbaar via de eigen API van de leverancier. Vergeleken met de gepubliceerde $1,40 / $4,40 van GLM-5.3 komt de Flash tegen lijstprijs nog steeds op ongeveer een tiende uit — de korting was een bonus bovenop een prijs die al het punt was, niet de prijs zelf. Artificial Analysis berekent een gemengd tarief van ongeveer $0,10 per miljoen tokens bij een 7:2:1-mix van cachehits/input/output, en vermeldt een outputsnelheid van ongeveer 117 tokens per seconde, wat het als opmerkelijk snel omschrijft, hoewel AA opmerkt dat de snelheidscijfers betrekking hebben op de first-party-API van het model en niet op een door AA uitgevoerde test.

Zhipu's bredere kostenverhaal is de reden dat de prijs daar kan blijven staan. In zijn halfjaarcijfers, gepubliceerd op 31 augustus, zei het bedrijf dat de inferentiekosten per token-eenheid op zijn binnenlandse vloot van 100.000 acceleratoren sinds het begin van 2026 met 80% waren gedaald, en dat de API-brutomarge van -0,4% naar 24,6% ging als gevolg van schaal, prijsstelling en goedkopere serving. Dat zijn bedrijfscijfers van een bedrijf dat aan aandeelhouders rapporteert, en ze zijn niet door ons geauditeerd; beschouw ze als richtinggevend, niet als precies. De bovenstaande serving-uitleg is het mechanisme achter de bewering — minder redundante kernel-passes, minder geheugendruk, betere overlap — wat een geloofwaardiger verhaal is dan een kaal percentage, zelfs als het net dat percentage is dat zal worden geciteerd.

De efficiëntieclaims ten opzichte van het vlaggenschip zijn onveranderd: attention-compute 3,0x lager en KV-cache 4,4x lager dan GLM-5.3, door de leverancier gerapporteerd, waarbij Zhipu toegeeft dat zijn KV-cache nog steeds iets groter is dan die van DeepSeek V4 Flash en Kimi K3. De bij de lancering gemaakte claim van een 3x end-to-end serveringsverbetering op binnenlandse chips wordt nu gesteld op 3,2x, gemeten vanaf de eerste boot tot volledig productieverkeer. Beide cijfers zijn van Zhipu, en de twee verslagen die ze bevatten liggen drie weken uit elkaar — niets hiervan is buiten het bedrijf gereproduceerd.

Waarom de onthulling ertoe doet — en waar het kopcijfer is gebleven

Dit is de correctie die het meest van belang is voor iedereen die de introductieverslaggeving heeft gelezen en het cijfer heeft onthouden. De materialen van Zhipu plaatsen GLM-5.3-Flash op 57 in de Artificial Analysis Intelligence Index, gelijk aan Claude Opus 4.8. Artificial Analysis heeft sindsdien zijn eigen meting van het model op Intelligence Index v4.3 gepubliceerd, en die komt uit op 42 — tegenover 47 voor GPT-5.6 Sol (max) op dezelfde versie. De 57 was nooit een onafhankelijk cijfer; het was dat van Zhipu, en de onafhankelijke meting plaatst het model ongeveer vijf punten onder de band die aan de frontier grenst en ruim onder het hoofdtal van de leverancier. Op dezelfde huidige index meet GLM-5.3 zelf 45, dus het cijfer van 60 voor het vlaggenschip dat in onze introductieverslaggeving verscheen, komt niet langer overeen met wat Artificial Analysis vandaag publiceert. Het verschil van 15 punten tussen bewering en meting is geen afrondingsverschil, en het is het meest nuttige dat een lezer uit deze update kan halen — met één voorbehoud dat de sectie hieronder toevoegt, omdat de tweede onafhankelijke meting in dit verhaal de andere kant op wijst.

Wat die correctie overleeft, is beperkter, maar nog steeds reëel. GLM-5.3-Flash is een open-weight multimodaal model met 1M context en native beeld- en video-input voor ongeveer een tiende van de adviesprijs van het topmodel uit dezelfde familie — een combinatie waarvoor de Amerikaanse frontier-labs geen direct equivalent hebben: hun vergelijkbare multimodale modellen kosten wezenlijk meer en worden closed source geleverd. Zhipu's eigen framing, 'frontier-intelligentie, flash-kosten', is het deel dat de klap kreeg: met een gemeten score van 42 is het een sterk budgetmodel, niet een frontier-model tegen een korting. Onafhankelijke metingen plaatsen het ook ruim boven de mediaan voor open-weight modellen van vergelijkbare omvang, wat een echte prestatie is voor een model met 18B actieve parameters en een tiende van de inferentiekosten — het is alleen een andere prestatie dan de berichtgeving rond de lancering deed vermoeden.

Het andere onafhankelijke getal — en het viel in het voordeel van het model uit.

Als de Artificial Analysis-uitslag GLM-5.3-Flash een tandje lager zette, gaat deze de andere kant op, en het is het vreemdste feit in het verhaal. ExploitBench, gebouwd aan Carnegie Mellon, vraagt niet of een model een doelwit kan laten crashen. Het scoort de klim: het bereiken van de kwetsbare code, het triggeren van de bug, het bouwen van herbruikbare primitieven, en ten slotte volledige control-flow-kaping met arbitraire code-uitvoering, mechanisch beoordeeld tegen productie-V8 met de beveiligingssandbox ingeschakeld. Generality Labs liet GLM-5.3-Flash op 41 bugs draaien met een budget van 1 miljard tokens per bug in plaats van de gebruikelijke limiet van 300 turns van de benchmark, met als argument dat turns een slechte proxy zijn voor wat een koper daadwerkelijk uitgeeft en dat dollars de eerlijke beperking zijn. GLM-5.3-Flash bereikte volledige arbitraire code-uitvoering op 13 van de 41, en een gemiddelde capaciteitsscore van 64,8% van het maximum van de ladder. De drie gepubliceerde runs van Claude Mythos Preview scoorden 9, 10 en 11 op dezelfde ladder — een gemiddelde van 10, oftewel 62,2%. De eigen framing van Generality, afgedrukt onder de grafiek, is dat GLM-5.3-Flash “kan op cybergebied Mythos-niveau zijn” bij deze meting. De eigen ExploitBench-run van Anthropic, gepubliceerd op 29 september, rapporteert dezelfde ordening bij veel lagere absolute cijfers — zij het op de vlaggenschip-GLM-5.3, niet op de Flash: het telt end-to-end-exploits per poging in plaats van voortgang op de ladder, en zet GLM-5.3 op 50 van 410 tegenover 56 van 410 voor Mythos Preview. Andere telregel, vergelijkbare ordening — wat precies de reden is waarom een ExploitBench-cijfer nooit geciteerd zou moeten worden zonder de regel erbij.

De reden die ertoe doet, is de noemer eronder. De run berekende de outputtokens van GLM-5.3-Flash tegen $0.50 per miljoen — het tarief met 50% korting, dat inmiddels is verlopen — tegenover de historische $125 per miljoen van Claude Mythos Preview, een verschil van factor 500. Bij kostenpariteit gaf de run $16.81 per kwetsbaarheid uit tegenover Mythos' $297.17, en daar komt het cijfer van ongeveer 6% vandaan. Lees de bewering zorgvuldig, want de versie die circuleert is de verkeerde. Het is niet zo dat GLM-5.3-Flash een betere exploitontwikkelaar is dan Claude Mythos Preview. Het is dat een dollar aan GLM-5.3-Flash-tokens ongeveer koopt wat een dollar aan Mythos-tokens koopt bij deze specifieke taak, en dat je je veel meer dollars van de eerste kunt veroorloven.

De eigen kanttekeningen van Generality zijn meer waard dan de kop. Ze zeggen onomwonden dat één enkele run geen pariteit over cyber als geheel aantoont, dat contaminatie een open vraag is — het kan zijn dat er op de een of andere manier tegen ExploitBench is getraind — en dat vier van de 41 samples fouten gaven en werden gescoord door het laatst waargenomen resultaat door te schuiven, wat het model eerder onderschat dan overschat. Op 28 september publiceerden ze ook een follow-up die de hele vergelijking compliceert. Toen dezelfde gewichten via zeven verschillende agent-harnesses werden gedraaid met een budget van 250 miljoen tokens, op tien samples die waren gekozen om het moeilijkheidsbereik te bestrijken, scoorde GLM-5.3-Flash 10,6 onder de Codex-harness — boven de referentie van 10,02 van Claude Mythos Preview — en 6,2 onder de Claude Code-harness, onder zelfs de oorspronkelijke turn-limited configuratie van de benchmark met 6,4. De harness verschoof de score meer dan de modelvergelijking deed, en de auteurs zeggen dat de subset van tien samples waarschijnlijk niet representatief is. Dat de grafiek op 2 oktober breed circuleerde met het argument dat test-time compute-scaling de verschillen tussen modelniveaus uitwist, is een bewering over de industrie, niet een bevinding van de evaluatie: wat de evaluatie aantoonde, is dat een goedkoop open model, als het budget krijgt in plaats van een turnlimiet, op één ladder de exploit-specialist van een frontier-lab kan evenaren.

Het is niet langer het verhaal van één lab. De eigen Frontier Red Team-beoordeling van Anthropic, gepubliceerd op 29 september, liet GLM-5.3-Flash — het kleinere broertje — draaien in een human-in-the-loop-sessie: kreeg openbare details van een gepatchte Chrome-kwetsbaarheid plus nog een andere, zonder noemenswaardige sturing; het model schakelde ze aaneen tot een betrouwbare ARM64-exploit die de pointer-authenticatie-hardening omzeilde, in 20 minuten menselijke aandacht en acht uur modelwerk — $20,40 tegen de API-tarieven van Zhipu. Dezelfde beoordeling is de bron van het cijfer 50 van 410 uit ExploitBench hierboven, en dat deel ervan mat GLM-5.3, het 743B-vlaggenschip, niet de Flash — een onderscheid dat de berichtgeving over het rapport grotendeels heeft vervaagd. Twee onafhankelijke partijen, verschillende harnesses, verschillende budgetten, dezelfde richting. Beide zijn ook runs van één enkel lab en geen van beide is een gereproduceerd resultaat, en alleen de Generality-run rapporteert een dollarbedrag voor de Flash in plaats van voor het vlaggenschip. De praktische lezing is wat Anthropic ronduit stelt: de gewichten zijn downloadbaar, het ablitereren van GLM-5.3-Flash kostte ongeveer 600 GPU-uren, en een model dat minder dan een dollar per uur kost om te draaien is een ander soort beschikbaarheidsprobleem dan een model achter een screeningsprogramma.

Probeer het, en hoe de routinglaag past

Toegang is eenvoudig. De eigen API van Zhipu levert het tegen het bovenstaande lijsttarief, de onder MIT-licentie vrijgegeven gewichten staan op Hugging Face bij zai-org/GLM-5.3-Flash in FP8 en BF16, en de coderingsproducten van Zhipu — ZCode en het GLM Coding Plan — bundelen het. Voor self-hosting ondersteunen zowel vLLM als SGLang het. Twee praktische opmerkingen als je die route kiest: de cookbook van SGLang bevat een waarschuwing over een openstaande wijziging dat visuele invoer stilzwijgend kan wegvallen op transformers-builds vóór 5.13, wat geen fout oplevert en je simpelweg een alleen-tekst-weergave van een afbeeldingsverzoek geeft; en het AMD-pad is nog steeds geen recept. De oorspronkelijke PR voor gfx950-enablement op de lanceringsdag (sgl-project/sglang #37653) werd op 6 september gesloten zonder te worden samengevoegd en opgevolgd door een bredere reeks gfx950 day-zero pull requests — mHC via AITER, k-pool DSA-indexer, FP8- en MXFP4-serving — waarvan er verschillende op 17 september nog open waren. Enablement op hardware van de MI350X-klasse is in uitvoering, nog niet beschikbaar, en er is nog altijd geen onafhankelijk AMD-doorvoercijfer.

Aan de routeringskant is de situatie sinds de lancering veranderd: GLM-5.3-Flash staat nu in het aanbod van OrcaRouter, samen met de rest van de GLM-lijn. We geven de lijstprijs van de provider door met 0% opslag en zonder routertoeslag, wat precies het mechanisme is dat ertoe doet voor een model waarvan de prijs net is veranderd — de korting die aan de kant van Zhipu afloopt, is de prijs die je hier betaalt, dezelfde dag, zonder dat je een tweede contract hoeft te heronderhandelen en zonder codewijziging. Die doorberekening werkt beide kanten op, en het is de moeite waard om dat expliciet te zeggen: een verlopen promotie is een echte prijsverhoging op je factuur, en die vindt hier plaats op hetzelfde moment als upstream. Als je de Flash afweegt tegen GLM-5.3 of een ander budgetmodel, zitten beide achter één sleutel met automatische failover tussen providers, wat de goedkope manier is om een model te proberen waarvan de onafhankelijke scores nog niet uitgekristalliseerd zijn, zonder er een productiepad op te wedden. Het is ook de juiste vorm voor het bovenstaande resultaat, en om een minder verbloemde reden dan gemak: dezelfde gewichten scoorden 10,6 of 6,2 op dezelfde benchmark, afhankelijk van welke agent-harness ze aanstuurde, dus wat een koper feitelijk test, is een scaffold-plus-modelcombinatie, en het verwisselen van het model achter een vaste scaffold onder één sleutel is goedkoper dan je aan een van beide vast te leggen.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

Wat nu te kijken

Vier dingen bepalen de rest van dit verhaal. Ten eerste, of de 42 beweegt: het model is sinds augustus breed publiek in gebruik, dus als de interne evaluatie van Zhipu en de harness van AA het om een structurele reden oneens zijn — accounting van reasoning-tokens, verboseheid, een evaluatie die de leverancier zwaar liet wegen — zou dat zichtbaar moeten worden bij de herziening van de index en niet als een eenmalige afwijking. Ten tweede, of het exploitresultaat wordt gereproduceerd. Generality Labs heeft 41 bugs één keer op zijn eigen harness gedraaid, en zegt dat ook; de harness-follow-up laat zien dat dezelfde gewichten vier punten verschuiven louter door de keuze van harness, dus het getal dat dit zou beslechten is een tweede team dat de 41 opnieuw draait met het budget vastgelegd in dollars en de harness constant gehouden. Ten derde, of het verhaal over binnenlandse silicium een tweede bron krijgt. Zhipu is de enige partij die de clustergrootte, de tweewekelijkse tijdlijn en de 3,2x kan noemen, en de enige onafhankelijk verifieerbare bewering daarin — de samengevoegde kernel-fix — is bescheiden. Ten vierde, de prijs: de korting is verdwenen, en de interessante vraag is of die terugkomt als promotie wanneer Zhipu volume nodig heeft, of dat het lijsttarief nu de ondergrens is.

De rode draad is dat GLM-5.3-Flash wordt gevraagd om tegelijk twee verschillende dingen te bewijzen — dat een goedkoop model goed genoeg kan zijn, en dat Chinese accelerators het op schaal kunnen bedienen — en de openbaarmaking van 17 september is Zhipu's antwoord op de tweede vraag, geleverd door een model dat heeft meegeholpen het te schrijven. Aan de eerste vraag zijn nu twee onafhankelijke cijfers verbonden, en ze wijzen in tegengestelde richtingen: een 42 op de intelligentie-index, ruim onder het kopcijfer van de leverancier, en een exploit-run die op hetzelfde niveau uitkomt als de specialist van een frontierlab, tegen een twintigste van de kosten. Beide kunnen tegelijk waar zijn, en de kloof tussen hen — niet een van beide cijfers — is waar de beslissingen daadwerkelijk worden genomen.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt