Hero-kaart van een artikel met de titel 'GLM 5.5 of GLM 5.3-Vision?' met de ondertitel 'Een anoniem model dat overeenkomt met de vingerafdruk van Z.ai is zojuist opgedoken' en de badge 'LEAK — niet-geverifieerd', over een zacht wit-blauw verloop met een subtiel neuraalnetwerkmotief en een vraagtekenelement.
Guides & Insights

GLM 5.5 of GLM 5.3-Vision? Een anoniem model dat overeenkomt met de vingerafdruk van Z.ai is zojuist opgedoken

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Een niet-geïdentificeerd model waarvan het serving-profiel — snelheid, time-to-first-token, cache-hitsnelheid — overeenkomt met de G​LM-stack van Z.ai, trekt nu de aandacht van capaciteitsanalisten, en de werkveronderstelling is dat het GLM 5.3-Vision of GLM 5.5 zou kunnen heten. Op 20 augustus plaatste de compute-en-capaciteitsanalist teortaxesTex dat een anoniem model dat hij volgt "duidelijk in ieder geval geen Dee​pSeek is", dat "er tot nu toe niets is dat G​LM uitsluit", en dat "snelheid, ttft, cache-hitsnelheid ook overeenkomen met G​LM". Zijn lezing: verwacht dat het GLM 5.3-Vision of 5.5 wordt genoemd, met een score van ruwweg 61 op de Artificial Analysis Intelligence Index — één punt boven waar de uitgebrachte GLM-5.3 vandaag staat. Hier is niets bevestigd. Er is geen modelcard, geen aankondiging van Z.ai en geen API, en deze pagina behandelt de waarneming als wat het is: een vroeg, niet-gerepliceerd leksignaal, dat het volgen waard is juist omdat GLM-5.5 de hele maand het verwachte vlaggenschip van Z.ai is geweest en niet is verschenen. Vijf dagen na dat bericht kwam er een tweede, en dit keer volledig controleerbaar datapunt: op 25 augustus opende vLLM — de inferentie-runtime achter de meeste grootschalige modelserving — een Do-Not-Merge-pullrequest dat masked-MHA-kernelondersteuning mogelijk maakt voor de G​LM-5-hoofddimensies. Het noemt geen variant en bewijst geen lancering; het is fundamentwerk voor de serving-stack, het soort achtergrondactiviteit dat een nieuw model achterlaat.

Wat het signaal eigenlijk zegt

De bron is een enkele X-post van teortaxesTex, gedateerd 20 augustus — hetzelfde account waarvan het "ruwweg een week"-timingsignaal voor de lancering van GLM-5.3 in augustus tot op de dag nauwkeurig klopte. De framing is expliciet over het bewijsniveau: "sterk bewijs (niet gerepliceerd)." De analist sluit Dee​pSeek uit, vindt niets dat G​LM tegenspreekt, en noemt drie serving-niveaumetingen — doorvoer, time-to-first-token en cache-hitratio — die overeenkomen met de stack van Z.ai. Vervolgens de twee kandidaatnamen en een verwachte score: "Momenteel verwacht ik dat het GLM 5.3-Vision of 5.5 wordt genoemd, en ongeveer 61 scoort op AA."

Neem elk onderdeel afzonderlijk. De identiteitsclaims (niet Dee​pSeek, komt overeen met G​LM) zijn vingerafdrukafleidingen van hoe het model wordt aangeboden, geen modelkaart. De score is een verwachting, geen meting. De namen zijn gissingen. Wat het signaal meer waard maakt dan ruis, is dat het qua richting consistent is met alles wat we verder weten over de routekaart van Z.ai deze maand: GLM-5.3 werd alleen als tekst uitgebracht, de vraag waar de community het hardst om riep was visie, en volgens meerdere media (via JPMorgan, Reuters, CGTN en een Goldman-notitie van 18 augustus) zou GLM-5.5 'binnen augustus' verschijnen — de finale van de maand is nu.

Waarom de serving-vingerafdruk ertoe doet

Time-to-first-token en cache-hitratio zijn signaturen op infrastructuurniveau. Ze worden bepaald door hoe een provider zijn inferentiestack opbouwt — de scheduler, de cache-indeling, het batchbeleid — niet door welke modelnaam een prompt aanroept. Wanneer een analist zegt dat de TTFT en cache-hitratio van een anoniem model overeenkomen met GLM, zegt hij daarmee dat de servingstack erachter zich gedraagt als die van Z.ai, wat zonder gewichten of een modelkaart het dichtst bij een vingerafdruk komt. Het is geen bewijs. Een andere leverancier zou dezelfde stack kunnen spiegelen, of Z.ai zou een model voor een partner kunnen serveren. Maar het is een specifieke, controleerbare bewering, en de kanttekening "niet gerepliceerd" vertelt je dat de analist het niet als vaststaand presenteert.

De uitsluiting van Dee​pSeek doet er ook toe. DeepSeek V4 Pro is op 13 augustus GA gegaan en de Flash-build is deze maand de andere snelle Chinese open-weight-release geweest. Een anoniem model dat Dee​pSeek uitsluit maar naar G​LM wijst, beperkt het veld tot de pijplijn van Z.ai — en de pijplijn van Z.ai heeft twee plausibele kandidaten, wat precies de splitsing is die het signaal aangeeft.

Een tweede signaal: de serving stack wordt opgebouwd voor GLM-5 attention

Op 25 augustus kwam er een tweede datapunt binnen — en dat is volledig controleerbaar. vLLM, de inferentieruntime achter de meeste grootschalige modelserving, ontving pull request #53785, getiteld "[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions." Geverifieerd tegen de repository, maakt dit de masked-MHA-prefillpad mogelijk voor de G​LM-5-aandachtsgeometrie: 64 koppen, een KV-rang van 512, QK-headdimensie 192+64 en V-headdimensie 256 — een 256/256 QK/V-indeling, volgens de PR-beschrijving. Het is afhankelijk van een FlashAttention-wijziging voor maskeringsondersteuning met hoofddimensie 256, zet FlashAttention tijdelijk vast op een fork-commit (daar dient de Do Not Merge-markering voor) en voegt gebenchmarkte routingdrempels toe voor het nieuwe pad: FlashMLA pure-prefill-limieten van 8K / 20K / 48K / 112K tokens bij TP 1/2/4/8, en een afgeronde 64K-limiet voor FlashInfer bij TP8. De auteur merkt op dat geen enkel ander open PR G​LM-5-masked-MHA-ondersteuning dekte.

Lees het voor wat het is: voorbereidend werk aan de serving-stack, geen aankondiging. De PR noemt GLM 5.5 of GLM 5.3-Vision niet — er staat "GLM-5" — en het mogelijk maken van een masked-MHA-prefillpad voor G​LM-5-hoofddimensies is infrastructuurwerk aan een familie die het vLLM-ecosysteem al via het sparse-MLA-pad draait (de eigen afstammingslijn van GLM-5.3 wordt daar vandaag al geserveerd). Het staat ook niet op zichzelf: zuster-PR's deze maand gingen over FlashInfer-MLA-dimensiecontroles voor G​LM-5, een Triton sparse-MLA-fallback voor modellen van de G​LM-5-klasse, en de gerapporteerde dimensieondersteuning van FlashAttention. Twee details houden het op de radar van een lektracker. Ten eerste de geometrie waarop het zich richt — 64 koppen, KV-rang 512, 256/256 QK/V — verschilt van Dee​pSeek's 192/128, wat dezelfde 'niet Dee​pSeek, wel G​LM'-scheiding is die de vingerafdruk van het anonieme model trekt, nu zichtbaar op het niveau van de attention-kernel. Ten tweede de timing: de PR werd geopend op 25 augustus, binnen hetzelfde augustusvenster waarin GLM-5.5 al de hele maand wordt verwacht. Niets daarvan bewijst dat het anonieme model een G​LM van de volgende generatie is — dit zou evengoed engineering aan het model kunnen zijn dat al is uitgebracht — maar het is het soort achtergrondactiviteit dat het serving-ecosysteem in aanloop naar een model verricht, en het is verifieerbaar op een manier zoals geen enkele X-post dat is.

Twee namen, één fork: GLM 5.3-Vision vs GLM 5.5

De twee kandidaat-identiteiten zijn werkelijk verschillende producten, en het lek maakt niet duidelijk welke er op het bord ligt.

• GLM 5.3-Vision zou een vision-capabele variant zijn van het model dat op 14 augustus werd uitgebracht. GLM-5.3 is alleen tekstinvoer — Artificial Analysis vermeldt het als tekst in, tekst uit, zonder beeldondersteuning — en die kloof is de luidruchtigste klacht van de community. Toen Tang Jie van Z.ai een wereldwijde feedbackcampagne hield, kwamen de reacties in essentie unaniem terug voor vision, en Z.ai heeft al de bouwstenen (het GLM-5V-Turbo multimodale model en de CogVLM-encoder) die het nog niet in de vlaggenschipreeks heeft geïntegreerd. Een 5.3-Vision-variant zou de snelste manier zijn om die kloof te dichten.

• GLM 5.5 is zelf het vlaggenschip. Gerapporteerde maar onbevestigde specificaties wijzen op een basis van meer dan een biljoen parameters (tegenover 743B bij GLM-5.3), een overgenomen 1M-token context, open gewichten en een sterkere focus op agentic/coding. Elke analistennotitie deze maand behandelt 5.5 als de grote — het voertuig waarvan Z.ai-medeoprichter Tang Jie heeft laten doorschemeren dat het de kloof met Fable-klasse closed modellen zal dichten. Het wordt binnen augustus verwacht en is op het moment van schrijven nog niet uitgebracht.

Dezelfde vingerafdruk kan je niet vertellen welke van de twee dit is — een op visie afgestemde 5.3 en een nieuw vlaggenschip zouden beide op dezelfde serverstack kunnen draaien. Die dubbelzinnigheid is de eerlijke staat van het signaal, en de twee namen in het bericht van de analist weerspiegelen dat in plaats van het op te lossen.

<img src="2.png" alt="Een vergelijkingsscorebord met twee kolommen, getiteld 'GLM 5.5 vs GLM-5.3 — het scorebord'. Linkerkolom GLM 5.5 (gelekt): 'AA Index ~61 (prognose, niet geverifieerd)', 'Status: niet uitgebracht', 'Omvang >1T parameters (volgens geruchten)', 'Beeldherkenning: verwacht', 'Context: 1M (verwacht)', 'Prijs: TBD'. Rechterkolom GLM-5.3 (uitgebracht): 'AA Index 60', 'Status: API live op 19 aug', 'Omvang 743B MoE / 40B actief', 'Beeldherkenning: alleen tekst', 'Context: 1M', 'Prijs: $1.40 / $4.40'. Voettekst luidt 'De cijfers van GLM 5.5 zijn niet-geverifieerde projecties; GLM-5.3 volgens Artificial Analysis.'" />

A two-column comparison scoreboard titled 'GLM 5.5 vs GLM-5.3 — the scoreboard'. Left column GLM 5.5 (leaked): 'AA Index: ~61 (projected)', 'Status: unreleased', 'Size: >1T params (rumored)', 'Vision: expected', 'Context: 1M (expected)', 'Price: TBD'. Right column GLM-5.3 (shipped): 'AA Index: 60', 'Status: API live Aug 19', 'Size: 743B MoE / 40B active', 'Vision: text-only', 'Context: 1M', 'Price: $1.40 / $4.40'. Footer reads 'GLM 5.5 figures are unverified projections; GLM-5.3 per Artificial Analysis.'

Wat een ~61 op de AA Intelligence Index zou betekenen

De verwachte score is het scherpste onderdeel van het lek. De Artificial Analysis Intelligence Index (v4.1.1) plaatst GLM-5.3 momenteel op 60 — gelijk met Kimi K3 voor de hoogste open-weights-score, en 7 punten boven de 53 van GLM-5.2. Eén punt daarboven, op 61, zou het terrein van GPT-5.6 Sol zijn, met Claude Fable 5 op 62 en Claude Opus 5 op 63. In duidelijke termen: een model uit de GLM-familie dat 61 scoort, zou met afstand de hoogste open-weights-score op de index zijn, boven Kimi K3 en GLM-5.3, en feitelijk op de gesloten-frontier-lijn.

Het is de moeite waard om te benadrukken wat 61 niet is. Het is de verwachting van teortaxesTex van wat een onafhankelijke evaluatie zal opleveren, geen gepubliceerde Artificial Analysis-score en geen leverancierscijfer. Een projectie kan in beide richtingen fout zitten — een visievariant zou een punt of twee kunnen inleveren op de tekstintensieve index, en een >1T-vlaggenschip zou hoger of lager kunnen uitkomen, afhankelijk van hoe de post-training uitpakt. De waarde van het getal is de claim die het bevat: wie dit anonieme model ook blijkt te zijn, het zal naar verwachting de huidige open-weights-leider verslaan in plaats van hem slechts te evenaren.

A screenshot of the Artificial Analysis page for GLM-5.3 (max) showing an Intelligence Index of 60 (well above the median of 35), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, a 1M-token context window, and summary text describing the model as leading in intelligence and reasonably priced.

Wat is bevestigd, en wat niet

Houd het grootboek schoon, want een lekstuk staat of valt daarmee.

• Bevestigd: GLM-5.3 is echt, uitgebracht op 14 augustus, API live op 18/19 augustus, scoorde 60 op de AA Intelligence Index (onafhankelijk gemeten door Artificial Analysis), geprijsd op $1,40 / $4,40 per 1M tokens, alleen tekstinvoer, met open gewichten bevestigd voor vrijdag 28 augustus. Deze feiten hangen niet af van het lek.

• Bevestigd: GLM-5.5 is nog niet uitgebracht. Op het moment van schrijven is er geen modelkaart, geen prijsinformatie en geen beschikbaarheid; het augustusvenster en het >1T parametercijfer zijn door analisten gerapporteerd, geen toezeggingen van Z.ai.

• Onbevestigd: dat het anonieme model bestaat als een apart product, dat het G​LM is, dat de naam GLM 5.3-Vision of 5.5 zal zijn, en dat het een score van 61 haalt. Alle vier berusten op één niet-gerepliceerde post van een analist.

• Ook onbevestigd: of dit anonieme model überhaupt verschilt van GLM-5.3 zelf. Een live GLM-5.3-endpoint onder een niet-gelabeld alias zou dezelfde serving-fingerprint opleveren. Totdat een naam, een modelkaart of het uitbrengen van de gewichten dit oplost, is de lezing 'nieuw model' de sterke prior, maar geen feit.

Wat nu te kijken

• Vrijdag 28 augustus — de GLM-5.3-gewichten. Als het anonieme model eigenlijk een hernoemde 5.3 of een 5.3-Vision is, zullen de gewichtsdump en de modelkaart dat snel uitwijzen.

• Een tweede bevestigende waarneming. De vingerafdruk van één analist is een hypothese; een tweede onafhankelijke lezing van dezelfde anonieme vermelding, of een Artificial Analysis-lijst die deze bij naam noemt, verheft het tot bewijs.

• Elke Z.ai-verklaring. GLM-5.5 is gerapporteerd voor het augustusvenster, en de maand is bijna voorbij. Een officiële naamgeving, een prijspagina of een API-changelogvermelding is de gebeurtenis die dit lek in een lanceerverhaal verandert.

Of de AA-score daadwerkelijk op 61 uitkomt. Als het anonieme model echt is en tot de G​LM-familie behoort, zou een onafhankelijke indexscore rond 61 het eerste open-weights-getal zijn dat boven de 60 uitkomt.

• Of het vLLM-aandachtwerk een modelnaam krijgt. PR #53785 richt zich op "GLM-5" head-dimensies zonder 5.3-Vision of 5.5 te noemen; een merge, een vermelding in ondersteunde modellen, of een modelkaart die die geometrie aan een specifieke naam koppelt, zou het sterkste signaal tot nu toe zijn.

Hoe te handelen bij een lek zoals dit

Een lek is een reden om je voor te bereiden, niet om van platform te wisselen. Als het volgende G​LM-familie-model op of nabij de top van de open-weights-ranglijst belandt, is de praktische vraag of je er echt verkeer naartoe moet routeren — en een onbewezen model met claims van de leverancier en de projectie van één analist is precies het geval waarin je een vangnet wilt in plaats van een gok. De GLM-5.3 die vorige week is uitgebracht, is al live op OrcaRouter — de modelpagina toont $1.26 / $3.96 per 1M tokens, een lanceerkorting van 10% op de $1.40 / $4.40 lijstprijs van de leverancier, doorberekend met nul opslag — en de routeringsopzet is wat een 5.5 of 5.3-Vision zou erven op de dag dat hij verschijnt. Leid een deel van het verkeer via de router naar het nieuwe model met automatische failover naar een bewezen model — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — en je krijgt een kwaliteitssignaal op je eigen workload in plaats van een slide deck. Als de projectie van het lek klopt, ben je als eerste op de hoogte; als hij fout is, vangt de failover het op en wordt er niets kapot opgeleverd. Dezelfde sleutel, geen tweede contract, en geen noodzaak om te kiezen tussen de twee kandidaatnamen totdat Z.ai dat doet.

De volgende G​LM komt eraan — de enige open vraag is welke naam hij draagt. GLM 5.3-Vision zou betekenen dat Z.ai het meest beklaagde hiaat van het zojuist uitgebrachte model dicht; GLM 5.5 zou het vlaggenschip met een biljoen parameters zijn waar de hele maand al naartoe heeft gewezen. De anonieme inzending teortaxesTex, waarvan op 20 augustus een fingerprint is gemaakt, is het eerste concrete object dat op een van beide lijkt, en de geprojecteerde 61 op de AA Intelligence Index zou die inzending vóór elk open-weights model plaatsen dat momenteel op de ranglijst staat. Vijf dagen na de fingerprint kwam ook de serving-stack in beweging: het G​LM-5 attention-werk van vLLM is precies het soort voorbereidend werk dat een nieuw model achterlaat, ook al noemt het geen variant. Niets daarvan is bevestigd, en deze pagina wordt bijgewerkt zodra de naam, de kaart of de gewichten uitsluitsel geven. Tot die tijd is de risicoarme zet om de routing klaar te hebben — niet om de stack op een fingerprint te verwedden.

The OrcaRouter model page for z-ai/glm-5.3, showing the model id, capability chips (Tools, JSON, Reasoning), a 1,000,000-token context window, a 128,000-token max output, text input and text output, and pass-through pricing of $1.26 per 1M input tokens and $3.96 per 1M output tokens.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt