Artikelns hero-kort med texten 'GLM 5.5 eller GLM 5.3-Vision?', undertiteln 'En anonym modell som matchar Z.ai:s fingeravtryck har precis dykt upp' och märket 'LÄCKA — overifierad', över en mjuk vit-och-blå gradient med ett subtilt motiv av ett neuralt nätverk och ett frågetecken-element.
Guides & Insights

GLM 5.5 eller GLM 5.3-Vision? En anonym modell som matchar Z.ai:s fingeravtryck har precis dykt upp

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

En oidentifierad modell vars serveringsprofil — hastighet, tid-till-första-token, cacheträfffrekvens — matchar Z.ai:s G​LM-stack har börjat väcka uppmärksamhet hos kapacitetsanalytiker, och den arbetande gissningen är att den kan heta GLM 5.3-Vision eller GLM 5.5. Den 20 augusti skrev compute- och kapacitetsanalytikern teortaxesTex att en anonym modell han följer "tydligt inte är Dee​pSeek, åtminstone", att "det finns inget som utesluter G​LM hittills", och att "hastighet, ttft, cacheträfffrekvens matchar G​LM också". Hans bedömning: förvänta sig att den kallas GLM 5.3-Vision eller 5.5, med en poäng på ungefär 61 på Artificial Analysis Intelligence Index — en poäng över där den lanserade GLM-5.3 ligger idag. Inget här är bekräftat. Det finns inget modellkort, inget Z.ai-tillkännagivande och inget API, och denna sida behandlar iakttagelsen för vad den är: en tidig, ej replikerad läckagesignal, värd att följa just eftersom GLM-5.5 har varit den förväntade Z.ai-flaggskeppsmodellen hela månaden och inte har dykt upp. Fem dagar efter det inlägget kom en andra och denna gång fullt verifierbar datapunkt: den 25 augusti öppnade vLLM — den runtime för inferens som ligger bakom de flesta storskaliga modellservrar — en Do-Not-Merge-pull request som möjliggör masked-MHA-kärnstöd för G​LM-5-huvuddimensionerna. Den namnger ingen variant och bevisar ingen lansering; det är förberedande arbete i serveringsstacken, den typ av bakgrundsaktivitet som en ny modell lämnar efter sig.

Vad signalen faktiskt säger.

Källan är ett enda X-inlägg från teortaxesTex, daterat den 20 augusti — samma konto vars "ungefär en vecka"-tidssignal för GLM-5.3:s lansering stämde till dagen i augusti. Inramningen är explicit om evidensnivån: "starka bevis (har inte replikerats)." Analytikern utesluter Dee​pSeek, hittar inget som motsäger G​LM, och citerar tre mätningar på tjänstenivå — genomströmning, tid till första token och cacheträffgrad — som matchar Z.ai:s stack. Sedan de två kandidatnamnen, och en prognostiserad poäng: "För närvarande förväntar jag mig att den kallas GLM 5.3-Vision eller 5.5, och får ungefär 61 på AA."

Ta varje del för sig. Identitetspåståendena (inte Dee​pSeek, matchar G​LM) är fingeravtrycksinferens utifrån hur modellen serveras, inte ett modellkort. Poängen är en förväntan, inte en mätning. Namnen är gissningar. Det som gör signalen värd mer än brus är att den är riktningsmässigt förenlig med allt annat vi vet om Z.ai:s färdplan den här månaden: GLM-5.3 levererades endast med text, gemenskapens enskilt mest högljudda önskemål var vision, och GLM-5.5 har rapporterats av flera kanaler (via JPMorgan, Reuters, CGTN och ett Goldman-notat den 18 augusti) som anländande "inom augusti" – månadens final är nu.

Varför serveringsfingeravtrycket spelar roll

Time-to-first-token och cache-träfffrekvens är signaturer på infrastrukturnivå. De bestäms av hur en leverantör bygger sin inferensstack – schemaläggaren, cache-layouten, batchpolicyn – inte av vilket modellnamn en prompt anropar. När en analytiker säger att en anonym modells TTFT och cache-träfffrekvens matchar G​LM, menar de att serving-stacken bakom den beter sig som Z.ai:s, vilket är det närmaste ett fingeravtryck man kan komma utan vikter eller ett modellkort. Det är inte bevis. En annan leverantör skulle kunna efterlikna samma stack, eller så kan Z.ai leverera en modell för en partner. Men det är ett specifikt, verifierbart påstående, och förbehållet ”har inte replikerats” talar om att analytikern inte presenterar det som definitivt.

Uteslutningen av Dee​pSeek spelar också roll. DeepSeek V4 Pro GA:ade den 13 augusti och dess Flash-version har varit den andra snabba kinesiska open-weight-utgåvan denna månad. En anonym modell som utesluter Dee​pSeek men pekar på G​LM begränsar fältet till Z.ais pipeline — och Z.ais pipeline har två tänkbara kandidater, vilket är exakt det vägskäl signalen namnger.

En andra signal: serveringsstacken byggs upp för GLM-5 attention

Den 25 augusti kom en andra datapunkt — den här helt verifierbar. vLLM, körningsmiljön bakom de flesta storskaliga modellservrar, fick pull request #53785, med titeln "[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions." Verifierad mot repot aktiverar den masked-MHA-prefill-vägen för G​LM-5:s uppmärksamhetsgeometri: 64 huvuden, en KV-rank på 512, QK-huvuddimension 192+64 och V-huvuddimension 256 — en 256/256 QK/V-layout, enligt PR-beskrivningen. Den beror på en FlashAttention-ändring för maskstöd med huvuddimension 256, pinnar tillfälligt FlashAttention till en fork-commit (vilket är vad Do Not Merge-markeringen är till för), och lägger till benchmarkade routingtrösklar för den nya vägen: FlashMLA rena prefill-gränser på 8K / 20K / 48K / 112K tokens vid TP 1/2/4/8, samt en avrundad 64K-gräns för FlashInfer vid TP8. Författaren noterar att ingen annan öppen PR täckte G​LM-5:s masked-MHA-stöd.

Läs det för vad det är: grundarbete i serving-stacken, inte ett tillkännagivande. PR:en namnger inte GLM 5.5 eller GLM 5.3-Vision — den säger "GLM-5" — och att aktivera en masked-MHA-prefill-väg för G​LM-5:s huvuddimensioner är infrastrukturarbete på en modellfamilj som vLLM-ekosystemet redan kör över sparse-MLA-vägen (GLM-5.3:s egen härstamning serveras där idag). Det är inte heller isolerat: syskon-PR:er denna månad täckte FlashInfer MLA-dimensionskontroller för GLM-5, en Triton sparse-MLA-fallback för GLM-5-klassmodeller och FlashAttentions rapporterade dimensionsstöd. Två detaljer håller det kvar på en läckagetrackers radar. För det första: den geometri som den riktar in sig på — 64 huvuden, KV-rank 512, 256/256 QK/V — skiljer sig från Dee​pSeeks 192/128, vilket är samma "inte Dee​pSeek, matchar G​LM"-separation som den anonyma modellens fingeravtryck visar, nu synlig på attention-kernel-nivå. För det andra: tajmingen. PR:en öppnades den 25 augusti, inom samma augustifönster där GLM-5.5 har förväntats hela månaden. Inget av det bevisar att den anonyma modellen är en nästa generations G​LM — detta skulle lika gärna kunna vara utvecklingsarbete på modellen som redan släppts — men det är den typen av bakgrundsaktivitet som serving-ekosystemet utför inför en modell, och det är verifierbart på ett sätt som inget X-inlägg är.

Två namn, en fork: GLM 5.3-Vision vs GLM 5.5

De två kandidatidentiteterna är genuint olika produkter, och läckan avgör inte vilken som sitter på kortet.

• GLM 5.3-Vision skulle vara en variant med bildstöd av modellen som släpptes den 14 augusti. GLM-5.3 är endast textinmatning — Artificial Analysis listar den som text in, text ut, utan bildstöd — och det gapet är communityts högljuddaste klagomål. När Z.ais Tang Jie genomförde en global feedbackkampanj återkom kommentarerna i princip enhälligt för vision, och Z.ai har redan byggstenarna (den multimodala modellen GLM-5V-Turbo och CogVLM-kodaren) som Z.ai ännu inte har införlivat i flaggskeppslinjen. En 5.3-Vision-variant skulle vara det snabbaste sättet att stänga det gapet.

GLM 5.5 är själva flaggskeppet. Rapporterade men obekräftade specifikationer pekar på en bas över en biljon parametrar (upp från GLM-5.3:s 743B), ett bibehållet 1M-token-kontext, öppna vikter och ett starkare fokus på agent- och kodningsförmåga. Varje analytikeranteckning den här månaden behandlar 5.5 som den stora – medlet som Z.ai:s medgrundare Tang Jie har antytt ska sluta gapet till Fable-klassens stängda modeller. Den förväntas inom augusti och har inte lanserats i skrivande stund.

Samma fingeravtryck kan inte avgöra vilken av de två det här är — en visionsanpassad 5.3 och ett nytt flaggskepp skulle båda kunna använda samma serveringsstack. Den tvetydigheten är signalens ärliga tillstånd, och de två namnen i analytikerns inlägg återspeglar den snarare än löser den.

<img src="2.png" alt="En jämförelsetavla i två kolumner med titeln 'GLM 5.5 vs GLM-5.3 — poängtavlan'. Vänster kolumn GLM 5.5 (läckt): 'AA Index ~61 (projicerat, overifierat)', 'Status: ej släppt', 'Storlek >1T parametrar (ryktas)', 'Vision: förväntad', 'Kontext: 1M (förväntad)', 'Pris: TBD'. Höger kolumn GLM-5.3 (släppt): 'AA Index 60', 'Status: API live 19 aug', 'Storlek 743B MoE / 40B aktiv', 'Vision: endast text', 'Kontext: 1M', 'Pris: $1.40 / $4.40'. Sidfoten lyder: 'Siffrorna för GLM 5.5 är overifierade projektioner; GLM-5.3 enligt Artificial Analysis.'" />

A two-column comparison scoreboard titled 'GLM 5.5 vs GLM-5.3 — the scoreboard'. Left column GLM 5.5 (leaked): 'AA Index: ~61 (projected)', 'Status: unreleased', 'Size: >1T params (rumored)', 'Vision: expected', 'Context: 1M (expected)', 'Price: TBD'. Right column GLM-5.3 (shipped): 'AA Index: 60', 'Status: API live Aug 19', 'Size: 743B MoE / 40B active', 'Vision: text-only', 'Context: 1M', 'Price: $1.40 / $4.40'. Footer reads 'GLM 5.5 figures are unverified projections; GLM-5.3 per Artificial Analysis.'

Vad ett ~61 på AA Intelligence Index skulle innebära

Den projicerade poängen är den vassaste delen av läckan. Artificial Analysis Intelligence Index (v4.1.1) placerar för närvarande GLM-5.3 på 60 — delad ledning med Kimi K3 för den högsta open-weights-poängen, och 7 poäng före GLM-5.2:s 53. En poäng därifrån, på 61, ligger GPT-5.6 Sols territorium, med Claude Fable 5 på 62 och Claude Opus 5 på 63. Enkelt uttryckt: en G​LM-modell som får 61 skulle vara den enskilt högsta open-weights-poängen på indexet, helt ensam ovanför Kimi K3 och GLM-5.3, och i praktiken vid gränsen till de stängda frontier-modellerna.

Det är värt att understryka vad 61 inte är. Det är teortaxesTex:s förväntning på vad en oberoende utvärdering kommer att returnera, inte en publicerad Artificial Analysis-poäng och inte ett leverantörsnummer. En prognos kan vara fel i endera riktningen — en visionsvariant kan tappa en poäng eller två på det texttunga indexet, och ett >1T-flaggskepp kan hamna högre eller lägre beroende på hur dess efterträning utfaller. Värdet av siffran är det påstående den kodar: vem denna anonyma modell än visar sig vara, förväntas den slå den nuvarande ledaren med öppna vikter snarare än att endast matcha den.

A screenshot of the Artificial Analysis page for GLM-5.3 (max) showing an Intelligence Index of 60 (well above the median of 35), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, a 1M-token context window, and summary text describing the model as leading in intelligence and reasonably priced.

Vad är bekräftat, och vad är inte

Håll räkenskaperna rena, för en läcka lever eller dör på det.

• Bekräftat: GLM-5.3 är verklig, släpptes den 14 augusti, API:et live den 18/19 augusti, fick 60 på AA Intelligence Index (oberoende uppmätt av Artificial Analysis), prissatt till 1,40 $ / 4,40 $ per 1M tokens, endast textinmatning, med öppna vikter bekräftade till fredag den 28 augusti. Dessa fakta är inte beroende av läckan.

• Bekräftat: GLM-5.5 är fortfarande inte utgiven. I skrivande stund finns inget modellkort, ingen prissättning och ingen tillgänglighet; augustifönstret och siffran på >1T parametrar är analytikerrapporterade, inte Z.ai-åtaganden.

• Obekräftat: att den anonyma modellen finns som en separat produkt, att den är G​LM, att dess namn kommer att vara GLM 5.3-Vision eller 5.5, och att den får 61. Alla fyra vilar på en enda analysts oupprepade inlägg.

• Även obekräftat: huruvida denna anonyma modell överhuvudtaget skiljer sig från själva GLM-5.3. En live GLM-5.3-slutpunkt under ett omärkt alias skulle ge samma serveringsfingeravtryck. Tills ett namn, ett modellkort eller en viktnedladdning löser frågan, är tolkningen "ny modell" den starka utgångspunkten men inte ett faktum.

Vad du ska titta på härnäst

• Fredagen den 28 augusti — GLM-5.3-vikterna. Om den anonyma modellen faktiskt är en omdöpt 5.3 eller en 5.3-Vision, kommer viktsläppet och modellkortet att avgöra det snabbt.

• En andra bekräftande observation. En analytikers fingeravtryck är en hypotes; en andra oberoende läsning av samma anonyma post, eller en Artificial Analysis-listning som namnger den, uppgraderar den till bevis.

• Eventuella Z.ai-uttalanden. GLM-5.5 har rapporterats för augustifönstret, och månaden är nästan slut. En officiell namngivning, en prissättningssida eller en post i API-ändringsloggen är händelsen som förvandlar denna läcka till en lanseringsnyhet.

Huruvida AA-poängen materialiseras vid 61. Om den anonyma modellen är verklig och tillhör G​LM-familjen, skulle ett oberoende indexvärde nära 61 vara den första siffran från en modell med öppna vikter att passera 60.

• Huruvida vLLM-uppmärksamhetsarbetet får ett modellnamn kopplat. PR #53785 riktar in sig på "GLM-5"-huvuddimensioner utan att nämna 5.3-Vision eller 5.5; en merge, en supported-models-post eller ett modellkort som kopplar den geometrin till ett specifikt namn skulle vara den starkaste signalen hittills.

Hur man agerar vid ett sådant läckage

En läcka är en anledning att förbereda sig, inte att byta plattform. Om nästa G​LM-familjsmodell hamnar på eller nära toppen av open-weights-ledartavlan, är den praktiska frågan om man ska dirigera riktig trafik till den — och en obeprövad modell med leverantörspåståenden och en analytikers prognos är precis det fall där du vill ha ett säkerhetsnät snarare än en satsning. GLM-5.3 som släpptes förra veckan är redan live på OrcaRouter — modellsidan visar den till $1.26 / $3.96 per 1M tokens, en 10% lanseringsrabatt från leverantörens listpris på $1.40 / $4.40, överfört med noll påslag — och routerinställningen är vad en 5.5 eller 5.3-Vision skulle ärva den dag den släpps. Rikta en del av trafiken mot den nya modellen genom routern med automatisk failover till en beprövad modell — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — och du får en kvalitetssignal på din egen arbetsbelastning istället för en bildpresentation. Om läckans prognos stämmer, fick du reda på det först; om den är fel, absorberar failover det och inget släpps sönder. Samma nyckel, inget andra kontrakt, och inget behov av att välja mellan de två kandidatnamnen förrän Z.ai gör det.

Nästa G​LM är på väg — den enda öppna frågan är vilket namn den bär. GLM 5.3-Vision skulle innebära att Z.ai täpper igen det mest kritiserade gapet i den modell man just släppt; GLM 5.5 skulle vara flaggskeppet med en biljon parametrar som hela månaden har pekat mot. Den anonyma posten teortaxesTex, vars fingeravtryck togs den 20 augusti, är det första konkreta objektet som liknar endera, och dess prognostiserade 61 på AA Intelligence Index skulle placera den före alla öppna viktmodeller som för närvarande finns på listan. Fem dagar efter fingeravtrycket rörde sig också serving-stacken: vLLM:s G​LM-5-attention-arbete är precis den typ av grundarbete som en ny modell lämnar efter sig, även om det inte namnger någon variant. Inget av detta är bekräftat, och denna sida uppdateras i samma stund som namnet, modellkortet eller vikterna avgör det. Tills dess är det lågriskiga draget att ha routing redo — inte att satsa hela stacken på ett fingeravtryck.

The OrcaRouter model page for z-ai/glm-5.3, showing the model id, capability chips (Tools, JSON, Reasoning), a 1,000,000-token context window, a 128,000-token max output, text input and text output, and pass-through pricing of $1.26 per 1M input tokens and $3.96 per 1M output tokens.