
GLM 5.5 eller GLM 5.3-Vision? En anonym modell som matchar Z.ai:s fingeravtryck har precis dykt upp
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 150 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
En oidentifierad modell vars serveringsprofil — hastighet, tid-till-första-token, cacheträfffrekvens — matchar Z.ai:s GLM-stack har börjat väcka uppmärksamhet hos kapacitetsanalytiker, och den arbetande gissningen är att den kan heta GLM 5.3-Vision eller GLM 5.5. Den 20 augusti skrev compute- och kapacitetsanalytikern teortaxesTex att en anonym modell han följer "tydligt inte är DeepSeek, åtminstone", att "det finns inget som utesluter GLM hittills", och att "hastighet, ttft, cacheträfffrekvens matchar GLM också". Hans bedömning: förvänta sig att den kallas GLM 5.3-Vision eller 5.5, med en poäng på ungefär 61 på Artificial Analysis Intelligence Index — en poäng över där den lanserade GLM-5.3 ligger idag. Inget här är bekräftat. Det finns inget modellkort, inget Z.ai-tillkännagivande och inget API, och denna sida behandlar iakttagelsen för vad den är: en tidig, ej replikerad läckagesignal, värd att följa just eftersom GLM-5.5 har varit den förväntade Z.ai-flaggskeppsmodellen hela månaden och inte har dykt upp. Fem dagar efter det inlägget kom en andra och denna gång fullt verifierbar datapunkt: den 25 augusti öppnade vLLM — den runtime för inferens som ligger bakom de flesta storskaliga modellservrar — en Do-Not-Merge-pull request som möjliggör masked-MHA-kärnstöd för GLM-5-huvuddimensionerna. Den namnger ingen variant och bevisar ingen lansering; det är förberedande arbete i serveringsstacken, den typ av bakgrundsaktivitet som en ny modell lämnar efter sig.
Vad signalen faktiskt säger.
Källan är ett enda X-inlägg från teortaxesTex, daterat den 20 augusti — samma konto vars "ungefär en vecka"-tidssignal för GLM-5.3:s lansering stämde till dagen i augusti. Inramningen är explicit om evidensnivån: "starka bevis (har inte replikerats)." Analytikern utesluter DeepSeek, hittar inget som motsäger GLM, och citerar tre mätningar på tjänstenivå — genomströmning, tid till första token och cacheträffgrad — som matchar Z.ai:s stack. Sedan de två kandidatnamnen, och en prognostiserad poäng: "För närvarande förväntar jag mig att den kallas GLM 5.3-Vision eller 5.5, och får ungefär 61 på AA."
Ta varje del för sig. Identitetspåståendena (inte DeepSeek, matchar GLM) är fingeravtrycksinferens utifrån hur modellen serveras, inte ett modellkort. Poängen är en förväntan, inte en mätning. Namnen är gissningar. Det som gör signalen värd mer än brus är att den är riktningsmässigt förenlig med allt annat vi vet om Z.ai:s färdplan den här månaden: GLM-5.3 levererades endast med text, gemenskapens enskilt mest högljudda önskemål var vision, och GLM-5.5 har rapporterats av flera kanaler (via JPMorgan, Reuters, CGTN och ett Goldman-notat den 18 augusti) som anländande "inom augusti" – månadens final är nu.
Varför serveringsfingeravtrycket spelar roll
Time-to-first-token och cache-träfffrekvens är signaturer på infrastrukturnivå. De bestäms av hur en leverantör bygger sin inferensstack – schemaläggaren, cache-layouten, batchpolicyn – inte av vilket modellnamn en prompt anropar. När en analytiker säger att en anonym modells TTFT och cache-träfffrekvens matchar GLM, menar de att serving-stacken bakom den beter sig som Z.ai:s, vilket är det närmaste ett fingeravtryck man kan komma utan vikter eller ett modellkort. Det är inte bevis. En annan leverantör skulle kunna efterlikna samma stack, eller så kan Z.ai leverera en modell för en partner. Men det är ett specifikt, verifierbart påstående, och förbehållet ”har inte replikerats” talar om att analytikern inte presenterar det som definitivt.
Uteslutningen av DeepSeek spelar också roll. DeepSeek V4 Pro GA:ade den 13 augusti och dess Flash-version har varit den andra snabba kinesiska open-weight-utgåvan denna månad. En anonym modell som utesluter DeepSeek men pekar på GLM begränsar fältet till Z.ais pipeline — och Z.ais pipeline har två tänkbara kandidater, vilket är exakt det vägskäl signalen namnger.
En andra signal: serveringsstacken byggs upp för GLM-5 attention
Den 25 augusti kom en andra datapunkt — den här helt verifierbar. vLLM, körningsmiljön bakom de flesta storskaliga modellservrar, fick pull request #53785, med titeln "[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions." Verifierad mot repot aktiverar den masked-MHA-prefill-vägen för GLM-5:s uppmärksamhetsgeometri: 64 huvuden, en KV-rank på 512, QK-huvuddimension 192+64 och V-huvuddimension 256 — en 256/256 QK/V-layout, enligt PR-beskrivningen. Den beror på en FlashAttention-ändring för maskstöd med huvuddimension 256, pinnar tillfälligt FlashAttention till en fork-commit (vilket är vad Do Not Merge-markeringen är till för), och lägger till benchmarkade routingtrösklar för den nya vägen: FlashMLA rena prefill-gränser på 8K / 20K / 48K / 112K tokens vid TP 1/2/4/8, samt en avrundad 64K-gräns för FlashInfer vid TP8. Författaren noterar att ingen annan öppen PR täckte GLM-5:s masked-MHA-stöd.
Läs det för vad det är: grundarbete i serving-stacken, inte ett tillkännagivande. PR:en namnger inte GLM 5.5 eller GLM 5.3-Vision — den säger "GLM-5" — och att aktivera en masked-MHA-prefill-väg för GLM-5:s huvuddimensioner är infrastrukturarbete på en modellfamilj som vLLM-ekosystemet redan kör över sparse-MLA-vägen (GLM-5.3:s egen härstamning serveras där idag). Det är inte heller isolerat: syskon-PR:er denna månad täckte FlashInfer MLA-dimensionskontroller för GLM-5, en Triton sparse-MLA-fallback för GLM-5-klassmodeller och FlashAttentions rapporterade dimensionsstöd. Två detaljer håller det kvar på en läckagetrackers radar. För det första: den geometri som den riktar in sig på — 64 huvuden, KV-rank 512, 256/256 QK/V — skiljer sig från DeepSeeks 192/128, vilket är samma "inte DeepSeek, matchar GLM"-separation som den anonyma modellens fingeravtryck visar, nu synlig på attention-kernel-nivå. För det andra: tajmingen. PR:en öppnades den 25 augusti, inom samma augustifönster där GLM-5.5 har förväntats hela månaden. Inget av det bevisar att den anonyma modellen är en nästa generations GLM — detta skulle lika gärna kunna vara utvecklingsarbete på modellen som redan släppts — men det är den typen av bakgrundsaktivitet som serving-ekosystemet utför inför en modell, och det är verifierbart på ett sätt som inget X-inlägg är.
Två namn, en fork: GLM 5.3-Vision vs GLM 5.5
De två kandidatidentiteterna är genuint olika produkter, och läckan avgör inte vilken som sitter på kortet.
• GLM 5.3-Vision skulle vara en variant med bildstöd av modellen som släpptes den 14 augusti. GLM-5.3 är endast textinmatning — Artificial Analysis listar den som text in, text ut, utan bildstöd — och det gapet är communityts högljuddaste klagomål. När Z.ais Tang Jie genomförde en global feedbackkampanj återkom kommentarerna i princip enhälligt för vision, och Z.ai har redan byggstenarna (den multimodala modellen GLM-5V-Turbo och CogVLM-kodaren) som Z.ai ännu inte har införlivat i flaggskeppslinjen. En 5.3-Vision-variant skulle vara det snabbaste sättet att stänga det gapet.
GLM 5.5 är själva flaggskeppet. Rapporterade men obekräftade specifikationer pekar på en bas över en biljon parametrar (upp från GLM-5.3:s 743B), ett bibehållet 1M-token-kontext, öppna vikter och ett starkare fokus på agent- och kodningsförmåga. Varje analytikeranteckning den här månaden behandlar 5.5 som den stora – medlet som Z.ai:s medgrundare Tang Jie har antytt ska sluta gapet till Fable-klassens stängda modeller. Den förväntas inom augusti och har inte lanserats i skrivande stund.
Samma fingeravtryck kan inte avgöra vilken av de två det här är — en visionsanpassad 5.3 och ett nytt flaggskepp skulle båda kunna använda samma serveringsstack. Den tvetydigheten är signalens ärliga tillstånd, och de två namnen i analytikerns inlägg återspeglar den snarare än löser den.
<img src="2.png" alt="En jämförelsetavla i två kolumner med titeln 'GLM 5.5 vs GLM-5.3 — poängtavlan'. Vänster kolumn GLM 5.5 (läckt): 'AA Index ~61 (projicerat, overifierat)', 'Status: ej släppt', 'Storlek >1T parametrar (ryktas)', 'Vision: förväntad', 'Kontext: 1M (förväntad)', 'Pris: TBD'. Höger kolumn GLM-5.3 (släppt): 'AA Index 60', 'Status: API live 19 aug', 'Storlek 743B MoE / 40B aktiv', 'Vision: endast text', 'Kontext: 1M', 'Pris: $1.40 / $4.40'. Sidfoten lyder: 'Siffrorna för GLM 5.5 är overifierade projektioner; GLM-5.3 enligt Artificial Analysis.'" />

Vad ett ~61 på AA Intelligence Index skulle innebära
Den projicerade poängen är den vassaste delen av läckan. Artificial Analysis Intelligence Index (v4.1.1) placerar för närvarande GLM-5.3 på 60 — delad ledning med Kimi K3 för den högsta open-weights-poängen, och 7 poäng före GLM-5.2:s 53. En poäng därifrån, på 61, ligger GPT-5.6 Sols territorium, med Claude Fable 5 på 62 och Claude Opus 5 på 63. Enkelt uttryckt: en GLM-modell som får 61 skulle vara den enskilt högsta open-weights-poängen på indexet, helt ensam ovanför Kimi K3 och GLM-5.3, och i praktiken vid gränsen till de stängda frontier-modellerna.
Det är värt att understryka vad 61 inte är. Det är teortaxesTex:s förväntning på vad en oberoende utvärdering kommer att returnera, inte en publicerad Artificial Analysis-poäng och inte ett leverantörsnummer. En prognos kan vara fel i endera riktningen — en visionsvariant kan tappa en poäng eller två på det texttunga indexet, och ett >1T-flaggskepp kan hamna högre eller lägre beroende på hur dess efterträning utfaller. Värdet av siffran är det påstående den kodar: vem denna anonyma modell än visar sig vara, förväntas den slå den nuvarande ledaren med öppna vikter snarare än att endast matcha den.

Vad är bekräftat, och vad är inte
Håll räkenskaperna rena, för en läcka lever eller dör på det.
• Bekräftat: GLM-5.3 är verklig, släpptes den 14 augusti, API:et live den 18/19 augusti, fick 60 på AA Intelligence Index (oberoende uppmätt av Artificial Analysis), prissatt till 1,40 $ / 4,40 $ per 1M tokens, endast textinmatning, med öppna vikter bekräftade till fredag den 28 augusti. Dessa fakta är inte beroende av läckan.
• Bekräftat: GLM-5.5 är fortfarande inte utgiven. I skrivande stund finns inget modellkort, ingen prissättning och ingen tillgänglighet; augustifönstret och siffran på >1T parametrar är analytikerrapporterade, inte Z.ai-åtaganden.
• Obekräftat: att den anonyma modellen finns som en separat produkt, att den är GLM, att dess namn kommer att vara GLM 5.3-Vision eller 5.5, och att den får 61. Alla fyra vilar på en enda analysts oupprepade inlägg.
• Även obekräftat: huruvida denna anonyma modell överhuvudtaget skiljer sig från själva GLM-5.3. En live GLM-5.3-slutpunkt under ett omärkt alias skulle ge samma serveringsfingeravtryck. Tills ett namn, ett modellkort eller en viktnedladdning löser frågan, är tolkningen "ny modell" den starka utgångspunkten men inte ett faktum.
Vad du ska titta på härnäst
• Fredagen den 28 augusti — GLM-5.3-vikterna. Om den anonyma modellen faktiskt är en omdöpt 5.3 eller en 5.3-Vision, kommer viktsläppet och modellkortet att avgöra det snabbt.
• En andra bekräftande observation. En analytikers fingeravtryck är en hypotes; en andra oberoende läsning av samma anonyma post, eller en Artificial Analysis-listning som namnger den, uppgraderar den till bevis.
• Eventuella Z.ai-uttalanden. GLM-5.5 har rapporterats för augustifönstret, och månaden är nästan slut. En officiell namngivning, en prissättningssida eller en post i API-ändringsloggen är händelsen som förvandlar denna läcka till en lanseringsnyhet.
Huruvida AA-poängen materialiseras vid 61. Om den anonyma modellen är verklig och tillhör GLM-familjen, skulle ett oberoende indexvärde nära 61 vara den första siffran från en modell med öppna vikter att passera 60.
• Huruvida vLLM-uppmärksamhetsarbetet får ett modellnamn kopplat. PR #53785 riktar in sig på "GLM-5"-huvuddimensioner utan att nämna 5.3-Vision eller 5.5; en merge, en supported-models-post eller ett modellkort som kopplar den geometrin till ett specifikt namn skulle vara den starkaste signalen hittills.
Hur man agerar vid ett sådant läckage
En läcka är en anledning att förbereda sig, inte att byta plattform. Om nästa GLM-familjsmodell hamnar på eller nära toppen av open-weights-ledartavlan, är den praktiska frågan om man ska dirigera riktig trafik till den — och en obeprövad modell med leverantörspåståenden och en analytikers prognos är precis det fall där du vill ha ett säkerhetsnät snarare än en satsning. GLM-5.3 som släpptes förra veckan är redan live på OrcaRouter — modellsidan visar den till $1.26 / $3.96 per 1M tokens, en 10% lanseringsrabatt från leverantörens listpris på $1.40 / $4.40, överfört med noll påslag — och routerinställningen är vad en 5.5 eller 5.3-Vision skulle ärva den dag den släpps. Rikta en del av trafiken mot den nya modellen genom routern med automatisk failover till en beprövad modell — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — och du får en kvalitetssignal på din egen arbetsbelastning istället för en bildpresentation. Om läckans prognos stämmer, fick du reda på det först; om den är fel, absorberar failover det och inget släpps sönder. Samma nyckel, inget andra kontrakt, och inget behov av att välja mellan de två kandidatnamnen förrän Z.ai gör det.
Nästa GLM är på väg — den enda öppna frågan är vilket namn den bär. GLM 5.3-Vision skulle innebära att Z.ai täpper igen det mest kritiserade gapet i den modell man just släppt; GLM 5.5 skulle vara flaggskeppet med en biljon parametrar som hela månaden har pekat mot. Den anonyma posten teortaxesTex, vars fingeravtryck togs den 20 augusti, är det första konkreta objektet som liknar endera, och dess prognostiserade 61 på AA Intelligence Index skulle placera den före alla öppna viktmodeller som för närvarande finns på listan. Fem dagar efter fingeravtrycket rörde sig också serving-stacken: vLLM:s GLM-5-attention-arbete är precis den typ av grundarbete som en ny modell lämnar efter sig, även om det inte namnger någon variant. Inget av detta är bekräftat, och denna sida uppdateras i samma stund som namnet, modellkortet eller vikterna avgör det. Tills dess är det lågriskiga draget att ha routing redo — inte att satsa hela stacken på ett fingeravtryck.

