La hero card dell'articolo con il titolo 'GLM 5.5 o GLM 5.3-Vision?', il sottotitolo 'Un modello anonimo che corrisponde all'impronta digitale di Z.ai è appena emerso' e il badge 'LEAK — non verificato', su un delicato gradiente bianco e blu con un sottile motivo a rete neurale e un elemento a punto interrogativo.
Guides & Insights

GLM 5.5 o GLM 5.3-Vision? Un Modello Anonimo che Corrisponde all'Impronta di Z.ai è Appena Emerso

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Un modello non identificato, il cui profilo di serving — velocità, tempo al primo token, tasso di cache hit — corrisponde allo stack G​LM di Z.ai, ha iniziato ad attirare l'attenzione degli analisti di capacità, e l'ipotesi di lavoro è che potrebbe chiamarsi GLM 5.3-Vision o GLM 5.5. Il 20 agosto, l'analista di compute e capacità teortaxesTex ha postato che un modello anonimo che sta monitorando «chiaramente non è Dee​pSeek, almeno», che «finora non c'è nulla che escluda G​LM» e che «anche velocità, ttft e tasso di cache hit corrispondono a G​LM». La sua lettura: aspettarsi che venga chiamato GLM 5.3-Vision o 5.5, con un punteggio di circa 61 sull'Artificial Analysis Intelligence Index — un punto sopra la posizione attuale del GLM-5.3 rilasciato. Nulla di tutto questo è confermato. Non c'è una model card, nessun annuncio di Z.ai e nessuna API, e questa pagina tratta l'avvistamento per quello che è: un segnale di leak precoce e non replicato, che vale la pena monitorare proprio perché GLM-5.5 è stato per tutto il mese l'ammiraglia attesa di Z.ai e non è ancora apparso. Cinque giorni dopo quel post, è arrivato un secondo dato, questa volta completamente verificabile: il 25 agosto, vLLM — il runtime di inferenza alla base del serving della maggior parte dei modelli su larga scala — ha aperto una pull request Do-Not-Merge che abilita il supporto del kernel masked-MHA per le dimensioni delle head del G​LM-5. Non nomina alcuna variante e non prova alcun lancio; è lavoro preparatorio sullo stack di serving, il tipo di attività di sottofondo che un nuovo modello si lascia dietro.

Cosa dice effettivamente il segnale

La fonte è un singolo post su X di teortaxesTex, datato 20 agosto — lo stesso account il cui segnale temporale di "circa una settimana" sul lancio di GLM-5.3 si è rivelato preciso al giorno ad agosto. L'impostazione è esplicita sul livello di evidenza: "forte evidenza (non ho replicato)." L'analista esclude Dee​pSeek, non trova nulla che contraddica G​LM e cita tre misurazioni a livello di servizio — throughput, tempo al primo token e tasso di cache hit — come corrispondenti allo stack di Z.ai. Poi i due nomi candidati e un punteggio previsto: "Attualmente mi aspetto che si chiami GLM 5.3-Vision o 5.5, e che ottenga circa 61 su AA."

Prendi ogni pezzo separatamente. Le affermazioni sull'identità (non Dee​pSeek, corrisponde a G​LM) sono inferenze basate sull'impronta digitale di come il modello viene servito, non una model card. Il punteggio è un'aspettativa, non una misurazione. I nomi sono supposizioni. Ciò che rende il segnale più prezioso del rumore è che è direzionalmente coerente con tutto ciò che sappiamo sulla roadmap di Z.ai di questo mese: GLM-5.3 è stato rilasciato solo in versione testuale, la richiesta più forte e unanime della community era la visione, e GLM-5.5 è stato segnalato da più testate (tramite JPMorgan, Reuters, CGTN e una nota di Goldman del 18 agosto) come in arrivo "entro agosto" — e il gran finale del mese è adesso.

Perché la fingerprint di serving è importante

Il time-to-first-token e il tasso di cache hit sono firme a livello infrastrutturale. Sono determinate da come un fornitore costruisce il proprio stack di inferenza — lo scheduler, l'organizzazione della cache, la politica di batching — non dal nome del modello che un prompt invoca. Quando un analista dice che il TTFT e il tasso di cache hit di un modello anonimo corrispondono a quelli di G​LM, sta dicendo che lo stack di serving dietro di esso si comporta come quello di Z.ai, che è la cosa più simile a un'impronta digitale che si possa ottenere senza pesi né model card. Non è una prova. Un altro fornitore potrebbe replicare lo stesso stack, oppure Z.ai potrebbe servire un modello per conto di un partner. Ma è un'affermazione specifica e verificabile, e l'avvertenza «non l'ho replicato» ti dice che l'analista non la presenta come assodata.

Anche l'esclusione di Dee​pSeek è importante. DeepSeek V4 Pro è andato in GA il 13 agosto e la sua build Flash è stata l'altra release open-weight cinese ad alto ritmo di questo mese. Un modello anonimo che esclude Dee​pSeek ma punta a G​LM restringe il campo alla pipeline di Z.ai — e la pipeline di Z.ai ha due occupanti plausibili, che è esattamente il bivio che il segnale indica.

Un secondo segnale: lo stack di serving si sta costruendo per l'attenzione di GLM-5

Il 25 agosto è arrivato un secondo dato — questa volta completamente verificabile. vLLM, il runtime di inferenza alla base del serving della maggior parte dei modelli su larga scala, ha ricevuto la pull request #53785, dal titolo "[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions." Una verifica sul repository conferma che abilita il percorso di prefill masked-MHA per la geometria di attenzione di G​LM-5: 64 teste, un rango KV di 512, dimensione della testa QK 192+64 e dimensione della testa V 256 — un layout QK/V 256/256, come da descrizione della PR. La PR dipende da una modifica di FlashAttention per il supporto della maschera con dimensione della testa 256, fissa temporaneamente FlashAttention a un commit di un fork (è a questo che serve il marcatore Do Not Merge), e aggiunge soglie di routing basate su benchmark per il nuovo percorso: limiti di prefill puro FlashMLA di 8K / 20K / 48K / 112K token con TP 1/2/4/8, e un limite arrotondato di 64K per FlashInfer con TP8. L'autore osserva che nessun'altra PR aperta copriva il supporto masked-MHA di G​LM-5.

Leggetelo per quello che è: lavoro di base sullo stack di serving, non un annuncio. La PR non menziona GLM 5.5 né GLM 5.3-Vision — dice "GLM-5" — e abilitare un percorso di prefill masked-MHA per le dimensioni delle testine di G​LM-5 è lavoro infrastrutturale su una famiglia che l'ecosistema vLLM già esegue tramite il percorso sparse-MLA (la discendenza di GLM-5.3 è servita lì oggi). Inoltre non è isolata: le PR sorelle di questo mese hanno riguardato i controlli delle dimensioni MLA di FlashInfer per GLM-5, un fallback sparse-MLA in Triton per i modelli di classe GLM-5 e il supporto dimensionale dichiarato di FlashAttention. Due dettagli la tengono sul radar dei tracker di leak. Primo, la geometria che prende di mira — 64 testine, rango KV 512, 256/256 QK/V — è distinta da quella di Dee​pSeek, 192/128, ed è la stessa separazione "non Dee​pSeek, corrisponde a G​LM" tracciata dall'impronta del modello anonimo, ora visibile a livello di kernel di attenzione. Secondo, i tempi: la PR è stata aperta il 25 agosto, nella stessa finestra di agosto in cui GLM-5.5 è stato atteso per tutto il mese. Nulla di tutto ciò dimostra che il modello anonimo sia un G​LM di prossima generazione — potrebbe ugualmente essere ingegneria sul modello già rilasciato — ma è il tipo di attività di sottofondo che l'ecosistema di serving svolge in vista di un modello, ed è verificabile come nessun post su X lo è.

Due nomi, un fork: GLM 5.3-Vision vs GLM 5.5

Le due identità candidate sono prodotti davvero diversi, e la fuga di notizie non chiarisce quale sia sulla scheda.

• GLM 5.3-Vision sarebbe una variante con capacità visive del modello pubblicato il 14 agosto. GLM-5.3 è solo testo in ingresso — Artificial Analysis lo elenca come testo in, testo fuori, nessun supporto immagini — e questa lacuna è la lamentela più forte della comunità. Quando Tang Jie di Z.ai ha condotto una campagna di feedback globale, i commenti erano essenzialmente unanimi per la visione, e Z.ai ha già i mattoni (il modello multimodale GLM-5V-Turbo e l'encoder CogVLM) che non ha ancora integrato nella linea di punta. Una variante 5.3-Vision sarebbe il modo più rapido per colmare questa lacuna.

• GLM 5.5 è l'ammiraglia stessa. Le specifiche riportate ma non confermate indicano una base superiore a mille miliardi di parametri (rispetto ai 743B di GLM-5.3), un contesto da 1M token mantenuto, pesi aperti e un focus più marcato su agenti e coding. Ogni nota degli analisti di questo mese tratta la 5.5 come il grande evento — il veicolo che il co-fondatore di Z.ai, Tang Jie, ha lasciato intendere colmerà il divario con i modelli chiusi di classe Fable. È atteso entro agosto e non è ancora stato rilasciato al momento della scrittura.

La stessa impronta non può rivelarti quale dei due sia — un 5.3 ottimizzato per la visione e un nuovo flagship potrebbero entrambi usare lo stesso stack di serving. Questa ambiguità è lo stato onesto del segnale, e i due nomi nel post dell'analista la riflettono piuttosto che risolverla.

img src="2.png" alt="Un tabellone di confronto a due colonne intitolato 'GLM 5.5 vs GLM-5.3 — il tabellone'. Colonna sinistra GLM 5.5 (divulgato): 'AA Index ~61 (previsto, non verificato)', 'Stato: non rilasciato', 'Dimensione >1T di parametri (presunto)', 'Visione: attesa', 'Contesto: 1M (atteso)', 'Prezzo: TBD'. Colonna destra GLM-5.3 (rilasciato): 'AA Index 60', 'Stato: API live dal 19 agosto', 'Dimensione 743B MoE / 40B attivi', 'Visione: solo testo', 'Contesto: 1M', 'Prezzo: $1.40 / $4.40'. Il piè di pagina riporta 'I dati di GLM 5.5 sono proiezioni non verificate; GLM-5.3 secondo Artificial Analysis.'" />

A two-column comparison scoreboard titled 'GLM 5.5 vs GLM-5.3 — the scoreboard'. Left column GLM 5.5 (leaked): 'AA Index: ~61 (projected)', 'Status: unreleased', 'Size: >1T params (rumored)', 'Vision: expected', 'Context: 1M (expected)', 'Price: TBD'. Right column GLM-5.3 (shipped): 'AA Index: 60', 'Status: API live Aug 19', 'Size: 743B MoE / 40B active', 'Vision: text-only', 'Context: 1M', 'Price: $1.40 / $4.40'. Footer reads 'GLM 5.5 figures are unverified projections; GLM-5.3 per Artificial Analysis.'

Cosa significherebbe un ~61 sull'AA Intelligence Index

Il punteggio previsto è la parte più tagliente della fuga. L'Artificial Analysis Intelligence Index (v4.1.1) attualmente colloca GLM-5.3 a 60 — a pari merito con Kimi K3 per il punteggio open-weights più alto, e 7 punti avanti rispetto al 53 di GLM-5.2. Un punto sopra, a 61, si troverebbe il territorio di GPT-5.6 Sol, con Claude Fable 5 a 62 e Claude Opus 5 a 63. In parole povere: un modello della famiglia G​LM con un punteggio di 61 sarebbe il punteggio open-weights più alto in assoluto sull'indice, da solo sopra Kimi K3 e GLM-5.3, e di fatto sulla linea della frontiera chiusa.

Vale la pena sottolineare ciò che {{1}}61{{/1}} non è. È l'aspettativa di teortaxesTex su ciò che restituirà una valutazione indipendente, non un punteggio Artificial Analysis pubblicato e non un numero del fornitore. Una proiezione può sbagliarsi in entrambe le direzioni — una variante vision potrebbe scambiare un punto o due sull'indice ricco di testo, e un {{2}}>1T flagship{{/2}} potrebbe atterrare più in alto o più in basso a seconda di come si comporta il post-training. Il valore del numero è l'affermazione che codifica: chiunque si riveli essere questo modello anonimo, ci si aspetta che batta l'attuale leader pesi-aperti piuttosto che limitarsi a eguagliarlo.

A screenshot of the Artificial Analysis page for GLM-5.3 (max) showing an Intelligence Index of 60 (well above the median of 35), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, a 1M-token context window, and summary text describing the model as leading in intelligence and reasonably priced.

Cosa è confermato, e cosa no.

Mantieni pulito il libro mastro, perché un pezzo di perdita vive o muore su quello.

• Confermato: GLM-5.3 è reale, rilasciato il 14 agosto, API attiva dal 18/19 agosto, ha ottenuto 60 nell'AA Intelligence Index (misurato indipendentemente da Artificial Analysis), al prezzo di $1,40 / $4,40 per 1 milione di token, solo testo in input, con pesi aperti confermati per venerdì 28 agosto. Questi fatti non dipendono dalla fuga di notizie.

• Confermato: GLM-5.5 non è ancora stato rilasciato. Al momento in cui scriviamo non ci sono né una scheda del modello, né prezzi, né disponibilità; la finestra di agosto e la cifra di >1T parametri sono state riportate dagli analisti, non sono impegni di Z.ai.

• Non confermato: che il modello anonimo esista come prodotto separato, che sia G​LM, che il suo nome sarà GLM 5.3-Vision o 5.5 e che ottenga 61. Tutte e quattro le affermazioni si basano su un post non replicato di un singolo analista.

• Anche non confermato: se questo modello anonimo sia effettivamente distinto da GLM-5.3 stesso. Un endpoint GLM-5.3 attivo sotto un alias non etichettato produrrebbe la stessa impronta di servizio. Finchè un nome, una scheda del modello o un rilascio dei pesi non lo chiarisce, la lettura del "nuovo modello" è il prior forte ma non un fatto.

Cosa guardare dopo

• Venerdì 28 agosto — i pesi di GLM-5.3. Se il modello anonimo è in realtà un 5.3 rinominato o un 5.3-Vision, il rilascio dei pesi e la scheda del modello lo chiariranno rapidamente.

• Una seconda osservazione a conferma. L'impronta di un singolo analista è un'ipotesi; una seconda lettura indipendente della stessa voce anonima, o un elenco di Artificial Analysis che la cita, la eleva a prova.

• Qualsiasi dichiarazione di Z.ai. GLM-5.5 è stato segnalato per la finestra di agosto, e il mese è quasi finito. Una denominazione ufficiale, una pagina dei prezzi o una voce nel changelog API è l'evento che trasforma questa fuga di notizie in una storia di lancio.

• Se il punteggio AA si materializza a 61. Se il modello anonimo è reale e della famiglia G​LM, un punteggio indice indipendente vicino a 61 sarebbe il primo numero open-weights a superare 60.

• Se al lavoro sull'attenzione di vLLM viene associato un nome di modello. PR #53785 prende di mira le dimensioni della testa di "GLM-5" senza nominare 5.3-Vision o 5.5; un merge, una voce nei modelli supportati o una model card che associ quella geometria a un nome specifico sarebbe il segnale più forte finora.

Come agire su una fuga di questo tipo

Una fuga di notizie è un motivo per prepararsi, non per cambiare piattaforma. Se il prossimo modello della famiglia G​LM si piazzerà in cima o quasi alla classifica dei modelli open-weight, la domanda pratica è se instradare il traffico reale verso di esso — e un modello non testato, con dichiarazioni del fornitore e la proiezione di un singolo analista, è esattamente il caso in cui si vuole una rete di sicurezza piuttosto che una scommessa. Il GLM-5.3 uscito la scorsa settimana è già attivo su OrcaRouter — la pagina del modello lo mostra a $1,26 / $3,96 per 1 milione di token, uno sconto di lancio del 10% rispetto al prezzo di listino del fornitore di $1,40 / $4,40, trasmesso senza alcun ricarico — e la configurazione di routing è quella che un 5.5 o 5.3-Vision erediterebbe il giorno in cui viene rilasciato. Indirizza una parte del traffico verso il nuovo modello attraverso il router con failover automatico su un modello collaudato — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — e ottieni un segnale di qualità sul tuo carico di lavoro reale invece che su una presentazione. Se la proiezione basata sulla fuga di notizie è corretta, lo scopri per primo; se è sbagliata, il failover assorbe il problema e niente viene rilasciato rotto. Stessa chiave, nessun secondo contratto, e nessuna necessità di scegliere tra i due nomi candidati finché non lo fa Z.ai.

Il prossimo G​LM è in arrivo — l'unica domanda aperta è con quale nome si presenterà. GLM 5.3-Vision significherebbe che Z.ai colma la lacuna più criticata del modello appena rilasciato; GLM 5.5 sarebbe il modello di punta da mille miliardi di parametri verso cui tutto il mese ha puntato. La voce anonima teortaxesTex, rilevata il 20 agosto, è il primo elemento concreto che somiglia all'uno o all'altro, e il suo punteggio previsto di 61 sull'AA Intelligence Index la collocherebbe davanti a tutti i modelli open-weights attualmente in classifica. Cinque giorni dopo il rilevamento, anche lo stack di serving si è mosso: il lavoro di vLLM sull'attention di G​LM-5 è esattamente il tipo di lavoro preparatorio che un nuovo modello lascia dietro di sé, anche se non nomina alcuna variante. Nulla di tutto ciò è confermato, e questa pagina verrà aggiornata nel momento in cui il nome, la scheda o i pesi lo chiariranno. Fino ad allora, la mossa a basso rischio è avere il routing pronto — non scommettere tutto lo stack su un'impronta.

The OrcaRouter model page for z-ai/glm-5.3, showing the model id, capability chips (Tools, JSON, Reasoning), a 1,000,000-token context window, a 128,000-token max output, text input and text output, and pass-through pricing of $1.26 per 1M input tokens and $3.96 per 1M output tokens.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno