
GLM 5.5 o GLM 5.3-Vision? Un Modello Anonimo che Corrisponde all'Impronta di Z.ai è Appena Emerso
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 150 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Un modello non identificato, il cui profilo di serving — velocità, tempo al primo token, tasso di cache hit — corrisponde allo stack GLM di Z.ai, ha iniziato ad attirare l'attenzione degli analisti di capacità, e l'ipotesi di lavoro è che potrebbe chiamarsi GLM 5.3-Vision o GLM 5.5. Il 20 agosto, l'analista di compute e capacità teortaxesTex ha postato che un modello anonimo che sta monitorando «chiaramente non è DeepSeek, almeno», che «finora non c'è nulla che escluda GLM» e che «anche velocità, ttft e tasso di cache hit corrispondono a GLM». La sua lettura: aspettarsi che venga chiamato GLM 5.3-Vision o 5.5, con un punteggio di circa 61 sull'Artificial Analysis Intelligence Index — un punto sopra la posizione attuale del GLM-5.3 rilasciato. Nulla di tutto questo è confermato. Non c'è una model card, nessun annuncio di Z.ai e nessuna API, e questa pagina tratta l'avvistamento per quello che è: un segnale di leak precoce e non replicato, che vale la pena monitorare proprio perché GLM-5.5 è stato per tutto il mese l'ammiraglia attesa di Z.ai e non è ancora apparso. Cinque giorni dopo quel post, è arrivato un secondo dato, questa volta completamente verificabile: il 25 agosto, vLLM — il runtime di inferenza alla base del serving della maggior parte dei modelli su larga scala — ha aperto una pull request Do-Not-Merge che abilita il supporto del kernel masked-MHA per le dimensioni delle head del GLM-5. Non nomina alcuna variante e non prova alcun lancio; è lavoro preparatorio sullo stack di serving, il tipo di attività di sottofondo che un nuovo modello si lascia dietro.
Cosa dice effettivamente il segnale
La fonte è un singolo post su X di teortaxesTex, datato 20 agosto — lo stesso account il cui segnale temporale di "circa una settimana" sul lancio di GLM-5.3 si è rivelato preciso al giorno ad agosto. L'impostazione è esplicita sul livello di evidenza: "forte evidenza (non ho replicato)." L'analista esclude DeepSeek, non trova nulla che contraddica GLM e cita tre misurazioni a livello di servizio — throughput, tempo al primo token e tasso di cache hit — come corrispondenti allo stack di Z.ai. Poi i due nomi candidati e un punteggio previsto: "Attualmente mi aspetto che si chiami GLM 5.3-Vision o 5.5, e che ottenga circa 61 su AA."
Prendi ogni pezzo separatamente. Le affermazioni sull'identità (non DeepSeek, corrisponde a GLM) sono inferenze basate sull'impronta digitale di come il modello viene servito, non una model card. Il punteggio è un'aspettativa, non una misurazione. I nomi sono supposizioni. Ciò che rende il segnale più prezioso del rumore è che è direzionalmente coerente con tutto ciò che sappiamo sulla roadmap di Z.ai di questo mese: GLM-5.3 è stato rilasciato solo in versione testuale, la richiesta più forte e unanime della community era la visione, e GLM-5.5 è stato segnalato da più testate (tramite JPMorgan, Reuters, CGTN e una nota di Goldman del 18 agosto) come in arrivo "entro agosto" — e il gran finale del mese è adesso.
Perché la fingerprint di serving è importante
Il time-to-first-token e il tasso di cache hit sono firme a livello infrastrutturale. Sono determinate da come un fornitore costruisce il proprio stack di inferenza — lo scheduler, l'organizzazione della cache, la politica di batching — non dal nome del modello che un prompt invoca. Quando un analista dice che il TTFT e il tasso di cache hit di un modello anonimo corrispondono a quelli di GLM, sta dicendo che lo stack di serving dietro di esso si comporta come quello di Z.ai, che è la cosa più simile a un'impronta digitale che si possa ottenere senza pesi né model card. Non è una prova. Un altro fornitore potrebbe replicare lo stesso stack, oppure Z.ai potrebbe servire un modello per conto di un partner. Ma è un'affermazione specifica e verificabile, e l'avvertenza «non l'ho replicato» ti dice che l'analista non la presenta come assodata.
Anche l'esclusione di DeepSeek è importante. DeepSeek V4 Pro è andato in GA il 13 agosto e la sua build Flash è stata l'altra release open-weight cinese ad alto ritmo di questo mese. Un modello anonimo che esclude DeepSeek ma punta a GLM restringe il campo alla pipeline di Z.ai — e la pipeline di Z.ai ha due occupanti plausibili, che è esattamente il bivio che il segnale indica.
Un secondo segnale: lo stack di serving si sta costruendo per l'attenzione di GLM-5
Il 25 agosto è arrivato un secondo dato — questa volta completamente verificabile. vLLM, il runtime di inferenza alla base del serving della maggior parte dei modelli su larga scala, ha ricevuto la pull request #53785, dal titolo "[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions." Una verifica sul repository conferma che abilita il percorso di prefill masked-MHA per la geometria di attenzione di GLM-5: 64 teste, un rango KV di 512, dimensione della testa QK 192+64 e dimensione della testa V 256 — un layout QK/V 256/256, come da descrizione della PR. La PR dipende da una modifica di FlashAttention per il supporto della maschera con dimensione della testa 256, fissa temporaneamente FlashAttention a un commit di un fork (è a questo che serve il marcatore Do Not Merge), e aggiunge soglie di routing basate su benchmark per il nuovo percorso: limiti di prefill puro FlashMLA di 8K / 20K / 48K / 112K token con TP 1/2/4/8, e un limite arrotondato di 64K per FlashInfer con TP8. L'autore osserva che nessun'altra PR aperta copriva il supporto masked-MHA di GLM-5.
Leggetelo per quello che è: lavoro di base sullo stack di serving, non un annuncio. La PR non menziona GLM 5.5 né GLM 5.3-Vision — dice "GLM-5" — e abilitare un percorso di prefill masked-MHA per le dimensioni delle testine di GLM-5 è lavoro infrastrutturale su una famiglia che l'ecosistema vLLM già esegue tramite il percorso sparse-MLA (la discendenza di GLM-5.3 è servita lì oggi). Inoltre non è isolata: le PR sorelle di questo mese hanno riguardato i controlli delle dimensioni MLA di FlashInfer per GLM-5, un fallback sparse-MLA in Triton per i modelli di classe GLM-5 e il supporto dimensionale dichiarato di FlashAttention. Due dettagli la tengono sul radar dei tracker di leak. Primo, la geometria che prende di mira — 64 testine, rango KV 512, 256/256 QK/V — è distinta da quella di DeepSeek, 192/128, ed è la stessa separazione "non DeepSeek, corrisponde a GLM" tracciata dall'impronta del modello anonimo, ora visibile a livello di kernel di attenzione. Secondo, i tempi: la PR è stata aperta il 25 agosto, nella stessa finestra di agosto in cui GLM-5.5 è stato atteso per tutto il mese. Nulla di tutto ciò dimostra che il modello anonimo sia un GLM di prossima generazione — potrebbe ugualmente essere ingegneria sul modello già rilasciato — ma è il tipo di attività di sottofondo che l'ecosistema di serving svolge in vista di un modello, ed è verificabile come nessun post su X lo è.
Due nomi, un fork: GLM 5.3-Vision vs GLM 5.5
Le due identità candidate sono prodotti davvero diversi, e la fuga di notizie non chiarisce quale sia sulla scheda.
• GLM 5.3-Vision sarebbe una variante con capacità visive del modello pubblicato il 14 agosto. GLM-5.3 è solo testo in ingresso — Artificial Analysis lo elenca come testo in, testo fuori, nessun supporto immagini — e questa lacuna è la lamentela più forte della comunità. Quando Tang Jie di Z.ai ha condotto una campagna di feedback globale, i commenti erano essenzialmente unanimi per la visione, e Z.ai ha già i mattoni (il modello multimodale GLM-5V-Turbo e l'encoder CogVLM) che non ha ancora integrato nella linea di punta. Una variante 5.3-Vision sarebbe il modo più rapido per colmare questa lacuna.
• GLM 5.5 è l'ammiraglia stessa. Le specifiche riportate ma non confermate indicano una base superiore a mille miliardi di parametri (rispetto ai 743B di GLM-5.3), un contesto da 1M token mantenuto, pesi aperti e un focus più marcato su agenti e coding. Ogni nota degli analisti di questo mese tratta la 5.5 come il grande evento — il veicolo che il co-fondatore di Z.ai, Tang Jie, ha lasciato intendere colmerà il divario con i modelli chiusi di classe Fable. È atteso entro agosto e non è ancora stato rilasciato al momento della scrittura.
La stessa impronta non può rivelarti quale dei due sia — un 5.3 ottimizzato per la visione e un nuovo flagship potrebbero entrambi usare lo stesso stack di serving. Questa ambiguità è lo stato onesto del segnale, e i due nomi nel post dell'analista la riflettono piuttosto che risolverla.
img src="2.png" alt="Un tabellone di confronto a due colonne intitolato 'GLM 5.5 vs GLM-5.3 — il tabellone'. Colonna sinistra GLM 5.5 (divulgato): 'AA Index ~61 (previsto, non verificato)', 'Stato: non rilasciato', 'Dimensione >1T di parametri (presunto)', 'Visione: attesa', 'Contesto: 1M (atteso)', 'Prezzo: TBD'. Colonna destra GLM-5.3 (rilasciato): 'AA Index 60', 'Stato: API live dal 19 agosto', 'Dimensione 743B MoE / 40B attivi', 'Visione: solo testo', 'Contesto: 1M', 'Prezzo: $1.40 / $4.40'. Il piè di pagina riporta 'I dati di GLM 5.5 sono proiezioni non verificate; GLM-5.3 secondo Artificial Analysis.'" />

Cosa significherebbe un ~61 sull'AA Intelligence Index
Il punteggio previsto è la parte più tagliente della fuga. L'Artificial Analysis Intelligence Index (v4.1.1) attualmente colloca GLM-5.3 a 60 — a pari merito con Kimi K3 per il punteggio open-weights più alto, e 7 punti avanti rispetto al 53 di GLM-5.2. Un punto sopra, a 61, si troverebbe il territorio di GPT-5.6 Sol, con Claude Fable 5 a 62 e Claude Opus 5 a 63. In parole povere: un modello della famiglia GLM con un punteggio di 61 sarebbe il punteggio open-weights più alto in assoluto sull'indice, da solo sopra Kimi K3 e GLM-5.3, e di fatto sulla linea della frontiera chiusa.
Vale la pena sottolineare ciò che {{1}}61{{/1}} non è. È l'aspettativa di teortaxesTex su ciò che restituirà una valutazione indipendente, non un punteggio Artificial Analysis pubblicato e non un numero del fornitore. Una proiezione può sbagliarsi in entrambe le direzioni — una variante vision potrebbe scambiare un punto o due sull'indice ricco di testo, e un {{2}}>1T flagship{{/2}} potrebbe atterrare più in alto o più in basso a seconda di come si comporta il post-training. Il valore del numero è l'affermazione che codifica: chiunque si riveli essere questo modello anonimo, ci si aspetta che batta l'attuale leader pesi-aperti piuttosto che limitarsi a eguagliarlo.

Cosa è confermato, e cosa no.
Mantieni pulito il libro mastro, perché un pezzo di perdita vive o muore su quello.
• Confermato: GLM-5.3 è reale, rilasciato il 14 agosto, API attiva dal 18/19 agosto, ha ottenuto 60 nell'AA Intelligence Index (misurato indipendentemente da Artificial Analysis), al prezzo di $1,40 / $4,40 per 1 milione di token, solo testo in input, con pesi aperti confermati per venerdì 28 agosto. Questi fatti non dipendono dalla fuga di notizie.
• Confermato: GLM-5.5 non è ancora stato rilasciato. Al momento in cui scriviamo non ci sono né una scheda del modello, né prezzi, né disponibilità; la finestra di agosto e la cifra di >1T parametri sono state riportate dagli analisti, non sono impegni di Z.ai.
• Non confermato: che il modello anonimo esista come prodotto separato, che sia GLM, che il suo nome sarà GLM 5.3-Vision o 5.5 e che ottenga 61. Tutte e quattro le affermazioni si basano su un post non replicato di un singolo analista.
• Anche non confermato: se questo modello anonimo sia effettivamente distinto da GLM-5.3 stesso. Un endpoint GLM-5.3 attivo sotto un alias non etichettato produrrebbe la stessa impronta di servizio. Finchè un nome, una scheda del modello o un rilascio dei pesi non lo chiarisce, la lettura del "nuovo modello" è il prior forte ma non un fatto.
Cosa guardare dopo
• Venerdì 28 agosto — i pesi di GLM-5.3. Se il modello anonimo è in realtà un 5.3 rinominato o un 5.3-Vision, il rilascio dei pesi e la scheda del modello lo chiariranno rapidamente.
• Una seconda osservazione a conferma. L'impronta di un singolo analista è un'ipotesi; una seconda lettura indipendente della stessa voce anonima, o un elenco di Artificial Analysis che la cita, la eleva a prova.
• Qualsiasi dichiarazione di Z.ai. GLM-5.5 è stato segnalato per la finestra di agosto, e il mese è quasi finito. Una denominazione ufficiale, una pagina dei prezzi o una voce nel changelog API è l'evento che trasforma questa fuga di notizie in una storia di lancio.
• Se il punteggio AA si materializza a 61. Se il modello anonimo è reale e della famiglia GLM, un punteggio indice indipendente vicino a 61 sarebbe il primo numero open-weights a superare 60.
• Se al lavoro sull'attenzione di vLLM viene associato un nome di modello. PR #53785 prende di mira le dimensioni della testa di "GLM-5" senza nominare 5.3-Vision o 5.5; un merge, una voce nei modelli supportati o una model card che associ quella geometria a un nome specifico sarebbe il segnale più forte finora.
Come agire su una fuga di questo tipo
Una fuga di notizie è un motivo per prepararsi, non per cambiare piattaforma. Se il prossimo modello della famiglia GLM si piazzerà in cima o quasi alla classifica dei modelli open-weight, la domanda pratica è se instradare il traffico reale verso di esso — e un modello non testato, con dichiarazioni del fornitore e la proiezione di un singolo analista, è esattamente il caso in cui si vuole una rete di sicurezza piuttosto che una scommessa. Il GLM-5.3 uscito la scorsa settimana è già attivo su OrcaRouter — la pagina del modello lo mostra a $1,26 / $3,96 per 1 milione di token, uno sconto di lancio del 10% rispetto al prezzo di listino del fornitore di $1,40 / $4,40, trasmesso senza alcun ricarico — e la configurazione di routing è quella che un 5.5 o 5.3-Vision erediterebbe il giorno in cui viene rilasciato. Indirizza una parte del traffico verso il nuovo modello attraverso il router con failover automatico su un modello collaudato — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — e ottieni un segnale di qualità sul tuo carico di lavoro reale invece che su una presentazione. Se la proiezione basata sulla fuga di notizie è corretta, lo scopri per primo; se è sbagliata, il failover assorbe il problema e niente viene rilasciato rotto. Stessa chiave, nessun secondo contratto, e nessuna necessità di scegliere tra i due nomi candidati finché non lo fa Z.ai.
Il prossimo GLM è in arrivo — l'unica domanda aperta è con quale nome si presenterà. GLM 5.3-Vision significherebbe che Z.ai colma la lacuna più criticata del modello appena rilasciato; GLM 5.5 sarebbe il modello di punta da mille miliardi di parametri verso cui tutto il mese ha puntato. La voce anonima teortaxesTex, rilevata il 20 agosto, è il primo elemento concreto che somiglia all'uno o all'altro, e il suo punteggio previsto di 61 sull'AA Intelligence Index la collocherebbe davanti a tutti i modelli open-weights attualmente in classifica. Cinque giorni dopo il rilevamento, anche lo stack di serving si è mosso: il lavoro di vLLM sull'attention di GLM-5 è esattamente il tipo di lavoro preparatorio che un nuovo modello lascia dietro di sé, anche se non nomina alcuna variante. Nulla di tutto ciò è confermato, e questa pagina verrà aggiornata nel momento in cui il nome, la scheda o i pesi lo chiariranno. Fino ad allora, la mossa a basso rischio è avere il routing pronto — non scommettere tutto lo stack su un'impronta.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
