Una card del titolo generata che recita 'GLM-5.3-Flash Revealed' con il sottotitolo 'il modello multimodale open di frontiera di Zhipu era l'anonimo Ox Alpha — ora a un decimo del prezzo di GLM-5.3', con icone a linee piatte di un chip con fulmine, un badge MIT e un'icona immagine-video.
Guides & Insights

GLM-5.3-Flash Rivelato: L'Anonimo "Ox Alpha" Era Fin dall'Inizio il Modello Multimodale Open di Frontiera di Zhipu

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il modello che ha trascorso una settimana in cima alle classifiche di utilizzo delle piattaforme di coding di terze parti ha finalmente un nome e un prezzo. Il 26 agosto 2026, Zhipu AI ha confermato che il modello gratuito "Ox Alpha" che gli sviluppatori stavano usando intensamente dal 20 agosto è GLM-5.3-Flash — un modello mixture-of-experts con 320 miliardi di parametri totali e 18 miliardi attivi (320B-A18B), la prima release nativamente multimodale della serie GLM-5 e uno dei modelli di livello frontier più economici su qualsiasi tariffario al momento del lancio. Zhipu ha fissato il prezzo di GLM-5.3-Flash a un decimo della tariffa API del suo modello di punta GLM-5.3, o a un ventesimo durante uno sconto a tempo limitato, e i pesi aperti — con licenza MIT — sono stati caricati su Hugging Face lo stesso giorno. A differenza di GLM-5.3, i cui pesi sono ancora previsti per la fine del mese, questo modello può essere auto-ospitato questa settimana, non la prossima.

Ecco la versione breve: Zhipu ha reso open source il suo modello grande più economico finora, supera il proprio GLM-5.2 nei benchmark nonostante utilizzi solo una frazione dei parametri attivi, e il fornitore colloca il suo punteggio Artificial Analysis Intelligence Index a 57 — eguagliando Claude Opus 4.8, secondo i materiali di lancio di Zhipu. Ogni dato di benchmark associato a questo lancio è riportato dal fornitore e non riprodotto al momento della scrittura; i prezzi e i conteggi dei parametri sono fatti attuali.

Cosa è stato effettivamente spedito

GLM-5.3-Flash è un MoE da 320B totali / 18B attivi con 45 layer, il che porta la sua impronta attiva a poco più della metà dei ~32B parametri attivi di GLM-5.2. La capacità di punta è la modalità: accetta nativamente input di testo, immagini e video — il primo modello GLM-5 a farlo — invece di instradare la visione attraverso un adattatore separato. La finestra di contesto arriva a 1 milione di token, e Zhipu sostiene che il costo di servizio per contesti lunghi si aggiri attorno a un terzo di quello di GLM-5.3.

Sul fronte dell'architettura, Zhipu lo descrive come il primo modello frontier open-source a utilizzare un design ibrido sparse-attention-plus-linear-attention, abbinato a Manifold-Constrained Hyper-Connections (mHC) per lo scaling e a un meccanismo IndexPool che comprime quattro vettori chiave dell'indexer in un unico pool pesato per ridurre la latenza nei contesti lunghi. Il pretraining è stato eseguito su un corpus multimodale da 30 trilioni di token. Nessuno di questi aspetti è stato ancora verificato in modo indipendente — è la descrizione che Zhipu fa del proprio modello — ma le affermazioni sull'efficienza di serving sono abbastanza specifiche da poter essere testate una volta che i pesi saranno disponibili per lo stack di inferenza open-source.

La scheda tecnica del giorno del lancio, a colpo d'occhio:

• Parametri — 320B totali / 18B attivi, 45 layer, MoE.

• Modalità — input nativo di testo, immagini e video; output di testo.

• Finestra di contesto — fino a 1.000.000 di token.

• Licenza — MIT, pesi aperti disponibili su Hugging Face al lancio.

• Prezzo — $0.15 / $0.50 per milione di token (input / output), $0.03 per milione di input in cache; una promo con il 50% di sconto fino al 9 settembre 2026 porta tali prezzi a $0.075 / $0.25 / $0.015. Al listino si tratta di circa un decimo dei $1.40 / $4.40 di GLM-5.3.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

La settimana Ox Alpha

La rivelazione chiude una settimana di speculazioni. Il 20 agosto, un modello anonimo è apparso su una piattaforma API di AI di terze parti con una finestra di contesto da 1 milione di token, input di testo/immagini/video e costo zero, ed è diventato rapidamente il modello con il maggior numero di chiamate nelle classifiche settimanali della piattaforma. La community lo ha ricondotto alla famiglia GLM di Zhipu entro 48 ore — lo stesso schema anonimo-e-poi-rivendicato che in precedenza aveva identificato modelli di altri laboratori cinesi — e gli analisti hanno ampiamente ipotizzato una variante Flash del GLM-5.3. L'annuncio del 26 agosto ha confermato l'ipotesi e ha aggiunto il dettaglio che la settimana gratuita era un test intenzionale: Zhipu afferma che l'esecuzione anonima ha stabilito record di volumi di chiamate sulle piattaforme di coding in cui è stata offerta, con tutto il traffico servito da chip prodotti in Cina.

Il contesto della settimana gratuita è rilevante per le aspettative sui prezzi. Un modello offerto a $0 per una settimana, poi lanciato a un decimo del prezzo del modello di punta con uno sconto a tempo limitato che lo riduce a un ventesimo del prezzo, è una mossa deliberata per creare mercato nella fascia economica — e la qualifica "a tempo limitato" è l'elemento da tenere d'occhio. Lo sconto è una decisione sui prezzi che può essere revocata; i pesi aperti MIT no.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

Quanto costa, in dollari reali

Il listino prezzi di Zhipu è stato pubblicato in dollari reali, non solo in rapporti: $0,15 per milione di token di input, $0,50 per milione di token di output e $0,03 per milione di token di input in cache. Rispetto ai prezzi dichiarati di GLM-5.3, pari a $1,40 / $4,40, il risultato è circa un decimo del prezzo di listino, e una promozione di lancio con il 50% di sconto, attiva fino al 9 settembre 2026, lo porta a $0,075 / $0,25 / $0,015 — circa un ventesimo. Zhipu indica inoltre il costo del modello per attività dell'AA Intelligence Index a circa $0,045, secondo quanto riportato dal fornitore, ed è questo il numero dietro l'inquadramento "1/40 di Opus 4.8". Per un modello che ottiene punteggi nella stessa fascia di modelli con prezzi 10–40 volte superiori, l'economia complessiva è reale; la clausola in piccolo è che lo sconto di lancio è temporaneo e il costo per attività dipende da quanto verboso si rivelerà il modello in produzione.

La storia dell'efficienza è il punto da cui Zhipu sostiene derivi il vantaggio in termini di costi. Rispetto a GLM-5.3, il vendor riporta un compute dell'attenzione ridotto di 3,0x e una KV cache ridotta di 4,4x, e dichiara il compute dell'attenzione più basso tra i modelli di fascia budget confrontati — GLM-5.3, DeepSeek V4 Flash e Kimi K3 — pur ammettendo che la sua KV cache è ancora leggermente più grande di quella di DeepSeek V4 Flash e Kimi K3. Sul fronte del serving, Zhipu riporta un miglioramento di 3x nelle prestazioni end-to-end del serving rispetto alla baseline su chip cinesi domestici, raggiungendo un costo per token che definisce paragonabile a quello delle GPU NVIDIA mainstream. Si tratta di dati dichiarati dal vendor e nessuno di essi è stato ancora riprodotto in modo indipendente; sono i numeri giusti da verificare rispetto ai pesi open.

Perché la rivelazione conta

Messi da parte i benchmark, il lancio cambia comunque il panorama dei modelli open in due modi. In primo luogo, è un modello multimodale a pesi aperti nella fascia frontier a un prezzo contenuto — la combinazione di licenza MIT, contesto da 1M, input nativo di immagini/video e costo di pochi centesimi per attività non ha equivalenti diretti nei laboratori frontier statunitensi, i cui modelli multimodali equivalenti costano un ordine di grandezza in più e vengono distribuiti in modalità chiusa. In secondo luogo, scalza il modello di punta di Zhipu: GLM-5.3 è il modello da 743B che questo mese ha ottenuto un punteggio di 60, misurato in modo indipendente, sull'AA Intelligence Index, e GLM-5.3-Flash è posizionato come "frontier intelligence, flash cost" in contrapposizione alla stessa famiglia. La tesi di Zhipu è che un modello più piccolo ed economico possa catturare gran parte delle capacità del modello di punta — il che, se le affermazioni del vendor su coding e capacità agentiche reggono, è lo stesso argomento dell'economia post-addestramento attorno a cui il settore gira da tutto l'anno.

Un'avvertenza mantiene tutto nella giusta prospettiva. Il punteggio AA Index di 57 di GLM-5.3-Flash proviene dai materiali di lancio di Zhipu, non ancora dalla classifica di Artificial Analysis, e il confronto sulla programmazione con Claude Opus 4.8 è basato sulla valutazione interna Z.ai Code Bench di Zhipu. Considera il 57 e la parità di coding come dichiarazioni finché non arriveranno misurazioni indipendenti — il modello è stato ampiamente testato in forma anonima, quindi i numeri di terze parti dovrebbero arrivare rapidamente.

Provalo e come si inserisce il livello di routing.

L'accesso dal primo giorno avviene tramite l'API proprietaria di Zhipu, i pesi aperti su Hugging Face (zai-org/GLM-5.3-Flash, MIT) e i prodotti di coding di Zhipu — ZCode e il GLM Coding Plan, che include una serie di schede di esperienza giornaliere. Per il self-hosting, la licenza MIT e il supporto per vLLM e SGLang rendono le affermazioni sull'efficienza di serving sopra menzionate direttamente verificabili.

Sul lato routing, GLM-5.3-Flash stesso non è ancora nell'elenco di OrcaRouter alla data di questo aggiornamento. Il resto della famiglia GLM invece sì: GLM-5.3 è andato online dal nostro lato lo stesso giorno in cui è stata aperta l'API di Zhipu, al prezzo di listino di Zhipu con margine dello 0%. Questo trasferimento diretto è esattamente il meccanismo che conta per un lancio come questo — una variazione di prezzo del fornitore, sia che lo sconto venga mantenuto sia che la tariffa cambi in seguito, si riflette dal nostro lato lo stesso giorno, senza rinegoziazione. Se vuoi eseguire Flash insieme al resto della linea GLM con un'unica chiave quando sarà disponibile, questa è la configurazione; fino ad allora, i pesi su Hugging Face sono il modo più rapido per testarlo tu stesso.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

Cosa guardare dopo

Tre cose chiariranno la vera storia nelle prossime due settimane. In primo luogo, una misurazione indipendente di Artificial Analysis del 57 — il modello era già in esecuzione pubblica come Ox Alpha, quindi la classifica dovrebbe aggiornarsi rapidamente. In secondo luogo, se la promozione con il 50% di sconto — attualmente prevista per terminare il 9 settembre 2026 — verrà estesa oltre quella data, poiché ciò determina il costo a regime di Flash. In terzo luogo, i pesi di GLM-5.3, ancora promessi per circa il 28 agosto — la stessa settimana in cui sono stati rilasciati i pesi MIT di Flash, il che darebbe alla comunità open-weights due livelli della stessa famiglia da confrontare contemporaneamente.

Confrontati in questo articolo3

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube