Una scheda del titolo in evidenza per GLM-5.3-FlashX vs GLM-5.3-Flash, con sottotitolo 'Stessi pesi, due cartellini del prezzo', con chip che riportano '200 vs 98 tok/s', '$0.37 / $1.25 vs $0.15 / $0.50' e 'Intelligenza identica', e una riga a piè di pagina 'GLM-5.3-FlashX è stato lanciato il 18 settembre 2026'.
Guides & Insights

GLM-5.3-FlashX vs GLM-5.3-Flash: stessi pesi, 2,5× il prezzo, un solo numero diverso

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Non puoi acquistare GLM-5.3-FlashX e ottenere un modello migliore. Non è una critica — è l'intera premessa. GLM-5.3-FlashX, lanciato sull'API di Z.ai il 18 settembre 2026, utilizza gli stessi pesi di GLM-5.3-Flash: la stessa architettura mixture-of-experts da 320B totali e 18B attivi, lo stesso contesto da 1M token, lo stesso input nativo di testo, immagini, video e file, lo stesso limite di output di 131.072 token. Z.ai non ha pubblicato alcun benchmark di FlashX perché non c'è nulla di nuovo da misurare. Ciò che differisce è quanto velocemente vengono generati i token e quanto costano, e quei due numeri sono le uniche cose che un acquirente deve valutare.

Questa è una decisione più netta della maggior parte dei confronti tra modelli, e anche più difficile, perché non c'è alcuna narrazione sulle capacità dietro cui nascondersi. O la latenza vale 2,5× per te, oppure no.

Un modello, due prezzi

• Cos'è FlashX — un livello di serving, non un rilascio di modello; stessi pesi, stessi punteggi, stessi limitibr> • Prezzo di input — $0,37 per 1M di token su FlashX contro $0,15 per 1M su Flash a listinobr> • Prezzo di output — $1,25 per 1M contro $0,50 per 1M, il moltiplicatore che fa davvero muovere una bollettabr> • Input in cache — $0,075 per 1M contro $0,03 per 1Mbr> • Velocità — fino a 200 token di output al secondo (picco dichiarato dal fornitore) contro 98 tok/s misurati indipendentemente da Artificial Analysisbr> • Accesso in abbonamento — GLM-5.3-Flash è incluso nel GLM Coding Plan di Z.ai con quota 3×; FlashX non è inclusobr> • Self-hosting — GLM-5.3-Flash è open weights con licenza MIT su Hugging Face; FlashX non ha pesi da scaricare

A two-column scoreboard titled 'GLM-5.3-FlashX vs GLM-5.3-Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: hosted tier only'; the GLM-5.3-Flash column reads 'Price: $0.15 / $0.50 per 1M', 'Cached input: $0.03 per 1M', 'Speed: 98 tok/s (measured)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: MIT open weights'; the footer reads 'Same weights and same scores; only serving speed and price differ.'

Nel mercato domestico di Z.ai lo stesso rapporto è dichiarato chiaramente: ¥2 in input e ¥7 in output per FlashX contro ¥0,8 e ¥2,8 per Flash. Diverse testate cinesi descrivono il lancio allo stesso modo — 5× la velocità a 2,5× il prezzo — e ognuna di esse nota che l'intelligenza è invariata.

La latenza è una voce di costo a sé stante e non viene tariffata per token.

Il motivo per cui il 2,5× non è automaticamente un cattivo affare è che il prezzo dei token e il costo di un'attività sono quantità diverse. Un job batch che genera un milione di token di output durante la notte paga $0,50 su Flash e $1,25 su FlashX per il solo output, e non ottiene nulla in cambio per i $0,75 extra perché nessuno è in attesa. Un ciclo di agente che effettua dieci chiamate sequenziali paga lo stesso sovrapprezzo per token, ma ogni chiamata ritorna più velocemente, e il risparmio si concretizza in tempo reale anziché in fattura. Se FlashX ritorna davvero in una frazione del tempo, dieci turni possono restituire decine di secondi di latenza per attività — e se quell'attività sta bloccando una persona o un servizio a monte, quei secondi valgono più dei token.

Il posizionamento di Z.ai segue esattamente questa linea. Indirizza FlashX verso il coding ad alta concorrenza, le chiamate agente multi-step, il dialogo in tempo reale, il completamento del codice e il lavoro multimodale a contesto lungo, e rimanda i carichi di lavoro sensibili al prezzo e non sensibili alla latenza — batch offline, generazione in blocco, qualsiasi cosa pianificata — al Flash di base. Questa è la suddivisione corretta, e vale la pena notare che è il fornitore stesso a tracciarla.

Dove il ragionamento cede è sul fronte del throughput. I 200 token al secondo di FlashX sono un picco riportato dal fornitore; i 98 del modello base sono una mediana misurata da un laboratorio indipendente. I picchi si raggiungono su output brevi, con cache calde e un cluster inattivo. Una richiesta multimodale a contesto lungo — esattamente il carico di lavoro per cui FlashX viene proposto — è la meno probabile ad avvicinarsi a quel valore, e nessuno al di fuori di Z.ai ha pubblicato numeri per risolvere la questione. Se il tuo carico di lavoro è limitato dal throughput anziché dalla latenza, un valore di picco ti dice molto poco su ciò che otterrai effettivamente.

La via di fuga che FlashX non ha

C'è una terza opzione in questo confronto, ed esiste solo perché il modello di base è aperto. GLM-5.3-Flash è stato rilasciato il 26 agosto 2026 con licenza MIT, con i pesi disponibili su Hugging Face e ModelScope, ed è oggi servito da stack di inferenza tra cui SGLang, vLLM, TokenSpeed e KTransformers. Se il vostro volume è abbastanza elevato da giustificare l'hardware, il confronto onesto non è Flash contro FlashX — è tra gli 1,25 $ di FlashX per milione di token in output e il vostro costo ammortizzato per token sulle vostre stesse acceleratrici.

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 19, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input, a 2026-08-26 release date by Z.ai, the 320B total / 18B active parameter line, and the billing row reading $0.07 per 1M input and $0.25 per 1M output tokens with a 6.68-second p50 time to first token.

Quell'opzione ha un vero prezzo d'ingresso. Il rilascio FP8 richiede all'incirca 328 GB di memoria GPU per essere servito, il che per la maggior parte dei team significa un deployment multi-nodo e per gli altri è un non-starter. Ma vale la pena dirlo perché è l'asimmetria che rende il prezzo di FlashX una prova deliberata anziché un'inevitabilità: Z.ai applica un sovrapprezzo per una configurazione di serving che, per il modello base, i clienti possono in linea di principio costruirsi da soli. Il sovrapprezzo è per la comodità, non per le capacità, e la comodità ha un prezzo di mercato che scende nel tempo.

Cosa c’è davvero dietro il cambiamento di prezzo

La logica economica dietro il lancio è insolitamente chiara. GLM-5.3-Flash è stato rilasciato a un decimo del prezzo di GLM-5.3 — la metà durante una promozione di lancio — ed è stato ampiamente utilizzato, inclusa una fase di test anonimi prima del rilascio che Z.ai ha poi confermato. FlashX è la prima volta che questa famiglia si muove nella direzione opposta: lo stesso modello, a un prezzo più alto. Gli analisti citati dalla stampa finanziaria cinese lo leggono come un deliberato test commerciale per capire se gli sviluppatori pagheranno per la velocità in quanto tale, dopo un anno trascorso a comprare quote di mercato con capacità quasi all'avanguardia a prezzi da commodity.

Due dettagli supportano questa lettura. FlashX è escluso dal GLM Coding Plan mentre il Flash base è incluso con quota tripla, quindi gli utenti in abbonamento non possono assorbire il nuovo livello in un impegno esistente: pagano per token. E il prezzo è fisso, senza sconto fuori picco, a differenza della struttura basata sull'orario del giorno che alcuni concorrenti usano per riempire la capacità inutilizzata. Un 2,5× fisso su un livello di velocità è un prezzo per chi non può aspettare, e Z.ai sta scoprendo quanti di questi ce ne siano.

Scegliere tra loro

Scegli FlashX se una persona o un servizio è bloccato in attesa del token successivo e il modello stesso è già la scelta giusta — completamento inline, agenti interattivi, chat in tempo reale, qualsiasi cosa in cui la pausa è il prodotto. Scegli GLM-5.3-Flash per lavori batch, offline e in blocco, per qualsiasi cosa tu possa pianificare e per qualsiasi carico di lavoro in cui paghi per il volume di output anziché per la latenza di output. Se il tuo volume è elevato e il tuo team può gestire acceleratori, valuta il costo dei pesi di base self-hosted prima di valutare il costo di FlashX; il confronto è più favorevole di quanto suggeriscano le tariffe per token.

In qualunque modo procediate, considerate i due come intercambiabili nel punto di chiamata. Accettano gli stessi prompt, restituiscono lo stesso formato e producono la stessa qualità — l'unica cosa che cambia è una stringa di modello, che è il tipo più economico di test A/B da eseguire. Su OrcaRouter il prezzo di listino del fornitore viene passato con 0% di ricarico, quindi una modifica dei prezzi o una promozione di Z.ai si applica il giorno stesso in cui va live a monte, ed entrambi i livelli stanno dietro un unico endpoint davanti a oltre 200 modelli. Per una decisione che dipende interamente dalla latenza misurata, poter passare dall'uno all'altro a metà esperimento senza toccare la propria integrazione è la maggior parte del lavoro.

Il verdetto è più ristretto di un normale confronto tra modelli, e questo è il punto. FlashX non è un modello migliore e non pretende di esserlo. È lo stesso modello con una coda più breve, venduto a un prezzo che ha senso solo se la coda era il tuo problema. Misura tu stesso il tuo tempo al primo token su entrambi prima di decidere: il 200 del fornitore è un tetto massimo, il tuo carico di lavoro è l'unico benchmark che conta, e la differenza tra i due livelli è a una modifica di configurazione di distanza.

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 19, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, $0.15 per 1M input and $0.50 per 1M output tokens, and a measured 98 output tokens per second against an average of 71.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno