
GLM-5.3-FlashX vs GLM-5.3-Flash: stessi pesi, 2,5× il prezzo, un solo numero diverso
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Non puoi acquistare GLM-5.3-FlashX e ottenere un modello migliore. Non è una critica — è l'intera premessa. GLM-5.3-FlashX, lanciato sull'API di Z.ai il 18 settembre 2026, utilizza gli stessi pesi di GLM-5.3-Flash: la stessa architettura mixture-of-experts da 320B totali e 18B attivi, lo stesso contesto da 1M token, lo stesso input nativo di testo, immagini, video e file, lo stesso limite di output di 131.072 token. Z.ai non ha pubblicato alcun benchmark di FlashX perché non c'è nulla di nuovo da misurare. Ciò che differisce è quanto velocemente vengono generati i token e quanto costano, e quei due numeri sono le uniche cose che un acquirente deve valutare.
Questa è una decisione più netta della maggior parte dei confronti tra modelli, e anche più difficile, perché non c'è alcuna narrazione sulle capacità dietro cui nascondersi. O la latenza vale 2,5× per te, oppure no.
Un modello, due prezzi
• Cos'è FlashX — un livello di serving, non un rilascio di modello; stessi pesi, stessi punteggi, stessi limitibr> • Prezzo di input — $0,37 per 1M di token su FlashX contro $0,15 per 1M su Flash a listinobr> • Prezzo di output — $1,25 per 1M contro $0,50 per 1M, il moltiplicatore che fa davvero muovere una bollettabr> • Input in cache — $0,075 per 1M contro $0,03 per 1Mbr> • Velocità — fino a 200 token di output al secondo (picco dichiarato dal fornitore) contro 98 tok/s misurati indipendentemente da Artificial Analysisbr> • Accesso in abbonamento — GLM-5.3-Flash è incluso nel GLM Coding Plan di Z.ai con quota 3×; FlashX non è inclusobr> • Self-hosting — GLM-5.3-Flash è open weights con licenza MIT su Hugging Face; FlashX non ha pesi da scaricare

Nel mercato domestico di Z.ai lo stesso rapporto è dichiarato chiaramente: ¥2 in input e ¥7 in output per FlashX contro ¥0,8 e ¥2,8 per Flash. Diverse testate cinesi descrivono il lancio allo stesso modo — 5× la velocità a 2,5× il prezzo — e ognuna di esse nota che l'intelligenza è invariata.
La latenza è una voce di costo a sé stante e non viene tariffata per token.
Il motivo per cui il 2,5× non è automaticamente un cattivo affare è che il prezzo dei token e il costo di un'attività sono quantità diverse. Un job batch che genera un milione di token di output durante la notte paga $0,50 su Flash e $1,25 su FlashX per il solo output, e non ottiene nulla in cambio per i $0,75 extra perché nessuno è in attesa. Un ciclo di agente che effettua dieci chiamate sequenziali paga lo stesso sovrapprezzo per token, ma ogni chiamata ritorna più velocemente, e il risparmio si concretizza in tempo reale anziché in fattura. Se FlashX ritorna davvero in una frazione del tempo, dieci turni possono restituire decine di secondi di latenza per attività — e se quell'attività sta bloccando una persona o un servizio a monte, quei secondi valgono più dei token.
Il posizionamento di Z.ai segue esattamente questa linea. Indirizza FlashX verso il coding ad alta concorrenza, le chiamate agente multi-step, il dialogo in tempo reale, il completamento del codice e il lavoro multimodale a contesto lungo, e rimanda i carichi di lavoro sensibili al prezzo e non sensibili alla latenza — batch offline, generazione in blocco, qualsiasi cosa pianificata — al Flash di base. Questa è la suddivisione corretta, e vale la pena notare che è il fornitore stesso a tracciarla.
Dove il ragionamento cede è sul fronte del throughput. I 200 token al secondo di FlashX sono un picco riportato dal fornitore; i 98 del modello base sono una mediana misurata da un laboratorio indipendente. I picchi si raggiungono su output brevi, con cache calde e un cluster inattivo. Una richiesta multimodale a contesto lungo — esattamente il carico di lavoro per cui FlashX viene proposto — è la meno probabile ad avvicinarsi a quel valore, e nessuno al di fuori di Z.ai ha pubblicato numeri per risolvere la questione. Se il tuo carico di lavoro è limitato dal throughput anziché dalla latenza, un valore di picco ti dice molto poco su ciò che otterrai effettivamente.
La via di fuga che FlashX non ha
C'è una terza opzione in questo confronto, ed esiste solo perché il modello di base è aperto. GLM-5.3-Flash è stato rilasciato il 26 agosto 2026 con licenza MIT, con i pesi disponibili su Hugging Face e ModelScope, ed è oggi servito da stack di inferenza tra cui SGLang, vLLM, TokenSpeed e KTransformers. Se il vostro volume è abbastanza elevato da giustificare l'hardware, il confronto onesto non è Flash contro FlashX — è tra gli 1,25 $ di FlashX per milione di token in output e il vostro costo ammortizzato per token sulle vostre stesse acceleratrici.

Quell'opzione ha un vero prezzo d'ingresso. Il rilascio FP8 richiede all'incirca 328 GB di memoria GPU per essere servito, il che per la maggior parte dei team significa un deployment multi-nodo e per gli altri è un non-starter. Ma vale la pena dirlo perché è l'asimmetria che rende il prezzo di FlashX una prova deliberata anziché un'inevitabilità: Z.ai applica un sovrapprezzo per una configurazione di serving che, per il modello base, i clienti possono in linea di principio costruirsi da soli. Il sovrapprezzo è per la comodità, non per le capacità, e la comodità ha un prezzo di mercato che scende nel tempo.
Cosa c’è davvero dietro il cambiamento di prezzo
La logica economica dietro il lancio è insolitamente chiara. GLM-5.3-Flash è stato rilasciato a un decimo del prezzo di GLM-5.3 — la metà durante una promozione di lancio — ed è stato ampiamente utilizzato, inclusa una fase di test anonimi prima del rilascio che Z.ai ha poi confermato. FlashX è la prima volta che questa famiglia si muove nella direzione opposta: lo stesso modello, a un prezzo più alto. Gli analisti citati dalla stampa finanziaria cinese lo leggono come un deliberato test commerciale per capire se gli sviluppatori pagheranno per la velocità in quanto tale, dopo un anno trascorso a comprare quote di mercato con capacità quasi all'avanguardia a prezzi da commodity.
Due dettagli supportano questa lettura. FlashX è escluso dal GLM Coding Plan mentre il Flash base è incluso con quota tripla, quindi gli utenti in abbonamento non possono assorbire il nuovo livello in un impegno esistente: pagano per token. E il prezzo è fisso, senza sconto fuori picco, a differenza della struttura basata sull'orario del giorno che alcuni concorrenti usano per riempire la capacità inutilizzata. Un 2,5× fisso su un livello di velocità è un prezzo per chi non può aspettare, e Z.ai sta scoprendo quanti di questi ce ne siano.
Scegliere tra loro
Scegli FlashX se una persona o un servizio è bloccato in attesa del token successivo e il modello stesso è già la scelta giusta — completamento inline, agenti interattivi, chat in tempo reale, qualsiasi cosa in cui la pausa è il prodotto. Scegli GLM-5.3-Flash per lavori batch, offline e in blocco, per qualsiasi cosa tu possa pianificare e per qualsiasi carico di lavoro in cui paghi per il volume di output anziché per la latenza di output. Se il tuo volume è elevato e il tuo team può gestire acceleratori, valuta il costo dei pesi di base self-hosted prima di valutare il costo di FlashX; il confronto è più favorevole di quanto suggeriscano le tariffe per token.
In qualunque modo procediate, considerate i due come intercambiabili nel punto di chiamata. Accettano gli stessi prompt, restituiscono lo stesso formato e producono la stessa qualità — l'unica cosa che cambia è una stringa di modello, che è il tipo più economico di test A/B da eseguire. Su OrcaRouter il prezzo di listino del fornitore viene passato con 0% di ricarico, quindi una modifica dei prezzi o una promozione di Z.ai si applica il giorno stesso in cui va live a monte, ed entrambi i livelli stanno dietro un unico endpoint davanti a oltre 200 modelli. Per una decisione che dipende interamente dalla latenza misurata, poter passare dall'uno all'altro a metà esperimento senza toccare la propria integrazione è la maggior parte del lavoro.
Il verdetto è più ristretto di un normale confronto tra modelli, e questo è il punto. FlashX non è un modello migliore e non pretende di esserlo. È lo stesso modello con una coda più breve, venduto a un prezzo che ha senso solo se la coda era il tuo problema. Misura tu stesso il tuo tempo al primo token su entrambi prima di decidere: il 200 del fornitore è un tetto massimo, il tuo carico di lavoro è l'unico benchmark che conta, e la differenza tra i due livelli è a una modifica di configurazione di distanza.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
