Una card del titolo hero per GLM-5.3-FlashX, con sottotitolo "Stessi pesi, 2,5 volte il prezzo", con chip che recitano "Fino a 200 tok/s (fornitore)", "0,37 $ / 1,25 $ per 1M" e "contesto da 1M", e una riga a piè di pagina "Livello di serving lanciato il 18 settembre 2026".
Guides & Insights

GLM-5.3-FlashX arriva a un prezzo 2,5 volte superiore a quello del modello su cui gira

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il numero da notare non è 200. È 2,5. Il 18 settembre 2026, Z.ai ha reso disponibile GLM-5.3-FlashX sulla propria API a una velocità fino a 200 token di output al secondo — e lo ha prezzato a 2,5× rispetto a quanto fa pagare per GLM-5.3-Flash, il modello a pesi aperti da cui è costruito. Nulla del modello in sé è cambiato. Stessi pesi, stesso backbone mixture-of-experts 320B-A18B, stessa finestra di contesto da 1M token, stessa gestione nativa di testo, immagini, video e file. Ciò che è cambiato è lo stack di serving sottostante, e ciò che Z.ai ora fa pagare per il privilegio di trovarsi più vicino all'inizio della coda.

Ciò rende FlashX una rarità nel mercato dei modelli: un lancio senza alcun benchmark allegato. Z.ai non ha pubblicato alcuna valutazione specifica per FlashX, perché non c'è alcun nuovo modello da valutare. Ogni dato sulle capacità che vale per GLM-5.3-Flash vale anche qui, inclusi quelli meno lusinghieri di quanto suggerisse la copertura del lancio.

L'intero delta, in un solo passaggio

• Velocità — GLM-5.3-FlashX fino a 200 tok/s (picco dichiarato dal fornitore) contro GLM-5.3-Flash a 98 tok/s, come misurato da Artificial Analysis sulla stessa API di Z.aibr> • Prezzo — $0.37 per 1M di input / $1.25 per 1M di output contro $0.15 / $0.50 di listinobr> • Input in cache — $0.075 per 1M contro $0.03 per 1Mbr> • Intelligenza — identica; FlashX eredita i punteggi del modello basebr> • Contesto — 1M token su entrambibr> • Pesi — GLM-5.3-Flash è a pesi aperti con licenza MIT; FlashX è un tier ospitato e non ne ha di propri

Il 200 e il 98 non sono lo stesso tipo di numero, e vale la pena dirlo senza giri di parole. Uno è un tetto massimo che il fornitore dice che il servizio può raggiungere. L'altro è ciò che un laboratorio indipendente ha misurato su richieste reali. Un utente che deve decidere se pagare 2,5× dovrebbe considerare il 200 come una pubblicità e andare a misurare il proprio carico di lavoro.

A single-column scoreboard titled 'GLM-5.3-FlashX - the scoreboard' with rows reading 'Speed: up to 200 tok/s (vendor peak)', 'Measured speed: 98 tok/s (base model)', 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Context: 1M tokens' and 'Weights: hosted tier only', with a footer reading 'Speed is a vendor-reported peak; base-model figures per Artificial Analysis.'

Quello che dice Z.ai sta facendo il lavoro

L'accelerazione è infrastrutturale, non matematica. Z.ai descrive FlashX come un sistema in esecuzione su un cluster di circa 100.000 acceleratori cinesi nazionali con uno stack di serving creato appositamente: un motore di inferenza basato su SGLang, quantizzazione W8A8, quantizzazione mista della cache INT8/FP8/BF16 e un'architettura disaggregata encode–prefill–decode che separa la fase di codifica multimodale dalle fasi di generazione dei token, in modo che nessuna delle due blocchi l'altra. L'azienda dichiara un throughput end-to-end del servizio circa 3 volte superiore rispetto al proprio baseline iniziale sullo stesso hardware, e afferma che un agente infrastrutturale basato su GLM-5.3 ha contribuito a ottimizzare lo stack.

Tutto ciò è dichiarato dal fornitore e, finora, non è stato riprodotto da nessuno al di fuori di Z.ai. È anche la parte più plausibile della storia: i lanci di livello serving come questo sono di solito vittorie ingegneristiche, e le scelte architetturali descritte sono il kit di strumenti standard proprio per questo tipo di guadagno. Ciò che non sono è una garanzia. Un valore di 200 tok/s è un picco, e i picchi si raggiungono con output brevi, cache calde e un cluster non congestionato. Le richieste multimodali a contesto lungo — il carico di lavoro a cui FlashX è esplicitamente rivolto — sono quelle con meno probabilità di raggiungerlo.

Il prezzo è la vera decisione di prodotto

A listino, GLM-5.3-FlashX costa $0,37 per milione di token di input e $1,25 per milione di token di output, con l'input in cache a $0,075 e l'archiviazione della cache gratuita per un periodo limitato. Nel listino nazionale di Z.ai, ciò equivale a ¥2 in input e ¥7 in output, rispetto a ¥0,8 e ¥2,8 per il Flash base — lo stesso rapporto di 2,5×, espresso nella valuta con cui Z.ai vende nel proprio mercato interno.

A screenshot of Z.ai's official pricing documentation page (captured September 19, 2026) showing the 'Latest Models' table with GLM-5.3-Flash at $0.15 input, $0.03 cached input and $0.50 output per 1M tokens, and GLM-5.3-FlashX at $0.37, $0.075 and $1.25.

L'aritmetica diventa scomoda in fretta nella direzione che le persone controllano raramente. I token di output sono dove il moltiplicatore morde più forte, perché l'output è il lato costoso su ogni modello di questa famiglia: l'output di FlashX è 2,5× l'output di Flash, e l'output è già ~3,4× il prezzo dell'input su entrambi. Un processo batch che genera un milione di token di output al giorno passa da $0,50 a $1,25 — una differenza di $274 all'anno per un carico di lavoro su cui, per definizione, nessuno è in attesa.

Il vantaggio sta nella latenza che si può ammortizzare. Un ciclo di agente che effettua dieci chiamate sequenziali risparmia dieci volte la differenza per chiamata e, se tale differenza è di due o tre secondi, hai recuperato mezzo minuto di tempo reale per attività. Per il completamento del codice interattivo, il dialogo in tempo reale o qualsiasi pipeline in cui una persona o un servizio a monte è bloccato in attesa del token successivo, questo compromesso è di solito corretto. Z.ai è anche esplicito sul fatto che il modello non fa attualmente parte del suo GLM Coding Plan, quindi gli utenti in abbonamento non ricevono FlashX incluso: lo pagano per token.

Se il tuo stack parla già con più di un provider, il passaggio è un cambio di stringa del modello e nient'altro. È questa la ragione pratica per cui il routing esiste come livello: su OrcaRouter il prezzo di listino del fornitore viene applicato con uno 0% di markup, così una variazione di prezzo di Z.ai o un taglio promozionale arriva lo stesso giorno in cui avviene a monte, e un unico endpoint davanti a oltre 200 modelli significa che valutare FlashX rispetto a Flash è una modifica di configurazione anziché un progetto di integrazione. Anche il failover conta in questo caso — un livello di serving nuovissimo su un cluster nuovissimo è esattamente il tipo di dipendenza dietro cui vale la pena avere un fallback.

Ciò che non è cambiato, e perché conta di più

FlashX eredita integralmente il profilo di capacità di GLM-5.3-Flash, e quel profilo è più ristretto di quanto lasciasse intendere la copertura del lancio. I materiali di Z.ai collocano il modello di base allo stesso livello di Claude Opus 4.8 sull'Artificial Analysis Intelligence Index. Artificial Analysis stessa attualmente indica GLM-5.3-Flash a 42 su quell'indice, misurato sulla stessa API di Z.ai — un punteggio solido, ben al di sopra della mediana per i modelli open-weight della sua classe, e molto lontano dal livello di frontiera che il confronto del fornitore suggerisce. Entrambe le affermazioni sono vere; semplicemente non sono la stessa affermazione, e il divario tra esse è il motivo per cui questo blog etichetta i numeri dei fornitori come numeri dei fornitori.

Il modello base è davvero capace e davvero aperto. GLM-5.3-Flash è stato rilasciato il 26 agosto 2026 con licenza MIT, con i pesi su Hugging Face, e il suo design ibrido di attenzione lineare più sparsa — compressione IndexPool, iperconnessioni vincolate alla varietà — riduce il calcolo dell'attenzione di circa 3× e la cache KV di circa 4,4× rispetto a GLM-5.3, ed è ciò che rende un modello da 320B con 18B di parametri attivi abbastanza economico da poter essere servito. L'output è limitato a 131.072 token. È veloce per il suo prezzo, non veloce per la sua classe: Artificial Analysis ha misurato 98 token al secondo contro una mediana dei pari superiore a 70 ma inferiore a quella dei modelli più veloci della classifica.

FlashX non cambia nulla di tutto ciò. Cambia quanto a lungo si aspetta per ottenerlo.

La lettura onesta

Acquista FlashX se il tuo carico di lavoro è vincolato dalla latenza e hai già deciso che GLM-5.3-Flash è il modello giusto — un agente che concatena chiamate, un editor che completa inline, una superficie vocale o di chat in cui la pausa è il prodotto. Resta su GLM-5.3-Flash, o sui pesi aperti che puoi ospitare da solo, se il tuo lavoro è a batch, offline o vincolato al throughput anziché alla latenza. L'intelligenza per cui stai pagando 2,5× è l'intelligenza che avevi già.

La questione aperta è cosa dicono le misurazioni indipendenti sul 200. Nessuno al di fuori di Z.ai ha ancora pubblicato numeri di throughput di FlashX, e finché qualcuno non lo farà, la posizione onesta è che FlashX è un tier di serving promettente venduto su un valore di picco. È anche, notevolmente, un test commerciale: un laboratorio che ha passato un anno a regalare un modello quasi di frontiera a un decimo del prezzo del suo flagship si sta ora chiedendo se gli sviluppatori pagheranno per la velocità in sé. La risposta determinerà come verrà prezzato il prossimo tier.

A screenshot of the OrcaRouter models catalogue (captured September 19, 2026) showing the header '199 models - 15 providers - one API key, one bill', the filter chips for input modalities, context length, input price, status, series and supported parameters, and the 'How to call any model' panel with the POST https://api.orcarouter.ai/v1/chat/completions endpoint.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno