Una card del titolo principale per GLM-5.3-FlashX vs DeepSeek V4.1 Flash, con sottotitolo 'La fascia di velocità che è più lenta del modello economico', con chip che riportano '200 vs 214.7 tok/s', '$0.37 / $1.25 vs $0.15 / $0.60' e 'AA 42 vs 40', e una riga di piè di pagina 'GLM-5.3-FlashX è stato lanciato il 18 settembre 2026'.
Guides & Insights

GLM-5.3-FlashX vs DeepSeek V4.1 Flash: La fascia di velocità che è più lenta del modello economico

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il tier premium di velocità di Z.ai ha un problema, e si chiama DeepSeek V4.1 Flash. Quando Z.ai ha lanciato GLM-5.3-FlashX il 18 settembre 2026, ha venduto il nuovo tier con un solo numero: fino a 200 token di output al secondo, circa cinque volte il throughput del GLM-5.3-Flash da cui deriva, a 2,5× il prezzo. Le misurazioni indipendenti collocano già il modello economico di DeepSeek a 214,7 token al secondo con un time to first token di 1,15 secondi — più veloce su entrambi i fronti rispetto al tetto massimo pubblicizzato da Z.ai, e a un prezzo a cui FlashX non si avvicina nemmeno. Se stai comprando velocità, il mercato si è mosso prima che FlashX arrivasse.

Quell'impostazione è ingiusta verso FlashX sotto un aspetto specifico, e corretta in tutti gli altri. Entrambi i modelli sono derivati open-weight con contesto da 1M, progettati per contenere i costi, ed entrambi sono davvero validi in ciò per cui sono stati creati. Ma sono stati costruiti per due metà diverse dello stesso problema, e il divario di prezzo tra loro è ormai così ampio che "quale sia migliore" ha una risposta in una riga per la maggior parte dei carichi di lavoro.

Dove ciascuno è davvero in vantaggio

• Prezzo, listino — GLM-5.3-FlashX 0,37 $ / 1,25 $ per 1M di input/output contro DeepSeek V4.1 Flash 0,15 $ / 0,60 $ fuori punta, 0,30 $ / 1,20 $ in puntabr> • Input in cache — FlashX 0,075 $ per 1M contro DeepSeek 0,003 $ fuori punta, un divario di 25× che si amplifica pesantemente nei loop degli agentibr> • Throughput misurato — FlashX fino a 200 tok/s (picco dichiarato dal fornitore, nessun dato indipendente pubblicato) contro DeepSeek 214,7 tok/s (Artificial Analysis, sull'API di DeepSeek)br> • Tempo al primo token — non pubblicato per FlashX contro 1,15 s misurati per DeepSeek V4.1 Flashbr> • Intelligenza indipendente — FlashX eredita il 42 di GLM-5.3-Flash sull'Artificial Analysis Intelligence Index contro il 40 di DeepSeek V4.1 Flashbr> • Architettura — MoE da 320B totali / 18B attivi contro 552B totali con circa 8B attivi in prefill e 16B in decodebr> • Modalità di input — testo, immagini, video e file contro testo e immaginibr> • Limite di output — 131.072 token contro circa 384.000br> • Pesi aperti — GLM-5.3-Flash è con licenza MIT; FlashX è un tier ospitato senza pesi propri, e DeepSeek V4.1 Flash è con licenza MIT

A two-column scoreboard titled 'GLM-5.3-FlashX vs DeepSeek V4.1 Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'AA Index: 42', 'Context: 1M tokens', 'Output cap: 131,072'; the DeepSeek V4.1 Flash column reads 'Price: $0.15 / $0.60 off-peak', 'Cached input: $0.003 per 1M', 'Speed: 214.7 tok/s (measured)', 'AA Index: 40', 'Context: 1M tokens', 'Output cap: 384,000'; the footer reads 'FlashX speed is vendor-reported; DeepSeek figures per Artificial Analysis.'

Leggi quella lista due volte, perché la sua forma è la storia. FlashX vince esattamente due righe, ed entrambe sono limitate: un vantaggio di due punti su un indice di intelligenza indipendente, e l'input video. DeepSeek vince su prezzo, prezzo in cache, velocità misurata, lunghezza dell'output e ampiezza di modalità nel senso che conta — accetta immagini e produce risposte lunghe. Il divario di due punti nell'indice rientra nel rumore di una singola esecuzione di benchmark e non dovrebbe essere ciò che decide la tua architettura.

Il livello di velocità che è più lento del modello economico

Questa è la parte su cui vale la pena soffermarsi. Z.ai ha creato FlashX per risolvere un problema reale: GLM-5.3-Flash è lento. Artificial Analysis lo ha misurato a 98 token di output al secondo, un valore superiore alla mediana dei modelli open-weight comparabili della sua dimensione, ma ben lontano dall'essere interattivo. La soluzione dell'azienda è stata una ricostruzione dello stack di serving — circa 100.000 acceleratori nazionali, un motore basato su SGLang, quantizzazione W8A8, cache KV a precisione mista e un'architettura disaggregata encode–prefill–decode — e riporta circa 3× di throughput end-to-end rispetto alla sua baseline sullo stesso hardware.

DeepSeek ha risolto lo stesso problema a livello architetturale, e ci è arrivata prima. La separazione Causal Encoder–Decoder di V4.1 Flash attiva circa 8 miliardi di parametri in prefill e 16 miliardi in decode invece di una cifra fissa, e Compressed Sparse Attention 2 con caching KV FP4 riduce la cache globale a 890 byte per token — all'incirca un quarto dell'HBM e un ottavo dello spazio di archiviazione SSD di cui necessitava il suo predecessore. Il risultato è un modello che gira a 214,7 token al secondo secondo le misurazioni di un laboratorio indipendente, sulla stessa API first-party, senza che sia richiesto alcun livello premium.

Il 200 di Z.ai è un picco dichiarato dal fornitore e il 214,7 di DeepSeek è una mediana indipendente, che è il confronto meno favorevole possibile per Z.ai e il motivo per prenderlo con le molle. È del tutto possibile che FlashX batta DeepSeek su una richiesta a caldo, con output breve e senza congestione. Non è possibile saperlo, perché nessuno al di fuori di Z.ai ha pubblicato numeri di throughput di FlashX. Ciò che è noto oggi è che i due modelli sono nella stessa fascia di velocità, e uno dei due costa un terzo dell'altro.

A screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash at max effort (captured September 19, 2026), showing an Intelligence Index score of 40, a measured 215 output tokens per second, $0.30 per 1M input and $1.20 per 1M output tokens, a 1M-token context window, 552B total parameters with 16B active, an MIT licence and weights on Hugging Face.

Dove il vantaggio di prezzo di DeepSeek diventa strutturale

DeepSeek V4.1 Flash costa $0,15 per milione di token in input e $0,60 per milione di token in output nelle ore non di punta, importo che raddoppia a $0,30 e $1,20 durante due fasce nei giorni feriali (01:00–04:00 e 06:00–10:00 UTC). FlashX è a $0,37 e $1,25 fissi. Mettili a confronto e il prezzo fisso che sembra un vantaggio è in realtà la struttura più costosa per chiunque possa pianificare il lavoro.

La voce dell'input in cache è quella che decide i carichi di lavoro degli agenti. DeepSeek addebita $0,003 per milione di token di input in cache fuori punta; FlashX addebita $0,075, venticinque volte tanto. Un agente che rinvia un lungo prompt di sistema e uno schema di strumenti a ogni passaggio paga quella differenza a ogni passaggio, ed è la singola voce di costo che più probabilmente dominerà una fattura reale. Z.ai elenca lo spazio di archiviazione della cache come gratuito per un periodo limitato, il che è uno sconto sull'archiviazione piuttosto che sulle letture che effettivamente si accumulano.

C'è un contrappeso, ed è l'onestà riguardo a quanto costano i numeri di DeepSeek stesso. Le valutazioni condotte dal fornitore dietro i punteggi principali di V4.1 Flash sono state prodotte al massimo sforzo di ragionamento, e DeepSeek documenta che passare dallo sforzo 25 allo sforzo 100 porta DeepSWE v1.1 da 66,0 a 74,2 consumando circa 2,5× i token di output. A 2,5× i token, il costo effettivo della configurazione ad alto sforzo è molto più vicino a FlashX di quanto suggerisca il prezzo di listino — e il modello è documentato come molto prolisso, generando 250M token di output sull'Intelligence Index contro una mediana di 130M. Una tariffa per token bassa su un modello loquace non equivale a un compito economico. Chiunque li confronti sul prezzo dovrebbe confrontare il costo per compito completato, non il costo per milione di token, e dovrebbe aspettarsi di misurare anziché stimare.

Come decidere, concretamente

Se il tuo workload è un agente a esecuzione prolungata con un prefisso stabile, DeepSeek V4.1 Flash è la scelta, e il rapporto di input in cache da solo decide la questione. Se hai bisogno di comprensione video o input di file nella stessa chiamata, FlashX è l'unico dei due che li accetta — è una differenza di capacità reale, non da scheda tecnica. Se hai bisogno di output generati lunghi, il limite di output di circa 384K di DeepSeek rispetto ai 131.072 di FlashX conta per la generazione di report, file di codice lunghi e qualsiasi cosa che sintetizzi anziché rispondere. Se hai bisogno del punteggio indipendente più forte su un singolo indice di benchmark, il 42 di FlashX contro 40 è reale ma troppo piccolo per costruirci sopra.

Entrambi i modelli sono raggiungibili da un unico endpoint se il tuo stack è già instradato, ed è il modo più economico per risolvere la questione. Su OrcaRouter il prezzo di listino del fornitore viene passato con 0% di ricarico, quindi lo sconto off-peak di DeepSeek e qualsiasi futura variazione di prezzo di Z.ai arrivano lo stesso giorno in cui avvengono, e passare dall'uno all'altro è una stringa di modello, non un'integrazione. Il failover automatico vale la pena averlo nello specifico per FlashX: è un tier di servizio attivo da tre settimane su un nuovo cluster, e il tipo di guasto contro cui ti stai assicurando è un tetto di capacità, non un modello che smette di funzionare.

Il riassunto schietto: DeepSeek V4.1 Flash è l'opzione predefinita migliore per la maggior parte dei lavori in produzione — più economico per token, più economico per token in cache, misurato più veloce e in grado di generare output più lunghi. GLM-5.3-FlashX è la scelta giusta in una fascia più ristretta, dove ti servono input video o file e vuoi un indice indipendente marginalmente più alto a supporto. Z.ai ha fissato un prezzo premium per un livello di velocità e l'ha lanciato in un mercato dove il modello veloce ed economico esisteva già. Questo è l'intero confronto.

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash (deepseek/deepseek-v4.1-flash, captured September 19, 2026) showing the model header, a 384K max output, text and image input, an MIT licence by DeepSeek with a 2026-09-10 release date, and the billing row reading $0.15 per 1M input and $0.60 per 1M output tokens with a 1.33-second p50 time to first token.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno