
GLM-5.3-FlashX vs DeepSeek V4.1 Flash: La fascia di velocità che è più lenta del modello economico
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Il tier premium di velocità di Z.ai ha un problema, e si chiama DeepSeek V4.1 Flash. Quando Z.ai ha lanciato GLM-5.3-FlashX il 18 settembre 2026, ha venduto il nuovo tier con un solo numero: fino a 200 token di output al secondo, circa cinque volte il throughput del GLM-5.3-Flash da cui deriva, a 2,5× il prezzo. Le misurazioni indipendenti collocano già il modello economico di DeepSeek a 214,7 token al secondo con un time to first token di 1,15 secondi — più veloce su entrambi i fronti rispetto al tetto massimo pubblicizzato da Z.ai, e a un prezzo a cui FlashX non si avvicina nemmeno. Se stai comprando velocità, il mercato si è mosso prima che FlashX arrivasse.
Quell'impostazione è ingiusta verso FlashX sotto un aspetto specifico, e corretta in tutti gli altri. Entrambi i modelli sono derivati open-weight con contesto da 1M, progettati per contenere i costi, ed entrambi sono davvero validi in ciò per cui sono stati creati. Ma sono stati costruiti per due metà diverse dello stesso problema, e il divario di prezzo tra loro è ormai così ampio che "quale sia migliore" ha una risposta in una riga per la maggior parte dei carichi di lavoro.
Dove ciascuno è davvero in vantaggio
• Prezzo, listino — GLM-5.3-FlashX 0,37 $ / 1,25 $ per 1M di input/output contro DeepSeek V4.1 Flash 0,15 $ / 0,60 $ fuori punta, 0,30 $ / 1,20 $ in puntabr> • Input in cache — FlashX 0,075 $ per 1M contro DeepSeek 0,003 $ fuori punta, un divario di 25× che si amplifica pesantemente nei loop degli agentibr> • Throughput misurato — FlashX fino a 200 tok/s (picco dichiarato dal fornitore, nessun dato indipendente pubblicato) contro DeepSeek 214,7 tok/s (Artificial Analysis, sull'API di DeepSeek)br> • Tempo al primo token — non pubblicato per FlashX contro 1,15 s misurati per DeepSeek V4.1 Flashbr> • Intelligenza indipendente — FlashX eredita il 42 di GLM-5.3-Flash sull'Artificial Analysis Intelligence Index contro il 40 di DeepSeek V4.1 Flashbr> • Architettura — MoE da 320B totali / 18B attivi contro 552B totali con circa 8B attivi in prefill e 16B in decodebr> • Modalità di input — testo, immagini, video e file contro testo e immaginibr> • Limite di output — 131.072 token contro circa 384.000br> • Pesi aperti — GLM-5.3-Flash è con licenza MIT; FlashX è un tier ospitato senza pesi propri, e DeepSeek V4.1 Flash è con licenza MIT

Leggi quella lista due volte, perché la sua forma è la storia. FlashX vince esattamente due righe, ed entrambe sono limitate: un vantaggio di due punti su un indice di intelligenza indipendente, e l'input video. DeepSeek vince su prezzo, prezzo in cache, velocità misurata, lunghezza dell'output e ampiezza di modalità nel senso che conta — accetta immagini e produce risposte lunghe. Il divario di due punti nell'indice rientra nel rumore di una singola esecuzione di benchmark e non dovrebbe essere ciò che decide la tua architettura.
Il livello di velocità che è più lento del modello economico
Questa è la parte su cui vale la pena soffermarsi. Z.ai ha creato FlashX per risolvere un problema reale: GLM-5.3-Flash è lento. Artificial Analysis lo ha misurato a 98 token di output al secondo, un valore superiore alla mediana dei modelli open-weight comparabili della sua dimensione, ma ben lontano dall'essere interattivo. La soluzione dell'azienda è stata una ricostruzione dello stack di serving — circa 100.000 acceleratori nazionali, un motore basato su SGLang, quantizzazione W8A8, cache KV a precisione mista e un'architettura disaggregata encode–prefill–decode — e riporta circa 3× di throughput end-to-end rispetto alla sua baseline sullo stesso hardware.
DeepSeek ha risolto lo stesso problema a livello architetturale, e ci è arrivata prima. La separazione Causal Encoder–Decoder di V4.1 Flash attiva circa 8 miliardi di parametri in prefill e 16 miliardi in decode invece di una cifra fissa, e Compressed Sparse Attention 2 con caching KV FP4 riduce la cache globale a 890 byte per token — all'incirca un quarto dell'HBM e un ottavo dello spazio di archiviazione SSD di cui necessitava il suo predecessore. Il risultato è un modello che gira a 214,7 token al secondo secondo le misurazioni di un laboratorio indipendente, sulla stessa API first-party, senza che sia richiesto alcun livello premium.
Il 200 di Z.ai è un picco dichiarato dal fornitore e il 214,7 di DeepSeek è una mediana indipendente, che è il confronto meno favorevole possibile per Z.ai e il motivo per prenderlo con le molle. È del tutto possibile che FlashX batta DeepSeek su una richiesta a caldo, con output breve e senza congestione. Non è possibile saperlo, perché nessuno al di fuori di Z.ai ha pubblicato numeri di throughput di FlashX. Ciò che è noto oggi è che i due modelli sono nella stessa fascia di velocità, e uno dei due costa un terzo dell'altro.

Dove il vantaggio di prezzo di DeepSeek diventa strutturale
DeepSeek V4.1 Flash costa $0,15 per milione di token in input e $0,60 per milione di token in output nelle ore non di punta, importo che raddoppia a $0,30 e $1,20 durante due fasce nei giorni feriali (01:00–04:00 e 06:00–10:00 UTC). FlashX è a $0,37 e $1,25 fissi. Mettili a confronto e il prezzo fisso che sembra un vantaggio è in realtà la struttura più costosa per chiunque possa pianificare il lavoro.
La voce dell'input in cache è quella che decide i carichi di lavoro degli agenti. DeepSeek addebita $0,003 per milione di token di input in cache fuori punta; FlashX addebita $0,075, venticinque volte tanto. Un agente che rinvia un lungo prompt di sistema e uno schema di strumenti a ogni passaggio paga quella differenza a ogni passaggio, ed è la singola voce di costo che più probabilmente dominerà una fattura reale. Z.ai elenca lo spazio di archiviazione della cache come gratuito per un periodo limitato, il che è uno sconto sull'archiviazione piuttosto che sulle letture che effettivamente si accumulano.
C'è un contrappeso, ed è l'onestà riguardo a quanto costano i numeri di DeepSeek stesso. Le valutazioni condotte dal fornitore dietro i punteggi principali di V4.1 Flash sono state prodotte al massimo sforzo di ragionamento, e DeepSeek documenta che passare dallo sforzo 25 allo sforzo 100 porta DeepSWE v1.1 da 66,0 a 74,2 consumando circa 2,5× i token di output. A 2,5× i token, il costo effettivo della configurazione ad alto sforzo è molto più vicino a FlashX di quanto suggerisca il prezzo di listino — e il modello è documentato come molto prolisso, generando 250M token di output sull'Intelligence Index contro una mediana di 130M. Una tariffa per token bassa su un modello loquace non equivale a un compito economico. Chiunque li confronti sul prezzo dovrebbe confrontare il costo per compito completato, non il costo per milione di token, e dovrebbe aspettarsi di misurare anziché stimare.
Come decidere, concretamente
Se il tuo workload è un agente a esecuzione prolungata con un prefisso stabile, DeepSeek V4.1 Flash è la scelta, e il rapporto di input in cache da solo decide la questione. Se hai bisogno di comprensione video o input di file nella stessa chiamata, FlashX è l'unico dei due che li accetta — è una differenza di capacità reale, non da scheda tecnica. Se hai bisogno di output generati lunghi, il limite di output di circa 384K di DeepSeek rispetto ai 131.072 di FlashX conta per la generazione di report, file di codice lunghi e qualsiasi cosa che sintetizzi anziché rispondere. Se hai bisogno del punteggio indipendente più forte su un singolo indice di benchmark, il 42 di FlashX contro 40 è reale ma troppo piccolo per costruirci sopra.
Entrambi i modelli sono raggiungibili da un unico endpoint se il tuo stack è già instradato, ed è il modo più economico per risolvere la questione. Su OrcaRouter il prezzo di listino del fornitore viene passato con 0% di ricarico, quindi lo sconto off-peak di DeepSeek e qualsiasi futura variazione di prezzo di Z.ai arrivano lo stesso giorno in cui avvengono, e passare dall'uno all'altro è una stringa di modello, non un'integrazione. Il failover automatico vale la pena averlo nello specifico per FlashX: è un tier di servizio attivo da tre settimane su un nuovo cluster, e il tipo di guasto contro cui ti stai assicurando è un tetto di capacità, non un modello che smette di funzionare.
Il riassunto schietto: DeepSeek V4.1 Flash è l'opzione predefinita migliore per la maggior parte dei lavori in produzione — più economico per token, più economico per token in cache, misurato più veloce e in grado di generare output più lunghi. GLM-5.3-FlashX è la scelta giusta in una fascia più ristretta, dove ti servono input video o file e vuoi un indice indipendente marginalmente più alto a supporto. Z.ai ha fissato un prezzo premium per un livello di velocità e l'ha lanciato in un mercato dove il modello veloce ed economico esisteva già. Questo è l'intero confronto.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
