
Qwen 4 Max vs DeepSeek V4 Pro: 95 miliardi di parametri attivi contro 49 miliardi
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
L'annuncio di Qwen 4 Max alla conferenza Yunqi del 22 settembre 2026 ha dato all'industria un nome e una struttura a livelli e nient'altro — nessun peso, nessun prezzo, nessuna finestra di contesto, nessuna data. DeepSeek V4 Pro è elencato dal 24 aprile 2026 come un mixture-of-experts da 1,6 trilioni di parametri con 49 miliardi di parametri attivi per token, un contesto da 1 milione di token e un prezzo fuori picco di $0,66 per milione di token di input e $1,98 per milione di token di output. Il numero che vale la pena mettere a confronto non è il conteggio totale dei parametri ma il conteggio attivo: l'ultimo Qwen3.8-Max pubblicato attiva 95 miliardi di parametri per token, circa il doppio dei 49 miliardi di parametri attivi che DeepSeek V4 Pro esegue, e quella singola cifra spiega la maggior parte del divario di prezzo triplo tra i due laboratori prima ancora che venga consultato un singolo benchmark.
Due diverse scommesse sulla sparsità
Entrambi i laboratori sviluppano modelli mixture-of-experts sparsi. Su quanto debbano essere sparsi, però, sono in netto disaccordo. Qwen3.8-Max — il flagship Qwen attualmente in distribuzione, nonché l'unico termine di paragone concreto per capire come sarà Qwen 4 Max — è un modello da 2,4 trilioni di parametri che ne attiva 95 miliardi per token, un rapporto di circa una parte su venticinque. DeepSeek V4 Pro è un modello da 1,6 trilioni di parametri che ne attiva 49 miliardi, un rapporto di circa una parte su trentatré, e memorizza i pesi dei suoi esperti in FP4 lasciando i layer di attenzione, router e norm in FP8, il che riduce ulteriormente il calcolo per token.
Quelle non sono differenze di messa a punto. Sono due risposte diverse alla stessa domanda — quanto dovrebbe spendere per token un modello di frontiera:
• Parametri totali — Qwen 3.8 flagship 2,4T contro DeepSeek V4 Pro 1,6T
• Attivi per token — Qwen 3.8 di punta 95B contro DeepSeek V4 Pro 49B
• Rapporto di attivazione — circa 1 su 25 rispetto a circa 1 su 33
• Prezzo di input, fuori picco — Qwen3.8-Max 2,00 $ per 1M rispetto a DeepSeek V4 Pro 0,66 $ per 1M
• Prezzo di output, fuori picco — Qwen3.8-Max $6,00 per 1M rispetto a DeepSeek V4 Pro $1,98 per 1M
• Pesi di punta — Qwen 3.8 di punta con licenza Qwen personalizzata contro DeepSeek V4 Pro pubblicato sotto MIT
• Contesto — Qwen3.8-Max 1M token contro DeepSeek V4 Pro 1M token
• Modalità — Qwen3.8-Max input di testo, immagini e video contro DeepSeek V4 Pro solo testo sulla sua scheda
• Latenza osservata — Qwen3.8-Max p50 tempo al primo token 3,29 s rispetto a DeepSeek V4 Pro 3,52 s sullo stesso catalogo
La differenza di sparsità e la differenza di prezzo questa volta puntano nella stessa direzione, che non è la direzione suggerita dal numero totale di parametri. Qwen attiva circa il doppio dei parametri per token rispetto a DeepSeek e costa circa tre volte tanto, e la sparsità da sola non colma quel divario. Ciò che colma il resto è la modalità: il modello di punta di Qwen include codificatori di visione e video, che vengono pagati a ogni richiesta indipendentemente dalla presenza o meno di un’immagine, ed è per questo che la tariffa di input è a quel livello. DeepSeek V4 Pro accetta testo e restituisce testo, ed è prezzato come un modello che fa solo questo.
Una precisazione va apposta alla colonna DeepSeek prima che la si usi per qualsiasi scopo. DeepSeek applica prezzi secondo un listino peak e off-peak: le cifre di $0,66 e $1,98 sono le tariffe off-peak, mentre durante le finestre peak — dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC nei giorni feriali, escluse le festività pubbliche cinesi — lo stesso modello viene fatturato a $1,32 per l'input e $3,96 per l'output. Tutto il resto, inclusi tutti i fine settimana e le festività, è off-peak. La tariffa che paghi dipende quindi da quando viene generato il tuo traffico, e un modello di costo costruito sul solo valore off-peak sarà sbagliato per qualsiasi carico di lavoro con una componente legata alle mattine dei giorni feriali.

La colonna Qwen 4 Max è vuota, e non è una condizione temporanea
È allettante colmare il confronto con l'ipotesi che Qwen 4 Max si collocherà vicino ai numeri di Qwen 3.8 e a un prezzo inferiore. Resisti. Alibaba ha descritto l'architettura di Qwen 4 come una nuova generazione e ha detto che è in addestramento; l'unico artefatto rilasciato che descrive quell'architettura è Qwen3.8-Flash-Next, reso open source alla fine di agosto 2026 ed etichettato sulla propria model card come un'anteprima del design di Qwen 4. È un modello principale da 125 miliardi di parametri con 51 miliardi di parametri di embedding di N-grammi che ne attivano circa 6 miliardi per passo, con attenzione sparsa QSA, residui gated e un contesto nativo di 262.000 token estendibile verso 1 milione.
Se quel design scala fino al tier Max, il conteggio attivo dovrebbe rimanere nell'ordine delle decine di miliardi anziché salire verso il totale di DeepSeek — mantenere il calcolo per passo approssimativamente piatto mentre i parametri totali crescono è l'intero punto di QSA e degli embedding N-gram che vengono cercati anziché calcolati in modo denso. Questa è una direzione più che una specifica, e non dovrebbe essere stampata come tale.
Ciò che è conoscibile ora è l'asimmetria operativa. Un modello che esiste può essere misurato sul tuo carico di lavoro; un modello che non esiste non può essere misurato su nulla. Qwen 4 Max sarà raggiungibile, quando uscirà, tramite l'API del fornitore stesso e diverse piattaforme di terze parti — la stessa strada che ha percorso ogni modello di punta di Alibaba. Oggi non è su OrcaRouter: il catalogo ha zero voci per la famiglia Qwen 4. DeepSeek V4 Pro è su OrcaRouter adesso, e lo è anche uno snapshot datato di esso.
La riproducibilità è l'argomento che nessuno avanza.
DeepSeek rilascia snapshot datati e li mantiene indirizzabili. Il catalogo contiene sia l'identificatore fluttuante DeepSeek V4 Pro sia una variante fissata al 2026-08-13 — essendo quella data la build che DeepSeek stessa ha designato come release di disponibilità generale. È poco appariscente e conta più di un delta di benchmark per chiunque esegua un harness di valutazione o una pipeline controllata dalla conformità: quando fissi lo snapshot, la tua suite di regressione sta misurando il tuo codice anziché la cadenza di rilascio del fornitore.
La generazione Qwen 3.8 ha fatto la stessa cosa — c'è uno snapshot datato di Qwen3.8-Max sullo stesso catalogo accanto al nome fluttuante — e non c'è motivo di pensare che Alibaba si fermerà. Ma è una proprietà dei modelli rilasciati, e vale la pena affermare chiaramente che il giorno in cui verrà annunciato Qwen 4 Max non avrà alcuno snapshot da fissare, nessun identificatore stabile con cui testare e nessun modo per eseguire un prima e dopo sui tuoi dati. Qualunque confronto tu voglia fare, lo farai più tardi.

Eseguire entrambi senza eseguire due stack
OrcaRouter instrada DeepSeek V4 Pro come deepseek/deepseek-v4-pro a 0,66 $ in input e 1,98 $ in output per milione di token, ovvero il prezzo di listino fuori punta di DeepSeek stesso, passato con uno 0% di ricarico. Quest'ultimo punto qui vale più che altrove in questo lotto, perché 1,98 $ in output è già vicino al minimo per un modello di fascia frontiera: un margine della piattaforma anche solo del dieci per cento sarebbe un quinto della differenza tra questo modello e un'alternativa di fascia media, e con uno 0% di ricarico la tariffa che vedi sulla pagina è la tariffa che DeepSeek pubblica — inclusa la suddivisione tra ore di punta e fuori punta, che viene trasferita secondo lo stesso orario anziché essere mediata in una tariffa fissa.
Lo stesso endpoint ospita la famiglia Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash e Qwen3.8-27B — accanto a DeepSeek V4 Pro su un'unica API compatibile con OpenAI con quasi 200 modelli, con failover automatico quando il percorso di un provider si degrada e un DSL di routing per rendere esplicita la selezione invece di codificarla rigidamente. Se DeepSeek riduce la tariffa, la modifica arriva sulla tua chiave lo stesso giorno, perché non c'è alcun livello di margine dietro cui una riduzione possa bloccarsi. Quando viene rilasciato un tier Qwen 4, è nello stesso catalogo che comparirebbe.
Dove questo ti lascia
DeepSeek V4 Pro vince questo confronto per forfait, e vale la pena essere precisi sul perché invece di abbellirla. È più economico su entrambi i fronti di un fattore di circa tre, attiva cinque volte tanti parametri per token, la sua finestra di contesto è equivalente, e ha uno snapshot datato che puoi fissare. Qwen 4 Max ha un nome di fascia e uno slot a una conferenza.
Il confronto effettivamente in corso è DeepSeek V4 Pro contro Qwen3.8-Max, ed è un vero compromesso, non una disfatta: DeepSeek è un modello solo testo a circa un terzo del prezzo, con pesi pubblicati con licenza MIT e un profilo di attivazione per token più snello, mentre il modello di punta di Qwen accetta input di immagini e video a $2,00 e $6,00. Scegli in base alla modalità e al costo misurato per attività completata, non al numero di parametri, e riesegui il confronto quando Alibaba pubblica una model card — a quel punto la domanda interessante sarà se Qwen 4 Max posiziona il prezzo della sua capacità multimodale al di sopra della tariffa per testo di DeepSeek in misura minore rispetto a oggi.

Confrontati in questo articolo4
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
