Card del titolo hero per un confronto tra DeepSeek V4 Pro e Qwen3.8 Max, con sottotitolo 'Specialista del ragionamento vs il tuttofare cinese'.
Guides & Insights

DeepSeek V4 Pro vs Qwen3.8 Max: Specialista del Ragionamento vs il Tuttofare Cinese

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

A distanza di dieci giorni, i due modelli più seguiti in Cina sono stati lanciati: Alibaba ha rilasciato Qwen3.8 Max il 3 agosto 2026 — un modello di punta sparse-MoE da 2,4 trilioni di parametri che presenta come tuttofare per agenti, lavoro d’ufficio e comprensione multimodale — e D​eepSeek ha distribuito la versione ufficiale di DeepSeek V4 Pro il 12 agosto, il suo specialista in ragionamento e codifica con 1,6 trilioni di parametri totali e un prezzo pari a circa un settimo di quello di Q​wen sui token di output. I due mirano agli stessi portafogli degli sviluppatori, ma non concordano su cosa debba essere un modello di punta. Qwen3.8 Max vuole essere il modello unico attraverso cui instradare tutto; DeepSeek V4 Pro vuole essere quello a cui affidare i compiti più difficili.

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

Punti chiave

• Qwen3.8 Max è il modello con la maggiore capacità grezza nelle classifiche generali cinesi (SuperCLUE #1, luglio) e il pacchetto multimodale/enterprise più potente — input video, strumenti integrati, output strutturato, tutto in un'unica API.

• DeepSeek V4 Pro è drasticamente più economico (~7× in output), ha già pesi aperti, e ora detiene le affermazioni più elevate in ambito coding/agentico — Terminal-Bench 2.1 a 87,9 contro gli 86,6 riportati dal vendor di Q​wen.

• Attenzione al costo della verbosità: esecuzioni indipendenti mostrano che Qwen3.8 Max richiede in media ~64 turni e ~$1,14 per attività agentica — un problema di costo effettivo che la scheda tecnica nasconde.

• Il titolo onesto: Qwen3.8 Max è il flagship della "guerra delle capacità" che eguaglia i prezzi dei modelli chiusi statunitensi; DeepSeek V4 Pro è la confutazione in termini di rapporto qualità-prezzo.

Due filosofie in un'unica tabella spec

• Parametri totali — Qwen3.8 Max 2.4T (MoE sparso, ~95B attivi) vs DeepSeek V4 Pro 1.6T (MoE, ~49B attivi)

• Contesto / output massimo — entrambi hanno un contesto di 1M; Qwen arriva a circa 128–131K di output contro i 384K di DeepSeek

• Input — Q​wen accetta testo, immagini e video; DeepSeek V4 Pro accetta testo e immagini, con il nuovo ragionamento nativo sulle immagini nella build ufficiale.

• Pesi aperti — DeepSeek V4 Pro: rilasciato (MIT); Qwen3.8 Max: promesso per la settimana del 10 agosto, il primo Q​wen di classe Max mai reso open-source

• API extra — Q​wen include strumenti integrati e output strutturato di serie; DeepSeek V4 Pro include interruttori di ragionamento, JSON strutturato, un'API Responses e compatibilità con Codex.

• Prezzo — Qwen3.8 Max $2,00 / $6,00 per milione di token ($0,25 in cache) vs DeepSeek V4 Pro ~$0,42 / $0,87 ($0,0035 in cache)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Dove vince Qwen3.8 Max

Sull'asse generalista, Qwen3.8 Max è in vantaggio e i dati indipendenti concordano. Artificial Analysis lo colloca a un Intelligence Index di 58, un Coding Index di 71,8 e un Agentic Index di 58 — il risultato più vicino mai ottenuto da un laboratorio cinese alla vetta di quella classifica agentica. Nella classifica in lingua cinese di SuperCLUE di luglio si posiziona al #1 con 71,48, mentre DeepSeek-V4-Pro è al #5 con 64,4. Le demo di lancio di Alibaba — una sessione di codifica autonoma di 16 giorni, una replica di un paper che ha superato il risultato AIME24 del paper originale — sono la prova più forte dell'intero ciclo di rilascio che questo sia un agente a lungo orizzonte genuinamente capace.

Per uno sviluppatore, i vantaggi pratici sono incentrati sull'integrazione: input video, chiamate di strumenti integrate, output strutturato senza configurazione e un ecosistema (Model Studio, la toolchain Q​wen) che D​eepSeek non cerca di eguagliare. Se il carico di lavoro è incentrato sui documenti, multimodale o richiede un'offerta di integrazione enterprise, Qwen3.8 Max è il modello che il mercato cinese attualmente sceglie di default.

Dove DeepSeek V4 Pro eccelle

Sul coding e sui costi, il V4 Pro ufficiale è la replica. D​eepSeek riporta la build ufficiale a 87.9 su Terminal-Bench 2.1 (in aumento dal 72.1 della preview) e 62.7 su DeepSWE — contro l'86.6 su Terminal-Bench riportato dal vendor di Q​wen. La preview vantava già un 80.6 SWE-bench Verified, un 90.1 GPQA Diamond e un 93.5 LiveCodeBench, il punteggio #1 tra i modelli open per la programmazione competitiva, e i cambiamenti della build ufficiale sono concentrati esattamente nei task agentici e di ragionamento in cui quei numeri vivono.

Poi c'è il prezzo. A $0,42/$0,87 per milione di token, DeepSeek V4 Pro costa circa 4,8× meno in input e 6,9× meno in output rispetto ai $2/$6 di Qwen3.8 Max. DeepSeek ha anche segnalato il 6 agosto che è in arrivo un aumento dei prezzi, il che rende la tariffa odierna una finestra, non una promessa — ne parleremo più avanti.

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

Fai i calcoli su un vero compito agenziale.

Le esecuzioni agentiche indipendenti sono il punto in cui il prezzo di listino di Qwen smette di essere il prezzo reale. Nei task agentici di Artificial Analysis, Qwen3.8 Max ha ottenuto in media ~64 turni per task e un costo di ~1,14 dollari per task, contro ~0,53 dollari per la generazione precedente — il modello è prolisso e pianifica molto. Eseguendo lo stesso tipo di task su DeepSeek V4 Pro a 0,87 dollari per milione di output, il costo per task risulta inferiore di circa un ordine di grandezza. Se il tuo prodotto è un loop che chiama il modello cento volte al giorno per utente, quella differenza è il tuo margine.

Avvertenze sull'affidabilità da entrambe le parti

L'onestà delle fonti funziona in entrambe le direzioni. Test indipendenti hanno segnalato che il tasso di allucinazioni di Qwen3.8 Max è salito dal 23% al 40% e un punteggio AA-Omniscience è sceso di dieci punti — il modello è diventato più capace e meno affidabile nella stessa release. La preview di D​eepSeek ha mostrato un tasso documentato del 94% di "risposta sempre" su AA-Omniscience, il che significa che tende a produrre una risposta sia che la conosca sia che non la conosca. Entrambi i segnali sono importanti per la produzione; nessuno dei due è squalificante per i carichi di lavoro a cui questi modelli sono destinati.

Perché la tempistica degli open-weights cambia i calcoli dei prezzi

Il rilascio dei pesi aperti di Qwen3.8 Max, quando arriverà, cambierà l'economia di questo confronto entro una settimana — chi si auto-ospita avrà un modello di punta da 2.4T, e la pressione sui prezzi delle API sarà reale. Questo è esattamente lo scenario in cui un modello di prezzo pass-through ti mantiene onesto. OrcaRouter trasmette il prezzo di listino del fornitore senza alcun ricarico, quindi nel momento in cui Alibaba o DeepSeek modifica un prezzo — in aumento o in diminuzione — la modifica è attiva su una chiave lo stesso giorno, senza rinegoziazioni e senza un secondo contratto da leggere. Instradi verso quello tra Qwen3.8 Max e DeepSeek V4 Pro che la tua valutazione attuale preferisce, e il prezzo rimane quello che il fornitore effettivamente applica.

Quale per la tua decisione sull'API builder?

Scegli Qwen3.8 Max quando il lavoro richiede tutta la superficie — input multimodale, output strutturato, strumenti integrati, qualità della lingua cinese ai vertici delle classifiche attuali — e il tuo modello di costo tollera esecuzioni agentiche verbose. Scegli DeepSeek V4 Pro quando il compito è incentrato su ragionamento o codice, il volume di token è elevato, i pesi aperti contano per la conformità o l'auto-hosting, oppure la voce di bilancio è il vincolo stringente. La lettura più pulita di questo confronto è quella che le due aziende stesse segnalano: Qwen3.8 Max è l'ammiraglia rispetto alla quale misuri tutto, e DeepSeek V4 Pro è quello che fa sembrare costoso il benchmark.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube