Recensione di DeepSeek V4: I modelli seri da 1 milione di token più economici nell'IA?

Recensione di DeepSeek V4: I modelli seri da 1 milione di token più economici nell'IA?

Autore

Fengya Tian

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

DeepSeek ha rilasciato la famiglia V4 il 24 aprile 2026 — due modelli, V4-Pro e V4-Flash, disponibili sull'API e resi open source sin dal primo giorno — e ha silenziosamente ridefinito il livello di base per quanto costa una capacità AI seria. Entrambi i modelli offrono una finestra di contesto predefinita di 1 milione di token, entrambi offrono modalità con e senza ragionamento, e il V4-Pro di punta raggiunge un costo massimo di $0,87 per milione di token di output: un prezzo che sottocosta ogni modello comparabile con contesto da 1 milione sul mercato, aperto o chiuso.

E luglio è il mese delle decisioni. In un avviso datato 29 giugno, DeepSeek ha confermato che la versione ufficiale della V4 arriverà a metà luglio 2026, promettendo miglioramenti nelle funzionalità e nelle prestazioni — e introducendo prezzi orari di punta che raddoppiano le tariffe durante le finestre lavorative di Pechino. Dieci giorni dopo, il 24 luglio, i nomi dei modelli legacy `deepseek-chat` e `deepseek-reasoner` verranno definitivamente ritirati. Questa recensione spiega cos'è effettivamente la V4, quanto costa oggi e dopo il rilascio ufficiale, dove eccelle, dove chiaramente non lo fa, e cosa fare prima delle scadenze.

Verdetto rapido

Considera DeepSeek V4 se...

- Eseguire carichi di lavoro di produzione ad alto volume dove il costo unitario decide cosa è sostenibile — il prezzo di V4 è in una categoria a sé stante

- Necessità di contesto lungo a basso costo: 1 milione di token standard, fino a 384.000 token di output per risposta, con sconti aggressivi per caching del contesto.

Vuoi un'integrazione plug-and-play — l'API supporta sia i formati OpenAI ChatCompletions che Anthropic, quindi gli strumenti esistenti funzionano quasi sempre senza problemi.

- Valorizzare i pesi aperti e le opzioni di self-hosting, specialmente il più piccolo V4-Flash

Rimanda (o indirizza altrove) se tu…

- Esegui agenti autonomi a lungo orizzonte — sulla tabella cross-modello pubblicata da Z.ai, V4-Pro è in ritardo sia rispetto a GLM-5.2 che alla frontiera chiusa nei benchmark di tipo maratona.

Necessita input immagine: V4 è solo testo

- Affidati a tariffe fisse 24 ore su 24 — a partire dal rilascio ufficiale a metà luglio 2026, le tariffe delle ore di punta raddoppiano durante le finestre lavorative di Pechino (le ore non di punta mantengono le tariffe odierne)

Cos'è DeepSeek V4?

V4 è la famiglia di modelli di quarta generazione di DeepSeek, distribuita come due modelli Mixture-of-Experts. DeepSeek-V4-Pro è il modello di punta: 1,6 trilioni di parametri totali con 49 miliardi attivi per token. DeepSeek-V4-Flash è il livello di efficienza: 284 miliardi totali, 13 miliardi attivi. Entrambi eseguono una finestra di contesto di 1 milione di token per impostazione predefinita nei servizi ufficiali di DeepSeek, ed entrambi espongono due modalità — pensiero per problemi difficili, non-pensiero per velocità — sotto gli ID modello deepseek-v4-pro e `deepseek-v4-flash`.

Due dettagli di posizionamento sono importanti. Primo, V4 è stato lanciato come anteprima che DeepSeek considera utilizzabile in produzione — e secondo l'avviso dell'azienda del 29 giugno, la versione ufficiale arriverà a metà luglio 2026 con "ottimizzazioni delle funzionalità e miglioramenti delle prestazioni." Secondo, è stato lanciato open-source, continuando la consuetudine di DeepSeek di rilasciare i pesi pubblicamente — il che mantiene disponibili l'hosting autonomo e il fine-tuning, realisticamente più per il 284B Flash che per il 1.6T Pro.

Cosa c'è di nuovo in DeepSeek V4?

Un contesto da 1M token come impostazione predefinita, non un upsell.Tutti i servizi ufficiali DeepSeek ora eseguono la finestra completa da un milione di token come standard — nessun SKU separato per contesto lungo, nessuna tariffa premium.

Enorme spazio per l'output.Entrambi i modelli supportano fino a 384K token di output per risposta — triplo rispetto a quanto consentito dai concorrenti con contesto da 1M — il che è importante per la generazione di codice a livello di intero file, estrazioni strutturate lunghe e scrittura di report.

Doppie modalità su un unico endpoint.Modalità di pensiero per problemi complessi, modalità non pensante per chiamate economiche e veloci, selezionabile per richiesta invece che per modello.

Due livelli con una sola forma API. Pro per capacità, Flash per volume — stesso contesto, stesse modalità, stessa integrazione.

Compatibilità API duale. V4 parla nativamente sia i formati OpenAI ChatCompletions che Anthropic API, quindi la maggior parte degli strumenti agent esistenti si connette senza una riscrittura.

Prezzi: quanto costa realmente

Questa è la sezione che rende V4 famoso. V4-Pro costs $0.435 per million input tokens and $0.87 per million output. V4-Flash costs $0.14 and $0.28.Cache hits su contesto ripetuto sono elencati a ben meno di un centesimo per milione di token — effettivamente gratuiti per loop di agent che rileggono lo stesso stato del progetto.

Per dare un'idea: GLM-5.2, celebrato come il miglior rapporto qualità-prezzo dell'estate, costa $1,40 / $4,40. Claude Sonnet 5 costa $3 / $15, Claude Opus 4.8 $5 / $25. Il prezzo di output di V4-Pro è un quinto di quello di GLM-5.2 e circa il 3% di quello di Opus 4.8. Anche se V4-Pro perde alcuni confronti diretti sulla qualità — e li perde — l'economia cambia quali domande valga la pena porre a un modello.

Un cambiamento è in arrivo con il rilascio ufficiale. Secondo l'avviso di DeepSeek del 29 giugno, da metà luglio tutti i prezzi dei token raddoppiano durante le finestre di punta — 09:00–12:00 e 14:00–18:00 ora di Pechino — mentre nelle ore non di punta rimangono le tariffe attuali. Anche raddoppiato, il prezzo di output di punta di V4-Pro (circa $1,74 per milione) è ancora inferiore alla tariffa standard di GLM-5.2, ma l'era del prezzo fisso termina con l'anteprima: se il tuo traffico raggiunge il picco durante l'orario lavorativo cinese, modella l'oscillazione — o pianifica e instrada intorno ad essa.

Punteggio recensione

I punteggi seguenti sono la nostra valutazione editoriale basata sulla documentazione ufficiale di DeepSeek e sulla tabella di benchmark cross-modello pubblicata da Z.ai — considera i numeri cross-vendor come contesto di terze parti piuttosto che come affermazioni di DeepSeek.

Codifica: 8/10 — competente nell'ingegneria quotidiana; non il leader dei pesi aperti.

- Agentico / uso di strumenti: 7/10 — solida orchestrazione di strumenti, debole sull'autonomia di maratona.

- Ragionamento: 8/10 — punteggi forti in matematica e scienze per la fascia di prezzo

- Efficienza dei costi: 10/10 — nulla di comparabile si avvicina.

- Contesto e documenti lunghi: 9/10 — 1M in, 384K out, cache hits quasi gratuiti

- Velocità: 8/10 — conteggi di parametri attivi snelli, più una modalità non pensante per percorsi veloci

Complessivo: ~8,3/10 — il re del rapporto qualità-prezzo della metà del 2026, con un asterisco a lungo termine.

Vantaggi

- Prezzi che reimpostano la curva: $0.14–$0.87 per milione di token in tutta la famiglia

- 1M di contesto standard con output di 384K — il più alto limite di output nella sua categoria

- Modalità di pensiero e non-pensiero su un unico endpoint, commutabile per richiesta

- La compatibilità API di OpenAI e Anthropic significa una frizione di migrazione quasi nulla.

- I pesi open-source mantengono il self-hosting e il fine-tuning sul tavolo.

Contro

- Il lavoro agentico a lungo termine è la chiara debolezza — nella tabella pubblicata da Z.ai, V4-Pro ottiene 29.0 su FrontierSWE dove GLM-5.2 registra 74.4 e Claude Opus 4.8 75.1

Solo testo: nessun input di immagini nell'API V4

- La tariffazione delle ore di punta arriva con il rilascio ufficiale di metà luglio — le tariffe raddoppiano durante le finestre commerciali di Pechino, quindi i budget smettono di essere piatti.

- Ancora un'anteprima fino a metà luglio, quindi il comportamento potrebbe cambiare con la versione ufficiale.

Il ritiro del 24 luglio 2026 di deepseek-chat e deepseek-reasoner costringe gli utenti legacy a migrare secondo il programma di DeepSeek.

- Auto-ospitare il Pro da 1.6 trilioni di parametri è poco pratico per quasi tutti (Flash, con 284 miliardi, è l'obiettivo realistico).

Come si confronta DeepSeek V4

V4-Pro vs V4-Flash.Stesso contesto, stesse modalità, stessa API — la differenza è tra qualità e throughput con un divario di prezzo di 3x. Un default sensato: Flash per riassunti, estrazione, classificazione e chat; Pro per codice, analisi e tutto ciò che un umano revisiona.

contro GLM-5.2.La lotta open-weight dell'estate, ed è davvero equilibrata in termini di valore. GLM-5.2 è il codificatore più forte — nella tabella pubblicata da Z.ai, guida V4-Pro 81.0 a 64.0 su Terminal-Bench 2.1 e domina nei lavori a lungo orizzonte (74.4 contro 29.0 su FrontierSWE) — mentre V4 risponde con prezzi 3–5 volte inferiori e triplicando il tetto di output. I pipeline di volume propendono per V4; gli agenti di codifica propendono per GLM-5.2.

contro la frontiera chiusa. Claude Opus 4.8 e GPT-5.5 rimangono chiaramente modelli più forti su benchmark difficili. Ma con un divario di prezzo di output di 30–60x rispetto a Opus 4.8, V4 non sta cercando di vincere quella battaglia — sta cercando di rendere il 90% del tuo traffico troppo economico per giustificare l'invio altrove.

La scadenza del 24 luglio: migrazione dai nomi legacy

Se la tua integrazione continua a chiamare `deepseek-chat` o `deepseek-reasoner`, quei nomi smetteranno di funzionare dopo 24 luglio 2026, 15:59 UTC. Attualmente vengono instradati a V4-Flash, il che significa che il tuo traffico sta già operando con l'economia V4 — ma dopo la scadenza, le richieste falliranno completamente. La migrazione stessa è una riga (`model: "deepseek-v4-pro"` o `"deepseek-v4-flash"`), quindi il vero lavoro è testare nuovamente i prompt rispetto al comportamento V4 e decidere, endpoint per endpoint, quale livello merita ogni carico di lavoro — o mettere un router davanti così la prossima deprecazione è un cambio di configurazione invece di un cambio di codice.

Chi dovrebbe usare DeepSeek V4?

Prodotti ad alto volume — supporto, riepilogo, estrazione, classificazione — dove i prezzi V4 rendono redditizie le funzionalità marginali

Carichi di lavoro pesanti su documenti lunghi e RAG che riempiono finestre da 1 milione di token al giorno e traggono profitto da cache quasi gratuite

Team che generano output lunghi: codebase, report, dati strutturati — 384K output è il limite della classe.

Costruttori attenti ai costi che vogliono un'impostazione predefinita capace e sono contenti di spostare il difficile 10% altrove.

Chi dovrebbe cercare altrove?

I team il cui carico di lavoro principale è costituito da agenti autonomi di lunga durata — GLM-5.2 o un modello flagship chiuso è la scelta più sicura.

Flussi di lavoro dipendenti dalla visione (V4 non acquisisce immagini)

Chiunque abbia bisogno oggi di un'etichetta 'stable' contrattuale invece di una preview.

Vale la pena DeepSeek V4?

Per il prezzo, decisamente sì — come una corsia, non una religione. V4 non batte il miglior codificatore open-weight (GLM-5.2) né le ammiraglie di frontiera in termini di qualità, e i suoi numeri di agente a lungo orizzonte sono davvero deboli. Quello che fa è rendere enormi porzioni di lavoro AI quotidiano — i riassunti, le estrazioni, le bozze e i turni di chat che dominano le fatture reali di token — quasi senza costo. Il modello vincente è V4 come pavimento di volume, con corsie di escalation sopra di esso.

Verdetto finale

DeepSeek V4 è il punto di riferimento prezzo-prestazioni con cui ogni altro modello viene ora confrontato — il nostro punteggio: ~8.3/10. Usa Flash dove conta il volume, Pro dove la qualità è importante ma i budget sono reali, e indirizza il lavoro di livello superiore a un modello più potente. Ricalcola i tuoi costi quando i prezzi di punta arriveranno a metà luglio — il conveniente resta tale, ma smette di essere piatto. E se sei ancora su deepseek-chat o deepseek-reasoner: hai tempo fino al 24 luglio. Muoviti.

Utilizzo di DeepSeek V4 tramite OrcaRouter

Una strategia a tre corsie — V4 per il volume, un modello chiuso o aperto più performante per i compiti difficili, un fallback per l'affidabilità — è esattamente la configurazione che è faticosa da gestire a mano e banale dietro un gateway. OrcaRouter serve DeepSeek V4 insieme a GLM-5.2, Claude, GPT, Gemini e oltre 200 altri modelli tramite un unico endpoint compatibile con OpenAI, ai prezzi dei fornitori senza markup sui token: il routing intelligente sceglie la corsia per ogni richiesta, il failover automatico copre i problemi tipici delle versioni in preview, e la visibilità per modello mostra cosa costa effettivamente ogni corsia per attività completata. Inoltre neutralizza i cambiamenti lato fornitore come il ritiro del nome del 24 luglio o i prezzi di punta di metà luglio — quando un nome di modello viene dismesso o si apre una finestra tariffaria, aggiorni una regola di routing, non il tuo codice.

Domande frequenti

DeepSeek V4 è disponibile ora?

Sì — V4-Pro e V4-Flash sono attivi sull'API DeepSeek dal 24 aprile 2026, con gli ID modello deepseek-v4-pro e deepseek-v4-flash, con pesi open-source. Ufficialmente è un'anteprima; l'avviso del 29 giugno di DeepSeek colloca la versione ufficiale a metà luglio 2026.

Qual è il prezzo di DeepSeek per le ore di punta?

Annunciato per il rilascio ufficiale: da metà luglio 2026, tutti i prezzi dei token raddoppiano durante le finestre di lavoro di Pechino (09:00-12:00 e 14:00-18:00 ora di Pechino), mentre nelle ore non di punta rimangono le tariffe attuali. Il traffico che raggiunge il picco al di fuori dell'orario lavorativo cinese – la maggior parte dei carichi di lavoro occidentali – evita in gran parte il sovrapprezzo.

Cosa succede a deepseek-chat e deepseek-reasoner?

Attualmente indirizzano automaticamente a V4-Flash, ma dopo il 24 luglio 2026 (15:59 UTC) entrambi i nomi saranno completamente ritirati e le richieste falliranno. Aggiorna esplicitamente il parametro del modello prima della scadenza.

Dovrei usare V4-Pro o V4-Flash?

Flash per lavori di volume che un umano non rivede mai riga per riga — riassunti, estrazione, classificazione, chat. Pro per codice, analisi e bozze, a circa 3 volte il prezzo di Flash ma ancora molto al di sotto di ogni modello comparabile.

È DeepSeek V4 migliore di GLM-5.2?

Più economico, non migliore. Nella tabella pubblicata da Z.ai, GLM-5.2 è nettamente in vantaggio nel coding e domina il lavoro degli agenti a lungo termine; V4 replica con prezzi 3–5 volte inferiori, un limite di output di 384K e cache hit quasi gratuiti. Molti team usano entrambi: V4 per il volume, GLM-5.2 per gli agenti di coding.

DeepSeek V4 può gestire immagini?

No — l'API V4 è solo testo. Instrada invece le attività di visione (screenshot, PDF come pixel, grafici) a un modello multimodale come Claude o Gemini.

Posso auto-ospitare DeepSeek V4?

I pesi sono open-source, ma siate realistici sulla scala: il V4-Pro è un MoE da 1,6T di parametri — territorio data-center — mentre il V4-Flash da 284B è l'obiettivo pratico di self-hosting per team ben forniti.

V4 funziona con i miei strumenti esistenti di OpenAI o Claude?

Per lo più sì — l'API supporta nativamente sia i formati OpenAI ChatCompletions che Anthropic, quindi i framework per agenti e gli SDK costruiti per l'uno o l'altro solitamente si connettono con una modifica dell'URL di base e del nome del modello.

Posso usare DeepSeek V4 tramite OrcaRouter?

Sì — i modelli DeepSeek sono disponibili su OrcaRouter ai prezzi di listino dei fornitori senza alcun margine, accanto a GLM, Claude, GPT e Gemini, così da poter eseguire la suddivisione volume-plus-escalation dietro un unico endpoint.

Pronto a rendere noiosa la tua bolletta dei token? Crea il tuo account OrcaRouter, punta il tuo client compatibile con OpenAI su un endpoint e instrada il volume verso DeepSeek V4 mentre i modelli più potenti gestiscono il vertice — con zero markup sui token e un'integrazione a prova di 24 luglio.


© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube