
DeepSeek V4 Flash Rilascio Ufficiale: il modello agentico da 1M di contesto, economico e veloce, spiegato
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
DeepSeek V4 Flash è la metà economica della scala V4 di DeepSeek, e i dati indipendenti l'hanno finalmente raggiunta: sul set AIME 2026 di MathArena ottiene un punteggio del 95,83%, statisticamente indistinguibile dal 96,67% di DeepSeek V4 Pro, a circa un nono del costo per problema. La build ufficiale in beta pubblica, -0731, è stata rilasciata il 31 luglio 2026 con la stessa architettura dell'anteprima di aprile — un modello mixture-of-experts da 284 miliardi di parametri, 13B attivi, con un contesto di 1 milione di token — ma con un ciclo di post-training aggiuntivo che ha nettamente migliorato le sue capacità agentiche, di coding e di chiamata degli strumenti, oltre al supporto nativo per le Responses-API e adattamenti specifici per gli agenti in stile Codex. Questa guida copre ciò che il rilascio ha effettivamente cambiato, cosa dicono le valutazioni del fornitore e quelle indipendenti, quanto costa considerando quanto ragiona, e come invocarlo.
Nota sull'accuratezza: i dettagli della release e i punteggi agentici principali riportati di seguito provengono dal changelog ufficiale dell'API di DeepSeek (datato 2026-07-31) e sono dichiarati dal fornitore, eseguiti sull'harness della stessa DeepSeek — considerali indicativi ed esegui le tue valutazioni. Le cifre indipendenti sono attribuite dove compaiono: Artificial Analysis per l'Intelligence Index e le sue componenti, MathArena per AIME 2026, la lista prezzi di DeepSeek per i prezzi. Dove qualcosa si basa sul report di un singolo operatore piuttosto che su una valutazione pubblicata, la frase lo dice esplicitamente. Specifiche e prezzi cambiano; verifica prima di sviluppare.
TL;DR. V4 Flash è il fratello conveniente del gigante DeepSeek V4 Pro: un MoE da 284B / 13B attivi con un contesto di 1M token e fino a 384K di output, ottimizzato per lavoro agentico ad alto volume e bassa latenza. Il rilascio ufficiale del 31 luglio è un aggiornamento post-addestramento — stessa dimensione, agenti e coding sostanzialmente migliori — che aggiunge anche il supporto nativo a Responses-API e Codex. DeepSeek riporta punteggi solidi in ambito agentico/coding (ad es., Terminal-Bench 2.1 82,7, Toolathlon 70,3), e Artificial Analysis ha in seguito assegnato alla build -0731 un punteggio di 50 sul proprio Intelligence Index: dieci punti in più rispetto all'anteprima di aprile, sei in più rispetto alla ben più grande V4 Pro, e alla pari con Gemini 3.6 Flash. Costa circa 0,15 $ / 0,29 $ al milione di token di input/output, all'incirca un terzo del prezzo di V4 Pro. Solo l'API Flash è stata aggiornata; V4 Pro e l'app/web di DeepSeek sono invariati. Su OrcaRouter lo ottieni con un markup dello 0% tramite un unico endpoint compatibile con OpenAI.
Punti chiave
• Rilascio ufficiale (build -0731, 31 luglio 2026): un aggiornamento post-training dell’anteprima — stessa architettura, agenti molto più potenti, codifica e uso degli strumenti.
• Architettura invariata: 284B totali / 13B attivi (MoE), contesto da 1M token (1,048,576), fino a 384K di output, input solo testo, con ragionamento, strumenti e JSON.
• Nuovo: supporto nativo per l'API Responses e un adattamento specifico per Codex; continua a supportare OpenAI ChatCompletions e interfacce in stile Anthropic. ID modello deepseek-v4-flash.
• Miglioramenti agentici/di coding riportati da DeepSeek: Terminal-Bench 2.1 82,7, Toolathlon (verificato) 70,3, Cybergym 76,7, DeepSWE 54,4, NL2Repo 54,2, DSBench-FullStack 68,7.
• Molto economico: circa $0,15 / $0,29 per 1M di token di input/output — circa un terzo dei $0,44 / $0,88 di V4 Pro — e DeepSeek fa pagare i cache hit a $0,0028 per 1M, circa il 98% in meno rispetto all'input non in cache. Solo l'API Flash è cambiata; Pro e app/web sono uguali.
Ciò che la versione ufficiale ha effettivamente aggiornato
V4 Flash è apparso per la prima volta come anteprima il 24 aprile 2026. Il rilascio ufficiale del 31 luglio 2026 (la -0731 build, secondo il changelog API di DeepSeek) è esplicitamente non una nuova architettura: i parametri totali e attivi (284B / 13B) e il contesto da 1M sono invariati. Ciò che è cambiato è il post-training — un'ulteriore messa a punto che DeepSeek afferma abbia migliorato significativamente le capacità agentiche, di codifica e di chiamata degli strumenti. Due aggiunte pratiche contano: V4 Flash ora supporta nativamente le API Responses ed è specificamente adattato per gli agenti di codifica in stile Codex, pur continuando a parlare le interfacce OpenAI ChatCompletions e in stile Anthropic. È importante notare che in questo rilascio è stata aggiornata solo l'API Flash; V4 Pro e le esperienze app/web di DeepSeek rimangono invariate. Per i team, ciò significa un miglioramento drop-in per i carichi di lavoro agentici allo stesso prezzo, senza migrazione.

Architettura: un MoE a piccola attivazione progettato per il throughput.
V4 Flash è un modello mixture-of-experts con circa 284 miliardi di parametri totali, ma solo circa 13 miliardi attivi per token. Questo numero basso di parametri attivi è il punto chiave: mantiene l'inferenza veloce ed economica, mentre un ampio pool di esperti preserva la qualità. La finestra di contesto è di ben 1.048.576 token (circa 1M), con un output massimo molto grande di 384K, e il modello supporta ragionamento (pensiero esteso), chiamate a strumenti e JSON strutturato. L'input è solo testo. L'obiettivo di progettazione — lavoro ad alto volume, bassa latenza e agentico — si riflette nei numeri di servizio: un p50 time-to-first-token di circa 394 millisecondi e un output di circa 184 token al secondo secondo le misurazioni di OrcaRouter.
Benchmark: cosa dicono i numeri ufficiali
La versione ufficiale punta fortemente sulle valutazioni agentiche e di coding, eseguite con l'harness di DeepSeek (impostazioni minimal-mode / max-effort). Ecco come leggere i risultati principali, tutti riportati da DeepSeek:
• Terminal-Bench 2.1: 82.7 — attività agentiche da riga di comando/software in un terminale reale. Un punteggio elevato qui indica un modello che sa davvero pilotare strumenti e shell, non solo rispondere a domande.
• Toolathlon (verificato): 70.3 e Automation Bench (Pubblico): 25.1 — ampiezza e affidabilità dell'uso degli strumenti e automazione end-to-end. L'affidabilità delle chiamate agli strumenti è la caratteristica decisiva per gli agenti.
• Cybergym: 76.7 — problem solving agentico in stile security/CTF.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — ingegneria del software e programmazione full-stack, dalla generazione a livello di repository ai task complessi di data science. Il forte risultato DSBench-FullStack (68.7) indica una concreta competenza di programmazione multi-file.
• Agent Last Exam: 25.2 — una prova di ragionamento agentico deliberatamente difficile in cui anche i modelli di punta ottengono punteggi bassi; utile come segnale relativo, non assoluto.
Per un contesto indipendente, Artificial Analysis ha ora valutato la build -0731 stessa e le assegna un punteggio di 50 sull'Artificial Analysis Intelligence Index — dieci punti sopra l'anteprima di aprile che sostituisce, sei punti sopra il molto più grande V4 Pro, e alla pari con Gemini 3.6 Flash. I suoi risultati componenti: GPQA Diamond 91%, AA-LCR 66%, Humanity's Last Exam 37%, SciCode 50%, τ³-Bench Banking 31%, CritPt 17% e un Elo di 1559 su GDPval-AA v2. Due di questi meritano un secondo sguardo. Artificial Analysis ha misurato Terminal-Bench 2.1 al 79% contro l'82,7 riportato da DeepSeek — vicino, ma più basso, che è la direzione in cui di solito mancano i numeri dell'harness del fornitore. E su AA-Omniscience il modello si attesta a -16 con un alto tasso di allucinazione misurato, quindi la storia del modello economico e agentico non si estende al richiamo fattuale non supervisionato. Questo è il modo più affilato di leggere questo modello: ragionamento forte per dollaro, conoscenza debole per query.
Matematica da competizione: l'unico posto dove Flash eguaglia Pro
La lettura indipendente più utile sul ragionamento di V4 Flash arriva da MathArena, che esegue ogni modello quattro volte su ciascun problema di una competizione appena resa pubblica e pubblica la griglia per-problema. Su AIME 2026 — entrambe le prove, 30 problemi, quattro esecuzioni ciascuna — V4 Flash in modalità max-reasoning ottiene il 95.83% ±3.58%, contro il 96.67% ±3.21% di DeepSeek V4 Pro. Questi intervalli si sovrappongono quasi completamente: su questo benchmark il modello più piccolo non è misurabilmente peggiore del modello di punta. È sulla colonna dei costi che si separano. MathArena stima una singola esecuzione di V4 Flash a $0.009 per problema contro $0.082 per V4 Pro — circa nove volte più economica a parità di accuratezza, un argomento a favore del livello di efficienza più forte di qualsiasi cosa contenuta nell'annuncio di DeepSeek stesso.
Due avvertenze vanno dette nello stesso respiro. MathArena segnala entrambe le voci DeepSeek con un avviso di contaminazione, la sua etichetta per un modello rilasciato dopo la comparsa della competizione, quindi parte di quella precisione potrebbe essere memoria piuttosto che ragionamento. E la versione testata da MathArena è datata 2026-04-24 — l'anteprima di aprile, non la build -0731. Al momento in cui scrivo, non esiste un punteggio AIME 2026 indipendente per la versione ufficiale, e la scheda del modello DeepSeek non pubblica alcun benchmark matematico per essa, solo quelli agentici.
La griglia mostra anche dove si colloca il tetto. Quasi tutti i modelli in classifica risolvono la maggior parte di AIME 2026; il problema che li distingue è il problema 15. Solo due voci lo risolvono in tutte e quattro le esecuzioni: GPT-5.5 con sforzo extra-alto e Claude Opus 4.8 al massimo. V4 Flash ottiene zero su quattro in quel problema, e così anche V4 Pro, insieme a GLM-5.2, Gemini 3.6 Flash, Kimi K2.6 e Claude Opus 4.7.
Quel dettaglio finale è ciò che rende un report del 5 agosto 2026 degno di nota. Il commentatore AI @teortaxesTex ha pubblicato che la build -0731 ha effettivamente risolto il problema 15 di AIME 2026, impiegando circa 1.006 secondi e circa 100.000 token di output, e ha descritto il modello che iniziava visibilmente a barare sul problema prima di abbandonare la scorciatoia e risolverlo onestamente. Questo è un singolo run di un professionista, non un risultato di benchmark: non è stato riprodotto, nessuna classifica pubblica ha valutato la build -0731, e una trascrizione isolata non è una valutazione. Ciò che si può verificare è la coerenza interna, e regge — Artificial Analysis misura l'output di questo modello a circa 116 token al secondo, e 1.006 secondi a quella velocità equivalgono a circa 117.000 token, lo stesso ordine di grandezza del conteggio riportato. Una risposta da 100.000 token è anche ben all'interno di ciò che DeepSeek prevede, dato che raccomanda di consentire fino a 384K token di output con sforzo di ragionamento alto o massimo. Entrambe le cifre sono circa tre volte le medie misurate da MathArena per questo modello (33.588 token di output e 6m 50s per risposta), il che è ciò che ci si aspetterebbe sul singolo problema più difficile del set. Quindi: plausibile nella forma, non verificato nell'esito, e se si replica è un vero salto rispetto alla build di anteprima, che fallisce quel problema quattro volte su quattro.
Prezzo: il numero che cambia i budget.
Su OrcaRouter, che trasmette i prezzi dei provider con un markup dello 0%, V4 Flash costa circa $0.15 per milione di token di input e $0.29 per milione di token di output, e DeepSeek ha mantenuto invariati i prezzi per questo aggiornamento. Si tratta di circa un terzo dei $0.44 / $0.88 di DeepSeek V4 Pro. I cache hit sono più economici di quanto la maggior parte delle persone pensi: DeepSeek elenca l'input in cache a $0.0028 per milione, circa il 98% in meno rispetto all'input fresco, ed è questo che rende così economico mantenere in esecuzione agenti e chat con un system prompt stabile. In termini reali, 10 milioni di token al mese con una ripartizione 70% input / 30% output si aggirano intorno a un paio di dollari; scalando a un miliardo di token, il divario rispetto a un modello di punta diventa una voce di costo che la finanza nota.
Su un modello di reasoning, però, il listino prezzi è la metà meno interessante della fattura: ciò che sposta i budget è quanti token il modello sceglie di spendere. Artificial Analysis ha avuto bisogno di circa 206 milioni di token di output per eseguire il suo Intelligence Index completo su V4 Flash, grosso modo il doppio della mediana di ~100 milioni riscontrata sui modelli che testa, e lo descrive come veloce ma molto prolisso. A conti fatti, una singola risposta da 100.000 token costa circa tre centesimi, e il tetto di output di 384K porta una risposta a quasi undici centesimi. Economico in termini assoluti, ma qualche centinaio di volte il costo di una risposta breve — ed è per questo che lo sforzo di reasoning è una leva di budget, non una manopola di qualità da lasciare sempre al massimo. Il resoconto pratico di Simon Willison fa lo stesso punto dalla direzione opposta: con le impostazioni predefinite, la sua generazione nei test è stata deludente, e alzare lo sforzo di reasoning a "high" l'ha migliorata sostanzialmente. Misura le tue richieste complesse prima di assumere che la tariffa di listino sia il tuo costo.
Dove si colloca V4 Flash: la scala DeepSeek V4
La gamma V4 di DeepSeek è una scala. V4 Pro è l'ammiraglia — un modello di ragionamento e codifica molto più grande, di fascia alta. V4 Flash è il livello efficiente: molta meno potenza di calcolo attiva, una frazione del prezzo e, dopo questo aggiornamento post-addestramento, capacità agentiche e di codifica davvero solide. Il fatto che DeepSeek abbia investito nel rendere Flash un agente migliore (Responses API, adattamento a Codex, benchmark sull'uso degli strumenti) ti dice dove prevede che si concentrerà il volume. Ma i numeri di AIME 2026 complicano la versione pulita di quella storia a favore di Flash: nella matematica da competizione i due modelli rientrano nei reciproci margini di errore, quindi "invia i problemi difficili a Pro" non è automaticamente giusto. La distinzione onesta è che Pro garantisce ampiezza di conoscenza e il lavoro agentico più difficile, non una migliore possibilità di risolvere un problema di matematica difficile — ed è per questo che instradare in base alla difficoltà misurata sui propri compiti batte l'usare di default il modello più grande.

Tre scenari reali
1. Agenti di codifica e flussi di lavoro in stile Codex
Il supporto nativo per Responses-API e Codex della build -0731 e i suoi punteggi Terminal-Bench (82.7) e DSBench-FullStack (68.7) rendono V4 Flash un motore potente ed economico per agenti di coding autonomi — risoluzione di issue, refactoring, generazione di test, uso di strumenti multi-step.
2. Agenti ad alto volume che utilizzano strumenti
Primi token veloci (~394 ms), throughput elevato (~184 tok/s), contesto da 1M e un'elevata affidabilità Toolathlon (70.3) si adattano ad agenti di produzione che chiamano strumenti su larga scala — recupero, automazione, orchestrazione.
3. Elaborazione di documenti lunghi con un budget limitato
Il contesto completo di 1M token e l'output di 384K gestiscono il riepilogo, l'analisi o la trasformazione di input molto grandi — log, codebase, report lunghi — in un'unica passata, a basso costo.
Come accedere a V4 Flash
Puoi chiamare V4 Flash direttamente sull'API di DeepSeek (model id deepseek-v4-flash; supporta le interfacce Responses API, OpenAI ChatCompletions e in stile Anthropic), oppure tramite un endpoint vendor-neutral. OrcaRouter espone V4 Flash con markup 0% attraverso un singolo endpoint compatibile con OpenAI (deepseek/deepseek-v4-flash) insieme ad altri 200+ modelli — così puoi confrontarlo con GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen3.8-Max e Kimi K3 in un unico posto, e instradare ogni richiesta verso l'opzione più economica per il compito. Poiché i prezzi vengono trasferiti direttamente, senza maggiorazione, una modifica dei prezzi di DeepSeek arriva sulla tua fattura il giorno stesso in cui viene rilasciata. E poiché l'interfaccia è compatibile con OpenAI, adottare V4 Flash — o abbandonarlo dopo una settimana di misurazione — è un cambio di configurazione, non una nuova integrazione.

Limitazioni e avvertenze oneste
{{1}}V4 Flash è un modello di efficienza, non un modello di punta, ma i dati indipendenti hanno reso quel confine più specifico di "peggiore nelle cose difficili".{{/1}} {{2}}Su AIME 2026 eguaglia V4 Pro entro gli intervalli di confidenza; dove resta chiaramente indietro è nell'ampiezza delle conoscenze — AA-Omniscience -16 e un alto tasso di allucinazioni misurato — e nel lavoro agentico più impegnativo.{{/2}} {{3}}L'input è solo testuale, senza input nativo di immagini.{{/3}} {{4}}I punteggi agentici principali sono riportati da DeepSeek sul proprio harness, e l'unica cifra che un laboratorio indipendente ha ricalcolato è risultata più bassa (Artificial Analysis ha misurato Terminal-Bench 2.1 al 79% contro l'82,7 riportato), quindi tratta i numeri del vendor come indicativi.{{/4}} {{5}}E "economico per token" non significa "economico per compito": questo modello è misurabilmente verboso, quindi limita lo sforzo di ragionamento e le iterazioni degli strumenti nelle chiamate semplici invece di lasciare lo sforzo massimo attivo per impostazione predefinita.{{/5}} {{6}}Valida sul tuo carico di lavoro prima di destinare traffico di produzione.{{/6}}
Domande frequenti
Cos'è DeepSeek V4 Flash?
Il modello di efficienza di DeepSeek nella linea V4: un modello mixture-of-experts da 284B / 13B attivi con un contesto di 1M token, fino a 384K di output, ottimizzato per lavoro agentico e di codifica rapido e ad alto volume. Il suo rilascio ufficiale (build -0731) è stato pubblicato il 31 luglio 2026.
Cosa è cambiato nella versione ufficiale?
L'architettura è invariata; si tratta di un upgrade post-training che migliora significativamente le capacità agentiche, di coding e di tool calling, e aggiunge il supporto nativo alle Responses API con adattamento Codex. Solo la Flash API è stata aggiornata — V4 Pro e app/web restano gli stessi.
Quanto costa V4 Flash?
Circa $0,15 per milione di token di input e $0,29 per milione di token di output su OrcaRouter (ricarico 0%) — all'incirca un terzo dei $0,44 / $0,88 di V4 Pro — con i cache hit indicati a $0,0028 per milione, circa il 98% in meno rispetto all'input non in cache. I prezzi sono rimasti invariati in questa release. Considera nel budget sia il volume di token che il costo: questo è un modello reasoning prolisso, e una risposta da 100.000 token costa circa tre centesimi.
Quanto è bravo V4 Flash nei compiti agentici e di codifica?
DeepSeek riporta punteggi elevati: Terminal-Bench 2.1 82.7, Toolathlon (verificato) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — tutti dati dell'harness del vendor, quindi verifica sui tuoi compiti.
V4 Flash è bravo nella matematica competitiva?
Migliore di quanto il prezzo suggerisca. Sulla griglia AIME 2026 di MathArena, la build di anteprima di aprile ottiene il 95,83% in quattro esecuzioni di 30 problemi — all'interno dell'intervallo di confidenza del 96,67% di V4 Pro, a circa un nono del costo per problema — anche se MathArena segnala entrambi i modelli per possibile contaminazione, e non ha ancora valutato la build -0731. L'unico problema che non risolve mai è il problema 15, che solo GPT-5.5 con sforzo extra-alto e Claude Opus 4.8 al massimo risolvono in modo affidabile.
Come si confronta V4 Flash con V4 Pro?
Pro è il flagship di gran lunga più potente per il ragionamento e il coding più complessi; Flash è il livello efficiente a circa 1/3 del prezzo, con una forte capacità agentica e di coding. Instrada i task difficili su Pro, tutto il resto su Flash.
Qual è la finestra di contesto?
Un totale di 1.048.576 token (circa 1 milione), con fino a 384.000 token di output.
V4 Flash è multimodale?
No — l'input è solo testo. Supporta ragionamento, chiamata di strumenti e output JSON.
V4 Flash funziona con Responses API e Codex?
Sì — la release -0731 aggiunge il supporto nativo per Responses-API e un adattamento specifico per Codex, insieme a OpenAI ChatCompletions e a interfacce in stile Anthropic.
Come uso V4 Flash?
Direttamente tramite l'API di DeepSeek, oppure tramite l'endpoint compatibile con OpenAI di OrcaRouter con un margine dello 0% (deepseek/deepseek-v4-flash), dove puoi anche confrontare e instradare le richieste tra modelli concorrenti.
Il risultato finale
Il rilascio ufficiale di DeepSeek V4 Flash mantiene la ricetta economica e veloce e lo rende un agente decisamente migliore: stessa MoE 284B / 13B-attivi e 1M di contesto, post-addestrato per un coding e un uso degli strumenti più solidi, con supporto nativo a Responses-API e Codex, allo stesso prezzo di ~$0,15 / $0,29. I numeri indipendenti ora supportano gran parte della proposta — Artificial Analysis colloca la build -0731 allo stesso livello di Gemini 3.6 Flash sul fronte dell'intelligenza, e MathArena vede la build preview eguagliare V4 Pro su AIME 2026 a un nono del costo per problema. Quello che il prezzo basso non compra è l'ampiezza delle conoscenze o un lasciapassare sulla verbosità: questo modello pensa impiegando all'incirca il doppio del budget di token di un modello medio, quindi la fattura per singola attività dipende più dallo sforzo di ragionamento che si consente che dal prezzo di listino. Provalo attraverso un endpoint compatibile OpenAI con ricarico 0% come OrcaRouter, misura quanto spendono davvero le tue richieste più difficili, e instrada verso un modello di punta solo dove la misurazione dice che è necessario.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
