
DeepSeek V4.1 Flash vs DeepSeek V4 Pro: il passaggio di consegne programmato da DeepSeek, poi annullato
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
DeepSeek V4.1 Flash è stato rilasciato il 2026-09-10, e ormai DeepSeek V4 Pro sarebbe dovuto sparire. Il piano, annunciato due giorni prima del rilascio di Flash e confermato il giorno stesso del rilascio, prevedeva che il 2026-09-14 alle 12:00 ora di Pechino ogni richiesta a deepseek-v4-pro sarebbe stata reindirizzata silenziosamente verso il più recente ed economico deepseek-flash e fatturata alle tariffe di Flash. DeepSeek ha annullato tutto il 2026-09-11 dopo le obiezioni degli sviluppatori, e il 2026-09-14 la scadenza è passata con V4 Pro ancora attivo e la sua fatturazione invariata. Quindi questo non è un confronto tra lanci — il modello a sinistra ha otto giorni di vita e il modello a destra è un flagship di un anno, al suo quarto mese di disponibilità generale. È un confronto tra due modelli il cui produttore ha pubblicato benchmark secondo cui quello economico vinceva, per poi scoprire che i suoi utenti non erano d'accordo, e fare marcia indietro. Quella sequenza è la cosa più utile che chiunque abbia pubblicato su uno dei due modelli questo mese, perché è esattamente la decisione che stai per prendere anche tu.
Cosa è realmente successo, in ordine.
Qui la tempistica conta più di qualunque singolo benchmark, perché l’inversione è il punto centrale e l’annuncio è stato volutamente tenuto a bassa voce.
• 2026-09-09 — DeepSeek comunica agli utenti che, prima dell'arrivo di V4.1 Pro, le richieste a V4 Pro saranno indirizzate a V4.1 Flash e fatturate alle tariffe di Flash. Il messaggio è che Flash ha superato Pro in modo completo in termini di prestazioni, costi, velocità e tempo di completamento delle attività.
• 2026-09-10 — DeepSeek V4.1 Flash diventa GA su app, web e API. I pesi arrivano su Hugging Face con licenza MIT. Il nome del modello API diventa deepseek-flash. I modelli della generazione precedente deepseek-v4-flash e deepseek-v4-flash-vision-exp vengono ritirati del tutto, con i loro ID legacy temporaneamente reindirizzati a V4.1 Flash. La disattivazione di Pro è posticipata al 2026-09-14, 12:00 ora di Pechino (04:00 UTC).
• 2026-09-11 — DeepSeek fa marcia indietro. In risposta alla richiesta degli utenti, afferma che il servizio API V4 Pro continuerà dopo il 2026-09-14 con fatturazione invariata, e il passaggio automatico a V4.1 Flash è annullato.
• 2026-09-14 — la scadenza passa. V4 Pro è ancora operativo a $0,66 / $1,98 per milione di token fuori picco.
L'asimmetria in quella sequenza è l'intero articolo. Gli utenti Flash sono stati migrati che lo volessero o no — il vecchio ID di V4 Flash ora risponde con un modello diverso. Gli utenti Pro hanno ottenuto una tregua, e il motivo non è che V4 Pro ottenga risultati migliori nei benchmark. È che i sistemi di produzione erano stati messi a punto su di esso: prompt, scaffold di agenti, harness di valutazione e assunzioni di riproducibilità che uno scambio di backend invalida senza alcuna modifica al codice da parte del chiamante. La pagina di confronto di DeepSeek elenca ancora oggi entrambi i modelli, fianco a fianco, il che ti dice che l'azienda intende servirli entrambi.
Fianco a fianco: i due SKU
Tutto ciò che segue è la specifica pubblicata da DeepSeek stessa, a meno che non venga indicata una fonte. I prezzi sono per milione di token, fuori punta, con la tariffa di punta tra parentesi — DeepSeek è in fascia di punta tra le 01:00 e le 04:00 e di nuovo tra le 06:00 e le 10:00 UTC, dal lunedì al venerdì, e tutte le altre ore sono fuori punta a metà della tariffa di punta.
• nome del modello API — deepseek-flash (DeepSeek-V4.1-Flash) vs deepseek-v4-pro (DeepSeek-V4-Pro-0813).
• Input, miss della cache — 0,15 $ (0,30 $) rispetto a 0,66 $ (1,32 $).
• Input, hit della cache — 0,003 $ (0,006 $) vs 0,022 $ (0,044 $).
• Output — $0.60 ($1.20) vs $1.98 ($3.96).
• Contesto / output massimo — 1M token / 384K su entrambi. Identici.
• Input immagine — supportato nativamente su Flash; indicato come non supportato su V4 Pro.
• Limite di concorrenza — 2.500 su Flash rispetto a 500 su V4 Pro.
• Parametri dichiarati — Flash: 552B totali, dato del fornitore, con una contestazione credibile da parte della comunità (ne parleremo più avanti nel dettaglio). V4 Pro: 1,6T totali, ~49B attivi, che anche Artificial Analysis elenca e la pagina della ricetta vLLM conferma.
• Budget attivo per token — Flash attiva all'incirca 8B in prefill e 16B in decode per scelta progettuale, che è proprio il punto della sua architettura; Pro attiva ~49B per token.
• Licenza — pesi aperti MIT su entrambi.
• Data GA — Flash 2026-09-10; V4 Pro 0813 2026-08-13, dopo un'anteprima di aprile.

Il divario di prezzo è l'intero argomento.
L'input costa 4,4× di più su Pro. L'output è 3,3×. Le cache hit — il livello che domina una lunga esecuzione di un agente con un prompt di sistema stabile — sono 7,3×. Poiché il picco raddoppia a ogni livello su entrambi i fronti, il rapporto è identico al picco; il divario non è un artefatto dello sconto.
Mettilo alla prova con un carico di lavoro. Prendi un agente di coding che consuma 10M di token di input al mese, con un tasso di cache hit del 70%, e 2M di token di output. Su V4.1 Flash in off-peak sono $0,45 di input fresco, $0,021 di input in cache e $1,20 di output: $1,67. Su V4 Pro in off-peak sono $1,98, $0,154 e $3,96: $6,09. Circa 3,6×, su un carico di lavoro volutamente ordinario.
Questo è il listino di DeepSeek stesso, ed è il prezzo che paghi effettivamente qui: OrcaRouter passa le tariffe di listino dei provider con markup allo 0%, quindi una variazione di prezzo di DeepSeek arriva dalla nostra parte lo stesso giorno invece di essere riconfezionata. Entrambi i modelli si trovano sulla stessa chiave, il che conta per la sezione più avanti — quella sul testare una migrazione che non devi più fare.

Dove DeepSeek V4.1 Flash vince davvero
La prova più forte a favore di Flash non è la tabella di benchmark di DeepSeek. È Artificial Analysis, che è indipendente e viene consultata direttamente dalle sue pagine dei modelli.
• Intelligence Index — Flash (Reasoning, Max Effort) ottiene un punteggio di 40, classificandosi al n. 6 su 113 modelli. V4 Pro 0813 (Reasoning, Max Effort) ottiene 36, classificandosi al n. 7. Stesso indice, stessa impostazione di effort, quattro punti di differenza, con il modello più economico in vantaggio.
• Velocità di output — 214,4 token/s contro 94,4 token/s. Sono 2,3×, ed è un dato misurato, non dichiarato.
• Tempo al primo token — 1,21s contro 1,74s.
• DeepSWE v1.1 — 74.2 per Flash nella classifica monitorata, primo posto, davanti a GPT-6 Astra a 74.10, Claude Opus 5 a 74.00 e Gemini 3.8 Flash a 73.70. Il 62.7 di V4 Pro 0813 sullo stesso benchmark è il dato di DeepSeek stesso. Il margine in testa è di 0.2 punti, il che è un pareggio, non una vittoria — ma un divario di 11.5 punti rispetto a Pro non è un pareggio.
• Efficienza di serving — Il decoder di Flash ricava il proprio KV globale dallo stato nascosto finale dell'encoder invece di ricalcolarlo per ogni livello, ed è questo che produce l'attivazione asimmetrica 8B-prefill / 16B-decode. Il profilo InferenceX di SemiAnalysis colloca la cache KV a circa 890 byte per token — circa un quarto di quella di V4 Flash — con memoria KV persistente ridotta a circa un ottavo. È questo il motivo per cui il prezzo è quello che è, ed è anche il motivo per cui il modello è disponibile a 2.500 concorrenze quando Pro si ferma a 500.
• Visione sull'API servita — non solo nei pesi. La pagina dei prezzi di DeepSeek stessa elenca l'input di immagini come supportato per Flash e non supportato per V4 Pro, e DeepSeek lo descrive come il suo primo flagship con comprensione multimodale nativa. Questo è il primo flagship DeepSeek in cui leggere uno screenshot non richiede un endpoint separato.
Tutti gli altri numeri di punta che vedrai citati — Terminal-Bench 2.1 a 90,6, GPQA Diamond a 90,9, Codeforces 3471 — sono di DeepSeek, non riprodotti da noi, e vanno letti tenendo conto di questo.
Dove DeepSeek V4 Pro è ancora la scelta giusta
Sarebbe facile liquidare V4 Pro dopo una settimana così. La deprecazione invertita dice il contrario, e anche la scheda tecnica dice il contrario.
Pro ha 1,6T di parametri totali e ne attiva ~49B per token, contro i 16B di Flash in fase di decodifica. Qualunque cosa dica l'indice, la capacità per token è una risorsa reale, e i carichi di lavoro in cui si manifesta sono quelli a lungo orizzonte: esecuzioni di agenti di più ore, grandi refactoring, attività in cui una svolta sbagliata all'inizio costa l'intera traiettoria. Un divario di quattro punti nell'indice misura la media di dieci valutazioni, non la coda della tua distribuzione.
Pro è anche una certezza consolidata. È disponibile a livello generale dal 2026-08-13, dopo un'anteprima di aprile, e la build 0813 ha ottenuto le sue prestazioni dal post-training anziché dall'architettura — stesso numero di parametri, stessa forma dell'anteprima, comportamento diverso. Sono quattro mesi di strumenti della comunità, harness per agenti pubblicati, pattern di prompt e modalità di errore. Flash è disponibile a livello generale da otto giorni, e l'ecosistema che lo circonda è di conseguenza esile. Se l'affidabilità del tuo team deriva dal sapere esattamente come fallisce un modello, Pro è il posto in cui risiede quella conoscenza.
E il servizio non si è fermato. L'impegno di DeepSeek è esplicito e la sua fatturazione è invariata, i pesi sono MIT, e V4 Pro è ancora nel nostro catalogo allo stesso prezzo di listino. La deprecazione annullata non è una sospensione dell'esecuzione — è una dichiarazione che DeepSeek intende continuare a servire il livello.

Tre cose da rinfacciare a entrambi i modelli
Paletti, perché sbagliare questa decisione costa caro.
• Il numero di parametri è contestato. 552B è il dato di DeepSeek. Un'analisi comunitaria credibile sostiene che il checkpoint rilasciato sia da 748B — la backbone transformer da 552B più la tabella di memoria condizionale Engram da ~196B, che è una struttura di lookup consultata in due punti della rete anziché uno strato attraverso cui scorre il segnale. Il download pubblicato è di 510,3 GB distribuiti su 48 shard safetensors di pesi densi FP8 con esperti instradati FP4. Entrambi i numeri possono essere corretti allo stesso tempo, a seconda che si conti il recupero separatamente dal calcolo. Considera 552B come dichiarato dal fornitore e controlla l'occupazione su disco prima di pianificare un deployment.
• Un punteggio in classifica è uno schermo, non un contratto. Il 74,2 di DeepSWE v1.1 è un benchmark di harness. Un audit autopubblicato di EyesTech Systems Lab sostiene che questi punteggi della classe Flash crollano quando vengono spostati su repository multi-file isolati e reali — collocando DeepSeek V4.1 Flash al 31,4% su SWE-bench Pro contro il 74,2% di punta, un calo maggiore rispetto ai modelli di frontiera nel suo stesso confronto. Quell'audit non è indipendente — l'autore vende uno strumento per rilevare esattamente lo sfruttamento dell'harness che descrive — e non abbiamo visto alcuna replica. Resta comunque l'atteggiamento giusto: verifica sui tuoi repository prima di migrare.
• La verbosità è una voce di costo.Artificial Analysis ha misurato V4.1 Flash mentre generava 250M token di output durante la sua esecuzione dell'Intelligence Index, rispetto a una mediana di 140M per modelli open-weights comparabili, e lo definisce molto verboso. L'output è la direzione costosa in questa tabella dei prezzi, quindi un modello che pensa ad alta voce intacca i propri risparmi. Su un carico di lavoro ad alta intensità di ragionamento, prevedi nel budget il conteggio dei token, non solo il prezzo dei token.
Un'ultima cosa, detta chiaramente così che nessuno faccia piani basandosi su una voce: DeepSeek V4.1 Pro non è stato rilasciato. La migrazione annullata è stata presentata come una soluzione temporanea "prima del lancio di V4.1 Pro", e nulla di tutto ciò è cambiato.
Scegli DeepSeek V4.1 Flash se
• Il tuo carico di lavoro è ad alto volume, sensibile alla latenza o limitato dai costi — classificazione, estrazione, routing, riepilogo, chat, gran parte della generazione di codice.
• Hai bisogno dell'input di immagini sullo stesso endpoint del testo. Questo è il primo modello di punta DeepSeek in cui ciò avviene con una singola chiamata anziché con un secondo modello.
• I tuoi prompt sono memorizzabili nella cache. A 7,3× sui cache hit il divario è più ampio esattamente dove vive il traffico degli agenti, e un prompt di sistema stabile costituisce la maggior parte dell'input di una lunga esecuzione.
• Questa settimana parti da zero e non hai un harness tarato sulle peculiarità di un modello specifico. Non c'è nulla da proteggere.
• Vuoi il tetto di concorrenza più alto. 2.500 contro 500 è una differenza di cinque volte in quanto puoi far passare prima di doverti mettere in coda.
Scegli DeepSeek V4 Pro se
• Hai già una produzione ottimizzata in funzione di questo. L'inversione significa che hai tempo: usalo per fare test invece di evitare la domanda.
• I tuoi compiti hanno un orizzonte lungo e un fallimento costa caro, e hai misurato che ~49B parametri attivi per token ti danno qualcosa che i 16B di Flash non offrono, sui tuoi dati anziché su una classifica.
• Hai bisogno di un comportamento prevedibile, esclusivamente testuale, senza alcun percorso di visione da considerare, oppure disponi di baseline di valutazione che un cambio di modello invaliderebbe a metà studio.
• Il tuo modello di accesso è a basso volume e ad alta posta in gioco, dove 3,6× su una fattura di piccolo importo non è il fattore decisivo.
Se hai già sviluppato su DeepSeek V4 Pro
La cosa utile che è cambiata il 2026-09-11 è che la tua migrazione ha smesso di essere una scadenza ed è diventata una decisione. Questo è decisamente meglio per te e decisamente peggio per la tua casella di posta, perché la decisione va ancora presa e ora nessuno la prende al posto tuo.
Inizia dal prezzo. Il divario di 3,3–4,4× è il numero che stai lasciando sul tavolo, e l'esempio svolto sopra lo trasforma in una cifra mensile in circa un minuto. Poi mettilo alla prova nell'unico modo che conta: rispecchia una porzione del traffico di produzione su Flash, mantieni Pro sul percorso primario e confronta gli output sulle tue attività. Poiché entrambi i modelli rispondono sulla stessa chiave al prezzo di listino del provider con failover automatico, quella shadow run è un cambiamento di routing anziché una seconda integrazione, e il router può rimandare una richiesta a Pro senza che tu debba scrivere il fallback. I team che bruciano token su una migrazione che non hanno richiesto sono il motivo per cui esiste lo strato di routing.
Non dare per scontato che Flash sia una sostituzione diretta. È un'architettura diversa — un encoder–decoder causale a 40 strati con attivazione asimmetrica — ed è più prolisso nel ragionamento. Il comportamento a livello di prompt non si trasferirà in modo pulito in nessuna delle due direzioni, quindi misura la migrazione sugli output, non sull'indice.
Cosa guardare
Tre cose decidono come apparirà questo abbinamento tra un mese. Primo, se V4.1 Pro verrà rilasciato e ripristinerà un vero livello Pro — l'intera migrazione annullata era esplicitamente una soluzione temporanea in attesa di quello, quindi la roadmap di DeepSeek ha ancora un buco a forma di flagship. Secondo, se la tregua sopravviverà alla prossima mossa sui prezzi di DeepSeek; un'azienda disposta a programmare una volta una deviazione silenziosa ha imparato che non può, non che non dovrebbe. Terzo, se qualcuno al di fuori di DeepSeek riprodurrà i numeri del benchmark di Flash su repository non modificati, l'unico risultato che risolverebbe la questione efficienza-contro-capacità su cui verte l'intero confronto. Fino ad allora, la posizione onesta è quella che l'inversione stessa implica: Flash è la scelta predefinita migliore per qualunque cosa nuova, Pro è la scommessa migliore per qualunque cosa già costruita, e DeepSeek ti ha appena detto che servirà entrambi mentre capisci quale dei due sei.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
