
DeepSeek V4.1 Flash vs DeepSeek V4 Flash: Stessa Flash Rate Card, un modello riaddestrato
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligenza49Codice
La settimana in cui DeepSeek V4.1 Flash è passato da successore vociferato a modello Flash in distribuzione è stata breve e intensa. L'8 settembre il modello è emerso come test API di due giorni con l'id modello deepseek-v4.1-flash-expires-on-0910 — una build che la stessa DeepSeek ha definito una "versione intermedia". Il 9 settembre la sua piattaforma aperta ha dichiarato che il rilascio ufficiale, DeepSeek V4.1 Flash, sarebbe arrivato intorno al 10 settembre e che "supera ampiamente" DeepSeek V4 Pro per capacità, costi, velocità e tempo end-to-end. Il 10 settembre l'avviso di rilascio è stato accompagnato da una nuova scheda tariffaria della serie Flash, entrata in vigore alle 12:00 ora di Pechino, che DeepSeek V4 Flash non vedeva da un aumento dei prezzi di agosto. Qualunque altra cosa sia vera, il cavallo di lavoro per il testo DeepSeek V4 Flash non è più il modo più recente per eseguire un carico di lavoro Flash, e questo articolo parla di cosa cambia davvero per l'app che stai eseguendo oggi.
Confronti così precoci sono sbilanciati, e vale la pena dirlo prima che i numeri inizino. DeepSeek V4 Flash ha una scheda tecnica pubblicata, un mese di traffico di produzione dietro l'aggiornamento DeepSeek-V4-Flash-0731, pesi aperti e misurazioni indipendenti da Artificial Analysis. DeepSeek V4.1 Flash ha un annuncio ufficiale, due giorni di test di velocità della community, e nessuna scheda pubblicata, nessun report tecnico e nessun punteggio di terze parti per ora. Le affermazioni del fornitore sono etichettate come affermazioni del fornitore di seguito; le cifre della community sono etichettate come misurate dalla community.
Il tier Flash è appena stato resettato — tre modifiche, una settimana
DeepSeek V4 Flash, il modello mixture-of-experts da 284 miliardi di parametri con 13 miliardi attivi, è stata la scelta ragionevole, a basso costo e ad alta produttività per gran parte del traffico testuale di produzione dal suo aggiornamento del 31 luglio. Tre annunci in tre giorni hanno spostato il terreno sotto di esso:
• 8 settembre — DeepSeek ha aperto una beta a tempo limitato di V4.1 Flash a qualsiasi account API, con un massimo di 20 richieste concorrenti e con scadenza prevista per il 10 settembre, sotto un nome di modello che portava con sé la propria data di scadenza.
• 9 settembre — la piattaforma aperta ha annunciato il rilascio ufficiale di DeepSeek V4.1 Flash per circa il 10 settembre, descrivendo una nuova struttura del modello con supporto multimodale nativo e sostenendo che supera DeepSeek V4 Pro in termini di prestazioni, costi, velocità e tempi di completamento complessivi.
• 10 settembre — il rilascio ufficiale porta un nuovo listino prezzi della serie Flash, in vigore dalle 12:00 ora di Pechino, che riduce le tariffe che DeepSeek V4 Flash ha applicato da un aumento del 17 agosto che ha suscitato forti critiche da parte degli sviluppatori.
{{1}}L'ultima di queste merita un momento a parte, perché è il raro taglio di prezzo che è davvero un taglio di prezzo.{{/1}} {{2}}Nel nuovo listino, l'input fuori picco con cache hit scende da ¥0,05 a ¥0,02 per milione di token{{/2}} — {{3}}un taglio del 60%{{/3}} — {{4}}mentre l'input con cache miss passa da ¥1,5 a ¥1 e l'output da ¥4,5 a ¥4.{{/4}} {{5}}Le tariffe nelle ore di picco sono il doppio di quelle fuori picco.{{/5}} {{6}}In dollari USA arrotondati, equivale a circa $0,003 per milione di token per l'input con cache hit, $0,14 per l'input con cache miss e $0,56 per l'output in fascia fuori picco, con prezzi raddoppiati in fascia di picco.{{/6}} {{7}}Il divario di 24 giorni tra l'aumento di agosto e questo taglio non è stato un caso di calendario; il riallineamento dei prezzi fa parte del lancio di V4.1 Flash.{{/7}}
Stesso livello, modello diverso
L'interpretazione semplice è che V4.1 Flash sia V4 Flash con la manopola della velocità alzata. Ma non è così. Il refresh 0731 è stato un aggiornamento post-addestramento sulla base esistente di DeepSeek V4 Flash: stessa architettura, stesso layout mixture-of-experts da 284B totali / 13B attivi. La descrizione di V4.1 Flash da parte di DeepSeek punta a qualcosa di più grande: una nuova struttura del modello, che diverse testate hanno letto come una nuova fase di pre-training piuttosto che un fine-tuning. La distinzione è importante perché un modello riaddestrato non eredita il comportamento del vecchio modello come farebbe un refresh — prompting, chiamate agli strumenti e stile di output possono tutti cambiare anche dove le capacità rimangono invariate.
• Architettura — DeepSeek V4.1 Flash: nuova struttura del modello, descritta da DeepSeek come una build completamente nuova con input multimodale nativo. DeepSeek V4 Flash: il refresh post-training V4-Flash-0731 di un MoE da 284B totali / 13B attivi.
• Input — V4.1 Flash gestisce nativamente l'input di testo e immagini nel modello base; DeepSeek V4 Flash supporta solo testo, e per le immagini è necessaria la build aggiuntiva separata DeepSeek-V4-Flash-Vision-Exp.
• Contesto e output — DeepSeek V4 Flash offre 1M di contesto e 384K di output massimo; i materiali di lancio di DeepSeek affermano che V4.1 Flash mantiene la finestra di contesto su scala di milioni di token, ma non è stata pubblicata alcuna scheda tecnica formale.
• Concorrenza — DeepSeek V4 Flash elenca un limite massimo di 2.500 connessioni concorrenti; la beta di V4.1 Flash era limitata a 20 e l'affermazione di DeepSeek di "alta concorrenza" per la build di rilascio non era ancora supportata da un numero pubblicato al momento della scrittura.
• Pesi — DeepSeek V4 Flash è open-weight sotto licenza MIT; non è stato annunciato nulla per V4.1 Flash.
Posizione indipendente — DeepSeek V4 Flash è stato misurato da Artificial Analysis; DeepSeek V4.1 Flash non ha ancora un punteggio di terze parti.
Il punto sul confronto testo-versus-multimodale merita una frase in più anche in un confronto testuale, perché decide a chi è destinato V4.1 Flash. Se la tua pipeline eseguiva DeepSeek V4 Flash per il testo e DeepSeek-V4-Flash-Vision-Exp per le immagini, V4.1 Flash è la prima build DeepSeek che copre entrambi i percorsi in un unico modello: un solo endpoint da mantenere, niente encoder aggiunto di lato.

Dove divergono davvero: throughput e costo di un compito completato
A parità di prezzo, i due modelli si distinguono per la velocità, ed è proprio lì che i numeri diventano più eclatanti. Artificial Analysis misura DeepSeek V4 Flash 0731 a circa 120–140 token di output al secondo sull'API di DeepSeek, a seconda della configurazione e della finestra di misurazione. I tester del primo giorno di V4.1 Flash hanno riportato una generazione sostenuta tra circa 280 e 500 token al secondo a seconda del compito, con picchi oltre 500 nelle esecuzioni a bassa concorrenza; le cifre più alte provengono da misurazioni della community, non sono pubblicate dal fornitore, e i token al secondo non sono mai una proprietà intrinseca di un modello. Ciononostante, la direzione è coerente in tutti i report del primo giorno, e l'affermazione di DeepSeek di una generazione più rapida e di un tempo di completamento totale inferiore punta nella stessa direzione.
Quel divario di velocità cambia l'economia anche con i due modelli sulla stessa tariffa, perché paghi per token e i token arrivano più velocemente. Un lavoro di recupero a contesto lungo o di generazione di codice che richiedeva un minuto su V4 Flash può terminare in una frazione del tempo su V4.1 Flash allo stesso prezzo per token — diversi tester del primo giorno hanno riportato prestazioni da cinque a sei volte più veloci end-to-end proprio su quelle classi di attività. Le prime lamentele della beta su "spende soldi più velocemente" erano l'altra faccia della stessa medaglia: a un prezzo per token invariato, un modello che emette token due o tre volte più velocemente prosciuga un saldo più rapidamente al minuto. Se la fattura per attività effettivamente diminuisca dipende dal fatto che il nuovo modello completi con meno token e meno tentativi, ed è esattamente ciò che nessuno può ancora dimostrare.
Nella stessa scheda prezzi, i due modelli sono affiancati. Per milione di token fuori picco nella lista del 10 settembre: ¥0,02 input con cache hit, ¥1 input con cache miss e ¥4 output, il doppio in fascia di picco — la stessa lista applicata al livello Flash prima del taglio era ¥0,05, ¥1,5 e ¥4,5. Per un carico di lavoro con uso intensivo della cache, il taglio è la notizia principale: ¥0,02 contro ¥0,05 rappresenta una riduzione del 60% sui token che costituiscono la maggior parte del flusso di input di un autocomplete o di un agent loop. Per un lavoro di ingestione di nuovi dati che manca la cache, il risparmio è più vicino a un terzo. Nulla di tutto ciò rende V4.1 Flash più economico per token rispetto a V4 Flash — condividono la stessa scheda — ma la maggiore produttività dell'architettura è il fattore differenziante, e non costa nulla in più.

Le ricevute sono per V4 Flash; le richieste sono per V4.1 Flash
Il dato di benchmark più importante in assoluto su questo confronto, in questo momento, è che non esiste alcun benchmark per il nuovo modello. L'affermazione di punta di DeepSeek V4.1 Flash — secondo cui supera completamente DeepSeek V4 Pro in capacità, costi e velocità — è riportata dal fornitore e non riprodotta. Non è stato pubblicato alcun conteggio di parametri, alcuna tabella di valutazione né alcun rapporto tecnico, e Artificial Analysis non lo aveva misurato al momento della stesura. A fronte di una famiglia di modelli il cui ultimo lancio di punta ha attirato verifiche indipendenti, «fidatevi, batte il Pro» è un'affermazione che il lettore dovrebbe prendere con le pinze finché una terza parte non la verifichi.
{{1}}DeepSeek V4 Flash, al contrario, ha una vera documentazione verificabile.{{/1}} {{2}}Artificial Analysis annovera la build di ragionamento 0731 tra i modelli leader della sua classe,{{/2}} {{3}}la valuta ben al di sopra della mediana per modelli open-weight comparabili,{{/3}} {{4}}e misura la sua throughput di output sull'API di DeepSeek nell'intervallo di ~120–140 token al secondo citato sopra.{{/4}} {{5}}Questi sono i numeri rispetto ai quali V4.1 Flash verrà giudicata quando arriverà il suo punteggio,{{/5}} {{6}}e fissano un'asticella più alta di quanto implichi l'etichetta "Flash veloce ed economica".{{/6}} {{7}}Il modello che la nuova build sostituisce non è debole; è un cavallo di battaglia open-weight genuinamente forte.{{/7}} {{8}}È questo che rende la decisione di aggiornamento reale, non cerimoniale.{{/8}}
Il routing sta facendo il lavoro pesante — dentro DeepSeek, e per te.
La parte meno segnalata di questo lancio è che DeepSeek sta smistando il traffico tra i propri modelli. Il suo annuncio è esplicito: una volta che V4.1 Flash sarà disponibile e finché V4.1 Pro non sarà rilasciato, ogni richiesta API destinata a deepseek-v4-pro sarà servita da DeepSeek V4.1 Flash e fatturata al prezzo del livello Flash. Gli utilizzatori di V4 Pro ottengono la nuova architettura e una frazione del costo per token senza cambiare una riga di codice. Nota cosa non viene smistato: le chiamate deepseek-v4-flash. Il vecchio modello Flash continua a servire chiunque vi faccia ancora riferimento, ed è esattamente il motivo per cui esiste questo confronto: se sei su V4 Pro il passaggio avviene per te, mentre se sei su V4 Flash è una decisione che devi prendere tu.
Un fornitore che decide silenziosamente che un modello più economico debba gestire le chiamate destinate al suo modello premium è un'approvazione lampante di V4.1 Flash — ed è anche la stessa logica che un livello di routing applica tra i fornitori. Questo è il vuoto che una piattaforma come OrcaRouter colma: un'unica API per oltre 200 modelli, con i prezzi di listino dei fornitori passati senza ricarico (margine 0%), così il taglio di prezzo del 10 settembre per Flash da parte di DeepSeek è attivo dalla nostra parte lo stesso giorno. DeepSeek V4 Flash su OrcaRouter resta chiamabile con la stessa chiave usata per tutti gli altri modelli che utilizzi, il che rende davvero economico il modo sicuro per adottare un modello day-one: indirizza una parte del traffico verso DeepSeek V4.1 Flash sull'API di DeepSeek, mantieni DeepSeek V4 Flash come fallback automatico sulla stessa regola di routing e lascia che il failover gestisca i casi limite mentre la nuova architettura si fa valere.
DeepSeek V4.1 Flash vs DeepSeek V4 Flash: quale dovresti chiamare?
Se la risposta onesta fosse un solo modello per tutti, non ci sarebbe alcun articolo. I due ora si adattano a diversi profili di rischio, e la divisione è insolitamente netta.

Passa a DeepSeek V4.1 Flash se oggi stai avviando un nuovo workload Flash, se latenza e throughput sono il vincolo principale, se vuoi l'input di immagini senza mantenere un secondo modello, o se sei disposto a lasciare che il routing di DeepSeek riduca il rischio dell'affermazione Pro-tier. Il modello è disponibile sull'API di prima parte di DeepSeek con il nome deepseek-v4.1-flash, ha lo stesso prezzo della scheda Flash del modello che sostituisce, e ogni segnale del primo giorno dice che è sostanzialmente più veloce.
Resta su DeepSeek V4 Flash se stai servendo traffico di produzione al tetto pubblicato di 2.500 connessioni concorrenti, se dipendi dai suoi pesi aperti per il self-hosting o la conformità, oppure se i tuoi prompt, le valutazioni e la logica di chiamata degli strumenti sono stati ottimizzati sul comportamento 0731 e non possono assorbire i capricci di un modello riaddestrato fin dal primo giorno. Una nuova esecuzione di pre-training è un cambiamento di comportamento, non solo di velocità, e la build 0731 è la versione con il mese di riscontri.
Per la maggior parte dei team, la scelta predefinita difendibile è la via di mezzo: trattare DeepSeek V4.1 Flash come predefinito per i nuovi carichi di lavoro, mantenere DeepSeek V4 Flash come failover per il carico di lavoro che paga le bollette, e lasciare che la prima scheda di valutazione indipendente — insieme a una scheda tecnica pubblicata e a un numero di concorrenza — risolva la disputa che nessuna beta di due giorni può risolvere. Il livello Flash ha appena ricevuto un nuovo motore; il vecchio non è obsoleto, è il punto di riferimento.
Curioso di vedere come appare il traffico di classe Pro mentre DeepSeek lo instrada verso V4.1 Flash a prezzi Flash? DeepSeek V4 Pro su OrcaRouter — entrambi sulla stessa chiave, fatturati al prezzo di listino di DeepSeek.
Confrontati in questo articolo4
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
