
Prezzi di DeepSeek V4.1 Flash: il listino completo e il numero di hit della cache che determina la tua fattura
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 177 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1323 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
DeepSeek V4.1 Flash è disponibile a livello generale dal 2026-09-10 e, a oggi, il suo listino pubblicato è la cosa più economica del livello più alto del mercato dei modelli: 0,15 $ per milione di token in input, 0,60 $ per milione in output e 0,003 $ per milione sulle cache hit. Queste tre cifre sono la colonna off-peak. Durante le finestre di picco infrasettimanali di DeepSeek ognuna di esse raddoppia, cache hit comprese. Il confronto che conta non è con l'ormai datata ammiraglia della stessa DeepSeek — DeepSeek-V4-Pro-0813 è listato a 0,66 $ / 1,98 $ per milione in off-peak, quindi Flash batte il proprio fratello di circa 4 volte sull'input — ma con il livello di frontiera chiuso rispetto al quale gli acquirenti stabiliscono effettivamente i prezzi: GPT-5.6 Sol, Claude Opus 5 e Gemini 3.8 Flash, ognuno dei quali fa pagare un ordine di grandezza in più per token.
Una correzione prima dei numeri, perché la fuga di notizie che ha preceduto questo lancio sta ancora circolando. Le cifre diffuse prima della GA descrivevano un taglio dei prezzi in arrivo "domani". I prezzi sono reali; l'inquadramento no. V4.1 Flash è stato rilasciato il 2026-09-10 con queste tariffe già in vigore, e il changelog di DeepSeek stesso registra la riduzione come parte del rilascio, non come un taglio successivo. Tutto quanto segue è tratto dalla pagina dei prezzi live di DeepSeek oggi, 2026-09-16.
Il tariffario completo, alla data del 2026-09-16
DeepSeek pubblica un unico foglio che copre gli SKU attuali, con ogni voce di riga suddivisa in una colonna peak e una off-peak. Per l'ID del modello deepseek-flash, che serve DeepSeek-V4.1-Flash, le tariffe pubblicate sono:
• Input, mancato accesso alla cache — $0,15 per 1 milione di token fuori dagli orari di punta; $0,30 per 1 milione negli orari di punta
• Input, hit della cache — 0,003 $ per 1 mln di token fuori punta; 0,006 $ per 1 mln nelle ore di punta
• Output — $0,60 per 1M di token fuori picco; $1,20 per 1M di picco
• Finestra di contesto — 1M token, con un output massimo di 384K
• Limite di concorrenza — 2.500 richieste simultanee nello SKU Flash
• ID modello legacy — deepseek-v4-flash e deepseek-v4-flash-vision-exp sono ritirati come prodotti separati ma vengono comunque instradati a V4.1 Flash, fatturati ai prezzi di Flash
Il divario tra le prime due righe è l'intera storia di questo foglio. Un cache hit costa 50 volte meno di un cache miss fuori dalle ore di punta — uno sconto del 98%, che è anche il modo in cui Artificial Analysis lo rappresenta nel suo modello di costo. Nient'altro sulla scheda sposta una fattura così tanto.


Peak non è un errore di arrotondamento, ed è programmato per Pechino.
Le fasce di punta di DeepSeek sono da lunedì a venerdì, 01:00–04:00 UTC e 06:00–10:00 UTC. Tutto ciò che è al di fuori di esse — comprese tutte le ore del fine settimana — viene fatturato a tariffa dimezzata. Il raddoppio si applica a tutte e tre le voci, quindi una cache miss nelle ore di punta costa $0,30 e l'output nelle ore di punta costa $1,20.
Dove cadono quelle finestre dipende interamente da dove ti trovi. A Pechino sono 09:00–12:00 e 14:00–18:00 — due blocchi di lavoro, ed è proprio questo il punto. A Berlino, a settembre, la seconda finestra è 08:00–12:00 CEST: l'intera mattina di un team europeo è in fascia di punta. A New York la stessa finestra è 02:00–06:00 EDT. Un team con sede negli Stati Uniti che lavora con orari normali non viene praticamente mai fatturato alla fascia di punta, mentre un team dell'UE paga il doppio ogni mattina prima di pranzo. Se stai scegliendo quando eseguire un job batch, è una decisione che vale 0,15 $ per milione di token e non costa nulla prenderla.
Che effetto ha realmente la tariffazione cache-hit sulla fattura di un agente
I cache hit sono automatici su DeepSeek — la documentazione afferma che la cache su disco è abilitata per impostazione predefinita per tutti gli utenti senza modifiche al codice — quindi lo sconto non è qualcosa per cui devi progettare l'architettura. È anche best-effort, non garantito: DeepSeek dichiara che non esiste un TTL fisso, una cache inutilizzata viene svuotata "di solito nell'arco di qualche ora o qualche giorno", e il sistema non promette un tasso di hit del 100%. Vale la pena leggere, della risposta, i prompt_cache_hit_tokens e prompt_cache_miss_tokens campi prima di modellare qualsiasi cosa su questo.
L'aritmetica conta più dell'aggettivo. Prendi un agente di programmazione con un prefisso stabile di 40.000 token — prompt di sistema, schemi degli strumenti, contesto del repository — eseguito per una sessione di 60 turni, in cui ogni turno aggiunge circa 2.000 token di output degli strumenti e il modello genera circa 1.200 token. L'input totale sull'intera sessione è di 5,94M token e l'output totale è di 72.000 token.
Con fatturazione senza alcuna cache, fuori dalle ore di punta: 5,94M di input a $0,15 equivalgono a $0,891, più 72.000 di output a $0,60, ovvero $0,043 — circa $0,93 per la sessione.
Fatturato con il prefisso in cache, che è ciò che in realtà accade per impostazione predefinita: 5,782 M di quei token di input arrivano come hit della cache a $0,003 ($0,017), 158.000 arrivano come miss della cache a $0,15 ($0,024), e gli stessi 72.000 token di output costano $0,043. Circa $0,084 — all'incirca 11 volte più economico. L'input scende dal 95% della fattura al 49%, la sola porzione in cache è il 21%, e i token di output diventano la singola voce più grande. Stesso modello, stessa sessione, stesso output — l'unica cosa che è cambiata è se il prefisso è stato riutilizzato.
Nota ciò che non compare nel prospetto di DeepSeek: una voce di costo per la scrittura della cache. Anthropic addebita 1,25x l'input di base per popolare una cache da 5 minuti e 2x per un'ora; la scheda di DeepSeek elenca solo hit e miss, e la sua guida alla cache non descrive alcun costo di scrittura o archiviazione. Se stai confrontando l'economia della cache tra fornitori invece delle tariffe token più pubblicizzate, quell'assenza vale più di quanto suggerisca lo sconto di 50x sugli hit.
È anche il motivo per cui il dettaglio del pass-through su DeepSeek V4.1 Flash su OrcaRouter conta in questo caso. Fatturiamo alla tariffa di listino del provider stesso, senza alcun ricarico, quindi una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno, invece di dover attendere un passaggio di riprezzamento — e le colonne cache-hit e peak/off-peak che vedi sopra sono quelle su cui vieni effettivamente fatturato, non un'approssimazione ponderata delle stesse.

Rispetto a DeepSeek-V4-Pro-0813: un divario di 4 volte, e un ritiro che non c'è stato
Il confronto interno ovvio è con lo SKU di punta, e non è così eclatante come suggerisce la tariffa di riferimento. DeepSeek-V4-Pro-0813, l'id del modello deepseek-v4-pro, è listato a $0.66 per 1M di input in caso di cache miss e $1.98 per 1M di output fuori picco, che raddoppiano in picco a $1.32 e $3.96. I suoi cache hit costano $0.022 fuori picco — più di 7 volte quelli di Flash.
• Input con cache miss — $0,15 contro $0,66 fuori dalle ore di punta, quindi Flash costa 4,4 volte meno
• Output — 0,60 $ vs 1,98 $ fuori picco, quindi Flash è 3,3 volte più economico
• Input con cache hit — $0,003 vs $0,022 fuori picco, quindi Flash costa 7,3 volte meno
• Contesto e limite massimo di output — identici a 1M e 384K su entrambi gli SKU
• Concorrenza — 2.500 su Flash contro 500 su V4 Pro, una differenza di 5 volte che scompare del tutto dal listino prezzi
Tre cose in questo confronto sono facili da sbagliare. Primo, l'argomento del riutilizzo è più forte sul modello di punta in termini assoluti, anche se Flash porta il moltiplicatore più alto: mettere in cache un milione di token fa risparmiare $0,638 su V4 Pro e $0,147 su Flash, perché il tasso di miss del modello di punta è molto più alto fin dall'inizio. Secondo, il modello che tutti si aspettavano venisse dismesso non lo è: DeepSeek ha annunciato che avrebbe smesso di servire V4 Pro il 2026-09-14 e avrebbe dirottato quelle richieste su Flash, ha suscitato la reazione negativa degli sviluppatori per aver sostituito un modello di backend sotto flussi di lavoro in produzione, e ha invertito la decisione il 2026-09-11. V4 Pro viene ancora servito, con fatturazione invariata. Terzo, e questa è la trappola in cui è caduta la copertura della fuga di notizie — non esiste alcun V4.1 Pro rilasciato. DeepSeek-V4-Pro-0813 resta lo SKU di punta, e il fornitore non ha rilasciato un successore con quel nome. Chiunque valuti una migrazione a "V4.1 Pro" sta valutando un modello che non esiste.
Rispetto al livello frontier chiuso
Rispetto ai modelli chiusi che gli acquirenti inseriscono davvero nella lista ristretta, il moltiplicatore è il dato di punta. Tutte le cifre riportate di seguito provengono dalla pagina dei prezzi pubblicata oggi da ciascun fornitore.
• GPT-5.6 Sol — è listato a $5,00 per 1M di input e $30,00 per 1M di output sul tier a contesto breve di OpenAI, attualmente con una tariffa promozionale di $4,00 / $20,00 che OpenAI dice essere disponibile almeno fino al 21/11/2026, con input in cache a $0,40. Rispetto alla tariffa promozionale, DeepSeek V4.1 Flash è 26,7 volte più economico sull'input e 33,3 volte sull'output; rispetto al listino, 33x e 50x. L'hit in cache di Sol costa 133 volte quello di Flash.
• Claude Opus 5 — 5,00 $ per 1M di input e 25,00 $ per 1M di output, con cache hit a 0,50 $ per 1M sul listino pubblicato di Anthropic. È 33 volte la tariffa di input di Flash, 42 volte la sua tariffa di output e 167 volte la sua tariffa di cache hit. Le scritture in cache da 5 minuti di Anthropic aggiungono un ulteriore 1,25x; il listino di DeepSeek non ha una voce equivalente.
• Gemini 3.8 Flash — $0,75 per 1M di input e $3,75 per 1M di output fino al 2026-12-31, con entrambe le tariffe che raddoppieranno il 2027-01-01, input in cache a $0,075 e — questa è la voce che ricorre su una fattura reale — storage della cache a $0,50 per 1M di token all'ora. Flash costa 5 volte meno sull'input, 6,25 volte sull'output e 25 volte sui cache hit rispetto ad esso, e DeepSeek non addebita nulla per mantenere una cache.
Il contesto sulle capacità è ciò che rende onesto tutto questo. Sull'Intelligence Index v4.3 di Artificial Analysis, DeepSeek V4.1 Flash (reasoning, max effort) ottiene un punteggio di 40 e si classifica 6° su 113 modelli, a $0,27 per attività dell'indice e 214,4 token di output al secondo. Si tratta di una posizione davvero vicina alla frontiera, a un prezzo 26 volte inferiore alla fascia con cui viene confrontato — ma la stessa misurazione mostra che è uno dei modelli più verbosi che AA abbia testato, con 250M di token di output generati durante l'esecuzione dell'indice contro una mediana di 140M. La verbosità non cambia il prezzo per token, ma cambia eccome il conto. Un modello che scrive il 62% di token in più rispetto alla mediana qui costa comunque molto meno, ma "economico per token" e "economico per attività" sono affermazioni diverse, e solo la seconda è quello che paghi.
Esiste un piano gratuito?
No. La pagina dei prezzi di DeepSeek non documenta alcun livello API gratuito, alcuna quota mensile gratuita e alcun modello gratuito: la fatturazione è a consumo su un saldo ricaricato o concesso, con il saldo concesso consumato per primo. L'app di chat per consumatori è gratuita; l'API dietro deepseek-flash non lo è, e non esiste un endpoint gratuito per essa sulla piattaforma DeepSeek. Diversi gateway di terze parti pubblicizzano accesso gratuito o di prova a questo modello, e li considereremmo tutti come superfici di prototipazione anziché backend di produzione, perché quei termini cambiano senza preavviso e nessuno di essi riporta il listino prezzi del fornitore.
Le dichiarazioni di efficienza dietro il prezzo
Il prezzo non è un sussidio, almeno stando a quanto dichiara DeepSeek stessa. La model card e il rapporto tecnico del fornitore descrivono V4.1 Flash come un mixture-of-experts da 552B parametri su un'architettura Causal Encoder-Decoder che attiva circa 8B parametri per token durante il prefill e 16B durante il decode — asimmetrico per progettazione, economico in lettura e più costoso in scrittura. Sul fronte della memoria, DeepSeek riporta una KV cache globale di circa 890 byte per token, all'incirca un quarto di quella di DeepSeek-V4-Flash, e un footprint di cache persistente pari a circa un ottavo di quello, a parità di carichi di lavoro, ottenuto scartando lo stato della finestra scorrevole e rieseguendo gli ultimi 128 token in caso di hit. Queste sono misurazioni dichiarate dal fornitore sul proprio hardware, e il rapporto tecnico non rivendica un'equivalenza matematica alla computazione completa per il percorso di replay.
Il conteggio dei parametri è l'unico dato di questa release che sia davvero irrisolto, e vale la pena essere precisi sul perché. La prosa di DeepSeek riporta 552B, e quello è il backbone — la parte che esegue i calcoli. Accanto ad esso c'è Engram, una tabella di lookup a memoria condizionale che la model card stima a 196B parametri, a cui si accede tramite lookup di token anziché essere calcolata. Sommandoli si arriva vicino a 748B, il numero che un'analisi della community molto letta su r/LocalLLaMA ha sostenuto nel giro di poche ore dall'arrivo dei pesi, e che il pannello dei file del repository stesso di Hugging Face spinge ancora più in alto, verso 763B. I resoconti di deployment della community hanno conteggiato il checkpoint a circa 510 GB su 48 shard, fornito nativamente quantizzato come pesi densi FP8 con esperti FP4. Considera il totale come contestato e la cifra del backbone come riportata dal fornitore. I conteggi dei parametri attivi sono quelli che determinano la velocità; i pesi residenti sono quelli che decidono se il modello si avvia o meno.
Il self-hosting è una vera alternativa a questo prezzo, sotto licenza MIT.
I pesi sono disponibili su deepseek-ai/DeepSeek-V4.1-Flash con licenza MIT, che consente l'uso commerciale, la modifica e la ridistribuzione. Questo rende il listino prezzi dell'API una scelta anziché un pedaggio: con la licenza MIT, nulla nel contratto di licenza impedisce di servire questo modello da soli e di pagare per la potenza di calcolo invece che per i token.
Ciò che non fa è renderlo economico. Il checkpoint è di circa 510 GB di pesi residenti prima di cache e attivazioni, DeepSeek non dichiara alcun requisito GPU in nessun punto del repository, e i resoconti di deployment della community collocano il minimo pratico a un nodo multi-GPU anziché a una workstation. Tre stack di serving hanno rilasciato supporto day-0 il 10 settembre 2026 — vLLM, SGLang con Miles e l'adattamento NeuWare di Cambricon basato su vLLM per i propri acceleratori — ma il giorno del rilascio vLLM e SGLang hanno distribuito immagini di anteprima dedicate anziché pacchetti ufficiali, e llama.cpp non aveva ancora integrato il supporto per l'architettura V4.1. Il self-hosting su hardware consumer non è oggi l'alternativa al prezzo dell'API; lo è un nodo 8-GPU noleggiato. Se il tuo volume è abbastanza grande da ammortizzare questo, la licenza te lo consente; se non lo è, $0,15 per milione di token è la risposta più economica, e non c'è paragone.
Ciò che il tariffario in realtà ti chiede di decidere
Tre cose, in ordine di quanti soldi muovono. Mantieni un prefisso di prompt stabile e lascia che la cache faccia il suo lavoro — è automatica, è uno sconto di 50x, e su un ciclo di agente da 60 turni trasforma una sessione da $0,93 in una da $0,084. Esegui il tuo traffico in batch al di fuori delle 01:00–04:00 e delle 06:00–10:00 UTC nei giorni feriali, cosa che per un team statunitense non cambia nulla e per un team europeo significa spostare il job del mattino al pomeriggio. E se stai facendo un confronto di prezzo con il flagship di DeepSeek, ricorda che il flagship è ancora in sconto — il ritiro programmato è stato annullato l'11 settembre 2026, entrambi gli SKU stanno dietro un'unica chiave, e passare dall'uno all'altro è un cambio di model-id più che una migrazione.
Quello che il listino non ti dice è se il modello è abbastanza buono per il tuo carico di lavoro, e i numeri per stabilirlo sono più recenti e più scarni del foglio prezzi. La posizione nell'indice di Artificial Analysis è una singola misurazione con sforzo di ragionamento massimo, le righe dei benchmark del fornitore sono dichiarate dal fornitore, e il numero di parametri è contestato. Il prezzo è la parte consolidata di questo rilascio. Imposta su di esso il prezzo della tua migrazione e verifica la capacità prima di impegnarti.
Confrontati in questo articolo4
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
