Una hero card per DeepSeek V4.1 Flash con il sottotitolo 'Beta API di due giorni: cosa sappiamo finora', badge a pillola che riportano 'BUILD INTERMEDIA' e 'TEST API - SCADE 09-10', una riga a piè di pagina 'Il post di rilascio ufficiale arriverà molto presto' e il logo OrcaRouter composto nell'angolo in basso a destra.
Guides & Insights

DeepSeek V4.1 Flash approda in una beta API di due giorni: nuova architettura, multimodale nativo e ambizione di livello pro.

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

DeepSeek V4.1 Flash è comparso esattamente dove Deep​Seek testa le cose prima di annunciarle: nell'API live, con un ID modello che porta con sé la propria data di scadenza. L'ID — deepseek-v4.1-flash-expires-on-0910 — ha iniziato a servire l'8 settembre 2026, dopo che il team di Deep​Seek ha pubblicato un test interno di «versione intermedia» nei suoi gruppi ufficiali della community, e quel 0910 finale è la storia in miniatura. È una build immessa nell'ambiente API reale per un test limitato, che dovrebbe andare offline intorno al 10 settembre, prima del post di rilascio ufficiale che gli insider che segnalano il modello si aspettano «molto presto». Non è un lancio. Non c'è una model card, nessun report tecnico, nessuna voce di changelog e, da questa sera, la pagina pubblica Models & Pricing di Deep​Seek elenca ancora solo DeepSeek V4 Flash, DeepSeek V4 Pro e DeepSeek-V4-Flash-Vision-Exp.

Tutto ciò che segue va letto tenendo presente quell'asterisco. Il canale ufficiale in questo caso è un annuncio in un gruppo della community e un modulo di feedback allegato, non una nota di rilascio. Quello che segue è l'unione di quell'annuncio, della copertura dei media cinesi nelle ore successive e delle misurazioni del primo giorno da parte di sviluppatori che hanno puntato le proprie chiavi verso l'endpoint — con le affermazioni del fornitore e i numeri della community etichettati per quello che sono.

Cosa è successo davvero oggi

Intorno alle 15:00, ora di Pechino, dell'8 settembre, il team di Deep​Seek ha comunicato ai propri gruppi ufficiali della community che una versione intermedia — descritta in cinese come 中间版本, cioè un checkpoint intermedio — era stata resa disponibile per test limitati all'interno dell'ambiente API reale, prima che la versione finale venga rilasciata. Chiunque disponga di una chiave API Deep​Seek può richiamarla: mantieni invariati il tuo URL di base e la tua chiave attuali, e imposta il nome del modello su deepseek-v4.1-flash-expires-on-0910. Questa è l'intera storia dell'accesso: non esiste un endpoint separato, né una lista d'attesa, né una nuova console.

Il margine operativo pratico è ristretto. Il suffisso codifica il piano: la versione di test "scadrà automaticamente e andrà offline il 10 settembre", lasciando circa due giorni di attività. Ogni account è limitato a 20 richieste concorrenti — contro il limite di 2.500 richieste concorrenti pubblicato da DeepSeek per deepseek-v4-flash — il che è un forte indizio sull'intento: serve per test funzionali e valutazione, non per indirizzare il traffico di produzione.

• Cos'è — un checkpoint di “versione intermedia” inserito nell'API live per test a breve termine prima di una build ufficiale.

• Dove gira — l'API proprietaria di Deep​Seek; URL di base e chiave invariati, nome del modello sostituito con deepseek-v4.1-flash-expires-on-0910.

Quanto dura — il nome dice expires-on-0910; il test dovrebbe andare offline intorno al 10 settembre.

• Chi può chiamarlo — qualsiasi account con una chiave DeepSeek, a 20 richieste concorrenti per account.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Model ID deepseek-v4.1-flash-expires-on-0910, Status 2-day API beta - expires 09-10, Concurrency 20 req/account (V4 Flash: 2,500), Billing same rate card as DeepSeek V4 Flash, Speed (community) ~420 tok/s peaks 500+, Native multimodal text + image (official claim), with a footer reading 'Speed is community-measured; no official benchmarks or specs published yet.'

Quanto costa la beta: il listino prezzi di DeepSeek V4 Flash

DeepSeek ha dichiarato che il test viene fatturato alle stesse tariffe di deepseek-v4-flash, e che la scheda tariffaria attuale di quel modello è quella applicabile. Dalla rideterminazione dei prezzi del 16 agosto 2026, DeepSeek applica una tariffazione con fasce di punta e non; le cifre esatte sono quelle ufficiali per il livello Flash:

• Input, cache hit — $0,007 per 1 milione di token fuori punta, $0,014 in punta

• Input, cache miss — $0.22 per 1M token fuori punta, $0.44 in punta.

• Output — $0.66 per 1M token fuori punta, $1.32 di punta

• Ore di punta — 01:00–04:00 e 06:00–10:00 UTC, lunedì–venerdì; tutte le altre ore sono fuori punta, a metà della tariffa di punta

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the current public lineup — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, the off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak), and published concurrency limits of 2,500 / 500 / 2,500.

Nota ciò che non è cambiato: il prezzo per token. L'affermazione di DeepSeek che V4.1 Flash è "a costo inferiore" è quindi una dichiarazione di efficienza, non un taglio delle tariffe — un punto che diversi tester del primo giorno hanno imparato a proprie spese, vedendo una sessione di cinque minuti prosciugare notevolmente più saldo rispetto allo stesso tempo reale su DeepSeek V4 Flash, poiché il modello consuma token molto più velocemente. Se il costo per attività diminuisca effettivamente dipende dal fatto che completi il lavoro con meno token e meno tentativi, cosa che nessuno può giudicare da due giorni di test di velocità.

Che cosa significa "nuova architettura, nativamente multimodale" — finora, non verificato.

La descrizione ufficiale di Deep​Seek della V4.1 Flash si articola in quattro affermazioni: una nuova struttura del modello, supporto multimodale nativo, maggiore capacità e generazione più rapida. L'affermazione sull'architettura è quella che spicca, perché rompe uno schema. La versione precedente, DeepSeek V4 Flash 0731, era un aggiornamento post-training che manteneva la stessa architettura e la stessa scala dell'anteprima; la formulazione di Deep​Seek qui punta a un cambiamento strutturale, e diverse testate lo hanno letto come un segno che il modello sia stato riaddestrato piuttosto che semplicemente sottoposto a fine-tuning. Al di là di questo, tutto è congettura. La speculazione della community su modifiche ai meccanismi di attenzione, reti di esperti o un modulo di visione integrato è esattamente questo — speculazione. Nessun conteggio di parametri, nessuna cifra sulla finestra di contesto, nessuna tabella di benchmark e nessun report tecnico è stato pubblicato.

L’espressione “multimodale nativo” è importante per un motivo specifico. DeepSeek-V4-Flash-Vision-Exp, lanciato il 21 agosto e con i pesi aperti dal 31 agosto, ha agganciato un encoder visivo alla base testuale di DeepSeek V4 Flash — i materiali della stessa Deep​Seek descrivevano l’insieme come un modello testuale più un percorso visivo esterno. V4.1 Flash è invece descritto come multimodale fin dalle fondamenta, con l’input di immagini e testo gestito dal modello base stesso. In linea di principio è una reale differenza architetturale, ma la specifica delle modalità non è stata pubblicata: ciò che i tester hanno finora messo alla prova è testo più immagini, e il lettore dovrebbe considerare “multimodale” confermato solo in quel senso testo-e-immagini, finché non appare una scheda del modello. Se un insieme di input più ampio faccia parte del piano, al momento in cui scriviamo, è sconosciuto piuttosto che confermato.

La velocità è il punto centrale — ed è una misura comunitaria.

Il numero che circola il primo giorno è di circa 420 token di output al secondo nelle generazioni lunghe, con picchi riportati oltre i 500 token/s nelle singole esecuzioni. Un test ampiamente condiviso ha generato più di 71.000 token in meno di tre minuti. Nulla di tutto ciò è ufficiale: si tratta di misurazioni degli sviluppatori sull'endpoint beta, in condizioni non controllate, e Deep​Seek non ha pubblicato alcun benchmark di velocità proprio. Per dare un'idea, Artificial Analysis misura l'endpoint pubblico DeepSeek V4 Flash 0731 a circa 128 token/s, quindi i primi resoconti indicano un balzo del throughput grezzo dell'ordine di tre volte o più — con la solita avvertenza che il throughput dipende dalla lunghezza dell'input, dalla concorrenza e dalle condizioni del server.

I confronti end-to-end contro DeepSeek-V4-Flash-Vision-Exp sono dove il divario appare più ampio, perché misurano lo stesso compito in successione. I tester hanno riportato circa 6× più veloce end-to-end su un task di generazione di codice SVG, circa 5.2× su un recupero a contesto lungo di 49k token, circa 5× su un ampio task di generazione e ottimizzazione SQL, 4.6× su un problema algoritmico e 3.9× su un task di refactoring asincrono. Considerali indicativi, non precisi: i numeri end-to-end dello stesso compito includono il tempo di pensiero, la latenza del primo token e la velocità di generazione, e provengono da singoli tester piuttosto che da una suite controllata. La direzione coerente tra tutti è il segnale interessante, non un singolo moltiplicatore.

La questione al centro della beta

Il dettaglio più strategico si nasconde nel modulo di feedback che Deep​Seek ha allegato al test. Oltre alle domande sui framework per agenti e sugli scenari reali, chiede direttamente ai tester se la versione intermedia di DeepSeek V4.1 Flash "può sostituire completamente il DeepSeek V4 Pro online". È notevole che un'azienda sottoponga agli utenti una domanda del genere, perché DeepSeek V4 Pro si colloca tre livelli di prezzo al di sopra di Flash: alle tariffe ufficiali attuali, il modello Pro costa $0,66 per 1 milione di token in input (cache miss) e $1,98 per 1 milione di token in output fuori picco, contro $0,22 e $0,66 per DeepSeek V4 Flash — un 3× netto su ogni voce. Se un modello di livello Flash si avvicina davvero alle capacità di livello Pro a prezzi di livello Flash, la questione si risolve da sé per una larga fetta di utenti, e Deep​Seek lo sa.

Letto insieme alla formulazione di “nuova struttura”, il questionario lascia intendere che V4.1 Flash è il primo passo visibile di qualcosa di più grande di un semplice aggiornamento puntuale — una linea Flash riposizionata per comprimere il divario con il modello di punta, nel modo in cui Deep​Seek ha ripetutamente usato un modello più economico e veloce per resettare le aspettative del mercato su ciò che una fascia di prezzo offre. Nessuno di questi elementi è confermato da un benchmark; è una lettura strategica di una domanda di due frasi. Ma è la cosa più interessante che Deep​Seek abbia detto su V4.1 Flash in tutta la giornata.

Dove provarlo e cosa eseguire in produzione nel frattempo

Durante la finestra di test, l'unico punto di accesso a V4.1 Flash è l'API proprietaria di Deep​Seek: non esiste hosting di terze parti per una build che scade tra due giorni, e nessuno dovrebbe collegare un percorso di produzione a un ID modello destinato a smettere di rispondere. L'uso sensato dei prossimi due giorni è la valutazione: esegui i tuoi carichi di lavoro rappresentativi, misura la qualità e la reale economia dei token, e tratta ogni numero di velocità che vedi come aneddotico finché non appare una release formale con una model card.

Per il traffico che deve continuare a funzionare, la gamma pubblica di Deep​Seek è invariata, ed è lì che un livello di routing dimostra il suo valore. Su OrcaRouter, DeepSeek V4 Flash, DeepSeek V4 Pro e DeepSeek-V4-Flash-Vision-Exp sono tutti raggiungibili tramite un'unica API al prezzo di listino di Deep​Seek, senza alcun markup — quindi il taglio dei prezzi di agosto è attivo dalla nostra parte dal giorno stesso in cui è arrivato, non quando un foglio di calcolo dei margini ha trovato il tempo di adeguarsi. Quando un V4.1 Flash ufficiale arriverà infine ai provider, la stessa configurazione è il modo per adottarlo con costi di migrazione minimi: invia una parte del traffico al nuovo modello, mantieni DeepSeek V4 Flash o V4 Pro come failover automatico e lascia che sia la DSL del router a decidere quali chiamate meritano il modello non collaudato e quali devono restare sul cavallo da lavoro. Non devi scommettere un percorso di produzione su una beta di due giorni per scoprire se è valido.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash (captured September 5, 2026) showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, text input, a p50 time-to-first-token of 434 ms, and the description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context, optimized for fast everyday workloads.'

Domande aperte

• Quando arriva la versione ufficiale? La segnalazione che ha evidenziato questo modello dice che un post di rilascio è atteso "molto presto"; la durata di due giorni della beta suggerisce che DeepSeek non intende far aspettare a lungo il mondo.

• La build finale corrisponde a questa? I tester indipendenti che seguono i cicli di test di Deep​Seek notano che l'azienda sembra eseguire più build candidate in parallelo, e la candidata più veloce in un test iniziale non è sempre quella che viene rilasciata — quindi i numeri di velocità di oggi potrebbero non descrivere il modello GA.

• Quali sono le specifiche? Il numero di parametri, i dettagli dell'architettura, la lunghezza del contesto e l'elenco completo delle modalità di input non sono stati pubblicati, e sono tutte le prime cose di cui una vera recensione ha bisogno.

• Il prezzo regge, e il "costo inferiore" sopravvive al contatto con carichi di lavoro reali? La beta fattura alle tariffe DeepSeek V4 Flash; un lancio potrebbe portare una nuova tariffa, e il costo per attività non è misurato.

• Può davvero essere all'altezza del ruolo Pro? Il questionario pone la domanda, ma solo valutazioni indipendenti su suite agentiche e di reasoning — i benchmark che oggi separano il livello Flash dal livello Pro — possono rispondere.

Se hai una chiave Deep​Seek, il conto alla rovescia di due giorni è la storia: chiama deepseek-v4.1-flash-expires-on-0910 prima che sparisca, esegui i tuoi carichi di lavoro e archivia i numeri sotto "misurato dalla community, condizioni variabili". Per tutti gli altri, la cosa da tenere d'occhio è il post di rilascio, e la domanda dietro di esso — se il livello più economico di Deep​Seek ha appena iniziato a prendere di mira quello più costoso.

Mentre la beta di due giorni si assesta, il modello Flash stabile che puoi effettivamente eseguire oggi è a una sola chiamata API di distanza: DeepSeek V4 Flash su OrcaRouter — al prezzo di listino di Deep​Seek, passato direttamente con un ricarico dello 0%.

E il modello di punta con cui il questionario beta continua a chiedere ai tester di confrontare V4.1 Flash: DeepSeek V4 Pro su OrcaRouter.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno