DeepSeek V4 Flash 0731 è il rilascio ufficiale del modello efficiente V4 Flash di DeepSeek a mixture-of-experts, sottoposto a un nuovo post-addestramento — 284B totali / 13B parametri attivi, identico per architettura e dimensioni al rilascio V4 Flash di aprile, con la fase di post-addestramento rifatta da zero. Offre una finestra di contesto da 1 milione di token con fino a 384K token di output, supporta sia la modalità di ragionamento (thinking) sia quella non di ragionamento (non-thinking) — ragionamento attivo per impostazione predefinita — oltre a output JSON e chiamate agli strumenti (tool call), e integra nativamente l'API Responses con un adattamento mirato per agenti di codifica in stile Codex. La revisione 0731 segna un notevole passo avanti nelle capacità degli agenti, superando persino DeepSeek V4 Pro Preview nei benchmark per agenti pubblicati da DeepSeek: 82.7 su Terminal Bench 2.1, 76.7 su Cybergym, 70.3 su Toolathlon Verified, 54.4 su DeepSWE e 54.2 su NL2Repo. Nell'API first-party di DeepSeek, il model id deepseek-v4-flash serve attualmente questa revisione; l'identificatore datato elenca la stessa revisione per i chiamanti che la referenziano tramite data. È una scelta eccellente per agenti di codifica, carichi di lavoro su terminale e uso di strumenti, e pipeline agentiche ad alto volume, al costo della fascia flash (flash-tier).
DeepSeek V4 Flash 0731 è un modello linguistico solo testo del provider deepseek, disponibile tramite OrcaRouter con l'ID modello deepseek/deepseek-v4-flash-0731. Le sue specifiche principali sono…
L'input è limitato al testo. La finestra di contesto è di 1.048.576 token e l'output massimo è di 384.000 token per risposta. Si tratta di un'area di lavoro ampia: puoi leggere circa un milione di token di contenuto prima di generare e puoi richiedere fino a 384.000 token di output in una singola chiamata. La scheda del modello li elenca come due limiti separati; non indica un limite combinato per una richiesta che utilizza entrambi i valori vicini al massimo. In pratica, per rimanere entro i limiti, conta i tuoi token prima di inviare e imposta max_tokens al di sotto del limite di output. Il vincolo del solo testo significa anche che devi convertire PDF, fogli di calcolo e altri documenti in testo semplice prima. La tokenizzazione non è specificata nei dati disponibili, quindi testa contenuti rappresentativi per vedere quanto diventano grandi i tuoi prompt. Se la tua richiesta supera i 1.048.576 token di input, la chiamata API fallirà; lo stesso vale per output superiori ai 384.000 token.
Date le specifiche elencate, il modello è più adatto per attività che combinano input testuali lunghi, output testuali lunghi e ragionamento agentico orientato al terminale. Il punteggio di 82,7 su Terminal Bench 2.1 è una prova della solidità nel completamento di attività da riga di comando, dove un modello legge l'output della shell e decide il comando successivo. Il contesto di 1.048.576 token supporta l'analisi dell'intero repository, la revisione del codice su più file, lunghi documenti legali o tecnici e cronologie di chat estese. L'output di 384.000 token supporta la generazione di lunghi documenti strutturati, dataset sintetici o analisi passo-passo in un'unica passata. Il prezzo per token di 0,15 $ per input e 0,29 $ per output per milione di token rende l'elaborazione testuale ad alto volume finanziariamente prevedibile. Il modello è meno appropriato quando si necessita di comprensione delle immagini, trascrizione audio o latenza molto bassa, nessuna delle quali è coperta dai dati forniti. Se l'attività rientra nel profilo di solo testo, grande contesto e grande output, questo è un candidato ragionevole da valutare tramite OrcaRouter.
Il modello non può accettare input non testuali; non esiste alcuna modalità visiva, audio o video nella sua scheda di catalogo. Inoltre, non ha garanzie pubblicate sulla latenza o sullo streaming nelle informazioni disponibili. Dovresti scegliere un modello più economico quando il tuo carico di lavoro non richiede i grandi limiti di contesto o di output. Ad esempio, un breve scambio chatbot che utilizza qualche migliaio di token verrebbe comunque fatturato alla stessa tariffa per token, ma potrebbe essere servito meglio da un modello con un contesto più piccolo e un prezzo per milione di token più basso. Le informazioni disponibili non elencano i prezzi delle alternative, quindi confronta le tariffe per 1 milione di token nel catalogo OrcaRouter. Se il tuo compito è una semplice classificazione o sintesi di brevi passaggi, un modello più economico può essere sufficiente. Se il tuo compito richiede il contesto completo di 1M o l'output di 384K, oppure trae vantaggio dal punto di forza di Terminal Bench 2.1 nel lavoro da riga di comando, allora il prezzo di questo modello è la base rilevante per la valutazione.
Ogni input deve essere testo. PDF, immagini, fogli di calcolo e file audio devono essere convertiti in testo semplice o trascritti prima di poter essere inviati. Questo è un passaggio di pre-elaborazione necessario, ma semplifica anche il formato della richiesta: campi di contenuto standard in stile OpenAI contenenti stringhe sono tutto ciò di cui hai bisogno. Il contesto di 1.048.576 token significa che puoi passare lunghi corpi di testo convertito in una singola richiesta; l'output di 384.000 token significa che puoi ricevere testo molto lungo in risposta. Il conteggio dei token è la principale preoccupazione operativa, poiché il costo totale dipende dai token di input e di output. OrcaRouter riporta l'utilizzo nella risposta compatibile con OpenAI, consentendoti di monitorare entrambi i numeri. Se lavori con lingue o codice che tokenizzano in modo inefficiente, il tuo contesto effettivo si ridurrà perché il limite vincolante è il conteggio dei token, non i caratteri. Non vengono forniti dettagli sul tokenizer, quindi esegui un rapido test con i tuoi contenuti per conoscere le lunghezze tipiche dei token.
Terminal Bench 2.1 valuta la capacità di un modello di lavorare in un ambiente terminale: comprendere l'output dei comandi, navigare tra le directory, eseguire comandi e completare attività realistiche di amministrazione di sistema o ingegneria del software tramite una shell. Il punteggio principale per DeepSeek V4 Flash 0731 è 82,7, su una scala in cui valori più alti indicano prestazioni migliori. Questo è l'unico risultato di benchmark fornito nei fatti disponibili. Il punteggio è un segnale utile se prevedi di costruire loop di agenti che emettono comandi shell, poiché il benchmark è progettato per testare esattamente questo tipo di capacità. Non è una misura della conoscenza generale, della scrittura creativa, della matematica o della competenza multilingue. Non vengono forniti baseline di confronto o altri numeri di benchmark, quindi l'82,7 va interpretato nel contesto: una forte evidenza per le attività legate al terminale e nessuna evidenza in un senso o nell'altro per altri domini. I punteggi dei benchmark dipendono dall'esatta distribuzione dei compiti, quindi i tuoi compiti di terminale potrebbero ottenere punteggi diversi; convalida con la tua valutazione prima dell'uso in produzione.
I dati disponibili per DeepSeek V4 Flash 0731 non includono token al secondo, tempo al primo token, latenza p95 o throughput. Il nome Flash suggerisce una variante più leggera, ma i dati forniti non quantificano la velocità. Ciò che i dati includono è una grande finestra di contesto di 1.048.576 token e un ampio limite di output di 384.000 token. Input e output più lunghi consumano intrinsecamente più calcolo, quindi la latenza sulle richieste con contesto completo sarà probabilmente più alta rispetto ai prompt brevi, anche per un modello veloce. Il prezzo di 0,15$/0,29$ per milione di token descrive il costo, non la velocità. Per prendere una decisione informata, esegui il tuo test di carico sull'API di OrcaRouter con prompt rappresentativi della dimensione che intendi utilizzare e confronta il tempo al primo token e la durata totale con altri modelli del catalogo. Non estrapolare la latenza dal punteggio del benchmark, che non misura il tempo di risposta.
I limiti principali sono evidenti dai fatti elencati. È solo testo, quindi qualsiasi input multimodale è fuori portata. Le prove dei benchmark si limitano a un punteggio, 82,7 su Terminal Bench 2.1, che copre il completamento di attività basate su terminale, non il ragionamento generale o la conoscenza. Non sono pubblicati parametri di latenza, disponibilità o tasso di errore, quindi le prestazioni sotto carico sono sconosciute. I limiti di contesto e di output sono ampi ma finiti: 1.048.576 token di input e 384.000 token di output per richiesta. Le richieste che li superano non andranno a buon fine. Non è documentato alcuno sconto per il caching del prompt nei fatti forniti, quindi i prefissi ripetuti vengono fatturati come token di input ordinari. Il prezzo è basso su base per token, ma i costi assoluti crescono linearmente con la dimensione del contesto. Se la tua applicazione richiede visione, bassa latenza o throughput molto elevato, questo modello potrebbe non essere la scelta giusta; verifica questi requisiti separatamente prima di impegnarti.
I costi sono calcolati per token, con una tariffa per l'input e una per l'output. I token di input costano $0,15 per 1.000.000 di token; i token di output costano $0,29 per 1.000.000 di token. OrcaRouter fattura questi importi alla tariffa del provider senza alcun ricarico, il che significa che nessuna percentuale aggiuntiva della piattaforma viene applicata sopra la tariffa di DeepSeek. Il costo di una singola richiesta è approssimativamente pari ai token di input moltiplicati per $0,15 diviso 1.000.000, più i token di output moltiplicati per $0,29 diviso 1.000.000. Ad esempio, un input completo da 1.048.576 token costa circa $0,1573, e un output di lunghezza massima di 384.000 token costa circa $0,1114, se entrambi i limiti fossero utilizzati in transazioni separate. I fatti disponibili non menzionano prezzi scontati per l'input in cache, quindi si presuppone che ogni token di input venga fatturato alla tariffa standard. Poiché il prezzo è lineare, la stima del costo di un batch è semplice una volta che si conoscono la dimensione media del prompt e la lunghezza dell'output.
Il principale compromesso è tra dimensione del contesto e prezzo. A 0,15 $ per 1 milione di token di input, un prompt che utilizza l'intero contesto di 1.048.576 token costa circa 0,157 $ solo in costi di input. Se il tuo compito richiede solo qualche migliaio di token di contesto, stai pagando per capacità inutilizzata, nel senso che un modello con contesto più piccolo e prezzo per token inferiore potrebbe essere più economico, a seconda delle sue tariffe. La tariffa di 0,29 $ per 1 milione di token di output significa che output lunghi non sono particolarmente costosi singolarmente, ma un carico di lavoro che genera gigabyte di testo accumulerà costi. Non sono elencati sconti per batch, prenotazioni o sconti per caching nei fatti forniti. La fatturazione a margine zero di OrcaRouter significa che il prezzo che vedi è il prezzo del fornitore; la tua fattura finale è semplicemente una funzione dei token inviati e ricevuti. Per lavori batch su larga scala, stima il totale dei token di input e output, moltiplica per le due tariffe e confronta con le alternative nel catalogo.
OrcaRouter fattura esplicitamente DeepSeek V4 Flash 0731 alla tariffa del provider, senza alcun margine. I $0.15 per 1M di token di input e i $0.29 per 1M di token di output sono le tariffe del provider, non una versione maggiorata. I fatti forniti non descrivono la cache dei prompt per questo modello. Non è elencato alcun livello tariffario per input in cache e non è indicato che OrcaRouter memorizzi automaticamente i prompt nella cache per conto vostro. Se il provider sottostante offre la memorizzazione nella cache, i termini non fanno parte di ciò che è stato fornito per questa voce di catalogo, quindi dovreste consultare la documentazione attuale di OrcaRouter prima di presupporre uno sconto. La risposta API, poiché segue il formato di completamento chat di OpenAI, include informazioni sull'utilizzo che consentono di verificare i token di input e output fatturati. A fini di audit, registrate l'oggetto usage di ogni risposta e confrontatelo con i conteggi di token previsti. Qualsiasi controllo dei costi deve derivare dalle vostre scelte relative a prompt e parametri.
Invia richieste di completamento chat standard all'API compatibile con OpenAI di OrcaRouter. L'URL di base è https://api.orcarouter.ai/v1 e l'ID del modello è deepseek/deepseek-v4-flash-0731. Imposta il campo model su quella stringa esatta e inserisci la tua chiave API OrcaRouter nell'header Authorization come token bearer. Costruisci un array messages con contenuto testuale; il modello non accetta contenuti immagine o audio. La risposta è formattata come un completamento chat OpenAI e include il messaggio generato e un oggetto usage. Poiché l'ID del modello include un prefisso del provider, mantienilo esattamente come mostrato. Le informazioni disponibili non richiedono header non standard né impostazioni di trasporto speciali. Puoi usare gli SDK OpenAI, curl o qualsiasi client HTTP che parli JSON. Inizia con una richiesta piccola, verifica che l'usage restituito corrisponda ai conteggi previsti di token di input e output, poi aumenta la scala.
Poiché l'endpoint è compatibile con OpenAI, sono disponibili i tipici parametri di chat completion: model, messages, temperature, top_p, max_tokens o max_completion_tokens, stop, stream e opzioni simili supportate dall'SDK che utilizzi. I dati disponibili non elencano quali parametri OrcaRouter onora per questo specifico modello, quindi dovresti testare qualsiasi cosa oltre a model e messages. I limiti cruciali sono quelli del modello stesso: 1,048,576 token di input e 384,000 token di output. Mantieni max_tokens al di sotto del limite di output per evitare richieste non riuscite. Per quanto riguarda il tool calling o function calling, i dati non indicano supporto; testa una definizione minima di tool prima di creare un agente. Per il controllo del formato di output, non c'è menzione della modalità JSON o di garanzie di output strutturato; valida tu stesso il testo generato se hai bisogno di una struttura affidabile. Lo streaming è generalmente supportato sugli endpoint compatibili con OpenAI, ma i dati non lo confermano per questo modello, quindi consulta il riferimento API di OrcaRouter.
La migrazione è per lo più configurazione: cambiare l'URL di base in https://api.orcarouter.ai/v1, passare alla propria chiave OrcaRouter e sostituire il nome del modello con deepseek/deepseek-v4-flash-0731. Il codice che già costruisce i messaggi, gestisce le risposte di chat completion e legge i dati di utilizzo continuerà a funzionare purché segua la convenzione OpenAI. Due differenze richiedono attenzione. In primo luogo, questo modello è solo testo, quindi rimuovere qualsiasi campo image_url o audio dalle richieste. In secondo luogo, i limiti di contesto e di output sono molto ampi; regolare l'impostazione max_tokens per rispettare il tetto di output di 384.000 token e prepararsi a risposte occasionalmente lunghe. Se il codice include retry su errori 429 o 5xx, mantenerli; questo non cambia le aspettative di gestione degli errori. Eseguire uno smoke test con un piccolo prompt, verificare che la fatturazione risulti a $0,15/$0,29 per milione di token, e poi spostare gradualmente il traffico.
L'URL di base per l'API di OrcaRouter è https://api.orcarouter.ai/v1. Tutte le richieste a questo endpoint devono utilizzare HTTPS. L'autenticazione avviene tramite una chiave API, inviata come token bearer standard nell'intestazione Authorization. I fatti disponibili non elencano metodi di autenticazione alternativi. L'ID del modello è deepseek/deepseek-v4-flash-0731, che include il nome del provider e il suffisso dello snapshot 0731; passalo esattamente come scritto. Nella maggior parte degli SDK compatibili con OpenAI, si configura un client con base_url e api_key, quindi si imposta il nome del modello su ogni chiamata. La risposta includerà i conteggi di token rilevanti per la fatturazione nell'oggetto usage. I fatti non indicano limiti di frequenza, comportamento di retry o indicazioni sui timeout, quindi consulta la documentazione di OrcaRouter per questi dettagli operativi. Conserva la tua chiave API in modo sicuro; la chiave determina l'accesso a ogni account del modello nel tuo progetto OrcaRouter. Se utilizzi un proxy o un gateway, puntalo all'URL di base di OrcaRouter e preserva l'ID completo del modello.
I fatti forniti coprono solo questo snapshot specifico, quindi un confronto numerico riga per riga con altre voci DeepSeek non è possibile sulla base di quanto fornito. Ciò che sappiamo di DeepSeek V4 Flash 0731 è il contesto di 1.048.576 token, il limite di output di 384.000 token, l'input di solo testo, il prezzo di $0,15/$0,29 per 1 milione di token e il punteggio di 82,7 su Terminal Bench 2.1. Gli altri modelli DeepSeek nel catalogo di OrcaRouter possono differire su uno qualsiasi di questi aspetti. Quando decidi, confronta le specifiche che contano: quanti token usano effettivamente i tuoi prompt, quanti token richiedono i tuoi output, se hai bisogno di un input multimodale e il prezzo per 1 milione di token del candidato. L'etichetta Flash implica una variante più snella rispetto ad altre versioni DeepSeek, ma l'unico indicatore oggettivo di prestazioni presente nei fatti è il punteggio di Terminal Bench. Prima di selezionare, consulta le pagine del catalogo di OrcaRouter per un confronto fianco a fianco di specifiche e prezzi correnti.
Con 1.048.576 token di contesto, questo modello si colloca nel livello a contesto lungo. Un modello con contesto più piccolo potrebbe fermarsi a poche centinaia di migliaia di token o meno, costringendoti a dividere i documenti, incorporare chunk o usare il retrieval. Il vantaggio di questo modello è che puoi inserire un corpus molto ampio in un singolo prompt e lasciare che il modello presti attenzione a tutto in un'unica passata. Lo svantaggio è il costo per richiesta: ogni token di input viene fatturato, quindi un contesto enorme moltiplica la spesa di input. I fatti non elencano alcun modello con una finestra di contesto ancora più ampia, quindi le uniche affermazioni sicure riguardano i limiti di questo modello stesso. Nella scelta, stima le dimensioni reali dei tuoi prompt. Se le tue attività usano tipicamente meno di 100K token, il contesto completo potrebbe essere irrilevante e un modello più economico e più piccolo potrebbe essere preferibile. Se superi regolarmente i limiti di contesto comuni, la finestra da 1M token di questo modello è la caratteristica decisiva.
Scegli DeepSeek V4 Flash 0731 quando l'attività è solo testo e puoi sfruttare le sue specifiche. Il contesto di 1.048.576 token giustifica la selezione quando devi leggere un intero repository, un set di documenti o una lunga trascrizione in un'unica passata. Il limite di output di 384.000 token giustifica la selezione quando hai bisogno di risposte generate molto lunghe senza dover effettuare molteplici round trip. Il punteggio di 82,7 su Terminal Bench 2.1 giustifica la selezione per l'automazione del terminale e i flussi di lavoro CLI agentici. Il prezzo di $0,15/$0,29 per 1 milione di token giustifica la selezione per l'elaborazione batch di testo ad alto volume dove il costo per token domina. Non sceglierlo quando ti servono immagini o audio, quando le tue esigenze di contesto sono minime ed esiste un modello più economico, o quando non puoi accettare caratteristiche di latenza sconosciute. I fatti disponibili non offrono garanzie sulla latenza, quindi i team sensibili alle prestazioni dovrebbero prima eseguire benchmark con prompt reali. In ogni caso, conferma l'ID del modello e la fatturazione su OrcaRouter prima di scalare.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| Input / 1M token | $0.147 |
| Output / 1M token | $0.295 |
| Lettura cache / 1M | $0.020 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
Di cosa parlano gli sviluppatori questa settimana
GET /api/public/models/deepseek/deepseek-v4-flash-0731Apri @misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731