DeepSeek V4 Flash 0731

deepseek/deepseek-v4-flash-0731
NuovoIn evidenza
StrumentiJSONRagionamento
di DeepSeek · 2026-07-31

DeepSeek V4 Flash 0731 è il rilascio ufficiale del modello efficiente V4 Flash di DeepSeek a mixture-of-experts, sottoposto a un nuovo post-addestramento — 284B totali / 13B parametri attivi, identico per architettura e dimensioni al rilascio V4 Flash di aprile, con la fase di post-addestramento rifatta da zero. Offre una finestra di contesto da 1 milione di token con fino a 384K token di output, supporta sia la modalità di ragionamento (thinking) sia quella non di ragionamento (non-thinking) — ragionamento attivo per impostazione predefinita — oltre a output JSON e chiamate agli strumenti (tool call), e integra nativamente l'API Responses con un adattamento mirato per agenti di codifica in stile Codex. La revisione 0731 segna un notevole passo avanti nelle capacità degli agenti, superando persino DeepSeek V4 Pro Preview nei benchmark per agenti pubblicati da DeepSeek: 82.7 su Terminal Bench 2.1, 76.7 su Cybergym, 70.3 su Toolathlon Verified, 54.4 su DeepSWE e 54.2 su NL2Repo. Nell'API first-party di DeepSeek, il model id deepseek-v4-flash serve attualmente questa revisione; l'identificatore datato elenca la stessa revisione per i chiamanti che la referenziano tramite data. È una scelta eccellente per agenti di codifica, carichi di lavoro su terminale e uso di strumenti, e pipeline agentiche ad alto volume, al costo della fascia flash (flash-tier).

ctx1M token
Output max384K
Inputtext
Outputtext
p50 TTFT791 ms
INGRESSO$0.15/ 1M token
USCITA$0.29/ 1M token
p50 TTFT791 ms7 g
p95 TTFT1.42 s7 g
TRAFFICO4.3Mtoken / 7 g

DeepSeek V4 Flash 0731 è un modello linguistico solo testo del provider deepseek, disponibile tramite OrcaRouter con l'ID modello deepseek/deepseek-v4-flash-0731. Le sue specifiche principali sono…

Cos'è DeepSeek V4 Flash 0731?

A chi è destinato questo modello?

Dove si colloca questo modello nella famiglia DeepSeek su OrcaRouter?

Esempi di codice

Chiama da qualsiasi SDK

Compatibile con OpenAI: mantieni il tuo SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash-0731",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parametri supportati

  • frequency_penalty
  • include_reasoning
  • logit_bias
  • logprobs
  • max_tokens
  • min_p
  • presence_penalty
  • reasoning
  • reasoning_effort
  • repetition_penalty
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Prezzi

Input / 1M token$0.147
Output / 1M token$0.295
Lettura cache / 1M$0.020
ValutaUSD

Calcolatore dei costi

Token / mese10MM
Quota di input70%%
Stimato / mese $1.91 · Con cache dei prompt $1.47

Stima basata sul prezzo di listino

Stima di token e costo

Token di input: 17Costo per richiesta: $0.000150

Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.

Prestazioni

p50 TTFT
791 ms
Velocità di output
101 tok/s
p95 TTFT
1.42 s
Tasso di errore
0%

Benchmark pubblici

69.1
AA Coding
Migliore del 85% dei modelli confrontati
n. 18 su 124
49.9
AA Intelligence
Migliore del 80% dei modelli confrontati
n. 24 su 126
Agent Last Exam
25.2
Automation Bench (Public)
25.1
Cybergym
76.7
DeepSWE
54.4
GPQA Diamond
90.8
Humanity's Last Exam
36.8
Long-Context Recall
65.7
NL2Repo
54.2
SciCode
49.9
tau_banking
31.1
Terminal Bench 2.1
82.7
terminalbench_v2_1
78.7
Toolathlon Verified
70.3
Fonte: artificialanalysis.ai, api-docs.deepseek.com

Discussioni della community

Di cosa parlano gli sviluppatori questa settimana

Hacker News7 menzioni · 7 gg7 in più rispetto alla settimana scorsa

A confronto

DeepSeek V4 Flash 0731DeepSeek V4 ProDeepSeek V4 FlashDeepSeek V3
Input $/M$0.15$0.44$0.15$0.15
Output $/M$0.29$0.88$0.29$0.29
Contesto1.0M1.0M1.0M1.0M
Qualità6/108/107/105/10
Confronta affiancatiConfronta affiancatiConfronta affiancatiConfronta affiancati

FAQ

Quanto costa DeepSeek V4 Flash 0731?
Costa $0,15 per 1.000.000 di token di input e $0,29 per 1.000.000 di token di output. OrcaRouter fattura alla tariffa del provider senza alcun ricarico, quindi queste sono le tariffe che paghi. La scheda del modello non descrive prezzi per input in cache né sconti per lotti.
Quale finestra di contesto e limite di output supporta?
Supporta 1,048,576 token di contesto di input e fino a 384,000 token di output. La modalità di input è solo testo. La scheda del modello non specifica un limite di token combinato separato oltre questi due massimali.
In cosa è più bravo il modello?
In base ai fatti inclusi, il suo punto di forza è il completamento di attività da terminale e da riga di comando, indicato da un punteggio di 82.7 su Terminal Bench 2.1. I suoi ampi limiti di contesto e di output supportano anche l'elaborazione di testi su documenti lunghi e la generazione di testi in formato lungo. Non vengono forniti altri punteggi benchmark.
Come si confronta con altri modelli?
I fatti forniti coprono solo questo modello. Confronta i candidati nel catalogo OrcaRouter per finestra di contesto, output massimo, modalità e prezzi per 1M di token. Questo modello è solo testo, ha un contesto di 1M token, un output di 384K e costa $0.15/$0.29 per 1M token.
Come vengono gestiti i dati quando si utilizza questo modello tramite OrcaRouter?
Le informazioni disponibili non descrivono la conservazione dei dati, l'uso per l'addestramento o l'archiviazione per questo modello. La gestione dei dati è disciplinata dai termini di OrcaRouter e dalle politiche del provider deepseek. Consultare la documentazione di OrcaRouter prima di inviare dati sensibili.
Come faccio a chiamare questo modello?
Utilizza l'API compatibile con OpenAI di OrcaRouter all'URL di base https://api.orcarouter.ai/v1 con l'ID del modello deepseek/deepseek-v4-flash-0731. Invia richieste standard di completamento chat con la tua chiave API OrcaRouter e messaggi solo di testo.
Supporta lo streaming o il function calling?
I fatti disponibili non indicano se lo streaming o la chiamata di funzioni sia supportata. L'API è compatibile con OpenAI, quindi testa queste funzionalità prima di fare affidamento su di esse. Imposta max_tokens entro il limite massimo di output di 384.000.
Questo è un modello multimodale?
No. La modalità di input è solo testo. Per immagini, audio o video, avrai bisogno di un modello multimodale nel catalogo di OrcaRouter o di una fase di pre-elaborazione separata.

Incorpora questo badge

DeepSeek: DeepSeek V4 Flash 0731$0.15/M in791ms p50tramite OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4-flash-0731.svg" alt="DeepSeek: DeepSeek V4 Flash 0731 su OrcaRouter" /> </a>
Markdown [![DeepSeek: DeepSeek V4 Flash 0731](https://www.orcarouter.ai/embed/deepseek/deepseek-v4-flash-0731.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731)

Scheda del modello come dati

GET /api/public/models/deepseek/deepseek-v4-flash-0731Apri
Leggibile dalle macchine:/llms.txt/llms-full.txt