DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
NuovoIn evidenza
VisioneStrumentiJSONRagionamento
di DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash è il modello più piccolo della nuova famiglia di architetture di DeepSeek, rilasciato il 10 settembre 2026, con comprensione visiva multimodale nativa — il successore in produzione sia di V4 Flash che dell'esperimento V4 Flash Vision. La nuova architettura mira a un tetto di capacità più elevato, a un'inferenza più rapida e a un throughput maggiore, e DeepSeek riporta che V4.1 Flash supera completamente V4 Pro in termini di prestazioni, costi, velocità e tempo totale di attività. Accetta testo e immagini con output testuale, offre una finestra di contesto da 1M token con fino a 384K token di output, e supporta modalità di pensiero (predefinita, con sforzo selezionabile basso / alto / massimo) e non-pensiero tramite le API Chat Completions, Responses e compatibili con Anthropic, insieme a output JSON, chiamate di strumenti e completamento del prefisso della chat; FIM funziona solo in modalità non-pensiero. I pesi del modello sono aperti su Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash). Benchmark ufficiali al rilascio: 90.6 su Terminal-Bench 2.1, 74.2 su DeepSWE v1.1, 65.4 su NL2Repo-Bench, 90.9 su GPQA Diamond, 63.9 su HLE con strumenti, e forti risultati di agenti con visione nativa (89.6 BabyVision, 78.9 Chartography con strumenti). Il prezzo è stato ridotto in concomitanza con il rilascio: $0,15/M di input (cache miss), $0,60/M di output e $0,003/M su cache hit a tariffe non di punta, raddoppiando durante le ore di punta nei giorni feriali (01:00-04:00 e 06:00-10:00 UTC); tutte le altre ore, inclusi i fine settimana, sono non di punta.

ctx1M token
Output max384K
Inputtext + image
Outputtext
p50 TTFT410 ms
INGRESSO$0.15/ 1M token
USCITA$0.60/ 1M token
p50 TTFT410 ms7 g
p95 TTFT1.56 s7 g
TRAFFICO271.0Mtoken / 7 g

DeepSeek V4.1 Flash è un modello DeepSeek disponibile tramite OrcaRouter, il gateway API compatibile con OpenAI. Accetta input testuali e immagini, ha una finestra di contesto di 1.048.576 token e…

Che cos'è DeepSeek V4.1 Flash?

Per chi è stato creato DeepSeek V4.1 Flash?

Perché la finestra di contesto di 1.048.576 token è importante?

Esempi di codice

Chiama da qualsiasi SDK

Compatibile con OpenAI: mantieni il tuo SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parametri supportati

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

Prezzi

Prezzi
Input / 1M token · Fuori punta$0.150
Output / 1M token · Fuori punta$0.600
Lettura cache / 1M · Fuori punta$0.0030
Ore di punta01:00–04:00, 06:00–10:00 ×2 (UTC)
Input / 1M token · ×2$0.300
Output / 1M token · ×2$1.20
Lettura cache / 1M · ×2$0.0060
ValutaUSD

Calcolatore dei costi

Token / mese10MM
Quota di input70%%
Stimato / mese $2.85 · Con cache dei prompt $2.34

Stima basata sul prezzo di listino

Stima di token e costo

Token di input: 17Costo per richiesta: $0.000303

Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.

Prestazioni

p50 TTFT
410 ms
Velocità di output
215 tok/s
p95 TTFT
1.56 s
Tasso di errore
0.07%

Benchmark pubblici

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
Fonte: api-docs.deepseek.com

Discussioni della community

Di cosa parlano gli sviluppatori questa settimana

Hacker News13 menzioni · 7 gg13 in più rispetto alla settimana scorsa

A confronto

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
Input $/M$0.15$0.73$0.24$0.24
Output $/M$0.60$2.18$0.73$0.73
Contesto1.0M1.0M1.0M1.0M
Qualità8/108/107/107/10
Confronta affiancatiConfronta affiancatiConfronta affiancatiConfronta affiancati

FAQ

Quanto costa DeepSeek V4.1 Flash su OrcaRouter?
OrcaRouter fattura DeepSeek V4.1 Flash a 0,15 $ per 1 milione di token di input e 0,60 $ per 1 milione di token di output, applicando la tariffa del provider senza alcun ricarico. Non è descritto alcun addebito separato per la finestra di contesto in sé: 1.048.576 token è un limite, non un costo. I token di input includono testo, immagini e cronologia della conversazione che invii; i token di output coprono tutto ciò che viene generato, fino a 384.000 token.
Quanto sono grandi la finestra di contesto e l'output massimo?
DeepSeek V4.1 Flash ha una finestra di contesto di 1.048.576 token e un output massimo di 384.000 token. La finestra di input consente di inviare interi documenti, trascrizioni o snapshot di repository in una sola chiamata, mentre il limite massimo di output supporta artefatti lunghi in un'unica passata come specifiche, piani di migrazione o diff estesi.
A cosa serve meglio DeepSeek V4.1 Flash?
È progettato per lavori con input lunghi e output lunghi: analisi di documenti completi, comprensione del codice di repository di grandi dimensioni, revisione multimodale di testo e immagini e flussi di lavoro che richiedono risposte generate sostanziali anziché risposte brevi. Il suo punteggio di 90,9 su GPQA Diamond indica anche una solida capacità di ragionamento scientifico e tecnico a livello di laurea magistrale. L'input supporta sia testo che immagini; l'output è solo testo.
Come si confronta con i modelli frontier più grandi?
I modelli di frontiera possono essere in testa nei benchmark di ragionamento più difficili e in genere costano di più per token, mentre DeepSeek V4.1 Flash offre una finestra di contesto di 1.048.576 token e un tetto di output di 384.000 token a $0.15 per 1M di token di input e $0.60 per 1M di token di output. Per lavori con contesto lungo e ad alto volume è spesso la scelta pratica; per i singoli passaggi di ragionamento più difficili, instradare quelle chiamate a un modello più costoso su OrcaRouter è uno schema ragionevole.
Come vengono gestiti i dati quando chiamo questo modello?
OrcaRouter instrada le richieste all'API di DeepSeek e fattura alla tariffa del provider senza alcun ricarico. La conservazione, l'uso per l'addestramento e i termini correlati sono disciplinati dalle politiche del provider anziché da un accordo separato descritto qui, quindi verifica le condizioni attuali del provider prima di inviare materiale sensibile. Oscura gli identificatori di cui non hai bisogno e mantieni i prompt al minimo richiesto dall'attività; un contesto più ridotto abbassa anche il costo di input a $0,15 per 1M token.
Come posso chiamarlo tramite un'API compatibile con OpenAI?
Imposta l'URL di base del tuo client su https://api.orcarouter.ai/v1 e usa l'ID del modello deepseek/deepseek-v4.1-flash con la tua chiave API di OrcaRouter. Le richieste e le risposte seguono lo schema delle chat completions di OpenAI, quindi gli SDK esistenti, i gestori di streaming e il parsing delle tool call continuano a funzionare senza modifiche. La migrazione di solito consiste nel cambio dell'URL di base e della stringa del modello più una riesecuzione del tuo set di valutazione.
DeepSeek V4.1 Flash può accettare immagini?
Sì. L'input di immagini è supportato tramite l'array standard di contenuti multimodali, con parti di testo e immagini nello stesso messaggio utente. I token delle immagini contano come input e vengono fatturati a $0,15 per 1M token di input su OrcaRouter. L'output rimane solo testo, quindi il modello descrive o estrae dalle immagini anziché generarle.
Un 90.9 su GPQA Diamond è sufficiente per fidarmi di esso per il mio compito?
È un segnale utile, non una garanzia. GPQA Diamond misura il ragionamento scientifico di livello universitario avanzato con un formato di prompt fisso, il che è rilevante per la risposta a domande tecniche ma dice poco sul richiamo su contesti lunghi, sul tono o sull'accuratezza di estrazione sui tuoi dati. Crea un piccolo set di valutazione da input reali, eseguilo su DeepSeek V4.1 Flash e su qualsiasi ID di modello alternativo su OrcaRouter, e confronta costi e qualità prima di instradare il traffico di produzione.

Incorpora questo badge

DeepSeek: DeepSeek V4.1 Flash$0.15/M in410ms p50tramite OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="DeepSeek: DeepSeek V4.1 Flash su OrcaRouter" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

Scheda del modello come dati

GET /api/public/models/deepseek/deepseek-v4.1-flashApri
Leggibile dalle macchine:/llms.txt/llms-full.txt