DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
NouveauEn vedette
VisionOutilsJSONRaisonnement
par DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash est le plus petit modèle de la nouvelle famille d’architectures de DeepSeek, publié le 10 septembre 2026, avec une compréhension visuelle multimodale native — le successeur en production à la fois de V4 Flash et de l’expérience V4 Flash Vision. La nouvelle architecture vise un plafond de capacité plus élevé, une inférence plus rapide et un débit supérieur, et DeepSeek indique que V4.1 Flash surpasse globalement V4 Pro en termes de performances, de coût, de vitesse et de temps total d’exécution des tâches. Il accepte du texte et des images avec sortie de texte, offre une fenêtre de contexte de 1M de jetons avec jusqu’à 384K jetons de sortie, et prend en charge les modes réflexion (par défaut, avec effort sélectionnable faible / élevé / maximal) et non-réflexion via les API Chat Completions, Responses et compatibles Anthropic, ainsi que la sortie JSON, les appels d’outils et la complétion de préfixe de chat ; FIM ne fonctionne qu’en mode non-réflexion. Les poids du modèle sont ouverts sur Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash). Benchmarks officiels à la sortie : 90.6 sur Terminal-Bench 2.1, 74.2 sur DeepSWE v1.1, 65.4 sur NL2Repo-Bench, 90.9 sur GPQA Diamond, 63.9 sur HLE avec outils, et de solides résultats d’agents en vision native (89.6 BabyVision, 78.9 Chartography avec outils). Les prix ont été réduits parallèlement à la sortie : $0.15/M en entrée (cache miss), $0.60/M en sortie et $0.003/M en cas de cache hits aux tarifs hors pointe, doublant pendant les heures de pointe en semaine (01:00-04:00 et 06:00-10:00 UTC) ; toutes les autres heures, y compris les week-ends, sont hors pointe.

ctx1M tokens
Sortie max384K
Entréetext + image
Sortietext
p50 TTFT410 ms
ENTRÉE$0.15/ 1M tokens
SORTIE$0.60/ 1M tokens
p50 TTFT410 ms7 j
TTFT p951.56 s7 j
TRAFIC271.0Mtokens / 7 j

DeepSeek V4.1 Flash est un modèle DeepSeek disponible via OrcaRouter, la passerelle API compatible OpenAI. Il accepte les entrées texte et image, dispose d'une fenêtre de contexte de 1 048 576 tokens…

Qu'est-ce que DeepSeek V4.1 Flash ?

À qui s'adresse DeepSeek V4.1 Flash ?

Pourquoi la fenêtre de contexte de 1,048,576 jetons est-elle importante ?

Exemples de code

Appelez depuis n'importe quel SDK

Compatible OpenAI — gardez votre SDK actuel

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Paramètres pris en charge

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

Tarifs

Tarifs
Entrée / 1M tokens · Heures creuses$0.150
Sortie / 1M tokens · Heures creuses$0.600
Lecture cache / 1M · Heures creuses$0.0030
Heures de pointe01:00–04:00, 06:00–10:00 ×2 (UTC)
Entrée / 1M tokens · ×2$0.300
Sortie / 1M tokens · ×2$1.20
Lecture cache / 1M · ×2$0.0060
DeviseUSD

Calculateur de coût

Tokens / mois10MM
Part d'entrée70%%
Estimé / mois $2.85 · Avec cache de prompt $2.34

Estimation basée sur le tarif public

Estimateur de tokens et de coût

Tokens d'entrée: 17Coût par requête: $0.000303

Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.

Performances

p50 TTFT
410 ms
Vitesse de sortie
215 tok/s
TTFT p95
1.56 s
Taux d'erreur
0.07%

Benchmarks publics

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
Source: api-docs.deepseek.com

Buzz communautaire

Ce dont parlent les développeurs cette semaine

Hacker News13 mentions · 7 jen hausse de 13 vs la semaine précédente

Comparatif

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
Entrée $/M$0.15$0.73$0.24$0.24
Sortie $/M$0.60$2.18$0.73$0.73
Contexte1.0M1.0M1.0M1.0M
Qualité8/108/107/107/10
Comparer côte à côteComparer côte à côteComparer côte à côteComparer côte à côte

FAQ

Combien coûte DeepSeek V4.1 Flash sur OrcaRouter ?
OrcaRouter facture DeepSeek V4.1 Flash à 0,15 $ par million de tokens d'entrée et 0,60 $ par million de tokens de sortie, répercutés au tarif du fournisseur, sans marge. Aucun frais distinct n'est décrit pour la fenêtre de contexte elle-même : 1 048 576 tokens est une limite, pas un frais. Les tokens d'entrée incluent le texte, les images et l'historique de conversation que vous envoyez ; les tokens de sortie couvrent tout ce qui est généré, jusqu'à 384 000 tokens.
Quelle est la taille de la fenêtre de contexte et de la sortie maximale ?
DeepSeek V4.1 Flash dispose d’une fenêtre de contexte de 1 048 576 jetons et d’une sortie maximale de 384 000 jetons. La fenêtre d’entrée vous permet de soumettre des documents entiers, des transcriptions ou des instantanés de dépôt en un seul appel, tandis que le plafond de sortie prend en charge de longs artefacts en une seule passe, tels que des spécifications, des plans de migration ou des diffs étendus.
Qu'est-ce que DeepSeek V4.1 Flash fait de mieux ?
Il est conçu pour les tâches à entrée longue et à sortie longue : analyse de documents entiers, compréhension de code de grands dépôts, examen multimodal de texte et d’images, et flux de travail nécessitant des réponses générées substantielles plutôt que de brèves réponses. Son score de 90,9 sur GPQA Diamond témoigne également d’un solide raisonnement scientifique et technique de niveau universitaire avancé. L’entrée prend en charge à la fois le texte et les images ; la sortie est uniquement textuelle.
Comment se compare-t-il aux modèles de pointe plus grands ?
Les modèles de pointe peuvent être en tête sur les benchmarks de raisonnement les plus difficiles et facturent généralement plus cher par token, tandis que DeepSeek V4.1 Flash offre une fenêtre de contexte de 1 048 576 tokens et un plafond de sortie de 384 000 tokens à 0,15 $ par million de tokens en entrée et 0,60 $ par million de tokens en sortie. Pour les travaux à contexte long et à fort volume, il est souvent le choix pratique ; pour les étapes de raisonnement individuelles les plus difficiles, acheminer ces appels vers un modèle plus coûteux sur OrcaRouter est une approche raisonnable.
Comment les données sont-elles traitées lorsque j'appelle ce modèle ?
OrcaRouter achemine les requêtes vers l'API de DeepSeek et facture au tarif du fournisseur sans marge. La conservation, l'utilisation pour l'entraînement et les conditions connexes sont régies par les politiques du fournisseur plutôt que par un accord distinct décrit ici, veuillez donc vérifier les conditions actuelles du fournisseur avant d'envoyer des données sensibles. Masquez les identifiants dont vous n'avez pas besoin et limitez les invites au minimum requis par la tâche ; un contexte plus réduit diminue aussi le coût d'entrée à 0,15 $ par 1M de tokens.
Comment puis-je l'appeler via une API compatible OpenAI ?
Définissez l'URL de base de votre client sur https://api.orcarouter.ai/v1 et utilisez l'identifiant de modèle deepseek/deepseek-v4.1-flash avec votre clé API OrcaRouter. Les requêtes et les réponses suivent le schéma des complétions de chat d'OpenAI, de sorte que les SDK existants, les gestionnaires de streaming et l'analyse des appels d'outils fonctionnent sans modification. La migration consiste généralement en un changement d'URL de base et de chaîne de modèle, suivi d'une nouvelle exécution de votre ensemble d'évaluation.
DeepSeek V4.1 Flash peut-il accepter des images ?
Oui. L'entrée d'images est prise en charge via le tableau de contenu multimodal standard, avec les parties texte et image dans le même message utilisateur. Les tokens d'image comptent comme entrée et sont facturés à $0.15 par 1 million de tokens d'entrée sur OrcaRouter. La sortie reste uniquement textuelle, donc le modèle décrit ou extrait des informations à partir des images plutôt que d'en générer.
Un score de 90,9 sur GPQA Diamond suffit-il pour lui faire confiance pour ma tâche ?
C'est un signal utile, pas une garantie. GPQA Diamond mesure le raisonnement scientifique de niveau supérieur dans un format d'invite fixe, ce qui est pertinent pour répondre à des questions techniques, mais en dit peu sur le rappel en contexte long, le ton ou la précision d'extraction sur vos données. Créez un petit ensemble d'évaluation à partir d'entrées réelles, exécutez-le sur DeepSeek V4.1 Flash et tout autre identifiant de modèle alternatif sur OrcaRouter, puis comparez le coût et la qualité avant d'acheminer le trafic de production.

Intégrer ce badge

DeepSeek: DeepSeek V4.1 Flash$0.15/M in410ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="DeepSeek: DeepSeek V4.1 Flash sur OrcaRouter" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

Fiche du modèle en données

GET /api/public/models/deepseek/deepseek-v4.1-flashOuvrir
Lisible par machine:/llms.txt/llms-full.txt