
Tarification de DeepSeek V4.1 Flash : la grille tarifaire complète, et le nombre de succès du cache qui détermine votre facture
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 177 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1323 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
DeepSeek V4.1 Flash est en disponibilité générale depuis le 2026-09-10, et à ce jour, sa grille tarifaire publiée est la moins chère du haut de gamme du marché des modèles : 0,15 $ par million de jetons d'entrée, 0,60 $ par million de jetons de sortie, et 0,003 $ par million sur les succès de cache. Ces trois chiffres correspondent à la colonne heures creuses. Pendant les fenêtres de pointe en semaine de DeepSeek, chacun d'eux double, y compris les succès de cache. La comparaison qui compte n'est pas avec le propre modèle phare vieillissant de DeepSeek — DeepSeek-V4-Pro-0813 est affiché à 0,66 $ / 1,98 $ par million en heures creuses, donc Flash propose un tarif environ 4 fois inférieur à celui de son propre modèle frère sur l'entrée — mais avec l'échelon fermé de la frontière qui sert réellement de référence tarifaire aux acheteurs : GPT-5.6 Sol, Claude Opus 5 et Gemini 3.8 Flash, chacun facturant un ordre de grandeur de plus par jeton.
Une correction avant d’en venir aux chiffres, car la fuite qui a précédé ce lancement circule encore. Les chiffres qui ont circulé avant la GA décrivaient une baisse de prix attendue « demain ». Les prix sont réels ; la présentation ne l’était pas. V4.1 Flash est sorti le 2026-09-10 avec ces tarifs déjà en vigueur, et le changelog de DeepSeek lui-même consigne la réduction comme faisant partie de la version, et non comme une baisse ultérieure. Tout ce qui suit est relevé sur la page de tarification en direct de DeepSeek aujourd’hui, 2026-09-16.
La grille tarifaire complète, au 16 septembre 2026
DeepSeek publie une feuille couvrant les SKU actuels, chaque ligne étant scindée en une colonne heures pleines et une colonne heures creuses. Pour l’identifiant de modèle deepseek-flash, qui sert DeepSeek-V4.1-Flash, les tarifs publiés sont :
• Entrée, échec de cache — 0,15 $ par million de tokens en heures creuses ; 0,30 $ par million en heures pleines
• Entrée, succès du cache — 0,003 $ par million de tokens en heures creuses ; 0,006 $ par million en heures de pointe
• Sortie — 0,60 $ par 1 M de tokens en heures creuses ; 1,20 $ par 1 M en heures pleines
• Fenêtre de contexte — 1 M de tokens, avec une sortie maximale de 384 K
• Limite de concurrence — 2 500 requêtes simultanées sur le SKU Flash
• Identifiants de modèles hérités — deepseek-v4-flash et deepseek-v4-flash-vision-exp sont retirés en tant que produits distincts, mais continuent d'être acheminés vers V4.1 Flash, facturés aux tarifs de Flash
L’écart entre les deux premières lignes est toute l’histoire de cette feuille. Une réussite de cache coûte 50 fois moins cher qu’un échec de cache hors pointe — une remise de 98 %, ce qui correspond aussi à la façon dont Artificial Analysis le représente dans son modèle de coûts. Rien d’autre sur la carte ne fait bouger une facture à ce point.


Le pic n'est pas une erreur d'arrondi, et il est programmé pour Pékin.
Les fenêtres de pointe de DeepSeek sont du lundi au vendredi, de 01:00 à 04:00 UTC et de 06:00 à 10:00 UTC. Tout ce qui se trouve en dehors — y compris toutes les heures du week-end — est facturé à moitié tarif. Le doublement s’applique aux trois lignes, donc un échec de cache en heure de pointe coûte 0,30 $ et une sortie en heure de pointe coûte 1,20 $.
L’endroit où ces fenêtres tombent dépend entièrement de l’endroit où vous vous trouvez. À Pékin, elles sont de 09:00 à 12:00 et de 14:00 à 18:00 — deux blocs de travail, et c’est bien là l’essentiel. À Berlin, en septembre, la deuxième fenêtre est de 08:00 à 12:00 CEST : toute la matinée d’une équipe européenne se situe en heures de pointe. À New York, la même fenêtre correspond à 02:00–06:00 EDT. Une équipe basée aux États-Unis travaillant à horaires normaux n’est pratiquement jamais facturée aux heures de pointe, tandis qu’une équipe de l’UE paie le double chaque matin avant le déjeuner. Si vous choisissez quand lancer un traitement par lots, c’est une décision qui vaut 0,15 $ par million de tokens et qui ne coûte rien à prendre.
Ce que la tarification des hits de cache fait réellement à la facture d’un agent
Les hits de cache sont automatiques sur DeepSeek — la documentation indique que la mise en cache sur disque est activée par défaut pour tous les utilisateurs sans modification du code — donc vous n'avez pas à concevoir d'architecture pour bénéficier de cette réduction. Elle est en outre fournie selon le principe du meilleur effort, sans garantie : DeepSeek indique qu'il n'existe pas de TTL fixe, qu'un cache inutilisé est vidé « généralement en quelques heures à quelques jours », et le système ne promet pas un taux de succès de 100 %. Cela vaut la peine de lire les champs prompt_cache_hit_tokens et prompt_cache_miss_tokens de la réponse avant de modéliser quoi que ce soit à partir de cela.
L’arithmétique importe plus que l’adjectif. Prenez un agent de codage avec un préfixe stable de 40 000 tokens — prompt système, schémas d’outils, contexte du dépôt — exécuté pendant une session de 60 tours, où chaque tour ajoute environ 2 000 tokens de sortie d’outil et le modèle émet environ 1 200 tokens. L’entrée totale sur l’ensemble de la session est de 5,94 M de tokens et la sortie totale de 72 000 tokens.
Facturé sans aucune mise en cache, en heures creuses : 5,94 M d'entrée à 0,15 $, soit 0,891 $, plus 72 000 de sortie à 0,60 $, soit 0,043 $ — environ 0,93 $ pour la session.
Facturé avec le préfixe mis en cache, ce qui se produit en réalité par défaut : 5.782M de ces tokens d'entrée arrivent en tant que succès de cache à $0.003 ($0.017), 158 000 arrivent en tant qu'échecs de cache à $0.15 ($0.024), et les mêmes 72 000 tokens de sortie coûtent $0.043. Environ $0.084 — environ 11 fois moins cher. L'entrée passe de 95 % de la facture à 49 %, la partie mise en cache représente à elle seule 21 %, et les tokens de sortie deviennent le poste le plus important. Même modèle, même session, même sortie — la seule chose qui a changé est la réutilisation ou non du préfixe.
Remarquez ce qui n'est pas sur la fiche de DeepSeek : une ligne d’écriture de cache. Anthropic facture 1,25x le tarif d’entrée de base pour alimenter un cache de 5 minutes et 2x pour une heure ; la fiche de DeepSeek ne répertorie que les hits et les miss, et son guide de mise en cache ne décrit aucuns frais d’écriture ni de stockage. Si vous comparez l’économie de la mise en cache entre fournisseurs plutôt que les tarifs par token affichés, cette absence vaut plus que ne le laisse penser la remise de 50x sur les hits.
C'est aussi pourquoi le détail de répercussion sur DeepSeek V4.1 Flash sur OrcaRouterimporte ici. Nous facturons au tarif catalogue du fournisseur, sans aucune marge, de sorte qu'une modification tarifaire du fournisseur est effective de notre côté le jour même, sans attendre une passe de re-tarification — et les colonnes de cache-hit et heures pleines/heures creuses que vous voyez ci-dessus sont bien celles sur lesquelles vous êtes réellement facturé, et non une approximation lissée de celles-ci.

Face à DeepSeek-V4-Pro-0813 : un écart de 4x, et un retrait qui n’a pas eu lieu
La comparaison interne qui s'impose est celle avec le SKU phare, et elle est moins spectaculaire que ne le suggère le tarif affiché. DeepSeek-V4-Pro-0813, l'identifiant de modèle deepseek-v4-pro, s'affiche à 0,66 $ par 1M de jetons en entrée en cas de défaut de cache et à 1,98 $ par 1M de jetons en sortie hors pointe, doublant aux heures de pointe pour atteindre 1,32 $ et 3,96 $. Ses succès de cache coûtent 0,022 $ hors pointe — plus de 7 fois ceux de Flash.
• Entrée en cas d'échec du cache — 0,15 $ contre 0,66 $ aux heures creuses, donc Flash est 4,4 fois moins cher
• Sortie — 0,60 $ contre 1,98 $ en heures creuses, donc Flash est 3,3 fois moins cher
• Entrée avec cache hit — 0,003 $ contre 0,022 $ hors pointe, donc Flash est 7,3 fois moins cher
• Plafond de contexte et de sortie — identique à 1M et 384K sur les deux SKU
• Concurrence — 2 500 sur Flash contre 500 sur V4 Pro, une différence de 5x qui disparaît totalement de la grille tarifaire
Trois choses sont faciles à rater dans cette comparaison. Premièrement, l'argument de la réutilisation est plus fort sur le modèle phare en termes absolus, même si Flash porte le multiplicateur le plus élevé : mettre en cache un million de tokens fait économiser 0,638 $ sur V4 Pro et 0,147 $ sur Flash, parce que le taux de miss du modèle phare est bien plus élevé au départ. Deuxièmement, le modèle que tout le monde croyait disparu ne l'est pas : DeepSeek a annoncé qu'il cesserait de servir V4 Pro le 2026-09-14 et redirigerait ces requêtes vers Flash, ce qui a provoqué une levée de boucliers des développeurs face au remplacement d'un modèle backend sous des workflows de production, puis a annulé sa décision le 2026-09-11. V4 Pro est toujours servi, à tarification inchangée. Troisièmement, et c'est le piège dans lequel la couverture de la fuite est tombée — aucun V4.1 Pro n'a été publié. DeepSeek-V4-Pro-0813 reste le SKU phare, et l'éditeur n'a pas livré de successeur sous ce nom. Quiconque chiffre une migration vers « V4.1 Pro » chiffre un modèle qui n'existe pas.
Par rapport au palier frontière fermé
Face aux modèles fermés que les acheteurs retiennent réellement dans leur présélection, le multiplicateur est l’élément phare. Tous les chiffres ci-dessous proviennent de la page de tarification publiée aujourd’hui par chaque fournisseur lui-même.
• GPT-5.6 Sol — s'affiche à 5,00 $ par million de tokens en entrée et 30,00 $ par million en sortie sur le palier à contexte court d'OpenAI, avec actuellement un tarif promotionnel de 4,00 $ / 20,00 $ qu'OpenAI indique disponible au moins jusqu'au 2026-11-21, les entrées mises en cache étant à 0,40 $. Par rapport au tarif promotionnel, DeepSeek V4.1 Flash est 26,7x moins cher en entrée et 33,3x en sortie ; par rapport au tarif catalogue, 33x et 50x. Le coût d'un cache hit de Sol est 133x celui de Flash.
• Claude Opus 5 — 5,00 $ par million de tokens d'entrée et 25,00 $ par million de tokens de sortie, avec des hits de cache à 0,50 $ par million sur la fiche publiée d'Anthropic. Cela représente 33 fois le tarif d'entrée de Flash, 42 fois son tarif de sortie et 167 fois son tarif de hit de cache. Les écritures de cache de 5 minutes d'Anthropic ajoutent encore un facteur 1,25 par-dessus ; la fiche de DeepSeek ne comporte pas de ligne équivalente.
• Gemini 3.8 Flash — 0,75 $ par million de tokens en entrée et 3,75 $ par million de tokens en sortie jusqu'au 31/12/2026, les deux tarifs devant doubler le 01/01/2027, l'entrée mise en cache à 0,075 $, et — c'est la ligne qui revient sur une vraie facture — le cache stockage à 0,50 $ par million de tokens par heure. Flash est 5 fois moins cher en entrée, 6,25 fois en sortie et 25 fois sur les hits de cache par rapport à lui, et DeepSeek ne facture rien pour conserver un cache.
C'est le contexte des capacités qui garantit l'honnêteté de l'ensemble. Sur l'Intelligence Index v4.3 d'Artificial Analysis, DeepSeek V4.1 Flash (raisonnement, effort maximal) obtient un score de 40 et se classe 6e sur 113 modèles, à 0,27 $ par tâche de l'index et 214,4 jetons de sortie par seconde. Il s'agit là d'un positionnement véritablement proche de la frontière, à un prix 26 fois inférieur à celui de la catégorie à laquelle il est comparé — mais la même mesure montre qu'il est l'un des modèles les plus verbeux qu'AA ait testés, générant 250 M de jetons de sortie sur l'ensemble de l'exécution de l'index, contre une médiane de 140 M. La verbosité ne change pas le prix par jeton, mais elle change bel et bien la facture. Un modèle qui écrit 62 % de jetons de plus que la médiane coûte malgré tout bien moins cher ici, mais « bon marché au jeton » et « bon marché à la tâche » sont deux affirmations différentes, et seule la seconde correspond à ce que vous payez.
Existe-t-il une offre gratuite ?
Non. La page tarifaire de DeepSeek elle-même ne documente aucun niveau d'API gratuit, aucun quota mensuel gratuit et aucun modèle gratuit — la facturation se fait à l'usage, sur un solde rechargé ou accordé, le solde accordé étant consommé en premier. L'application de chat grand public est gratuite ; l'API derrière deepseek-flash ne l'est pas, et il n'existe aucun point de terminaison gratuit pour celle-ci sur la plateforme de DeepSeek. Plusieurs passerelles tierces annoncent un accès gratuit ou d'essai à ce modèle, et nous les considérerions toutes comme des surfaces de prototypage plutôt que comme des backends de production, car ces conditions changent sans préavis et aucune d'entre elles ne comporte la grille tarifaire du fournisseur.
Les allégations d'efficacité derrière le prix
Le prix n’est pas une subvention, du moins selon DeepSeek lui-même. La fiche modèle et le rapport technique du fournisseur décrivent V4.1 Flash comme un mélange d’experts de 552 milliards de paramètres sur une architecture encodeur-décodeur causale qui active environ 8 milliards de paramètres par token pendant le préremplissage et 16 milliards pendant le décodage — asymétrique par conception, peu coûteux en lecture et plus coûteux en écriture. Côté mémoire, DeepSeek rapporte un cache KV global d’environ 890 octets par token, soit environ un quart de celui de DeepSeek-V4-Flash, et une empreinte de cache persistante d’environ un huitième de celle-ci dans des charges de travail identiques, obtenue en éliminant l’état de fenêtre glissante et en rejouant les 128 derniers tokens en cas de succès du cache. Il s’agit de mesures rapportées par le fournisseur sur son propre matériel, et le rapport technique ne revendique pas d’équivalence mathématique avec un calcul complet pour le chemin de rejeu.
Le nombre de paramètres est le seul chiffre de cette publication qui soit réellement incertain, et il vaut la peine de préciser pourquoi. Le texte de DeepSeek indique 552 B, et c’est l’ossature — la partie qui effectue les calculs. À côté d’elle se trouve Engram, une table de consultation à mémoire conditionnelle que la fiche modèle estime à 196 B de paramètres, à laquelle on accède par recherche de tokens plutôt que par calcul. Additionnez-les et vous obtenez près de 748 B, le nombre pour lequel une analyse communautaire très lue sur r/LocalLLaMA a plaidé dans les heures qui ont suivi la mise à disposition des poids, et que le panneau de fichiers du dépôt Hugging Face lui-même pousse encore plus haut, vers 763 B. Des comptes rendus de déploiement de la communauté ont évalué le checkpoint à environ 510 Go répartis sur 48 shards, livré nativement quantifié en poids denses FP8 avec des experts FP4. Considérez le total comme contesté et le chiffre de l’ossature comme déclaré par le fournisseur. Les décomptes de paramètres actifs sont ceux qui déterminent la vitesse ; les poids résidents sont ceux qui décident si le modèle démarre tout court.
L’auto-hébergement est une véritable alternative à ce prix, sous licence MIT.
Les poids sont disponibles sur deepseek-ai/DeepSeek-V4.1-Flash sous licence MIT, qui autorise l’utilisation commerciale, la modification et la redistribution. Cela fait de la grille tarifaire de l’API un choix plutôt qu’un péage : avec la licence MIT, rien dans celle-ci ne vous empêche d’exécuter ce modèle vous-même et de payer pour la puissance de calcul plutôt que pour des jetons.
Ce que cela ne rend pas, c’est son exécution à bas coût. Le checkpoint représente environ 510 GB de poids résidents avant le cache et les activations, DeepSeek ne mentionne aucune exigence de GPU nulle part dans le dépôt, et les comptes rendus de déploiement de la communauté situent le plancher pratique à un nœud multi-GPU plutôt qu’à une station de travail. Trois piles de service ont livré une prise en charge dès le jour 0 le 2026-09-10 — vLLM, SGLang avec Miles, et l’adaptation NeuWare de Cambricon basée sur vLLM pour ses propres accélérateurs — mais le jour de la sortie, vLLM et SGLang ont livré des images de préversion dédiées plutôt que des paquets officiels, et llama.cpp n’avait pas fusionné la prise en charge de l’architecture V4.1. L’auto-hébergement sur du matériel grand public n’est pas l’alternative au prix de l’API aujourd’hui ; un nœud 8 GPU loué l’est. Si votre volume est suffisamment important pour amortir cela, la licence vous le permet ; sinon, 0,15 $ par million de tokens est la réponse la moins chère, et de loin.
Ce que la grille tarifaire vous demande réellement de décider
Trois choses, par ordre d'impact financier. Gardez un préfixe de prompt stable et laissez le cache faire son travail — c'est automatique, c'est une réduction de 50x, et sur une boucle d'agent de 60 tours, cela transforme une session à 0,93 $ en une session à 0,084 $. Lancez votre trafic par lots en dehors des créneaux 01:00–04:00 et 06:00–10:00 UTC en semaine, ce qui, pour une équipe américaine, ne change rien et, pour une équipe européenne, signifie déplacer la tâche du matin vers l'après-midi. Et si vous comparez le prix de ceci à celui du propre modèle phare de DeepSeek, rappelez-vous que le modèle phare est toujours en promotion — le retrait programmé a été annulé le 2026-09-11, les deux SKU sont derrière une seule clé, et le basculement entre eux est un changement de model-id plutôt qu'une migration.
Ce que la grille tarifaire ne vous dit pas, c’est si le modèle est suffisamment bon pour votre charge de travail, et les chiffres pour en juger sont plus récents et plus ténus que la feuille de prix. Le positionnement dans l’indice Artificial Analysis est une mesure unique à effort de raisonnement maximal, les lignes de benchmark des fournisseurs sont déclarées par les fournisseurs, et le nombre de paramètres est contesté. Le prix est la partie établie de cette sortie. Chiffrez votre migration sur cette base, et testez la capacité avant de vous engager.
Comparés dans cet article4
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
