
DeepSeek V4.1 Flash vs DeepSeek V4 Pro : la passation que DeepSeek avait programmée, puis annulée
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
DeepSeek V4.1 Flash est sorti le 10 septembre 2026, et DeepSeek V4 Pro était censé avoir disparu à l'heure qu'il est. Le plan, annoncé deux jours avant la sortie de Flash et confirmé le jour de la sortie, était que le 14 septembre 2026 à 12 h 00, heure de Pékin, chaque requête adressée à deepseek-v4-pro serait discrètement redirigée vers le modèle plus récent et moins cher deepseek-flash et facturée aux tarifs de Flash. DeepSeek a annulé cela le 11 septembre 2026 après les objections des développeurs, et le 14 septembre 2026, l'échéance est passée avec V4 Pro toujours en ligne et sa facturation inchangée. Il ne s'agit donc pas d'une comparaison de lancements — le modèle de gauche a huit jours et celui de droite est un fleuron vieux d'un an, dans son quatrième mois de disponibilité générale. C'est une comparaison de deux modèles dont le fabricant a publié des benchmarks disant que le moins cher l'emportait, puis a découvert que ses utilisateurs n'étaient pas d'accord, et a fait marche arrière. Cette séquence est la chose la plus utile que quiconque ait publiée sur l'un ou l'autre modèle ce mois-ci, car c'est exactement la décision que vous êtes sur le point de prendre vous-même.
Ce qui s'est réellement passé, dans l'ordre.
La chronologie compte plus que n’importe quel benchmark pris isolément ici, car le revirement est l’essentiel et l’annonce a été volontairement discrète.
• 2026-09-09 — DeepSeek informe les utilisateurs qu'avant l'arrivée de V4.1 Pro, les requêtes V4 Pro seront acheminées vers V4.1 Flash et facturées aux tarifs de Flash. Le message est clair : Flash a surpassé Pro sur tous les plans, que ce soit en performance, en coût, en vitesse et en temps d'exécution des tâches.
• 2026-09-10 — DeepSeek V4.1 Flash passe en disponibilité générale sur l’application, le web et l’API. Les poids sont publiés sur Hugging Face sous licence MIT. Le nom du modèle d’API devient deepseek-flash. Les modèles de génération précédente deepseek-v4-flash et deepseek-v4-flash-vision-exp sont retirés définitivement, leurs identifiants hérités étant temporairement redirigés vers V4.1 Flash. L’arrêt de Pro est repoussé au 2026-09-14, 12 h 00 heure de Pékin (04 h 00 UTC).
• 2026-09-11 — DeepSeek fait marche arrière. En réponse à la demande des utilisateurs, il indique que le service API V4 Pro continuera après le 2026-09-14, avec une facturation inchangée, et que le basculement automatique vers V4.1 Flash est annulé.
• 2026-09-14 — le délai expire. V4 Pro est toujours proposé à 0,66 $ / 1,98 $ par million de tokens en heures creuses.
L’asymétrie dans cette séquence constitue tout l’article. Les utilisateurs de Flash ont été migrés, qu’ils le veuillent ou non — l’ancien ID V4 Flash répond désormais avec un modèle différent. Les utilisateurs de Pro ont obtenu un sursis, et la raison n’est pas que V4 Pro obtient de meilleurs résultats aux benchmarks. C’est que les systèmes de production avaient été calibrés sur lui : prompts, échafaudages d’agents, harnais d’évaluation et hypothèses de reproductibilité qu’un remplacement de backend invalide sans aucune modification du code côté appelant. La page de comparaison de DeepSeek liste encore aujourd’hui les deux modèles, côte à côte, ce qui indique que l’entreprise entend servir les deux.
Côte à côte : les deux UGS
Tout ce qui suit est la spécification que DeepSeek a publiée elle-même, sauf si une source est nommée. Les prix sont indiqués par million de tokens, en heures creuses, le tarif en heures pleines étant entre parenthèses — DeepSeek est en heures pleines entre 01:00 et 04:00, puis de nouveau entre 06:00 et 10:00 UTC, du lundi au vendredi ; toutes les autres heures sont en heures creuses, à la moitié du tarif en heures pleines.
• Nom du modèle API — deepseek-flash (DeepSeek-V4.1-Flash) vs deepseek-v4-pro (DeepSeek-V4-Pro-0813).
• Entrée, défaut de cache — 0,15 $ (0,30 $) vs 0,66 $ (1,32 $).
• Entrée, réussite du cache — 0,003 $ (0,006 $) vs 0,022 $ (0,044 $).
• Sortie — 0,60 $ (1,20 $) vs 1,98 $ (3,96 $).
• Contexte / sortie max — 1M de tokens / 384K sur les deux. Identiques.
• Entrée d'image — prise en charge nativement sur Flash ; répertoriée comme non prise en charge sur V4 Pro.
• Limite de concurrence — 2 500 sur Flash contre 500 sur V4 Pro.
• Paramètres déclarés — Flash : 552 B au total, chiffre du fournisseur, avec une contestation crédible de la part de la communauté (plus de détails ci-dessous). V4 Pro : 1,6 T au total, ~49 B actifs, qu'Artificial Analysis répertorie également et que la page de recettes vLLM confirme.
• Budget actif par token — Flash active environ 8B au prefill et 16B au decode par conception, ce qui est le point même de son architecture ; Pro active ~49B par token.
• Licence — Poids ouverts MIT pour les deux.
• Date de disponibilité générale — Flash 2026-09-10 ; V4 Pro 0813 2026-08-13, après un aperçu en avril.

L’écart de prix est tout l’argument.
L'entrée coûte 4,4× plus cher sur Pro. La sortie, 3,3×. Les hits de cache — le palier qui domine une longue exécution d'agent avec un prompt système stable — sont à 7,3×. Comme le pic double à chaque palier des deux côtés, le ratio est identique au pic ; l'écart n'est pas un artefact de remise.
Mettons-y une charge de travail. Prenons un agent de codage qui traite 10 M de jetons d'entrée par mois avec un taux de succès du cache de 70 % et 2 M de jetons de sortie. Sur V4.1 Flash en heures creuses, cela représente 0,45 $ d'entrée fraîche, 0,021 $ d'entrée mise en cache et 1,20 $ de sortie : $1.67. Sur V4 Pro en heures creuses, cela donne 1,98 $, 0,154 $ et 3,96 $ : $6.09. Environ 3,6×, sur une charge de travail délibérément banale.
C'est la liste de DeepSeek elle-même, et c'est le prix que vous payez réellement ici : OrcaRouter répercute les tarifs catalogue des fournisseurs à 0 % de marge, si bien qu'une variation de prix de DeepSeek arrive de notre côté le jour même plutôt que d'être reconditionnée. Les deux modèles utilisent la même clé, ce qui importe pour la section plus bas — celle qui concerne le test d'une migration que vous n'avez plus à effectuer.

Là où DeepSeek V4.1 Flash l’emporte véritablement
La preuve la plus solide en faveur de Flash n'est pas le tableau de benchmarks de DeepSeek. C'est Artificial Analysis, qui est indépendant et que l'on lit directement sur ses pages de modèles.
• Intelligence Index — Flash (Raisonnement, effort maximal) obtient un score de 40 et se classe 6e sur 113 modèles. V4 Pro 0813 (Raisonnement, effort maximal) obtient 36 et se classe 7e. Même indice, même réglage d'effort, quatre points d'écart, avec le modèle le moins cher devant.
• Débit de sortie — 214,4 tokens/s contre 94,4 tokens/s. C’est 2,3×, et c’est mesuré, non pas affirmé.
• Temps jusqu'au premier token — 1,21 s contre 1,74 s.
• DeepSWE v1.1 — 74,2 pour Flash sur le classement suivi, première place, devant GPT-6 Astra à 74,10, Claude Opus 5 à 74,00 et Gemini 3.8 Flash à 73,70. Le 62,7 de V4 Pro 0813 sur le même benchmark est le chiffre de DeepSeek lui-même. L'écart en tête est de 0,2 point, ce qui est une égalité, pas une victoire — mais un écart de 11,5 points sur Pro n'est pas une égalité.
• Efficacité de service — Le décodeur de Flash dérive son KV global de l'état caché final de l'encodeur au lieu de le recalculer couche par couche, ce qui produit l'activation asymétrique de préremplissage 8B / décodage 16B. Le profil InferenceX de SemiAnalysis estime le cache KV à environ 890 octets par token — soit environ un quart de celui de V4 Flash — avec un stockage KV persistant réduit à environ un huitième. C'est la raison pour laquelle le prix est ce qu'il est, et c'est aussi pourquoi le modèle est disponible à 2 500 requêtes simultanées alors que Pro plafonne à 500.
• Vision sur l’API servie — pas seulement dans les poids. La page de tarification de DeepSeek elle-même répertorie l’entrée d’images comme prise en charge pour Flash et non prise en charge pour V4 Pro, et DeepSeek le décrit comme son premier modèle phare doté d’une compréhension multimodale native. C’est le premier modèle phare de DeepSeek où lire une capture d’écran ne nécessite aucun point de terminaison distinct.
Tous les autres chiffres phares que vous verrez cités — Terminal-Bench 2.1 à 90,6, GPQA Diamond à 90,9, Codeforces 3471 — sont ceux de DeepSeek, non reproduits par nous, et doivent être lus en gardant cela à l’esprit.
Là où DeepSeek V4 Pro reste encore le bon choix
Il serait facile d’écarter la V4 Pro après une semaine comme celle-là. L’abandon annulé dit le contraire, et la fiche technique aussi.
Pro embarque 1,6 T de paramètres au total et active ~49 B par token, contre 16 B pour Flash au décodage. Quoi qu'en dise l'indice, la capacité par token est une ressource bien réelle, et les charges de travail où elle se manifeste sont celles à long horizon : des exécutions d'agents de plusieurs heures, de gros refactorings, des tâches où une mauvaise décision prise tôt coûte toute la trajectoire. Un écart de quatre points sur l'indice mesure la moyenne de dix évaluations, pas la queue de votre distribution.
Pro est aussi la valeur sûre. Il est en disponibilité générale depuis le 2026-08-13, après un aperçu en avril, et la build 0813 tire ses performances du post-entraînement plutôt que de l'architecture — même nombre de paramètres, même forme que l'aperçu, comportement différent. Cela représente quatre mois d'outillage communautaire, de harnais d'agents publiés, de schémas de prompt et de modes de défaillance. Flash est en GA depuis huit jours, et l'écosystème qui l'entoure est proportionnellement maigre. Si la fiabilité de votre équipe repose sur le fait de savoir exactement comment un modèle échoue, c'est dans Pro que réside cette connaissance.
Et le service ne s'est pas arrêté. L'engagement de DeepSeek est explicite et sa facturation reste inchangée, les poids sont sous licence MIT, et V4 Pro figure toujours dans notre catalogue au même tarif affiché. La dépréciation annulée n'est pas un sursis — c'est l'affirmation que DeepSeek entend continuer à servir ce palier.

Trois choses à reprocher aux deux modèles
Des garde-fous, car il est coûteux de se tromper sur cette décision.
• Le nombre de paramètres est contesté. 552B est le chiffre de DeepSeek. Une analyse crédible de la communauté soutient que le checkpoint publié fait 748B — le squelette de transformeur de 552B plus la table de mémoire conditionnelle Engram d’environ 196B, qui est une structure de consultation interrogée à deux points du réseau plutôt qu’une couche que le signal traverse. Le téléchargement publié représente 510,3 GB répartis sur 48 fragments safetensors de poids denses FP8 avec des experts routés FP4. Les deux chiffres peuvent être exacts à la fois, selon que l’on compte la récupération séparément du calcul ou non. Considérez 552B comme déclaré par le fournisseur et vérifiez l’empreinte disque avant de planifier un déploiement.
• Un score de classement est une capture d'écran, pas un contrat. Le 74,2 de DeepSWE v1.1 est un score de banc d'essai. Un audit auto-publié par EyesTech Systems Lab affirme que ces scores de la classe Flash s'effondrent lorsqu'on les transpose dans des dépôts multi-fichiers isolés et réels — ce qui ramènerait DeepSeek V4.1 Flash à 31,4 % sur SWE-bench Pro, contre 74,2 % en chiffre phare, une chute plus importante que celle des modèles de pointe dans sa propre comparaison. Cet audit n'est pas indépendant — son auteur vend un outil destiné à détecter précisément l'exploitation du banc d'essai qu'il décrit — et nous n'avons vu aucune réplication de celui-ci. Cela reste la bonne attitude : vérifiez sur vos propres dépôts avant de migrer.
• La verbosité est un poste de coût. Artificial Analysis a mesuré V4.1 Flash générant 250M de tokens de sortie lors de son passage sur l’Intelligence Index, contre une médiane de 140M pour des modèles comparables à poids ouverts, et le qualifie de très verbeux. La sortie est le poste coûteux dans ce tableau de prix, donc un modèle qui pense tout haut grignote ses propres économies. Sur une charge de travail à forte intensité de raisonnement, prévoyez un budget pour le nombre de tokens, pas seulement pour le prix des tokens.
Une dernière chose, dite clairement pour que personne ne planifie sur la base d'une rumeur : DeepSeek V4.1 Pro n'est pas disponible. La migration annulée a été présentée comme une solution provisoire « avant le lancement de V4.1 Pro », et rien n'a changé à ce sujet.
Choisissez DeepSeek V4.1 Flash si
• Votre charge de travail est à fort volume, sensible à la latence ou limitée en coûts — classification, extraction, routage, résumé, chat, la plupart du codegen.
• Vous avez besoin d'une entrée d'image sur le même endpoint que le texte. C'est le premier modèle phare de DeepSeek où il s'agit d'un seul appel plutôt que d'un second modèle.
• Vos prompts peuvent être mis en cache. À 7,3× sur les hits de cache, l’écart est le plus large exactement là où se trouve le trafic des agents, et un prompt système stable représente la majeure partie de l’entrée d’une longue exécution.
• Vous repartez de zéro cette semaine et ne disposez d'aucun harnais adapté aux particularités d'un modèle précis. Il n'y a rien à protéger.
• Vous voulez le plafond de concurrence le plus élevé. 2 500 contre 500, c'est une différence d'un facteur cinq dans le volume que vous pouvez faire passer avant de commencer à faire la queue.
Choisissez DeepSeek V4 Pro si
• Vous avez déjà une production calibrée face à cela. Le revirement signifie que vous disposez de temps — utilisez-le pour tester plutôt que pour esquiver la question.
• Vos tâches s’inscrivent sur un horizon long et coûtent cher en cas d’échec, et vous avez mesuré que ~49B de paramètres actifs par token vous apportent quelque chose que les 16B de Flash n’apportent pas, sur vos données plutôt que sur un classement.
• Vous avez besoin d'un comportement prévisible, uniquement textuel, sans chemin de vision à analyser, ou vous disposez de références d'évaluation qu'un changement de modèle invaliderait en cours d'étude.
• Votre schéma d’accès est à faible volume et à forts enjeux, où un facteur de 3,6× sur une petite facture n’est pas le terme décisif.
Si vous avez déjà développé sur DeepSeek V4 Pro
Ce qui a changé d’utile le 11 septembre 2026, c’est que votre migration a cessé d’être une échéance pour devenir une décision. C’est strictement mieux pour vous et strictement pire pour votre boîte de réception, car la décision doit encore être prise et, désormais, personne ne la prend à votre place.
Commencez par en calculer le coût. L'écart de 3,3–4,4× représente la somme que vous laissez sur la table, et l'exemple détaillé ci-dessus le convertit en montant mensuel en une minute environ. Testez-le ensuite de la seule manière qui compte : dupliquez une partie du trafic de production vers Flash, gardez Pro sur le chemin principal, et comparez les sorties sur vos propres tâches. Comme les deux modèles répondent sur la même clé au prix catalogue du fournisseur, avec basculement automatique, cette exécution fantôme est un simple changement de routage plutôt qu'une seconde intégration, et le routeur peut renvoyer une requête vers Pro sans que vous ayez à écrire la solution de repli. Les équipes qui brûlent des tokens sur une migration qu'elles n'ont pas demandée sont précisément la raison d'être de la couche de routage.
Ne partez pas du principe que Flash est un remplacement direct. C’est une architecture différente — un encodeur-décodeur causal à 40 couches avec activation asymétrique — et il est plus verbeux dans son raisonnement. Le comportement au niveau du prompt ne se transposera pas proprement dans un sens comme dans l’autre, donc mesurez la migration sur les sorties, pas sur l’index.
Que regarder
Trois choses détermineront à quoi ressemblera cette association dans un mois. Premièrement, si V4.1 Pro sort et restaure un véritable niveau Pro — toute la migration annulée était explicitement un expédient pour cela, donc la feuille de route de DeepSeek comporte toujours un trou en forme de produit phare. Deuxièmement, si le sursis survit au prochain changement de prix de DeepSeek ; une entreprise prête à programmer une fois un reroutage silencieux a appris qu’elle ne le peut pas, et non qu’elle ne le devrait pas. Troisièmement, si quelqu’un en dehors de DeepSeek reproduit les chiffres du benchmark Flash sur des dépôts non modifiés, ce qui est le seul résultat qui trancherait l’argument efficacité contre capacité sur lequel repose toute cette comparaison. D’ici là, la position honnête est celle que le revirement lui-même implique : Flash est le meilleur choix par défaut pour tout ce qui est nouveau, Pro est le meilleur pari pour tout ce qui est déjà construit, et DeepSeek vient de vous dire qu’il servira les deux pendant que vous déterminez lequel vous êtes.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
