
DeepSeek V4.1 Flash vs DeepSeek V4 Pro : même fournisseur, différentes générations
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ce qui est intéressant lorsqu’on oppose DeepSeek V4.1 Flash à DeepSeek V4 Pro, c’est que le modèle le plus récent n’est pas le plus grand. DeepSeek V4 Pro est un modèle à mélange d’experts de 1 600 milliards de paramètres dont 49 milliards actifs, et il est toujours mis à disposition. DeepSeek V4.1 Flash est un MoE de 552 milliards de paramètres, avec 8 milliards actifs en entrée et 16 milliards actifs en sortie, et c’est le modèle que DeepSeek a conçu pour le remplacer. Les deux figurent sur la grille tarifaire du même fournisseur, les deux prennent en charge un million de jetons de contexte, et les deux sont distribués sous licence MIT. Choisir entre eux n’est pas une question de taille. C’est une question de savoir pour quelle architecture vous voulez payer, et la réponse a changé le 10 septembre 2026.
Ce qui diffère réellement, côte à côte
• Paramètres — V4.1 Flash 552B au total / 8B actifs en entrée et 16B en sortie, contre V4 Pro 1,6T au total / 49B actifs. V4 Pro représente environ trois fois plus de paramètres au total et six fois plus d'actifs côté entrée.
• Architecture — V4.1 Flash est un encodeur-décodeur causal, une nouvelle architecture de base par rapport à la conception antérieure de V4 Pro. C’est là la différence de fond entre les deux, et la raison pour laquelle le « .1 » n’est pas une version mineure.
• Prix pour 1 M de tokens — V4.1 Flash 0,15 $ en entrée / 0,60 $ en sortie hors pointe, contre V4 Pro 0,66 $ en entrée / 1,98 $ en sortie, selon les tarifs d’OrcaRouter.
• Entrée mise en cache — V4.1 Flash 0,003 $ par 1M vs V4 Pro 0,024 $ par 1M.
• Cache KV par token — V4.1 Flash : 890 octets contre une empreinte plus importante pour V4 Pro. À un million de tokens de contexte, c’est le poste qui détermine si une longue transcription d’agent reste résidente.
• Contexte et sortie — 1M de contexte et 384K de sortie maximale pour les deux. Niveau.
• Latence observée jusqu'au premier token — V4.1 Flash 2,63 s p50 contre V4 Pro 3,58 s p50, d'après la télémétrie sur 7 jours d'OrcaRouter, avec un p95 à 10,00 s pour V4 Pro.
• Modalités d'entrée — V4.1 Flash accepte le texte et les images, contrairement à V4 Pro, qui ne prend en charge que le texte en entrée comme en sortie, sur les mêmes fiches. Le modèle le plus récent est le plus large des deux en entrée et aussi le moins cher.
Lisez la liste sans le cadrage du fournisseur et le schéma est inhabituel. Le successeur est moins cher sur chaque ligne, plus rapide jusqu’au premier token, plus large en entrée, et plus petit sur chaque ligne. Voilà à quoi ressemble un véritable changement d’architecture lorsqu’il se concrétise, et c’est pourquoi « lequel est meilleur » a ici une réponse courte et une plus longue en dessous.

Le calendrier de la V4 Pro, car cela compte pour tous ceux qui l’utilisent encore
DeepSeek V4 Pro devait être retiré. L’API devait être désactivée le 14 septembre 2026 à 12 h 00, heure de Pékin, le trafic étant redirigé vers V4.1 Flash. Cela ne s’est pas produit. Le 11 septembre, le fournisseur est revenu sur sa décision, déclarant que « En réponse à la demande des utilisateurs, nous avons décidé de continuer à fournir des services API pour DeepSeek V4 Pro après le 14 septembre 2026, le mode de facturation restant inchangé. »
Deux choses en découlent, et toutes deux méritent d’être précisées, car la situation invite à une surinterprétation.
Le premier point, c'est que V4 Pro n'est pas déprécié. C'est un modèle pris en charge, à prix inchangé, et c'est celui vers lequel la propre notification de DeepSeek redirige le trafic existant de V4 Pro. Si vous avez un chemin de production épinglé à ce modèle, rien ne vous a été retiré.
Le deuxième point est que DeepSeek V4.1 Pro n'existe pas. L'avis de retrait mentionnait que le trafic de V4 Pro était servi par V4.1 Flash « jusqu'au lancement de V4.1-Pro », ce qui a donné lieu à un certain nombre de spéculations sur un modèle frère plus grand. Au 22 septembre 2026, il n'existe pas d'API V4.1 Pro, pas de fiche de modèle, pas de poids et aucune annonce. Un rapport du 21 septembre 2026 évoquait un modèle de 2 000 milliards de paramètres attendu entre la mi-octobre et la fin octobre, ce qui constitue une affirmation à source unique au sujet d'un produit non annoncé et doit être considérée comme telle. Quiconque planifie des capacités en fonction d'un lancement de V4.1 Pro planifie en fonction d'une rumeur.
Lequel faut-il vraiment appeler ?
Le cas de la migration est simple, et c’est celui que DeepSeek a lui-même effectué en routant le trafic V4 Pro vers le nouveau modèle. D’après les chiffres ci-dessus, V4.1 Flash est moins cher, plus rapide jusqu’au premier token et plus rapide en régime stable, avec un cache KV plus petit par token. Si votre charge de travail est une charge de travail V4 Pro qui ne fait pas quelque chose que seuls 49B paramètres actifs peuvent faire, le modèle plus récent est le meilleur instrument en termes de coût et de latence, et il n’y a aucun compromis à évaluer.
L'argument en faveur du maintien sur V4 Pro repose sur ce qu'un nombre de paramètres actifs bien plus élevé vous apporte en matière de raisonnement difficile et de travail agentique à long horizon, et c'est un argument que vous devez étayer avec vos propres évaluations plutôt qu'avec une fiche technique. La raison en est que les deux modèles ne sont pas comparés sur un tableau public commun d'une manière qui les isole : DeepSeek V4.1 Flash apparaît dans la campagne d'évaluation Agents on Rails du 21 septembre 2026 à 17 % sur l'effort maximal, tandis que V4 Pro n'est pas sur ce tableau. Il n'y a pas de chiffre en face-à-face à citer. Ce qui existe, c'est un argument plausible issu de l'architecture — six fois les paramètres actifs, c'est beaucoup de capacité à abandonner — et c'est un argument, pas une mesure.
Deux remarques pratiques pour quiconque déplace du trafic entre les deux. Premièrement, le barème des heures de pointe s’applique aux deux modèles, de sorte qu’une comparaison de coûts effectuée au mauvais moment de la journée sera faussée d’un facteur deux ; les heures de pointe sont de 01:00 à 04:00 et de 06:00 à 10:00 UTC en semaine, et les week-ends sont entièrement en heures creuses. Deuxièmement, les deux modèles partagent une fenêtre de contexte et un plafond de sortie, donc une migration ne change pas votre budget de prompt — ce qui rend le basculement particulièrement peu risqué côté application.
Exécuter les deux via un seul point de terminaison
La situation où vous voulez vraiment les deux est la période de transition, et elle est plus courante qu'elle n'y paraît : une équipe qui souhaite passer à V4.1 Flash mais qui a un pipeline dont le comportement sur la nouvelle architecture n'est pas encore vérifié. Faire tourner les deux côte à côte via des fournisseurs distincts signifie deux contrats et deux ensembles de clés pour ce qui est, au niveau du modèle, un seul fournisseur.
Les deux se trouvent sur OrcaRouter sous une seule clé, ce qui réduit cela à une décision de routage. OrcaRouter répercute les prix catalogue des fournisseurs avec 0 % de marge, ainsi les chiffres ci-dessus sont les tarifs de DeepSeek eux-mêmes, et non les nôtres, et le calendrier heures pleines/heures creuses de DeepSeek s'applique exactement tel que DeepSeek le définit — y compris un changement de tarif en milieu de transition, qui est actif de notre côté le jour même. Vous pouvez envoyer une fraction du trafic vers le nouveau modèle et comparer les sorties, ou router selon le type de tâche, et placer un basculement automatique derrière le nouveau chemin afin que, si V4.1 Flash fait quelque chose d'inattendu sur vos données, la requête arrive sur V4 Pro plutôt que sur une page d'erreur.
Étant donné que le fournisseur a déjà changé d’avis une fois sur lequel de ces modèles va disparaître, garder les deux accessibles derrière une seule intégration est l’option qui ne vous oblige pas à prédire le prochain revirement.

Que regarder
• Si le prix ou le statut de fin de vie de V4 Pro change encore. Le revirement de septembre a été explicite sur le maintien de la facturation à l’identique, et c’est cet engagement auquel il faut tenir le fournisseur.
• V4.1 Pro deviendra-t-il réalité ? Tant qu’il n’y aura pas de carte de modèle ou de publication de poids, l’histoire du modèle à 2 000 milliards de paramètres est une rumeur à source unique.
• Une évaluation indépendante qui fait tourner les deux modèles sur le même banc d’essai. Tant qu’une telle évaluation n’existe pas, la comparaison honnête entre ces deux modèles porte sur le coût, la latence et l’architecture, qui sont mesurables, plus une estimation raisonnée des capacités, qui ne l’est pas.
En attendant l'arrivée du troisième d'entre eux, le résumé exact est le suivant : DeepSeek V4.1 Flash est le successeur moins cher et plus rapide de DeepSeek V4 Pro, V4 Pro est toujours pris en charge à un prix inchangé, et la question de savoir si l'architecture plus récente renonce à des capacités est une question à laquelle aucun benchmark public ne répond actuellement.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
