
DeepSeek V4 Flash vs V4 Pro : le niveau efficacité face au fleuron, comparés
- obsidianNOUVEAUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 par million de tokens · 24 tok/s
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-1328 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 2657 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
La gamme V4 de DeepSeek est une échelle à deux échelons : V4 Flash, le modèle d'efficacité bon marché et rapide — désormais dans sa version officielle -0731 avec des agents bien plus puissants — et V4 Pro, le grand modèle phare pour le raisonnement et le codage les plus difficiles, qui est passé à sa build GA officielle (0813) le 12 août 2026. Ce qui est intéressant, c'est à quel point ils sont proches dans le travail pratique, et à quel point ils diffèrent sur le prix. Ce guide compare les deux sur les capacités, le coût, la vitesse et l'adéquation, chaque chiffre étant accompagné de sa source.
Note de précision : les scores agentiques/de codage de V4 Flash sont rapportés par DeepSeek (journal des modifications officiel, 2026-07-31, harnais DeepSeek) ; les scores GA (0813) de V4 Pro sont également rapportés par DeepSeek sur le même harnais, et aucune évaluation indépendante de la version 0813 n'a encore été publiée. Les tarifs sont en vigueur au 12 août 2026 ; la baisse des prix GA est répercutée sur OrcaRouter avec une marge de 0 %. Les chiffres issus des harnais des fournisseurs sont généralement optimistes — vérifiez sur vos propres tâches.
TL;DR. V4 Flash est un MoE de 284B / 13B actifs à 0,08 $ / 0,18 $ par million de jetons ; V4 Pro est le fleuron nettement plus grand, désormais dans sa version GA officielle (0813) à 0,435 $ / 0,87 $ — environ cinq fois le prix de Flash, contre quatorze fois environ avant la baisse de prix d'août. En codage pratique, Flash se situe à quelques points de Pro (par ex., SWE-bench Verified ~79 % contre ~80,6 %, selon les agrégateurs), et la mise à niveau post-entraînement -0731 fait de Flash un agent solide à part entière. Utilisez Pro pour les raisonnements les plus difficiles et le codage multi-fichiers le plus exigeant ; utilisez Flash pour la majorité à fort volume — et routez par difficulté pour obtenir l'essentiel de la qualité de Pro à environ un cinquième du coût.
Points clés
• Taille et prix : Flash est 284B / 13B actifs à 0,08 $ / 0,18 $ ; Pro est le fleuron beaucoup plus grand à 0,435 $ / 0,87 $ — Flash coûte environ un cinquième du prix, et la baisse de prix GA de Pro a réduit l’ancien écart d’environ 14x à environ 5x.
L'écart en codage est faible : l'agrégateur SWE-bench Verified affiche ~79 % (Flash) contre ~80,6 % (Pro en phase d'aperçu ; la version GA n'a pas encore de scores indépendants) ; sur le banc de test de DeepSeek, la version GA Pro obtient 87,9 sur Terminal-Bench 2.1 contre 82,7 pour Flash.
• Les deux partagent le contexte de 1M de jetons et la sortie de 384K ; les deux sont en texte uniquement, avec raisonnement, outils et JSON.
• Flash est plus rapide et moins cher à servir (p50 TTFT ~394 ms, ~184 tok/s) ; Pro échange la vitesse contre une capacité de pointe.
• Bonne pratique : router selon la difficulté — Flash pour le volume, Pro pour la minorité difficile.
Ce qu'est chaque modèle
V4 Flash est le niveau efficacité : un modèle à mélange d'experts avec 284B de paramètres au total mais seulement ~13B actifs, un contexte de 1M de tokens, une sortie allant jusqu'à 384K, optimisé pour les travaux à grand volume, à faible latence et de type agentique. Sa version officielle -0731 (du 31 juillet 2026) est une mise à niveau post-entraînement qui a amélioré les agents, le codage et l'utilisation d'outils, et a ajouté la prise en charge native de l'API Responses et de Codex. V4 Pro est le modèle phare de DeepSeek — un modèle beaucoup plus grand, conçu pour les tâches de raisonnement et de codage les plus difficiles, où la capacité maximale compte plus que le coût. Il a été disponible en préversion à partir d'avril, puis est passé à sa version GA officielle le 12 août 2026, avec un prix beaucoup plus bas. Les deux modèles font partie de la même famille V4 et partagent le contexte de 1M, l'entrée texte uniquement, ainsi que la prise en charge du raisonnement, des outils et du JSON.

Capacité : à quel point Flash est-il proche de Pro ?
Plus proche que ne le suggère l'écart de prix, du moins en codage pratique. Les évaluations agrégées placent le V4 Flash (Max) autour de 79,0 % sur SWE-bench Verified — résolution de vrais problèmes GitHub — contre environ 80,6 % pour le V4 Pro tel que testé à l'époque de son aperçu. La build GA (0813) est trop récente pour des scores indépendants — aucun n'a encore été publié — donc la meilleure comparaison Pro disponible est le harnais de DeepSeek lui-même, où la build GA affiche Terminal-Bench 2.1 87,9 et DeepSWE 62,7, contre les chiffres -0731 de Flash de 82,7 et 54,4 (tous rapportés par DeepSeek). Là où le Pro prend l'avantage, c'est sur le terrain le plus difficile : le raisonnement multi-étapes le plus complexe, le codage multi-fichiers le plus délicat, et les tâches où un budget de paramètres actifs plus important aide réellement. Si la plupart de votre travail est « difficile mais pas à la pointe », Flash le couvre ; réservez Pro à la minorité véritablement à la pointe.
Prix et vitesse : l'avantage décisif de Flash
C'est là que les deux divergent le plus — et c'est là que le calcul vient de changer. Flash est à 0,08 $ / 0,18 $ par million de jetons d'entrée/sortie ; la version GA officielle de V4 Pro (0813) est à 0,435 $ / 0,87 $ — soit environ cinq fois le prix de Flash. C'est toujours une prime réelle, mais une fraction de l'écart d'environ 14x avant la baisse de prix : l'ancienne référence deepseek-v4-pro était à 1,168 $ / 2,336 $, donc la version GA est environ 63 % moins chère. Sur un mois de 10 millions de jetons avec 70 % d'entrée, Flash coûte environ 1,10 $ et Pro environ 5,66 $ — le ratio se maintient à mesure que l'on passe à des milliards de jetons. Flash est également conçu pour le débit (p50 TTFT ~394 ms, ~184 tok/s), c'est donc le meilleur choix pour les agents à volume élevé et sensibles à la latence. La prime de Pro achète une capacité de pointe, pas la vitesse ni des économies — mais avec un écart d'environ 5x au lieu de 14x, le prix de cette marge haut de gamme a considérablement baissé.
Le bon modèle : router par difficulté
Vous n'avez pas à choisir. La configuration la moins chère et de haute qualité envoie la majorité des requêtes faciles à modérées à Flash et ne fait remonter que les plus difficiles à Pro. Comme les deux appartiennent à la même famille avec le même contexte et les mêmes interfaces, ce routage est transparent — et la mise à niveau -0731 signifie que Flash gère désormais une plus grande partie du niveau intermédiaire avant que vous ayez besoin de faire remonter. Bien fait, le routage par difficulté offre l'essentiel de la qualité de Pro à un coût proche de celui de Flash, et la réduction de prix GA rend l'escalade occasionnelle vers Pro nettement moins chère qu'à l'époque de l'aperçu.

Lequel devriez-vous choisir ?
Choisissez V4 Flash si…
Vous exécutez des charges de travail à volume élevé, qu'elles soient agentiques, de codage ou de longs documents, où le coût et la vitesse comptent, et une qualité « quasi haut de gamme » suffit — ce qui, après la mise à niveau -0731, couvre beaucoup de terrain.
Choisissez V4 Pro si…
Vous avez besoin de capacités maximales pour les raisonnements les plus ardus et le codage multi-fichiers le plus exigeant, et vous êtes prêt à payer environ 5 fois le prix de Flash pour cette marge de manœuvre haut de gamme — une demande bien plus facile à satisfaire que la prime d'environ 14 fois associée à la tarification de l'ère d'aperçu.
Utilisez les deux via un seul point de terminaison.
Les deux sont disponibles sur OrcaRouter avec une marge de 0 % via un endpoint compatible OpenAI — Flash sous le nom deepseek/deepseek-v4-flash-0731 et Pro en tant que build officielle deepseek/deepseek-v4-pro-0813 GA — afin que vous puissiez implémenter le routage par difficulté comme choix de configuration, benchmarker les deux sur vos propres tâches et basculer le trafic sans avoir à réintégrer. C'est le moyen le plus simple de profiter des économies de Flash tout en gardant Pro à portée de main pour la minorité de tâches difficiles.

FAQ
Est-ce que V4 Flash est aussi bon que V4 Pro ?
En codage pratique, presque à égalité — agrégateur SWE-bench Verified ~79 % contre ~80,6 % (version d'aperçu pour Pro ; la version GA n'a pas encore de scores indépendants). Sur le raisonnement le plus difficile et le codage le plus complexe, Pro mène. Pour la plupart des charges de travail, Flash suffit après la mise à niveau -0731.
Combien moins cher est V4 Flash ?
Flash coûte environ un cinquième du prix de Pro : $0.08 / $0.18 par million de jetons contre $0.435 / $0.87 pour GA Pro. Avant la baisse de prix de Pro en août, l’écart était d’environ 14x ; il est maintenant d’environ 5x.
Partagent-ils la même fenêtre de contexte ?
Oui — les deux offrent un contexte de 1M de tokens (1 048 576) et jusqu’à 384K de sortie.
Lequel est le plus rapide ?
Flash, de par sa conception — temps p50 jusqu'au premier token d'environ 394 ms et ~184 tokens/seconde, optimisé pour les usages à haut volume et à faible latence.
Puis-je utiliser les deux ensemble ?
Oui — acheminez selon la difficulté via l'endpoint unique d'OrcaRouter : Flash pour le volume, Pro pour les tâches les plus difficiles.
En résumé
V4 Flash contre V4 Pro, c'est l'efficacité face à la capacité de pointe. Flash offre l'essentiel des capacités de codage pratiques de Pro, plus un agent véritablement solide après la mise à niveau -0731, pour environ un cinquième du prix et avec une vitesse supérieure. La version GA officielle de Pro est le produit phare pour les tâches les plus exigeantes, et sa baisse de prix — à 0,435 $ / 0,87 $, soit environ cinq fois Flash au lieu des quatorze fois d'antan — rend ce haut de gamme plus abordable que jamais. La bonne stratégie n'est pas de choisir l'un ou l'autre, mais de router selon la difficulté via un seul endpoint comme OrcaRouter : les volumes passent à moindre coût sur Flash, et seule la minorité difficile paie pour Pro.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
