
DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash : même prix, l'un voit
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
DeepSeek V4 Flash Vision (Exp) et DeepSeek V4 Flash sont le même modèle avec exactement une seule différence, et cette différence résume toute l'histoire : le modèle de vision voit des images, le modèle de texte n'en voit pas. Lancé aujourd'hui, le 21 août 2026, en version expérimentale, DeepSeek V4 Flash Vision (Exp) conserve le cerveau textuel de DeepSeek V4 Flash inchangé — le même contexte de 1M de jetons, la même sortie maximale de 384K, les mêmes prix par jeton — et ajoute une entrée d'images qui réorganise ses scores sur les benchmarks d'agents où le modèle texte échoue discrètement. La seule vraie question est de savoir si « expérimental » vous coûte plus qu'il ne vous fait économiser.
Les deux modèles
DeepSeek V4 Flash est le cheval de trait budgétaire officiel de l'entreprise : un modèle Mixture-of-Experts d'environ 284 milliards de paramètres au total, dont 13 milliards actifs, texte uniquement, optimisé pour les charges de travail quotidiennes à forte concurrence, avec un budget de concurrence de 2 500 tokens par seconde sur l'API du fournisseur. DeepSeek V4 Flash Vision (Exp) appartient à la même famille de poids, précédé d'un encodeur visuel, facturé à l'identique et marqué comme expérimental. Tout ce qui se trouve sous les yeux est partagé.
• Paramètres — Vision-Exp : 284B au total / 13B MoE actifs vs V4-Flash : 284B au total / 13B MoE actifs (même famille)
• Entrée — Vision-Exp : texte + images (JPEG, PNG, GIF, WebP) vs V4-Flash : texte uniquement
• Contexte — Vision-Exp : 1 M de tokens vs V4-Flash : 1 M de tokens
• Sortie maximale — Vision-Exp : 384K jetons contre V4-Flash : 384K jetons
• Modes de réflexion — les deux prennent en charge la réflexion et la non-réflexion
• Formats d'API — les deux : Chat Completions, Messages, Responses
• Prix — identique (les deux facturent selon les tarifs de jetons de pointe/hors pointe de V4-Flash)
• Statut — Vision-Exp : expérimental, pas de date de GA vs V4-Flash : version officielle (V4-Flash-0731)

Là où la vision change le tableau d'affichage.
Sur le texte pur, DeepSeek affirme que les deux sont à égalité, et il n'y a aucune raison d'en douter — le modèle de vision est construit sur la même capacité textuelle. La divergence apparaît sur les benchmarks d'agents qui contiennent des captures d'écran, des graphiques et des images d'interface, où le modèle purement textuel ignore littéralement le contenu multimodal. Tous les chiffres ci-dessous proviennent de la note de lancement d'aujourd'hui, rapportés par le fournisseur, et n'ont pas été reproduits indépendamment :
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2
• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7
• NL2Repo — Vision-Exp 57.7 contre V4-Flash 54.2
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4
• Cartographie — Vision-Exp 64.3 (V4-Flash ne peut pas tenter)
• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash ne peut pas tenter)

Le plus grand bond est ApexBench, où l'ajout de la vision fait passer le score de 26.2 à 36.5 — un écart de dix points qui n'est pas dû au fait que le modèle réfléchit plus fort, mais au fait qu'il lit enfin la tâche. Pour un agent qui opère à travers un écran — un navigateur, un bureau, un terminal avec sortie rendue — le modèle texte était complètement aveugle sur exactement les parties de la tâche qui portent l'information.
La question du prix a une réponse.
Il n'y a aucune différence de prix, et c'est là que la comparaison devient un choix évident dans un sens. DeepSeek V4 Flash Vision (Exp) est facturé exactement aux mêmes tarifs que DeepSeek V4 Flash, lesquels, depuis le 16 août 2026, sont en heures de pointe/hors pointe :
• Entrée, échec de cache — 0,22 $ par 1M de jetons en heures creuses, 0,44 $ en heures de pointe (les deux modèles).
• Entrée, succès de cache — 0,007 $ par 1M de jetons hors pointe, 0,014 $ en pointe (les deux modèles)
• Sortie — 0,66 $ par million de jetons en heures creuses, 1,32 $ en heures de pointe (les deux modèles)
• Heures de pointe — 01:00–04:00 et 06:00–10:00 UTC, les deux modèles
Le seul coût supplémentaire qu'apporte la vision est l'image elle-même : chaque image est tokenisée jusqu'à 384 tokens, de sorte qu'une capture d'écran coûte environ 0,0085 centime en heures creuses. Même un agent très orienté vision qui lit 50 images par exécution ajoute moins d'un centime au coût d'entrée. Choisir le modèle texte pour économiser de l'argent, c'est préférer des centimes à la vue — l'économie n'est pas réelle.
Quand choisir lequel
Choisissez DeepSeek V4 Flash Vision (Exp) si votre pipeline peut un jour recevoir une image. Agents de tests UI et de QA par captures d'écran, agents de navigation web qui doivent lire la page sur laquelle ils se trouvent, extraction de graphiques et de diagrammes, captures d'écran de documents, captures de messages d'erreur depuis l'écran d'un utilisateur — dans chacun de ces cas, le modèle de vision est strictement supérieur au même prix. Selon le fournisseur, il n'y a aucune pénalité sur la qualité du texte, la seule raison de ne pas l'utiliser étant donc la stabilité.
Choisissez DeepSeek V4 Flash si votre trafic est purement textuel et que rien ne changera à son sujet. Pour la complétion de code, la récupération et les boucles d'agent textuelles uniquement, les deux modèles obtiennent le même score sur le texte et la version officielle est le pari le plus sûr par définition. Si vous êtes déjà sur V4-Flash et que vous n'envoyez jamais d'image, il n'y a aucune raison de changer — et aucune raison de ne pas avoir l'option dans votre configuration de routage non plus.
La seule vraie différence : le statut expérimental
Tout ce qui se trouve au-dessus des yeux est identique ; le coût de la vision est négligeable ; les benchmarks favorisent le modèle de vision. Le seul facteur qui peut légitimement vous retenir sur DeepSeek V4 Flash en production est que le modèle de vision est expérimental. DeepSeek le qualifie ainsi, ne donne aucune date de disponibilité générale et précise qu'il n'est pas recommandé pour une utilisation en production. Le cerveau textuel qui le sous-tend est éprouvé, mais le chemin de la vision est nouveau, et une surface d'API expérimentale est exactement l'endroit où vous ne voulez pas d'un échec silencieux à 2 heures du matin.
C'est l'unique endroit où la comparaison n'est pas tranchée par les spécifications, et c'est aussi l'unique endroit où un routeur change la réponse. Sur OrcaRouter, les deux modèles sont en direct — deepseek/deepseek-v4-flash-vision-exp et deepseek/deepseek-v4-flash — derrière une seule clé API, au prix catalogue du fournisseur, répercuté sans aucune marge. Parce que la même plateforme route les deux, vous pouvez adopter le modèle de vision là où il justifie sa place et verrouiller le reste sur la version officielle, avec un basculement automatique pour qu'un pépin expérimental ne fasse jamais tomber tout le pipeline. Vous obtenez le gain de dix points sur ApexBench pour les appels qui en ont besoin et la stabilité de la version officielle pour ceux qui n'en ont pas besoin, sans deuxième contrat ni deuxième chemin de code.

En résumé
Si votre charge de travail peut recevoir des images, DeepSeek V4 Flash Vision (Exp) surpasse DeepSeek V4 Flash sur tous les axes qui comptent et ne perd que sur l'unique axe que vous pouvez contourner : le statut expérimental. Si votre charge de travail est purement textuelle, les modèles sont équivalents en sortie et la version officielle l'emporte en stabilité. Les deux ne sont pas vraiment concurrents — le modèle de vision est le modèle de texte avec une compétence débloquée, sans frais supplémentaires. La seule décision qui vaut la peine est de savoir quelle part de votre trafic vous êtes prêt à diriger vers une API expérimentale, et c'est une décision de routage, pas une décision de modèle.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
