Une carte de titre hero pour 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash' avec le sous-titre 'Même prix, l'un voit', une icône au trait d'œil à gauche et une icône au trait de document texte à droite, séparées par un fin séparateur neutre, et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash : même prix, l'un voit

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

DeepSeek V4 Flash Vision (Exp) et DeepSeek V4 Flash sont le même modèle avec exactement une seule différence, et cette différence résume toute l'histoire : le modèle de vision voit des images, le modèle de texte n'en voit pas. Lancé aujourd'hui, le 21 août 2026, en version expérimentale, DeepSeek V4 Flash Vision (Exp) conserve le cerveau textuel de DeepSeek V4 Flash inchangé — le même contexte de 1M de jetons, la même sortie maximale de 384K, les mêmes prix par jeton — et ajoute une entrée d'images qui réorganise ses scores sur les benchmarks d'agents où le modèle texte échoue discrètement. La seule vraie question est de savoir si « expérimental » vous coûte plus qu'il ne vous fait économiser.

Les deux modèles

DeepSeek V4 Flash est le cheval de trait budgétaire officiel de l'entreprise : un modèle Mixture-of-Experts d'environ 284 milliards de paramètres au total, dont 13 milliards actifs, texte uniquement, optimisé pour les charges de travail quotidiennes à forte concurrence, avec un budget de concurrence de 2 500 tokens par seconde sur l'API du fournisseur. DeepSeek V4 Flash Vision (Exp) appartient à la même famille de poids, précédé d'un encodeur visuel, facturé à l'identique et marqué comme expérimental. Tout ce qui se trouve sous les yeux est partagé.

• Paramètres — Vision-Exp : 284B au total / 13B MoE actifs vs V4-Flash : 284B au total / 13B MoE actifs (même famille)

• Entrée — Vision-Exp : texte + images (JPEG, PNG, GIF, WebP) vs V4-Flash : texte uniquement

• Contexte — Vision-Exp : 1 M de tokens vs V4-Flash : 1 M de tokens

• Sortie maximale — Vision-Exp : 384K jetons contre V4-Flash : 384K jetons

• Modes de réflexion — les deux prennent en charge la réflexion et la non-réflexion

• Formats d'API — les deux : Chat Completions, Messages, Responses

• Prix — identique (les deux facturent selon les tarifs de jetons de pointe/hors pointe de V4-Flash)

• Statut — Vision-Exp : expérimental, pas de date de GA vs V4-Flash : version officielle (V4-Flash-0731)

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Là où la vision change le tableau d'affichage.

Sur le texte pur, Deep​Seek affirme que les deux sont à égalité, et il n'y a aucune raison d'en douter — le modèle de vision est construit sur la même capacité textuelle. La divergence apparaît sur les benchmarks d'agents qui contiennent des captures d'écran, des graphiques et des images d'interface, où le modèle purement textuel ignore littéralement le contenu multimodal. Tous les chiffres ci-dessous proviennent de la note de lancement d'aujourd'hui, rapportés par le fournisseur, et n'ont pas été reproduits indépendamment :

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2

• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2

• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7

• NL2Repo — Vision-Exp 57.7 contre V4-Flash 54.2

• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4

• Cartographie — Vision-Exp 64.3 (V4-Flash ne peut pas tenter)

• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash ne peut pas tenter)

A two-column comparison scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash — the scoreboard': left column DeepSeek-V4-Flash-Vision-Exp — Input text + image, Context 1M tokens, Max output 384K, ApexBench Pass@1 36.5, Price $0.22/M off-peak, Status experimental; right column DeepSeek-V4-Flash — Input text only, Context 1M tokens, Max output 384K, ApexBench Pass@1 26.2, Price $0.22/M off-peak, Status official release; footer 'Benchmark figures vendor-reported; pricing per DeepSeek API docs.'

Le plus grand bond est ApexBench, où l'ajout de la vision fait passer le score de 26.2 à 36.5 — un écart de dix points qui n'est pas dû au fait que le modèle réfléchit plus fort, mais au fait qu'il lit enfin la tâche. Pour un agent qui opère à travers un écran — un navigateur, un bureau, un terminal avec sortie rendue — le modèle texte était complètement aveugle sur exactement les parties de la tâche qui portent l'information.

La question du prix a une réponse.

Il n'y a aucune différence de prix, et c'est là que la comparaison devient un choix évident dans un sens. DeepSeek V4 Flash Vision (Exp) est facturé exactement aux mêmes tarifs que DeepSeek V4 Flash, lesquels, depuis le 16 août 2026, sont en heures de pointe/hors pointe :

• Entrée, échec de cache — 0,22 $ par 1M de jetons en heures creuses, 0,44 $ en heures de pointe (les deux modèles).

• Entrée, succès de cache — 0,007 $ par 1M de jetons hors pointe, 0,014 $ en pointe (les deux modèles)

• Sortie — 0,66 $ par million de jetons en heures creuses, 1,32 $ en heures de pointe (les deux modèles)

• Heures de pointe — 01:00–04:00 et 06:00–10:00 UTC, les deux modèles

Le seul coût supplémentaire qu'apporte la vision est l'image elle-même : chaque image est tokenisée jusqu'à 384 tokens, de sorte qu'une capture d'écran coûte environ 0,0085 centime en heures creuses. Même un agent très orienté vision qui lit 50 images par exécution ajoute moins d'un centime au coût d'entrée. Choisir le modèle texte pour économiser de l'argent, c'est préférer des centimes à la vue — l'économie n'est pas réelle.

Quand choisir lequel

Choisissez DeepSeek V4 Flash Vision (Exp) si votre pipeline peut un jour recevoir une image. Agents de tests UI et de QA par captures d'écran, agents de navigation web qui doivent lire la page sur laquelle ils se trouvent, extraction de graphiques et de diagrammes, captures d'écran de documents, captures de messages d'erreur depuis l'écran d'un utilisateur — dans chacun de ces cas, le modèle de vision est strictement supérieur au même prix. Selon le fournisseur, il n'y a aucune pénalité sur la qualité du texte, la seule raison de ne pas l'utiliser étant donc la stabilité.

Choisissez DeepSeek V4 Flash si votre trafic est purement textuel et que rien ne changera à son sujet. Pour la complétion de code, la récupération et les boucles d'agent textuelles uniquement, les deux modèles obtiennent le même score sur le texte et la version officielle est le pari le plus sûr par définition. Si vous êtes déjà sur V4-Flash et que vous n'envoyez jamais d'image, il n'y a aucune raison de changer — et aucune raison de ne pas avoir l'option dans votre configuration de routage non plus.

La seule vraie différence : le statut expérimental

Tout ce qui se trouve au-dessus des yeux est identique ; le coût de la vision est négligeable ; les benchmarks favorisent le modèle de vision. Le seul facteur qui peut légitimement vous retenir sur DeepSeek V4 Flash en production est que le modèle de vision est expérimental. DeepSeek le qualifie ainsi, ne donne aucune date de disponibilité générale et précise qu'il n'est pas recommandé pour une utilisation en production. Le cerveau textuel qui le sous-tend est éprouvé, mais le chemin de la vision est nouveau, et une surface d'API expérimentale est exactement l'endroit où vous ne voulez pas d'un échec silencieux à 2 heures du matin.

C'est l'unique endroit où la comparaison n'est pas tranchée par les spécifications, et c'est aussi l'unique endroit où un routeur change la réponse. Sur OrcaRouter, les deux modèles sont en direct — deepseek/deepseek-v4-flash-vision-exp et deepseek/deepseek-v4-flash — derrière une seule clé API, au prix catalogue du fournisseur, répercuté sans aucune marge. Parce que la même plateforme route les deux, vous pouvez adopter le modèle de vision là où il justifie sa place et verrouiller le reste sur la version officielle, avec un basculement automatique pour qu'un pépin expérimental ne fasse jamais tomber tout le pipeline. Vous obtenez le gain de dix points sur ApexBench pour les appels qui en ont besoin et la stabilité de la version officielle pour ceux qui n'en ont pas besoin, sans deuxième contrat ni deuxième chemin de code.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text', a price block of $0.15 input / $0.29 output per 1M tokens with p50 TTFT 602 ms, and the model description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context'.

En résumé

Si votre charge de travail peut recevoir des images, DeepSeek V4 Flash Vision (Exp) surpasse DeepSeek V4 Flash sur tous les axes qui comptent et ne perd que sur l'unique axe que vous pouvez contourner : le statut expérimental. Si votre charge de travail est purement textuelle, les modèles sont équivalents en sortie et la version officielle l'emporte en stabilité. Les deux ne sont pas vraiment concurrents — le modèle de vision est le modèle de texte avec une compétence débloquée, sans frais supplémentaires. La seule décision qui vaut la peine est de savoir quelle part de votre trafic vous êtes prêt à diriger vers une API expérimentale, et c'est une décision de routage, pas une décision de modèle.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube