
DeepSeek V4 Flash Vision (Exp) arrive sur l'API : même prix que V4-Flash, désormais avec des yeux
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
DeepSeek V4 Flash Vision (Exp) est arrivé sur la plateforme API DeepSeek aujourd'hui, le 21 août 2026, et le nombre le plus important de l'annonce n'est pas un benchmark — c'est le prix : ce modèle de vision expérimental est facturé exactement aux mêmes tarifs de tokens que DeepSeek V4 Flash, le cheval de bataille textuel dont il égale d'emblée les capacités purement textuelles. Cela fait de cette annonce la première fois que l'API de DeepSeek accepte des images, et cela signifie que le moyen le moins cher d'exécuter un agent à contexte de 1M vient de devenir multimodal gratuitement.
Ce qui a réellement été livré
DeepSeek V4 Flash Vision (Exp) est un modèle multimodal expérimental, accessible avec l’identifiant de modèle deepseek-v4-flash-vision-exp. Il accepte du texte et des images en entrée et produit du texte en sortie, sur une fenêtre de contexte de 1 million de jetons avec une sortie maximale de 384 000, en modes avec et sans réflexion. Il prend en charge le format Chat Completions, les Messages de style Anthropic et le format Responses, ce qui constitue le trio dont un framework d’agents a besoin pour l’intégrer sans adaptateur personnalisé.
Pour l'entrée d'images, DeepSeek accepte les formats JPEG, PNG, GIF et WebP, transmis de trois manières : en base64 inline, via une URL externe, ou par un fichier téléchargé via la nouvelle API Files. Il n'y a pas encore d'entrée vidéo ou audio — ici, la « vision » ne concerne que les images fixes.

Le positionnement propre de DeepSeek, dans sa note de version : la capacité en texte pur — agents, raisonnement, connaissances du monde — est au même niveau que la version officielle DeepSeek V4 Flash, tandis que la capacité d'agent multimodal fait un bond majeur et s'approche d'Opus-4.8. C'est une affirmation du fournisseur, non reproduite, et qui mérite d'être lue attentivement, car le détail des benchmarks qui la sous-tend est plus intéressant que le titre.
Pourquoi le saut de benchmark est plus important qu'il n'y paraît
Tous les chiffres suivants proviennent de DeepSeek lui-même, publiés aujourd'hui dans la note de lancement, et n'ont pas été vérifiés de manière indépendante. Sur les benchmarks d'agents qui intègrent des captures d'écran et des images, le DeepSeek V4 Flash, limité au texte, ne les lit pas — il ignore simplement les parties multimodales de la tâche. DeepSeek V4 Flash Vision (Exp), lui, regarde réellement, ce qui explique pourquoi les écarts sont si importants :
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)
• Agents' Last Exam — Vision-Exp 27.3 contre V4-Flash 25.2 (Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4 (Opus-4.8 58.0)
• Chartography — Vision-Exp 64.3 (le V4-Flash en mode texte ne peut pas s'y essayer)
• ZeroBench Pass@5 — Vision-Exp 35.0 (le V4-Flash, uniquement texte, ne peut pas le tenter)

Deux de ces chiffres méritent un second regard. Sur Agents' Last Exam, Vision-Exp (27.3) devance Opus-4.8 (25.7), et sur DeepSWE, il bat également Opus-4.8 (59.3 contre 58.0). C'est sur cela que repose réellement le « proche d'Opus-4.8 » — non pas un résultat vedette, mais une série de benchmarks agentiques où le fait de voir l'écran comble la majeure partie de l'écart avec le modèle multimodal de pointe, tout en le sous-vendant en prix d'environ un ordre de grandeur.
Ce que coûte une image, au centime près.
Les images sont tokenisées à des fins de facturation — jusqu'à 384 jetons chacune — puis facturées aux mêmes tarifs par jeton que DeepSeek V4 Flash. Comme DeepSeek a déplacé tous ses modèles vers une tarification heures pleines/heures creuses le 16 août 2026, les chiffres exacts dépendent du moment où vous appelez :
Entrée, échec de cache — 0,22 $ par 1M de jetons hors pointe, 0,44 $ en pointe
• Entrée, cache touché — 0,007 $ par million de jetons hors pointe, 0,014 $ en pointe
• Sortie — 0,66 $ par million de tokens en heures creuses, 1,32 $ en heures de pointe.
• Heures de pointe — 01:00–04:00 et 06:00–10:00 UTC (toutes les autres heures hors pointe)
Faites le calcul et le coût de la vision disparaît presque. Une image à son plafond de 384 tokens représente environ 0,0085 centime hors pointe et 0,017 centime en pointe, en entrée. Un agent qui lit 50 captures d'écran en une seule exécution ajoute à peu près un demi-centime de tokens d'entrée — avant même que le modèle n'écrive son premier token de sortie. DeepSeek plafonne également la résolution avant l'inférence : le niveau de détail faible redimensionne en 512×512, et le niveau élevé/original pré-adapte l'image (les petites jusqu'à environ 384×384, les grandes jusqu'à environ 800×800), de sorte qu'un original haute résolution n'est jamais transmis au modèle à son nombre de pixels natif.
Les seconds rôles : une API Files gratuite et Harness 0.1.1.
Deux briques d'infrastructure ont été livrées avec le modèle. L'API Files est en ligne et gratuite : téléversez une image une seule fois, référencez-la par file_id et réutilisez-la d'une requête à l'autre sans renvoyer les octets — ce qui est utile pour un agent de navigation qui garde une page en contexte sur plusieurs tours. Et DeepSeek Harness 0.1.1, publié le même jour, prend en charge d'emblée le nouveau modèle, de sorte que le harnais qui évalue et pilote les charges de travail agentiques de DeepSeek puisse le cibler immédiatement.
L'avertissement de production, formulé simplement.
Il s'agit d'un modèle expérimental. DeepSeek le qualifie explicitement ainsi, n'a annoncé aucune date de disponibilité générale (GA) et déconseille de l'exécuter directement en production ; le plan annoncé est d'itérer sur les retours et de publier une version stable plus tard. La conséquence pratique est que le cerveau textuel est éprouvé — c'est la même famille de poids qui alimente V4-Flash — mais le chemin de la vision est un nouveau code, et personne en dehors de DeepSeek ne l'a mis à l'épreuve à grande échelle.
Voilà exactement la situation où une couche de routage justifie son existence. Sur OrcaRouter, à la fois deepseek/deepseek-v4-flash-vision-exp et deepseek/deepseek-v4-flash sont actifs derrière une seule API, au prix catalogue de DeepSeek, répercuté sans aucune marge. Vous pouvez diriger le trafic contenant des images vers le modèle expérimental et, dans la même configuration, définir un basculement automatique vers un modèle de secours dès qu'il génère une erreur ou expire — ce qui réduit le risque du problème du « nouveau code ». Le DSL de routage vous permet également d'envoyer uniquement les appels qui contiennent réellement des images au modèle de vision et de conserver le trafic purement textuel sur DeepSeek V4 Flash, capturant ainsi les gains de benchmark là où ils existent et ne payant rien de plus là où ils n'existent pas.

Que regarder ensuite
Les questions ouvertes sont celles que l'on retrouve habituellement lors d'un lancement expérimental. Quand {{1}}DeepSeek V4 Flash Vision (Exp){{/1}} atteindra-t-il la disponibilité générale, et le prix tiendra-t-il ? L'entrée vidéo ou audio suivra-t-elle — le modèle ne prend aujourd'hui en charge que des images fixes, ce qui laisse les grands modèles multimodaux de pointe sans concurrence sur les médias en mouvement. Et les évaluations indépendantes (la première exécution par un tiers sur {{2}}ApexBench{{/2}} ou {{3}}Terminal-Bench{{/3}}) reproduisent-elles les chiffres publiés ? Ce qui est intéressant, c'est que même si tous les benchmarks dérivent à la baisse, l'affirmation qui est déjà rentable — la vision au prix du texte — est un fait de tarification, pas une affirmation de benchmark, et elle n'a pas besoin d'être reproduite.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
