Une carte de titre hero pour DeepSeek-V4-Flash-Vision-Exp avec le sous-titre « Même prix que V4-Flash, maintenant avec des yeux », une icône au trait représentant un œil et une étiquette de prix, un petit badge arrondi indiquant « EXPÉRIMENTAL • API • 2026-08-21 » et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) arrive sur l'API : même prix que V4-Flash, désormais avec des yeux

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

DeepSeek V4 Flash Vision (Exp) est arrivé sur la plateforme API Deep​Seek aujourd'hui, le 21 août 2026, et le nombre le plus important de l'annonce n'est pas un benchmark — c'est le prix : ce modèle de vision expérimental est facturé exactement aux mêmes tarifs de tokens que DeepSeek V4 Flash, le cheval de bataille textuel dont il égale d'emblée les capacités purement textuelles. Cela fait de cette annonce la première fois que l'API de Deep​Seek accepte des images, et cela signifie que le moyen le moins cher d'exécuter un agent à contexte de 1M vient de devenir multimodal gratuitement.

Ce qui a réellement été livré

DeepSeek V4 Flash Vision (Exp) est un modèle multimodal expérimental, accessible avec l’identifiant de modèle deepseek-v4-flash-vision-exp. Il accepte du texte et des images en entrée et produit du texte en sortie, sur une fenêtre de contexte de 1 million de jetons avec une sortie maximale de 384 000, en modes avec et sans réflexion. Il prend en charge le format Chat Completions, les Messages de style Anthropic et le format Responses, ce qui constitue le trio dont un framework d’agents a besoin pour l’intégrer sans adaptateur personnalisé.

Pour l'entrée d'images, Deep​Seek accepte les formats JPEG, PNG, GIF et WebP, transmis de trois manières : en base64 inline, via une URL externe, ou par un fichier téléchargé via la nouvelle API Files. Il n'y a pas encore d'entrée vidéo ou audio — ici, la « vision » ne concerne que les images fixes.

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Le positionnement propre de Deep​Seek, dans sa note de version : la capacité en texte pur — agents, raisonnement, connaissances du monde — est au même niveau que la version officielle DeepSeek V4 Flash, tandis que la capacité d'agent multimodal fait un bond majeur et s'approche d'Opus-4.8. C'est une affirmation du fournisseur, non reproduite, et qui mérite d'être lue attentivement, car le détail des benchmarks qui la sous-tend est plus intéressant que le titre.

Pourquoi le saut de benchmark est plus important qu'il n'y paraît

Tous les chiffres suivants proviennent de Deep​Seek lui-même, publiés aujourd'hui dans la note de lancement, et n'ont pas été vérifiés de manière indépendante. Sur les benchmarks d'agents qui intègrent des captures d'écran et des images, le DeepSeek V4 Flash, limité au texte, ne les lit pas — il ignore simplement les parties multimodales de la tâche. DeepSeek V4 Flash Vision (Exp), lui, regarde réellement, ce qui explique pourquoi les écarts sont si importants :

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)

• Agents' Last Exam — Vision-Exp 27.3 contre V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3 (le V4-Flash en mode texte ne peut pas s'y essayer)

• ZeroBench Pass@5 — Vision-Exp 35.0 (le V4-Flash, uniquement texte, ne peut pas le tenter)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

Deux de ces chiffres méritent un second regard. Sur Agents' Last Exam, Vision-Exp (27.3) devance Opus-4.8 (25.7), et sur DeepSWE, il bat également Opus-4.8 (59.3 contre 58.0). C'est sur cela que repose réellement le « proche d'Opus-4.8 » — non pas un résultat vedette, mais une série de benchmarks agentiques où le fait de voir l'écran comble la majeure partie de l'écart avec le modèle multimodal de pointe, tout en le sous-vendant en prix d'environ un ordre de grandeur.

Ce que coûte une image, au centime près.

Les images sont tokenisées à des fins de facturation — jusqu'à 384 jetons chacune — puis facturées aux mêmes tarifs par jeton que DeepSeek V4 Flash. Comme Deep​Seek a déplacé tous ses modèles vers une tarification heures pleines/heures creuses le 16 août 2026, les chiffres exacts dépendent du moment où vous appelez :

Entrée, échec de cache — 0,22 $ par 1M de jetons hors pointe, 0,44 $ en pointe

• Entrée, cache touché — 0,007 $ par million de jetons hors pointe, 0,014 $ en pointe

• Sortie — 0,66 $ par million de tokens en heures creuses, 1,32 $ en heures de pointe.

• Heures de pointe — 01:00–04:00 et 06:00–10:00 UTC (toutes les autres heures hors pointe)

Faites le calcul et le coût de la vision disparaît presque. Une image à son plafond de 384 tokens représente environ 0,0085 centime hors pointe et 0,017 centime en pointe, en entrée. Un agent qui lit 50 captures d'écran en une seule exécution ajoute à peu près un demi-centime de tokens d'entrée — avant même que le modèle n'écrive son premier token de sortie. Deep​Seek plafonne également la résolution avant l'inférence : le niveau de détail faible redimensionne en 512×512, et le niveau élevé/original pré-adapte l'image (les petites jusqu'à environ 384×384, les grandes jusqu'à environ 800×800), de sorte qu'un original haute résolution n'est jamais transmis au modèle à son nombre de pixels natif.

Les seconds rôles : une API Files gratuite et Harness 0.1.1.

Deux briques d'infrastructure ont été livrées avec le modèle. L'API Files est en ligne et gratuite : téléversez une image une seule fois, référencez-la par file_id et réutilisez-la d'une requête à l'autre sans renvoyer les octets — ce qui est utile pour un agent de navigation qui garde une page en contexte sur plusieurs tours. Et Deep​Seek Harness 0.1.1, publié le même jour, prend en charge d'emblée le nouveau modèle, de sorte que le harnais qui évalue et pilote les charges de travail agentiques de Deep​Seek puisse le cibler immédiatement.

L'avertissement de production, formulé simplement.

Il s'agit d'un modèle expérimental. Deep​Seek le qualifie explicitement ainsi, n'a annoncé aucune date de disponibilité générale (GA) et déconseille de l'exécuter directement en production ; le plan annoncé est d'itérer sur les retours et de publier une version stable plus tard. La conséquence pratique est que le cerveau textuel est éprouvé — c'est la même famille de poids qui alimente V4-Flash — mais le chemin de la vision est un nouveau code, et personne en dehors de Deep​Seek ne l'a mis à l'épreuve à grande échelle.

Voilà exactement la situation où une couche de routage justifie son existence. Sur OrcaRouter, à la fois deepseek/deepseek-v4-flash-vision-exp et deepseek/deepseek-v4-flash sont actifs derrière une seule API, au prix catalogue de Deep​Seek, répercuté sans aucune marge. Vous pouvez diriger le trafic contenant des images vers le modèle expérimental et, dans la même configuration, définir un basculement automatique vers un modèle de secours dès qu'il génère une erreur ou expire — ce qui réduit le risque du problème du « nouveau code ». Le DSL de routage vous permet également d'envoyer uniquement les appels qui contiennent réellement des images au modèle de vision et de conserver le trafic purement textuel sur DeepSeek V4 Flash, capturant ainsi les gains de benchmark là où ils existent et ne payant rien de plus là où ils n'existent pas.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

Que regarder ensuite

Les questions ouvertes sont celles que l'on retrouve habituellement lors d'un lancement expérimental. Quand {{1}}DeepSeek V4 Flash Vision (Exp){{/1}} atteindra-t-il la disponibilité générale, et le prix tiendra-t-il ? L'entrée vidéo ou audio suivra-t-elle — le modèle ne prend aujourd'hui en charge que des images fixes, ce qui laisse les grands modèles multimodaux de pointe sans concurrence sur les médias en mouvement. Et les évaluations indépendantes (la première exécution par un tiers sur {{2}}ApexBench{{/2}} ou {{3}}Terminal-Bench{{/3}}) reproduisent-elles les chiffres publiés ? Ce qui est intéressant, c'est que même si tous les benchmarks dérivent à la baisse, l'affirmation qui est déjà rentable — la vision au prix du texte — est un fait de tarification, pas une affirmation de benchmark, et elle n'a pas besoin d'être reproduite.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube