DeepSeek V4 Flash Sortie officielle : Le modèle à contexte 1M, économique, rapide et agentique, expliqué
Guides & Insights

DeepSeek V4 Flash Sortie officielle : Le modèle à contexte 1M, économique, rapide et agentique, expliqué

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

DeepSeek V4 Flash est la moitié économique de la gamme V4 de DeepSeek, et les chiffres indépendants sont enfin à la hauteur : sur l'ensemble AIME 2026 de MathArena, il obtient 95,83 %, statistiquement indistinguable des 96,67 % de DeepSeek V4 Pro, pour un coût par problème environ neuf fois inférieur. La version officielle bêta publique, -0731, publiée le 31 juillet 2026, conserve la même architecture que l'aperçu d'avril — un modèle de mélange d'experts de 284 milliards de paramètres, 13B actifs, avec un contexte d'un million de jetons — mais bénéficie d'une session supplémentaire de post-entraînement qui a nettement amélioré ses capacités agentiques, de codage et d'appel d'outils, ainsi qu'un support natif de l'API Responses et des adaptations spécifiques pour les agents de type Codex. Ce guide couvre ce que la version a réellement changé, ce que disent les évaluations du fournisseur et les évaluations indépendantes, ce qu'elle coûte une fois que l'on tient compte de l'ampleur de sa réflexion, et comment l'appeler.

Note de précision : les détails de la version et les scores agentiques indiqués en titre ci-dessous proviennent du journal des modifications officiel de l'API DeepSeek (daté du 31/07/2026) et sont déclarés par le fournisseur, sur la base du propre harnais de test de DeepSeek — traitez-les comme indicatifs et exécutez vos propres évaluations. Les chiffres indépendants sont attribués lorsqu'ils apparaissent : Artificial Analysis pour l'indice d'intelligence et ses composants, MathArena pour l'AIME 2026, et la propre grille tarifaire de DeepSeek pour les prix. Lorsqu'une information repose sur le rapport d'un praticien unique plutôt que sur une évaluation publiée, la phrase le précise. Les spécifications et les prix changent ; vérifiez avant de construire.

TL;DR. V4 Flash est le petit frère économique du géant DeepSeek V4 Pro : un MoE de 284B / 13B actifs avec un contexte de 1 million de jetons et jusqu'à 384K de sortie, optimisé pour les travaux d'agents à volume élevé et à faible latence. La version officielle du 31 juillet est une mise à niveau post-entraînement — même taille, agents et codage nettement meilleurs — qui ajoute également la prise en charge native de Responses-API et de Codex. DeepSeek rapporte de solides scores en agentique et en codage (par exemple Terminal-Bench 2.1 82.7, Toolathlon 70.3), et Artificial Analysis a depuis attribué à la build -0731 un score de 50 sur son indice d'intelligence : dix points de plus que l'aperçu d'avril, six de plus que le V4 Pro pourtant bien plus grand, et à égalité avec Gemini 3.6 Flash. Le coût est d'environ 0,15 $ / 0,29 $ par million de jetons en entrée/sortie, soit environ un tiers du prix du V4 Pro. Seule l'API Flash a été mise à niveau ; V4 Pro et l'application/le site Web DeepSeek sont inchangés. Sur OrcaRouter, vous l'obtenez avec une marge de 0 % via un point de terminaison compatible OpenAI.

Points clés

• Version officielle (build -0731, 31 juillet 2026) : une mise à niveau post-entraînement de l’aperçu — même architecture, agents bien plus performants, codage et utilisation d’outils.

• Architecture inchangée : 284B au total / 13B actifs (MoE), contexte de 1M tokens (1 048 576), jusqu’à 384K de sortie, entrée texte uniquement, avec raisonnement, outils et JSON.

• Nouveau : prise en charge native de l'API Responses et adaptation spécifique à Codex ; continue de prendre en charge les interfaces OpenAI ChatCompletions et de type Anthropic. Identifiant du modèle deepseek-v4-flash.

• Gains agentiques/codage rapportés par DeepSeek : Terminal-Bench 2.1 82.7, Toolathlon (vérifié) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.

• Très bon marché : environ 0,15 $ / 0,29 $ par million de jetons d'entrée/sortie — soit environ un tiers des 0,44 $ / 0,88 $ du V4 Pro — et DeepSeek facture les accès au cache à 0,0028 $ par million, environ 98 % de moins qu'une entrée non mise en cache. Seule l'API Flash a changé ; Pro et app/web sont identiques.

Ce que la version officielle a réellement amélioré

V4 Flash est d'abord apparu en aperçu le 24 avril 2026. La sortie officielle du 31 juillet 2026 (le -0731 build, d'après le journal des modifications de l'API de DeepSeek) n'est explicitement pas une nouvelle architecture : les paramètres totaux et actifs (284B / 13B) et le contexte de 1M sont inchangés. Ce qui a changé, c'est le post-entraînement — un fine-tuning supplémentaire qui, selon DeepSeek, a considérablement amélioré les capacités agentiques, de codage et d'appel d'outils. Deux ajouts pratiques comptent : V4 Flash prend désormais en charge nativement l'API Responses et est spécifiquement adapté aux agents de codage de type Codex, tout en continuant à parler les interfaces OpenAI ChatCompletions et de style Anthropic. Point important : seule l'API Flash a été mise à niveau dans cette version ; V4 Pro et les expériences app/web DeepSeek sont inchangés. Pour les équipes, cela signifie une amélioration directe pour les charges de travail agentiques au même prix, sans migration.

Architecture : un MoE à petit nombre d’experts actifs conçu pour le débit

V4 Flash est un modèle de mélange d'experts avec environ 284 milliards de paramètres au total, mais seulement environ 13 milliards d'actifs par jeton. Ce faible nombre de paramètres actifs est l'essentiel : il maintient une inférence rapide et peu coûteuse tandis qu'un vaste bassin d'experts préserve la qualité. La fenêtre de contexte est de 1 048 576 jetons complets (environ 1M), avec une sortie maximale très large de 384K, et le modèle prend en charge le raisonnement (pensée étendue), l'appel d'outils et le JSON structuré. L'entrée est textuelle uniquement. L'objectif de conception — travail agentique à haut volume et faible latence — se reflète dans les chiffres de service : un p50 time-to-first-token d'environ 394 millisecondes et une sortie d'environ 184 jetons par seconde selon les mesures d'OrcaRouter.

Benchmarks : ce que disent les chiffres officiels

La version officielle s'appuie fortement sur les évaluations agentiques et de codage, exécutées avec le harnais propre à DeepSeek (réglages minimal-mode / max-effort). Voici comment lire les principaux résultats, tous rapportés par DeepSeek :

• Terminal-Bench 2.1 : 82,7 — des tâches agentiques de ligne de commande/logiciel dans un vrai terminal. Un score élevé ici indique un modèle qui peut réellement piloter des outils et des shells, et pas seulement répondre à des questions.

• Toolathlon (vérifié) : 70.3 et Automation Bench (Public) : 25.1 — l’étendue et la fiabilité de l’utilisation des outils et de l’automatisation de bout en bout. La fiabilité des appels d’outils est la caractéristique déterminante pour les agents.

• Cybergym : 76.7 — résolution de problèmes agentique de type sécurité/CTF.

• DeepSWE : 54.4, NL2Repo : 54.2, DSBench-FullStack : 68.7, DSBench-Hard : 59.6 — ingénierie logicielle et codage full-stack, de la génération au niveau du dépôt aux tâches difficiles de science des données. Le score élevé de DSBench-FullStack (68.7) indique une compétence pratique en codage multi-fichiers.

• Agent Last Exam : 25.2 — un défi de raisonnement agentique délibérément difficile où même les meilleurs modèles obtiennent des scores faibles ; utile comme signal relatif, et non comme mesure absolue.

Pour un contexte indépendant, Artificial Analysis a désormais évalué la build -0731 elle-même et lui attribue un score de 50 sur l'Artificial Analysis Intelligence Index — dix points au-dessus de l'aperçu d'avril qu'elle remplace, six points au-dessus du V4 Pro, bien plus volumineux, et à égalité avec Gemini 3.6 Flash. Ses résultats par composante : GPQA Diamond 91 %, AA-LCR 66 %, Humanity's Last Exam 37 %, SciCode 50 %, τ³-Bench Banking 31 %, CritPt 17 %, et un Elo de 1559 sur GDPval-AA v2. Deux d'entre eux méritent qu'on y regarde de plus près. Artificial Analysis a mesuré Terminal-Bench 2.1 à 79 %, contre 82,7 annoncés par DeepSeek — proche, mais inférieur, ce qui est la direction dans laquelle les chiffres des harnais de test des fournisseurs se trompent généralement. Et sur AA-Omniscience, le modèle atterrit à -16 avec un taux d'hallucination mesuré élevé : l'argument du « pas cher et agentique » ne s'étend donc pas au rappel factuel non supervisé. C'est la façon la plus pertinente de lire ce modèle : un raisonnement solide par dollar, des connaissances faibles par requête.

Maths de compétition : le seul domaine où Flash rivalise avec Pro.

La lecture indépendante la plus utile sur le raisonnement de V4 Flash provient de MathArena, qui exécute chaque modèle quatre fois sur chaque problème d'une compétition fraîchement publiée et publie la grille par problème. Sur AIME 2026 — les deux sujets, 30 problèmes, quatre exécutions chacun — V4 Flash en mode raisonnement maximal obtient 95,83 % ±3,58 %, contre 96,67 % ±3,21 % pour DeepSeek V4 Pro. Ces intervalles se chevauchent presque totalement : sur ce benchmark, le petit modèle n'est pas mesurablement moins performant que le modèle phare. C'est au niveau de la colonne des coûts qu'ils se séparent. MathArena estime une exécution de V4 Flash à 0,009 $ par problème contre 0,082 $ pour V4 Pro — environ neuf fois moins cher pour la même précision, ce qui est un argument plus fort pour le niveau d'efficacité que tout ce que DeepSeek a annoncé lui-même.

Deux mises en garde vont de pair. MathArena signale les deux entrées DeepSeek avec un avertissement de contamination, son étiquette pour un modèle publié après l'apparition de la compétition, si bien qu'une partie de cette précision pourrait relever de la mémorisation plutôt que du raisonnement. Et la version testée par MathArena est datée du 2026-04-24 — l'aperçu d'avril, pas la version -0731. À l'heure où nous écrivons ces lignes, il n'existe aucun score AIME 2026 indépendant pour la version officielle, et la fiche modèle de DeepSeek ne publie aucun benchmark mathématique pour celle-ci, seulement des benchmarks agentiques.

Le graphique montre aussi où se situe le plafond. Presque tous les modèles du tableau réussissent la plupart des problèmes de l'AIME 2026 ; le problème qui les départage est le problème 15. Seules deux entrées le résolvent lors des quatre exécutions — GPT-5.5 avec un effort extra-élevé et Claude Opus 4.8 au maximum. V4 Flash obtient zéro sur quatre ici, tout comme V4 Pro, aux côtés de GLM-5.2, Gemini 3.6 Flash, Kimi K2.6 et Claude Opus 4.7.

Ce dernier détail est ce qui rend un rapport daté du 5 août 2026 digne d'être signalé. Le commentateur IA @teortaxesTex a publié que la version -0731 a bien résolu le problème 15 de l'AIME 2026, en prenant environ 1 006 secondes et environ 100 000 jetons de sortie, et a décrit le modèle qui commençait visiblement à contourner le problème avant d'abandonner le raccourci et de le résoudre honnêtement. Il s'agit d'une seule exécution d'un praticien, pas d'un résultat de référence : elle n'a pas été reproduite, aucun classement public n'a noté la version -0731, et une transcription isolée n'est pas une évaluation. Ce qui peut être vérifié, c'est la cohérence interne, et elle tient — Artificial Analysis mesure la sortie de ce modèle à environ 116 jetons par seconde, et 1 006 secondes à ce rythme représentent environ 117 000 jetons, soit le même ordre de grandeur que le nombre rapporté. Une réponse de 100 000 jetons est également bien dans ce que DeepSeek attend, puisqu'il recommande d'autoriser jusqu'à 384 000 jetons de sortie avec un effort de raisonnement élevé ou maximal. Ces deux chiffres sont environ trois fois plus élevés que les moyennes mesurées par MathArena pour ce modèle (33 588 jetons de sortie et 6 min 50 s par réponse), ce qui est ce à quoi on s'attendait pour le problème le plus difficile de l'ensemble. Donc : plausible dans la forme, non vérifié dans le résultat, et s'il se reproduit, c'est un vrai bond par rapport à la version d'aperçu, qui échoue sur ce problème quatre fois sur quatre.

Tarification : le nombre qui change les budgets

Sur OrcaRouter, qui transmet les tarifs des fournisseurs avec une marge de 0 %, la V4 Flash coûte environ 0,15 $ par million de jetons d’entrée et 0,29 $ par million de jetons de sortie, et DeepSeek a maintenu des prix inchangés pour cette mise à jour. Cela représente environ un tiers des 0,44 $ / 0,88 $ de DeepSeek V4 Pro. Les hits de cache sont moins chers que ce que la plupart des gens supposent : DeepSeek affiche l’entrée en cache à 0,0028 $ par million, soit environ 98 % de moins que l’entrée fraîche, ce qui rend les agents et les chats avec un prompt système stable si peu coûteux à faire fonctionner. Concrètement, 10 millions de jetons par mois avec une répartition 70 % en entrée / 30 % en sortie revient à quelques dollars ; à l’échelle d’un milliard de jetons, l’écart avec un modèle haut de gamme devient une ligne que les finances remarquent.

Cependant, sur un modèle de raisonnement, la grille tarifaire est la moitié la moins intéressante de la facture — ce qui fait bouger les budgets, c'est le nombre de jetons que le modèle choisit de dépenser. Artificial Analysis a eu besoin d'environ 206 millions de jetons de sortie pour exécuter son Intelligence Index complet sur V4 Flash, soit à peu près le double de la médiane d'environ 100 millions parmi les modèles qu'il teste, et le décrit comme rapide mais très verbeux. En termes de prix, une réponse unique de 100 000 jetons coûte environ trois centimes, et le plafond de sortie de 384K limite une réponse à près de onze centimes. Bon marché en termes absolus, mais plusieurs centaines de fois le coût d'une réponse courte — c'est pourquoi l'effort de raisonnement est un levier budgétaire plutôt qu'un réglage de qualité que l'on laisse au maximum. Le compte rendu pratique de Simon Willison fait le même point dans l'autre sens : avec les paramètres par défaut, sa génération de test était décevante, et l'augmentation de l'effort de raisonnement à un niveau élevé l'a nettement améliorée. Mesurez vos propres requêtes difficiles avant de supposer que le tarif annoncé correspond à votre coût.

Où V4 Flash se situe : l'échelle DeepSeek V4

La gamme V4 de DeepSeek est une échelle. V4 Pro est le modèle phare — un modèle de raisonnement et de codage bien plus grand, de tout premier plan. V4 Flash est le niveau efficacité : beaucoup moins de calcul actif, une fraction du prix et, après cette mise à niveau post-entraînement, des capacités agentiques et de codage réellement solides. Le fait que DeepSeek ait investi pour faire de Flash un meilleur agent (Responses API, adaptation Codex, benchmarks d'utilisation d'outils) vous indique où il s'attend à voir passer le volume. Mais les chiffres AIME 2026 compliquent la version bien propre de cette histoire en faveur de Flash : en mathématiques de compétition, les deux modèles se situent dans les marges d'erreur de l'autre, donc « envoyer les problèmes difficiles à Pro » n'est pas automatiquement la bonne décision. La répartition honnête est que Pro apporte une étendue de connaissances et le travail agentique le plus difficile, pas une meilleure chance de résoudre un problème de maths difficile — c'est pourquoi router selon la difficulté mesurée sur vos propres tâches vaut mieux que de recourir par défaut au plus grand modèle.

Trois scénarios du monde réel

1. Agents de codage et workflows de type Codex

Le support natif de Responses-API et Codex dans la build -0731, ainsi que ses scores Terminal-Bench (82,7) et DSBench-FullStack (68,7), font de V4 Flash un moteur puissant et économique pour les agents de codage autonomes — correction de bugs, refactorisations, génération de tests, utilisation d'outils en plusieurs étapes.

2. Agents utilisant des outils à haut volume

Premiers tokens rapides (~394 ms), débit élevé (~184 tok/s), contexte de 1M et fiabilité solide sur Toolathlon (70,3) conviennent aux agents de production qui appellent des outils à grande échelle — recherche, automatisation, orchestration.

3. Traitement de documents longs à petit budget

Le contexte complet de 1M de jetons et la sortie de 384K gèrent le résumé, l'analyse ou la transformation de très grandes entrées — journaux, bases de code, rapports longs — en un seul passage, à moindre coût.

Comment accéder à V4 Flash

Vous pouvez appeler V4 Flash directement sur l'API de DeepSeek (identifiant de modèle deepseek-v4-flash ; il prend en charge les API Responses, OpenAI ChatCompletions et les interfaces de type Anthropic), ou via un endpoint neutre vis-à-vis du fournisseur. OrcaRouter expose V4 Flash avec une marge de 0 % via un endpoint unique compatible OpenAI (deepseek/deepseek-v4-flash) aux côtés de plus de 200 autres modèles — vous pouvez donc le comparer à GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen3.8-Max et Kimi K3 en un seul endroit, et acheminer chaque requête vers l'option la moins chère pour la tâche. Comme les prix sont répercutés tels quels, sans marge, un changement de prix de DeepSeek se reflète sur votre facture le jour même où il est publié. Et comme l'interface est compatible OpenAI, adopter V4 Flash — ou l'abandonner après une semaine de mesures — est une simple modification de configuration, pas une réintégration.

Limitations et réserves honnêtes

V4 Flash est un modèle axé sur l'efficacité, pas un modèle phare, mais les données indépendantes ont rendu cette frontière plus précise que « moins bon sur les tâches difficiles ». Sur AIME 2026, il correspond à V4 Pro dans les intervalles de confiance ; là où il est clairement en retrait, c'est l'étendue des connaissances — AA-Omniscience -16 et un taux d'hallucination élevé selon les mesures — et le travail agentique le plus exigeant. L'entrée est en texte uniquement, sans entrée d'image native. Les scores agentiques principaux sont annoncés par DeepSeek sur son propre cadre d'évaluation, et le seul chiffre qu'un laboratoire indépendant a re-mesuré est ressorti plus bas (Artificial Analysis a mesuré Terminal-Bench 2.1 à 79 % contre les 82,7 annoncés), donc traitez les chiffres du fournisseur comme des indications. Et « pas cher par jeton » ne signifie pas « pas cher par tâche » : ce modèle est mesurablement verbeux, donc plafonnez l'effort de raisonnement et les itérations d'outils sur les appels simples au lieu de laisser l'effort maximal activé par défaut. Validez sur votre propre charge de travail avant d'engager du trafic de production.

FAQ

Qu'est-ce que DeepSeek V4 Flash ?

Le modèle d'efficacité de DeepSeek dans la gamme V4 : un modèle de mélange d'experts (MoE) de 284B paramètres avec 13B actifs, un contexte de 1M de jetons, jusqu'à 384K de sortie, optimisé pour un travail d'agent et de codage rapide et à grand volume. Sa version officielle (build -0731) est sortie le 31 juillet 2026.

Qu'est-ce qui a changé dans la version officielle ?

L'architecture est inchangée ; il s'agit d'une mise à niveau post-entraînement qui améliore considérablement les capacités agentiques, de codage et d'appel d'outils, et ajoute la prise en charge native de l'API Responses avec l'adaptation Codex. Seule l'API Flash a été mise à niveau — V4 Pro et l'application/le web restent identiques.

Combien coûte V4 Flash ?

Environ 0,15 $ par million de jetons d'entrée et 0,29 $ par million de jetons de sortie sur OrcaRouter (marge de 0 %) — soit environ un tiers des 0,44 $ / 0,88 $ de V4 Pro — avec les cache hits indiqués à 0,0028 $ par million, soit environ 98 % de moins que l'entrée fraîche. Les prix sont restés stables dans cette version. Prévoyez un budget pour le volume de jetons ainsi que pour le tarif : c'est un modèle de raisonnement verbeux, et une réponse de 100 000 jetons coûte environ trois cents.

À quel point V4 Flash est-il performant pour les tâches agentiques et de codage ?

DeepSeek rapporte de bons scores : Terminal-Bench 2.1 82,7, Toolathlon (vérifié) 70,3, Cybergym 76,7, DeepSWE 54,4, DSBench-FullStack 68,7 — tous des chiffres issus du harnais du fournisseur, donc vérifiez sur vos propres tâches.

Est-ce que V4 Flash est bon en maths de compétition ?

Mieux que ce que son prix laisse supposer. Sur la grille AIME 2026 de MathArena, la version d'aperçu d'avril obtient un score de 95,83 % sur quatre séries de 30 problèmes — dans l'intervalle de confiance des 96,67 % de V4 Pro, pour environ un neuvième du coût par problème — bien que MathArena signale les deux modèles comme potentiellement contaminés, et qu'elle n'ait pas encore évalué la version -0731. Le seul problème qu'elle ne résout jamais est le problème 15, que seuls GPT-5.5 en effort extra-élevé et Claude Opus 4.8 en résolution maximale résolvent de manière fiable.

Comment V4 Flash se compare-t-il à V4 Pro ?

Pro est le vaisseau amiral nettement plus grand pour le raisonnement et le codage les plus difficiles ; Flash est le palier d'efficacité à environ 1/3 du prix avec de solides capacités agentiques/de codage. Acheminez les tâches difficiles vers Pro, tout le reste vers Flash.

Quelle est la fenêtre de contexte?

Un total de 1 048 576 jetons (environ 1 M), avec jusqu'à 384 K jetons de sortie.

V4 Flash est-il multimodal ?

Non — l'entrée est textuelle uniquement. Elle prend en charge le raisonnement, l'appel d'outils et la sortie JSON.

Est-ce que V4 Flash fonctionne avec l'API Responses et Codex ?

Oui — la version -0731 ajoute la prise en charge native de l'API Responses et une adaptation spécifique à Codex, aux côtés des interfaces de type OpenAI ChatCompletions et Anthropic.

Comment utiliser V4 Flash ?

Directement via l'API de DeepSeek, ou via le point de terminaison compatible OpenAI d'OrcaRouter avec une majoration de 0% (deepseek/deepseek-v4-flash), où vous pouvez également comparer et router entre des modèles concurrents.

En résumé

La sortie officielle de DeepSeek V4 Flash conserve la recette bon marché et rapide tout en en faisant un bien meilleur agent : le même MoE de 284B / 13B actifs et un contexte de 1M, post-entraîné pour un codage et une utilisation d'outils plus solides, avec prise en charge native de l'API Responses et de Codex, au même prix d'environ 0,15 $ / 0,29 $. Les chiffres indépendants soutiennent désormais l'essentiel du discours — Artificial Analysis place le niveau de build -0731 au même niveau que Gemini 3.6 Flash en intelligence, et MathArena indique que le build de prévisualisation correspond au V4 Pro sur AIME 2026 pour un neuvième du coût par problème. Ce que le faible tarif n'achète pas, c'est l'étendue des connaissances ou un passe-droit sur la verbosité : ce modèle pense avec un budget de tokens environ deux fois supérieur à celui d'un modèle médian, de sorte que votre facture par tâche dépend plus de l'effort de raisonnement que vous autorisez que du prix affiché. Passez-le par un endpoint compatible OpenAI à marge nulle, comme OrcaRouter, mesurez ce que vos propres requêtes difficiles dépensent réellement, et acheminez vers un modèle phare uniquement là où la mesure vous y oblige.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement