DeepSeek V4 Flash Sortie officielle : Le modèle à contexte 1M, économique, rapide et agentique, expliqué
Guides & Insights

DeepSeek V4 Flash Sortie officielle : Le modèle à contexte 1M, économique, rapide et agentique, expliqué

Auteur

jinhao song

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le modèle d’efficacité de DeepSeek, V4 Flash, est passé de la version préliminaire à une version bêta publique officielle — le code>-0731/code> la build est sortie le 31 juillet 2026. L’architecture n’a pas changé (il s’agit toujours d’un modèle à mélange d’experts de 284 milliards de paramètres avec un contexte d’un million de jetons), mais une série de post-entraînements supplémentaires a nettement amélioré ses capacités agentiques, de codage et d’appel d’outils, et il prend désormais en charge nativement l’API Responses avec des adaptations spécifiques pour les agents de type Codex. Ce guide explique ce qu’est V4 Flash, ce que la version officielle a réellement amélioré, comment interpréter ses benchmarks (rapportés par DeepSeek), quel est son coût et comment l’utiliser — chaque chiffre étant étiqueté selon sa source.

Note de précision : les détails de publication et les scores de référence ci-dessous proviennent du journal des modifications de l'API officielle de DeepSeek (daté du 31 juillet 2026) ; l'architecture, le contexte et la tarification sont recoupés avec la page du modèle OrcaRouter ; les composites d'Artificial Analysis sont indépendants. Les benchmarks rapportés par DeepSeek utilisent ses propres réglages de banc de test — considérez-les comme des chiffres du fournisseur et effectuez vos propres évaluations. Les spécifications et les prix changent ; vérifiez avant de construire.

TL;DR. V4 Flash est le petit frère économique du géant DeepSeek V4 Pro : un MoE de 284B / 13B actifs avec un contexte de 1M de jetons et jusqu'à 384K de sortie, optimisé pour les travaux agentiques à volume élevé et à faible latence. La sortie officielle du 31 juillet est une mise à niveau post-entraînement — même taille, agents et codage nettement meilleurs — qui ajoute également la prise en charge native de Responses-API et de Codex. DeepSeek rapporte de solides scores agentiques/codage (par exemple, Terminal-Bench 2.1 82,7, Toolathlon 70,3), et cela coûte environ 0,15 $ / 0,29 $ par million de jetons d'entrée/sortie, soit environ un tiers du prix de V4 Pro. Seule l'API Flash a été mise à niveau ; V4 Pro et l'application/le web DeepSeek restent inchangés. Sur OrcaRouter, vous l'obtenez avec une majoration de 0 % via un seul endpoint compatible OpenAI.

Points clés

• Version officielle (build -0731, 31 juillet 2026) : une mise à niveau post-entraînement de l’aperçu — même architecture, agents bien plus performants, codage et utilisation d’outils.

• Architecture inchangée : 284B au total / 13B actifs (MoE), contexte de 1M tokens (1 048 576), jusqu’à 384K de sortie, entrée texte uniquement, avec raisonnement, outils et JSON.

• Nouveau : prise en charge native de l’API Responses ainsi qu’une adaptation spécifique à Codex ; continue de prendre en charge les interfaces de type OpenAI ChatCompletions et Anthropic. Identifiant du modèle code>deepseek-v4-flash/code>.

• Gains agentiques/codage rapportés par DeepSeek : Terminal-Bench 2.1 82.7, Toolathlon (vérifié) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.

• Très bon marché : environ 0,15 $ / 0,29 $ pour 1M de tokens d’entrée/sortie, avec ~0,02 $ de lectures cache (OrcaRouter, marge de 0 %) — soit environ un tiers des 0,44 $ / 0,88 $ de V4 Pro. Seule l’API Flash a changé ; Pro et app/web sont identiques.

Ce que la version officielle a réellement amélioré

V4 Flash est d'abord apparu en aperçu le 24 avril 2026. La version officielle du 31 juillet 2026 (la code>-0731/code> build, selon le journal des modifications de l'API DeepSeek) n'est explicitement pas une nouvelle architecture : les paramètres totaux et actifs (284B / 13B) ainsi que le contexte de 1M sont inchangés. Ce qui change, c'est le post-entraînement — un affinage supplémentaire qui, selon DeepSeek, a considérablement amélioré les capacités agentiques, de codage et d'appel d'outils de base. Deux ajouts pratiques comptent : V4 Flash prend désormais en charge nativement l'API Responses et est spécifiquement adapté aux agents de codage de style Codex, tout en parlant toujours les interfaces OpenAI ChatCompletions et de type Anthropic. Surtout, seule l'API Flash a été mise à niveau dans cette version ; V4 Pro et les expériences app/web de DeepSeek sont inchangés. Pour les équipes, cela signifie une amélioration directe pour les charges de travail agentiques au même prix, sans migration.

Architecture : un MoE à petit nombre d’experts actifs conçu pour le débit

V4 Flash est un modèle de mélange d'experts avec environ 284 milliards de paramètres au total, mais seulement environ 13 milliards d'actifs par jeton. Ce faible nombre de paramètres actifs est l'essentiel : il maintient une inférence rapide et peu coûteuse tandis qu'un vaste bassin d'experts préserve la qualité. La fenêtre de contexte est de 1 048 576 jetons complets (environ 1M), avec une sortie maximale très large de 384K, et le modèle prend en charge le raisonnement (pensée étendue), l'appel d'outils et le JSON structuré. L'entrée est textuelle uniquement. L'objectif de conception — travail agentique à haut volume et faible latence — se reflète dans les chiffres de service : un p50 time-to-first-token d'environ 394 millisecondes et une sortie d'environ 184 jetons par seconde selon les mesures d'OrcaRouter.

Benchmarks : ce que disent les chiffres officiels

La version officielle s'appuie fortement sur les évaluations agentiques et de codage, exécutées avec le harnais propre à DeepSeek (réglages minimal-mode / max-effort). Voici comment lire les principaux résultats, tous rapportés par DeepSeek :

• Terminal-Bench 2.1 : 82,7 — des tâches agentiques de ligne de commande/logiciel dans un vrai terminal. Un score élevé ici indique un modèle qui peut réellement piloter des outils et des shells, et pas seulement répondre à des questions.

• Toolathlon (vérifié) : 70.3 et Automation Bench (Public) : 25.1 — l’étendue et la fiabilité de l’utilisation des outils et de l’automatisation de bout en bout. La fiabilité des appels d’outils est la caractéristique déterminante pour les agents.

• Cybergym : 76.7 — résolution de problèmes agentique de type sécurité/CTF.

• DeepSWE : 54.4, NL2Repo : 54.2, DSBench-FullStack : 68.7, DSBench-Hard : 59.6 — ingénierie logicielle et codage full-stack, de la génération au niveau du dépôt aux tâches difficiles de science des données. Le score élevé de DSBench-FullStack (68.7) indique une compétence pratique en codage multi-fichiers.

• Agent Last Exam : 25.2 — un défi de raisonnement agentique délibérément difficile où même les meilleurs modèles obtiennent des scores faibles ; utile comme signal relatif, et non comme mesure absolue.

Pour un contexte indépendant, Artificial Analysis (évalué le 25/06/2026, version préliminaire) a placé le V4 Flash autour de 56,2 en AA Coding, 40,3 en AA Intelligence et 50,0 en AA Math — un généraliste orienté codage au-dessus de la médiane des modèles ouverts. L’amélioration officielle post-entraînement vise précisément l’axe agentique/codage, attendez-vous donc à ce que la version plus récente soit plus performante sur exactement ces tâches. Comme toujours, les chiffres du harnais du fournisseur sont optimistes ; validez sur vos propres charges de travail.

Tarification : le nombre qui change les budgets

Sur OrcaRouter, qui transmet les tarifs des fournisseurs sans marge (0 % de majoration), V4 Flash coûte environ 0,15 $ par million de tokens en entrée et 0,29 $ par million de tokens en sortie, avec des lectures de cache autour de 0,02 $ — et DeepSeek a maintenu des prix bas dans cette version (aucune hausse pour la mise à niveau). Cela représente environ un tiers des 0,44 $ / 0,88 $ de DeepSeek V4 Pro. Concrètement : 10 millions de tokens par mois, avec une répartition de 70 % en entrée / 30 % en sortie, revient à quelques dollars sur V4 Flash ; à l’échelle d’un milliard de tokens, l’écart avec un modèle phare devient une ligne que la finance remarque. La mise en cache des prompts réduit encore les coûts pour les agents et les conversations avec un prompt système stable, car l’entrée en cache est facturée environ un dixième du prix de l’entrée fraîche. Des capacités agentiques moins chères au même prix bas : c’est tout l’argument de cette version.

Où V4 Flash se situe : l'échelle DeepSeek V4

La gamme V4 de DeepSeek est une échelle. V4 Pro est le modèle phare — un modèle de raisonnement et de codage beaucoup plus grand, haut de gamme. V4 Flash est le niveau d'efficacité : beaucoup moins de calcul actif, une fraction du prix et, après cette mise à niveau post-entraînement, des capacités d'agent et de codage véritablement solides. Le fait que DeepSeek ait investi pour faire de Flash un meilleur agent (Responses API, adaptation Codex, benchmarks d'utilisation d'outils) vous indique où il s'attend à ce que le volume se dirige : le trafic quotidien d'agent et de codage sur Flash, le raisonnement le plus difficile étant réservé à Pro. Cela reflète le schéma de toute l'industrie — défaut bon marché + modèle phare premium — et c'est pourquoi le routage par difficulté l'emporte sur le fait de choisir par défaut le plus grand modèle.

Trois scénarios du monde réel

1. Agents de codage et workflows de type Codex

Le support natif de Responses-API et Codex dans la build -0731, ainsi que ses scores Terminal-Bench (82,7) et DSBench-FullStack (68,7), font de V4 Flash un moteur puissant et économique pour les agents de codage autonomes — correction de bugs, refactorisations, génération de tests, utilisation d'outils en plusieurs étapes.

2. Agents utilisant des outils à haut volume

Premiers tokens rapides (~394 ms), débit élevé (~184 tok/s), contexte de 1M et fiabilité solide sur Toolathlon (70,3) conviennent aux agents de production qui appellent des outils à grande échelle — recherche, automatisation, orchestration.

3. Traitement de documents longs à petit budget

Le contexte complet de 1M de jetons et la sortie de 384K gèrent le résumé, l'analyse ou la transformation de très grandes entrées — journaux, bases de code, rapports longs — en un seul passage, à moindre coût.

Comment accéder à V4 Flash

Vous pouvez appeler V4 Flash directement sur l'API de DeepSeek (identifiant du modèle code>deepseek-v4-flash/code> ; il prend en charge les API Responses, les ChatCompletions d'OpenAI et les interfaces de style Anthropic), ou via un point de terminaison neutre. a href="https://www.orcarouter.ai/">OrcaRouter/a> expose V4 Flash avec une marge de 0 % via un point de terminaison unique compatible OpenAI (code>deepseek/deepseek-v4-flash/code>) aux côtés de plus de 185 autres modèles — vous pouvez ainsi le comparer à GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 et Kimi K3 en un seul endroit, et acheminer chaque requête vers l'option la moins chère pour la tâche. Comme il est compatible OpenAI, adopter V4 Flash — ou cesser de l'utiliser — est un changement de configuration, pas une réintégration.

Limitations et réserves honnêtes

V4 Flash est un modèle d'efficacité, pas un produit phare : sur les raisonnements les plus difficiles, il est en retrait par rapport à V4 Pro et aux meilleurs modèles occidentaux. L'entrée est textuelle uniquement (pas de saisie d'image native). Les scores de référence ici sont rapportés par DeepSeek avec son propre harnais, donc traitez les chiffres exacts comme des indicateurs et attendez-vous à ce que les évaluations indépendantes soient un peu plus basses. Et « pas cher par token » n'est pas « pas cher par tâche » si vous laissez les boucles de raisonnement ou d'agent tourner longtemps — plafonnez l'effort de raisonnement et les itérations d'outils sur les appels simples. Validez sur votre propre charge de travail avant d'engager du trafic de production.

FAQ

Qu'est-ce que DeepSeek V4 Flash ?

Le modèle d'efficacité de DeepSeek dans la gamme V4 : un modèle de mélange d'experts (MoE) de 284B paramètres avec 13B actifs, un contexte de 1M de jetons, jusqu'à 384K de sortie, optimisé pour un travail d'agent et de codage rapide et à grand volume. Sa version officielle (build -0731) est sortie le 31 juillet 2026.

Qu'est-ce qui a changé dans la version officielle ?

L'architecture est inchangée ; il s'agit d'une mise à niveau post-entraînement qui améliore considérablement les capacités agentiques, de codage et d'appel d'outils, et ajoute la prise en charge native de l'API Responses avec l'adaptation Codex. Seule l'API Flash a été mise à niveau — V4 Pro et l'application/le web restent identiques.

Combien coûte V4 Flash ?

Environ 0,15 $ par million de jetons d’entrée et 0,29 $ par million de jetons de sortie sur OrcaRouter (marge de 0 %), avec des lectures de cache à ~0,02 $ — soit environ un tiers des 0,44 $ / 0,88 $ du V4 Pro. Les prix sont restés bas dans cette version.

À quel point V4 Flash est-il performant pour les tâches agentiques et de codage ?

DeepSeek rapporte de bons scores : Terminal-Bench 2.1 82,7, Toolathlon (vérifié) 70,3, Cybergym 76,7, DeepSWE 54,4, DSBench-FullStack 68,7 — tous des chiffres issus du harnais du fournisseur, donc vérifiez sur vos propres tâches.

Comment V4 Flash se compare-t-il à V4 Pro ?

Pro est le vaisseau amiral nettement plus grand pour le raisonnement et le codage les plus difficiles ; Flash est le palier d'efficacité à environ 1/3 du prix avec de solides capacités agentiques/de codage. Acheminez les tâches difficiles vers Pro, tout le reste vers Flash.

Quelle est la fenêtre de contexte?

Un total de 1 048 576 jetons (environ 1 M), avec jusqu'à 384 K jetons de sortie.

V4 Flash est-il multimodal ?

Non — l'entrée est textuelle uniquement. Elle prend en charge le raisonnement, l'appel d'outils et la sortie JSON.

Est-ce que V4 Flash fonctionne avec l'API Responses et Codex ?

Oui — la version -0731 ajoute la prise en charge native de l'API Responses et une adaptation spécifique à Codex, aux côtés des interfaces de type OpenAI ChatCompletions et Anthropic.

Comment utiliser V4 Flash ?

Directement via l'API de DeepSeek, ou via l'endpoint compatible OpenAI d'OrcaRouter avec une majoration de 0% (code>deepseek/deepseek-v4-flash/code>), où vous pouvez également comparer et router entre des modèles concurrents.

En résumé

La sortie officielle de DeepSeek V4 Flash conserve la formule économique et rapide et en fait un bien meilleur agent : même MoE de 284B / 13B actifs et contexte de 1M, mais post-entraîné pour un codage et une utilisation d'outils plus solides, avec prise en charge native de Responses-API et de Codex — au même tarif d'environ 0,15 $ / 0,29 $. Ce n'est pas un modèle phare et il n'est pas multimodal, mais pour la grande majorité des travaux d'agents, de codage et de documents longs, c'est l'une des meilleures options en termes de rapport qualité-prix par token en 2026. Essayez-le via un endpoint compatible OpenAI et sans marge, comme OrcaRouter, et acheminez la minorité de requêtes les plus difficiles vers un modèle phare — cette combinaison est difficile à battre sur le plan des coûts.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube