
Benchmarks de DeepSeek V4.1 Flash : ce que 74.2 prouve et ne prouve pas
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 984 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 195 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
DeepSeek V4.1 Flash a obtenu 74,2 sur DeepSWE v1.1, soit un dixième de point au-dessus de GPT-6 Astra, un demi-point au-dessus de Gemini 3.8 Flash et de Claude Opus 5, et ce chiffre a été cité toute la semaine comme un changement de garde. Il vaut la peine d’être précis sur ce qu’il est réellement. Le modèle lui-même n’est pas nouveau — DeepSeek V4.1 Flash est passé en disponibilité générale le 2026-09-10, il y a six jours — donc rien ici n’est un lancement. Ce qui est arrivé dans cette fenêtre, c’est la couche de mesure : les premières entrées d’index indépendantes, le premier résultat d’arène indépendant, la prise en charge du service dès le jour 0 sur trois piles, et la décision d’un fournisseur de retirer son propre modèle phare au profit de celui-ci. Cette page est un récapitulatif de ce qui a réellement été mesuré, avec la source indiquée pour chaque chiffre, et un constat clair de ce que personne n’a encore établi.
Le score DeepSWE, et les quatre modèles à moins d’un demi-point de celui-ci
DeepSWE v1.1 est un benchmark d'ingénierie logicielle à long horizon de Datacurve — 113 tâches originales réparties sur 91 dépôts open source et cinq langages de programmation, construit autour de modifications multi-fichiers et de la correction comportementale. Sur la fiche modèle de DeepSeek elle-même, le tableau rapporté par le fournisseur indique : DeepSeek V4.1 Flash 74,2, Claude Opus 5 74,0, GPT-5.6 Sol 73,0, Kimi K3 67,5, GLM-5.3 66,9, DeepSeek V4-Pro-0813 62,7, DeepSeek V4-Flash 54,4.
Le classement indépendant pour le même benchmark ne reproduit pas cet ordre, et les écarts importent davantage que le résultat principal. Le classement Pass@1 DeepSWE v1.1 de Datacurve place Muse Spark 1.3 (FAIR) en tête à 75,40, devant DeepSeek V4.1 Flash à 74,20. Derrière : GPT-6 Astra à 74,12 (extra high) et 74,10 (max), Gemini 3.8 Flash à 73,83 (high), Claude Opus 5 à 73,65 (max).
Donc le 74,2 est une entrée réelle sur un véritable classement tiers, et il est deuxième, pas premier. L'affirmation qui a circulé le jour de la sortie — selon laquelle c'est l'état de l'art sur DeepSWE — ne résiste pas au contact du classement qui porte ce score. Muse Spark 1.3 a 1,2 point d'avance.
Voici maintenant la partie que l'on passe sous silence. Quatre modèles de pointe se tiennent à moins de 0,55 point les uns des autres sur ce benchmark : 74,20, 74,12, 73,83, 73,65. C'est une fourchette plus étroite que le bruit de mesure. La variation publiée d'une exécution à l'autre sur DeepSWE est de l'ordre de 1,4 à 3,2 points — soit trois à six fois l'ampleur de tout l'écart du quatuor de tête. Une avance de 0,2 point sur GPT-6 Astra n'est pas un résultat ; c'est à quoi ressemble une égalité quand on l'affiche à deux décimales.
La sensibilité au scaffold est la deuxième raison de considérer ce chiffre avec prudence, et ici, la documentation du fournisseur lui-même en apporte la preuve. DeepSeek rapporte DeepSWE sur huit scaffolds dans les mêmes documents de publication. Le 74,2 a été obtenu sur mini-SWE. Le même modèle a obtenu 72,6 sur DSH Minimal, 70,5 sur DSH Standard, 69,8 sur Claude Code, 67,6 sur DSH PTC, 66,2 sur Pi, 65,6 sur Codex et 65,5 sur OpenCode. Cela représente un écart de 8,7 points sur un seul modèle et un seul benchmark, uniquement dû au harnais qui l’entoure. Quiconque compare un chiffre DeepSeek produit sur mini-SWE à celui d’un concurrent produit sur une boucle d’agent différente compare des scaffolds, pas des modèles.
Où l'index indépendant le place réellement
Artificial Analysis exécute une suite fixe à des paramètres d'effort déclarés, ce qui fait de son Intelligence Index le contrôle externe le plus propre disponible. Sur la page du modèle DeepSeek V4.1 Flash, à l'effort de raisonnement maximal, l'indice affiche 40 — classé n°6 sur 113 modèles de cette classe, contre une médiane de classe de 18. Les rivaux fermés se situent au-dessus : Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. Le précédent fleuron de DeepSeek lui-même, V4-Pro-0813, se situe en dessous, à 36.
Lisez les deux tableaux de scores côte à côte et le désaccord est structurel, pas une erreur. Sur le benchmark choisi par DeepSeek, avec le bon échafaudage, le modèle égale la frontière. Sur une suite externe fixe moyennée sur le raisonnement, le codage, les mathématiques et le travail agentique, il est à onze points derrière Claude Opus 5 et à un point derrière Gemini 3.8 Flash. Les deux peuvent être vrais. Un tableau de fournisseur est un argument ; un indice est une moyenne.
La page d'index présente aussi deux chiffres qui comptent pour une décision de routage et font rarement les gros titres. DeepSeek V4.1 Flash tourne à 214,4 jetons de sortie par seconde à effort maximal — rapide. Il a aussi généré 250 M de jetons de sortie pour compléter l'Intelligence Index, contre une médiane de 140 M, ce qu'Artificial Analysis signale comme nettement verbeux. La verbosité n'est pas un problème de qualité ; c'est une facture. Un modèle qui réfléchit en 79 % de jetons de plus que ses pairs rend une partie de son avantage tarifaire à chaque appel de raisonnement long.

ProgramBench : un score obtenu avec un modèle unique et un score obtenu avec un système multi-agents ne constituent pas la même mesure.
Voici le nombre le plus susceptible d'être mal lu, il vaut donc la peine de le séparer avec soin.
• Modèle unique, configuration standard — DeepSeek V4.1 Flash obtient 20,3 sur ProgramBench (Almost@1), selon la fiche modèle de DeepSeek elle-même. C'est en dessous de GPT-5.6 Sol à 23,0 et bien en dessous de Claude Opus 5 à 37,0, et seulement légèrement au-dessus de GLM-5.3 à 19,0 et Kimi K3 à 17,5. Rapporté par le fournisseur, et cela ne flatte pas le modèle.
• Configuration d'équipe multi-agents — le rapport technique de DeepSeek, DeepSeek-V4.1-Flash : repousser les limites de la compression du cache KV, décrit une recette préliminaire d'Agent Swarm RL dans laquelle un agent principal coordonne ses coéquipiers via un tableau de tâches partagé. Sur un sous-ensemble ProgramBench à haute confiance de 172 tâches — des tâches où la solution de référence réussit à 95 % ou mieux — la configuration multi-agents passe de 13,59 % à une échéance d'une heure à un pic de 30,04 % à huit heures, tandis que la référence mono-agent passe de 12,79 % à 20,39 %.
Le 30,04 % est la source de l'affirmation « 30 % », et il ne s'agit pas d'un score d'un seul modèle. C'est une équipe d'agents disposant de huit heures, évaluée sur un sous-ensemble filtré, dans l'évaluation préliminaire du fournisseur lui-même. La comparaison qu'elle invite — « bien au-dessus d'un Sol seul, presque 2x Kimi K3 » — est arithmétiquement juste face aux 23,0 de Sol et aux 17,5 de K3, et c'est aussi une comparaison entre une configuration multi-agents et des références à modèle unique sur un ensemble de tâches différent. Le même rapport montre l'effet sur FrontierSWE v2 : le multi-agents atteint 32,90 % à vingt heures contre 28,20 % pour l'agent unique. L'écart est réel, il se réduit à mesure que l'échéance s'allonge, et le coût en tokens pour l'obtenir n'est pas négligeable — un compte rendu pratique rapporte plus de 10x les tokens et des temps d'exécution approchant quatre heures.
Le nombre de paramètres n’est pas encore arrêté, alors considérez toute comparaison de taille comme provisoire.
Les notes de version de DeepSeek décrivent un « MoE de 552 milliards de paramètres ». C’est le chiffre du fournisseur, et c’est ce que la plupart des articles reprennent. Ce n’est pas non plus tout l’artefact.
La fiche de modèle de DeepSeek elle-même documente un second composant aux côtés du backbone transformer : « mémoire conditionnelle Engram (196B paramètres, accédée de façon éparse via une recherche basée sur les tokens) ». Additionnez les deux et vous obtenez 748B. C’est l’arithmétique derrière l’interprétation de la communauté qui a circulé sur r/LocalLLaMA dans les heures suivant la sortie, et l’index safetensors de la fiche de modèle elle-même répertorie 763B paramètres répartis entre ses types de tenseurs. Le chiffre d’environ 510 GB en FP8 provient de la même lignée d’analyse : ce que vous téléchargez et conservez réellement en mémoire.
La réconciliation tient au fait que ces chiffres comptent des choses différentes. 552B est la colonne vertébrale computationnelle — les paramètres à travers lesquels passe un token. 196B est une table de correspondance consultée à des couches spécifiques, qui renvoie des informations stockées plutôt que de calculer sur celles-ci. 8B et 16B, les chiffres d’activation cités par DeepSeek, sont les tranches par token actives pendant le préremplissage et le décodage, respectivement. Les quatre nombres décrivent le même modèle.
Rien de tout cela ne rend la comparaison sûre. Toute affirmation de la forme « ce modèle égale un modèle de pointe pour une fraction de la taille » repose sur un titre de fournisseur qui exclut un cinquième de l’artefact. Tant que personne ne publie une comptabilisation reproductible des paramètres, les arguments fondés sur la taille devraient inclure la mise en garde directement dans le texte.
ARC-AGI : aucun résultat pour ce modèle
Il n'existe aucun score ARC-AGI-2 ni ARC-AGI-1 pour DeepSeek V4.1 Flash. La page des résultats vérifiés d'ARC Prize ne comporte aucune entrée pour ce checkpoint, et le propre tableau de référence de DeepSeek ne contient aucune ligne ARC. Le seul résultat DeepSeek vérifié par ARC Prize concerne l'ancien checkpoint V4 Flash 0731 — 61,4 % sur ARC-AGI-2 semi-private à effort de raisonnement maximal et 89,0 % sur ARC-AGI-1, à 0,04 $ et 0,02 $ par tâche respectivement. Ce sont les chiffres du prédécesseur sur un modèle différent, et les citer comme résultats de V4.1 Flash serait erroné. Si l'ARC-AGI compte pour votre évaluation, ce modèle n'a actuellement pas de score.
Qu’est-ce qui d’autre a atterri à l’intérieur de la fenêtre ?
Trois choses ont changé pour un lecteur qui cherche à décider s'il doit essayer ce modèle, et aucune d'entre elles n'est la sortie du modèle lui-même.
• Résultat indépendant de l'arène.OpenDesign Arena a soumis treize modèles à des tâches de design identiques — applications web, tableaux de bord, écrans mobiles, pages de destination. DeepSeek V4.1 Flash a obtenu 81,2 sur 100 contre 82,7 pour GPT-6 Astra, à 0,023 $ par design finalisé contre 1,61 $, et a terminé en 5,3 minutes contre 11,1. Le taux de livraison — des livrables utilisables sans révision — s'élevait à 57,7 % contre 60 % pour Astra. Il s'agit de l'une des premières mesures véritablement indépendantes du modèle, et elle mesure spécifiquement la production de design, pas le raisonnement général ni la programmation.
• Prise en charge du serving Day-0 sur trois stacks. vLLM a publié une image day-0 (2026-09-09) validée sur du matériel NVIDIA et AMD. SGLang et Miles ont publié le 2026-09-10 une prise en charge day-0 pour l’inférence et le RL, incluant un chemin de déport d’hôte Engram qui a augmenté la capacité du cache KV de 36 % sur 4x GB300 et une optimisation de rejeu borné qui a augmenté le débit de prefill de 1,56x sur 8x H200. Cambricon a annoncé le jour même l’adaptation Day-0 sur la stack vLLM. Pour un modèle dont l’argument de vente est une compression agressive du cache KV — un quart de l’empreinte HBM de la génération précédente, un huitième de son SSD —, pouvoir tourner sur des stacks standard dès le premier jour fait la différence entre un résultat de laboratoire et quelque chose que l’on peut déployer.
• Le fournisseur a retiré son propre produit phare. DeepSeek abandonne progressivement V4-Pro. À partir du 2026-09-14 à 04:00 UTC, toute requête nommant « deepseek-v4-pro » est acheminée vers V4.1 Flash et facturée aux tarifs de Flash, et ce jusqu’au lancement d’un V4.1 Pro. DeepSeek V4.1 Pro n’est pas encore publié — c’est un modèle à venir, et la redirection est une mesure provisoire qui évite que les intégrations épinglées ne cassent. Également retirés : « deepseek-v4-flash » et « deepseek-v4-flash-vision-exp », tous deux temporairement acheminés vers V4.1 Flash pour compatibilité. Si vous avez un ID de modèle épinglé en production, cette redirection est le seul fait opérationnel de cette page que vous ne pouvez pas ignorer.
Ce que le prix fait à la décision
La tarification est le point où ce modèle cesse d'être une histoire de benchmark. Selon les tarifs publiés par DeepSeek lui-même, à compter du 2026-09-10 à 04:00 UTC, les heures de pointe étant définies comme 01:00–04:00 et 06:00–10:00 UTC en semaine, et tout le reste étant hors pointe.
• Heures creuses, par million de tokens — 0,003 $ en cas de lecture réussie du cache, 0,15 $ en cas d'échec du cache, 0,60 $ en sortie.
• Pic, par million de jetons — 0,006 $ en cas de succès du cache, 0,30 $ en cas d’échec du cache, 1,20 $ en sortie.
• Entrée mise en cache, comparée à un modèle fermé de pointe — trois dixièmes de centime par million contre environ cinquante centimes. Pour un agent qui boucle sur le même dépôt, ce palier concentre la plupart des tokens.
• Mesuré sur notre propre catalogue — 0,15 $ en entrée et 0,60 $ en sortie par million, 784 ms de délai médian avant le premier token, 211 tokens par seconde au cours des sept derniers jours.
Artificial Analysis répertorie le même modèle à 0,30 $ en entrée et 1,20 $ en sortie, avec une remise de 98 % sur le cache et un prix mixte de 0,18 $ par million — c’est le palier de pointe, et les deux chiffres correspondent au même prix à des moments différents de la journée. Cette distinction mérite d’être intégrée avant de comparer des fournisseurs : un modèle doté d’une grille horaire à deux paliers ne peut pas être comparé sur un seul tarif affiché.
C'est aussi pourquoi la tarification en répercussion compte plus que d'habitude ici. OrcaRouter route DeepSeek V4.1 Flash aux côtés du reste de son catalogue à 0 % de marge — prix catalogue du fournisseur, inchangé, de sorte que les paliers heures pleines et heures creuses de DeepSeek arrivent de notre côté exactement tels que DeepSeek les publie, et qu'un changement de prix du fournisseur soit effectif le jour même. Sur un modèle dont le tarif double pendant quatre heures chaque matin en semaine, une plateforme qui aplatit les paliers cache le seul chiffre dont vous aviez besoin.


Ce que personne n’a établi
La lacune dans cette histoire n’est pas un benchmark manquant. C’est qu’il n’existe aucune comparaison directe crédible entre DeepSeek V4.1 Flash et ses rivaux nommés sur un banc d’essai partagé, menée par quelqu’un n’ayant aucun intérêt dans le résultat. Chaque chiffre sur cette page est l’une de trois choses : déclaré par le fournisseur, produit par un tiers sur une configuration différente, ou une moyenne sur une suite fixe qui n’a pas été conçue pour isoler cette confrontation. Il n’y a aucune exécution où DeepSeek V4.1 Flash et GPT-6 Astra ont été évalués sur les mêmes tâches, avec le même échafaudage, le même paramètre d’effort, et publiée avec variance.
Trois choses précises changeraient la donne, et aucune d’elles n’existe aujourd’hui.
• Une comparaison DeepSWE à scaffold contrôlé. L'écart de 8,7 points entre les différents scaffolds de DeepSeek est plus important que n'importe quel écart entre les quatre meilleurs modèles du classement. Tant que la frontière n'est pas mesurée sur un seul harnais, l'ordre en tête de ce tableau n'a pas de sens.
• Une reproduction indépendante du résultat de l'équipe d'agents ProgramBench. Les 30,04 % proviennent du rapport technique du fournisseur, sur un sous-ensemble filtré de 172 tâches, dans une configuration préliminaire, avec un coût en tokens qui n'a pas été caractérisé pour des budgets de production.
• ARC-AGI.Aucun score n'existe du tout pour ce checkpoint.
La conséquence pratique est une affirmation plus restrictive que ne le laissent entendre les gros titres. DeepSeek V4.1 Flash se situe, de manière mesurable, dans la marge de bruit de la frontière sur un benchmark de codage à long horizon, est véritablement compétitif sur des tâches de conception indépendantes pour environ 1,4 % du coût, et accuse environ dix points de retard sur un indice agrégé. Cela suffit à justifier de le confronter à votre propre charge de travail et de laisser votre évaluation trancher la question. Cela ne suffit pas à justifier de réécrire une table de routage de production sur la foi de 0,2 point — et le fait que ces deux affirmations soient vraies constitue toute la conclusion.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
