
Benchmarks DeepSeek V4 Pro : le scorecard complet 0813, chaque vérification indépendante, et ce que personne n'a encore vérifié
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 143 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
La réponse en une ligne : DeepSeek V4 Pro affiche un scorecard agentique réellement solide sur la base des chiffres de DeepSeek lui-même — Terminal-Bench 2.1 à 87,9, DeepSWE à 62,7, CyberGym à 83,3 — mais presque tous les chiffres clés sont rapportés par le fournisseur, et le tableau indépendant est moins flatteur.Artificial Analysis place la build officielle 0813 à 53 sur son Intelligence Index, à égalité avec GLM 5.2, quatre points derrière GPT-5.6 Terra et sept derrière Kimi K3 ; Vals AI la classe 12e, sous le GPT-5.5 de la génération précédente. Cet article est l'agrégation complète que personne d'autre n'a écrite : le scorecard 0813 complet, l'ensemble de codage étendu du rapport technique, toutes les vérifications indépendantes existantes, et un registre honnête des chiffres qui ont été reproduits et de ceux qui ne reposent encore que sur la parole de DeepSeek. Une semaine après la publication de la fiche, le tableau du serving commence aussi à se remplir — le 19 août 2026, LMSYS et Ant Group ont publié une pile de serving H20 qui atteint 271 tokens de sortie/s à une taille de lot de 1, couverte dans sa propre section ci-dessous et, comme tout ce qui provient du vendeur sur cette page, classée comme auto-déclarée jusqu'à ce que quelqu'un la reproduise.
Le tableau de bord officiel 0813 — les chiffres de DeepSeek, tous.
L'annonce officielle de DeepSeek (documentation API, news260813, 13 août 2026) fait état de la version de production par rapport à l'aperçu d'avril. Tous les chiffres de cette section proviennent du fournisseur — aucun n'a été reproduit de manière indépendante au 16 août 2026.
• Terminal-Bench 2.1 — 87,9 (aperçu : 72,1).
• DeepSWE — 62.7 (aperçu : 12.8) — soit un bond d'environ 5x, qui est l'affirmation la plus frappante de la fiche.
• CyberGym — 83,3 (aperçu : 52,7).
• Humanity's Last Exam — 42.7 sans outils, 60.0 avec outils (aperçu : 37.7 / 48.2).
• Toolathlon-Verified — 74,1 (aperçu : 55,9).
• AutomationBench (public) — 31,8 (aperçu : 12,8).
• DSBench-FullStack — 71,1 ; DSBench-Hard — 67,2 (aperçu : 41,8 / 31,1).
• NL2Repo — 61.5 (aperçu : 38.5).
• Agents' Last Exam — 25,7 (aperçu : 16,5).
Le schéma à remarquer est celui de la concentration des gains : les benchmarks agentiques et de cybersécurité. C'est exactement le type de tableau de bord qu'un laboratoire produit lorsqu'il veut promouvoir un modèle d'agent — et exactement le type qui nécessite une nouvelle exécution neutre avant d'y consacrer de l'argent de production.

L'ensemble de codage étendu du rapport technique de DeepSeek
Au-delà de la carte agentique, le rapport technique DeepSeek (tel qu'agrégé par BenchLM le 16 août 2026) ajoute un ensemble plus large de codage et de contexte long. Également déclaré par le fournisseur, et étiqueté « Provider exact » par BenchLM — aucun test indépendant :
• SWE-bench Verified — 80,6 % ; SWE-bench Pro — 55,4 %.
• LiveCodeBench Pass@1-CoT — 93.5 % — le meilleur vérifié dans le catalogue de BenchLM.
• Rating Codeforces — 3206 — également le meilleur vérifié du catalogue.
• BrowseComp — 83,4 % ; Terminal-Bench 2.0 — 67,9 %.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — tous deux les meilleurs du catalogue en matière de récupération sur 1M de jetons, ce qui importe pour un modèle qui annonce une fenêtre de contexte de 1M de jetons.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (répertorié sur la page du modèle OrcaRouter).
Ce que les évaluateurs indépendants mesurent réellement
Trois sources indépendantes ont exécuté DeepSeek V4 Pro, et leurs verdicts se regroupent sous la fiche du fournisseur :
• Artificial Analysis Intelligence Index — 53 (reportage de SCMP, août 2026 ; la page modèle d'OrcaRouter affiche 53,2, classé 20e sur 132). À égalité avec GLM 5.2, quatre points derrière GPT-5.6 Terra, sept derrière Kimi K3.
• Artificial Analysis Coding — 68.8, classé 24e sur 130 (d'après la page du modèle OrcaRouter).
• Vals AI Index — 12e, derrière le GPT-5.5 de la génération précédente et bien loin derrière Kimi K3 et Claude Opus 5 (SCMP). Les propres tests de Vals AI ont mis en évidence deux points faibles concrets : accomplir des tâches dans un environnement de terminal sandboxé, et construire des modèles financiers complexes dans des feuilles de calcul Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, la seule exécution indépendante « Benchmark exact » de l’ensemble).
Le grand livre honnête — ce qui a été reproduit vs ce qui n'est encore que la parole de DeepSeek
C'est la section qu'un article de référence a pour but de fournir, et la raison pour laquelle vous devriez mettre cette page en favori plutôt que la couverture du lancement. Répartissez chaque score dans l'un des deux groupes :
• De source indépendante : AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI rank 12e, Vibe Code Bench 49.93 — et un run Terminal-Bench 2.1 issu d'une source distincte, de 78.7 qui figure aux côtés du 87.9 de DeepSeek sur la page du modèle d'OrcaRouter. Cet écart de neuf points entre le chiffre du fournisseur et un run indépendant est la donnée la plus importante de cette page : c'est l'écart de reproduction, quantifié.
• Uniquement rapporté par le fournisseur, non reproduit indépendamment : tous les chiffres de la carte officielle 0813 ci-dessus (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) et l'intégralité de l'ensemble de codage étendu (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Les propres documents de DeepSeek qualifient la valeur Terminal-Bench 2.1 d'« exécution par le fournisseur ».
Lu de cette manière, l'histoire est cohérente : DeepSeek V4 Pro est un véritable modèle frontalier de milieu de peloton — AA 53, classé dans les rangs 13 à 29 — avec un tableau de bord du fournisseur qui revendique des performances agentiques et de codage proches du sommet. Les deux affirmations sont vraies et ne sont pas en conflit ; l'une est mesurée, l'autre est revendiquée.

Ce que coûte le scorecard
DeepSeek V4 Pro est le modèle phare MoE de 1,6T au total / 49B actifs, avec une fenêtre de contexte de 1M de jetons et une sortie maximale de 384K. Sur OrcaRouter, il est proposé au prix catalogue de DeepSeek, sans aucune majoration : $0,435 par million de jetons d’entrée et $0,87 par million de jetons de sortie (lecture du cache : $0,060 par million), selon l’annuaire consulté le 15 août 2026 et confirmé sur la page du modèle en ligne. À ce tarif, le calcul du prix par point est l’argument le plus fort en faveur du modèle : son prix de sortie ne représente qu’environ un dixième de celui des modèles qui obtiennent des scores proches du sien sur l’indice indépendant, si bien que vous payez un prix de milieu de gamme pour un palmarès qui, si les affirmations du fournisseur se confirment, se situe près du sommet. Un point de vigilance : DeepSeek a annoncé un barème de prix heures pleines/heures creuses (heures creuses à 50 % du prix des heures pleines) à compter du 17 août, heure de Pékin, le tarif peut donc évoluer — les chiffres mentionnés ici correspondent au prix catalogue en vigueur à la date de cet article.

Service DeepSeek V4 Pro : 271 jetons de sortie/s sur H20
Les benchmarks évaluent ce que le modèle sait ; les chiffres de serving évaluent, eux, à quel prix on peut le faire penser. Le 19 août 2026, LMSYS — l'organisation à l'origine de Chatbot Arena — et l'équipe open-source d'Ant Group ont publié le premier travail sérieux de serving sur la build 0813 : une « pile de serving spécifique au scénario » construite sur SGLang, le moteur open-source que LMSYS maintient. Le chiffre clé est 271 tokens/s en sortie avec un batch de taille 1 sur un NVIDIA H20, que l'équipe estime à 1,42× par rapport à un B300 — atteint sur une puce sans Tensor Cores FP4 natifs. Il s'agit des mesures de LMSYS et d'Ant Group eux-mêmes, annoncées dans leur blog et sur X ; aucune n'a été reproduite de manière indépendante.
Le reste des chiffres de la pile, tous auto-déclarés par LMSYS et Ant Group sur leur propre pile :
• Latence de décodage — un composant « optimized DSpark » réduit le temps par jeton de sortie (TPOT) de 74,8 à 78,0 % avec une taille de lot de 1.
• Prefill — un prefill d’un million de jetons s’effectue en 43,7 secondes, soit un gain de débit de prefill de 36,5 % en moyenne géométrique.
• Cache KV — un mécanisme que l'équipe appelle « Humming MXFP4AFP8 + Online C128 » — multiplie par 10,14 la capacité du cache KV complet, le levier qui rend viables les charges de travail d'agents à 1 M de jetons sur cette classe de silicium.
• Décodage par GPU — avec un contexte de 4K, le débit de décodage par GPU passe de 319,9 à 703,2 tokens/s/GPU, soit une amélioration de 2,20×.
Lisez les mises en garde avant de dimensionner une flotte sur cette base. La taille de lot 1 correspond au régime monoflux — ce qu’un agent interactif ou un chat rencontre, pas une API à haute concurrence — et la comparaison de 1.42× par rapport au B300 est un ratio que LMSYS avance sans publier les tokens/s absolus du B300, donc l’écart est affirmé, pas vérifiable. Le résultat mesure aussi la pile, pas la puce : ces gains proviennent d’une optimisation au niveau SGLang sur du matériel qui, autrement, semblerait sous-dimensionné pour un MoE de 1.6T au total. Pour contexte, la page du modèle en direct d’OrcaRouter mesure DeepSeek V4 Pro à 80.8 tokens/s en sortie via un endpoint API partagé — le chiffre du H20 est un benchmark monoflux sur une pile dédiée, un nombre différent avec une signification différente.
Si votre charge de travail est servie via une API, rien de tout cela ne change la façon dont vous appelez le modèle : DeepSeek V4 Pro est une clé compatible OpenAI sur OrcaRouter au prix catalogue de DeepSeek, avec bascule automatique si le fournisseur ralentit. Les chiffres H20 importent surtout si vous êtes l'équipe qui évalue une flotte H20 auto-hébergée par rapport au paiement de l'API — l'écart que les travaux de LMSYS et d'Ant Group comblent concerne une décision d'achat de matériel, et non un choix de modèle.
Quand cette recommandation est erronée
Les cas honnêtes où DeepSeek V4 Pro ne devrait pas être votre choix :
• Vous avez besoin d'un raisonnement de pointe confirmé de manière indépendante.AA Index 53 est en milieu de peloton — Kimi K3 (60) et GPT-5.6 Terra (57) sont en tête et vérifiés. Si votre décision dépend du plafond mesuré, la fiche du fournisseur n'y change rien.
• Vous pariez votre production sur DeepSWE 62.7 avant qu'une autre personne ne le réexécute. Un passage de 12.8 à 62.7 en une seule version est une affirmation, pas un fait. Attendez une reproduction neutre — l'écart de 87.9 contre 78.7 sur Terminal-Bench montre ce que l'on pourrait trouver.
• Votre charge de travail est l'automatisation de terminaux sandboxés ou la modélisation financière Excel. Vals AI affirme que c'est exactement là où le modèle éprouve des difficultés, indépendamment de tout score de fournisseur.
• Vous prenez une décision en matière de cybersécurité sur la base de CyberGym 83.3. C'est DeepSeek qui teste son propre modèle sur son propre benchmark — un fournisseur de sécurité qui s'appuie sur ce chiffre achète des données non auditées.
• Vous achetez des H20s sur la seule base du chiffre de 271 tokens/s. Ce chiffre est un benchmark auto-déclaré sur une seule pile, avec une taille de lot de 1 — prometteur, non répliqué, et un point sur une courbe de coûts qui inclut aussi l’utilisation, la puissance, et la pile de service que vous feriez réellement tourner.
L'essentiel
DeepSeek V4 Pro 0813 est un véritable modèle de pointe avec un tableau de bord fournisseur qui dépasse son bilan indépendant. La version 0813 a transformé un aperçu textuel en un concurrent agentique sérieux — nous avons couvert la sortie elle-même séparément — et si vous souhaitez l'évaluer aujourd'hui, c'est une clé compatible OpenAI sur OrcaRouter au prix catalogue de DeepSeek, avec bascule automatique en cas de défaillance du fournisseur. Il suffit de lire le tableau de bord comme le découpe cet article : les contrôles indépendants (AA 53, Vals 12e, le run Terminal-Bench à 78,7) sont ce à quoi vous pouvez faire confiance aujourd'hui ; les 87,9 et 62,7 sont ce que vous devez vérifier avant de construire dessus. La même discipline s'étend désormais au service : les 271 jetons de sortie/s sur H20 de LMSYS et Ant Group sont la meilleure image de débit dont nous disposons, et ce n'est encore que leur parole jusqu'à ce qu'un test neutre le confirme. Achetez-le pour son rapport qualité-prix et son contexte de 1M de jetons, pas pour les chiffres des gros titres non reproduits.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
