Carte de titre principale pour l'article « DeepSeek V4 Pro Benchmarks » : un tableau de scores avec une grande jauge, gros titre « DeepSeek V4 Pro — la fiche de scores des benchmarks », sous-titre « Scores officiels 0813, vérifications indépendantes et ce qui reste non reproduit », et des badges indiquant « TERMINAL-BENCH 2.1: 87.9 », « DEEPSWE: 62.7 », « AA INDEX: 53 », « 1M CONTEXT ». Logo OrcaRouter incrusté en bas à droite.
Guides & Insights

Benchmarks DeepSeek V4 Pro : le scorecard complet 0813, chaque vérification indépendante, et ce que personne n'a encore vérifié

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La réponse en une ligne : DeepSeek V4 Pro affiche un scorecard agentique réellement solide sur la base des chiffres de Deep​Seek lui-même — Terminal-Bench 2.1 à 87,9, DeepSWE à 62,7, CyberGym à 83,3 — mais presque tous les chiffres clés sont rapportés par le fournisseur, et le tableau indépendant est moins flatteur.Artificial Analysis place la build officielle 0813 à 53 sur son Intelligence Index, à égalité avec GLM 5.2, quatre points derrière GPT-5.6 Terra et sept derrière Kimi K3 ; Vals AI la classe 12e, sous le GPT-5.5 de la génération précédente. Cet article est l'agrégation complète que personne d'autre n'a écrite : le scorecard 0813 complet, l'ensemble de codage étendu du rapport technique, toutes les vérifications indépendantes existantes, et un registre honnête des chiffres qui ont été reproduits et de ceux qui ne reposent encore que sur la parole de Deep​Seek. Une semaine après la publication de la fiche, le tableau du serving commence aussi à se remplir — le 19 août 2026, LMSYS et Ant Group ont publié une pile de serving H20 qui atteint 271 tokens de sortie/s à une taille de lot de 1, couverte dans sa propre section ci-dessous et, comme tout ce qui provient du vendeur sur cette page, classée comme auto-déclarée jusqu'à ce que quelqu'un la reproduise.

Le tableau de bord officiel 0813 — les chiffres de Deep​Seek, tous.

L'annonce officielle de Deep​Seek (documentation API, news260813, 13 août 2026) fait état de la version de production par rapport à l'aperçu d'avril. Tous les chiffres de cette section proviennent du fournisseur — aucun n'a été reproduit de manière indépendante au 16 août 2026.

• Terminal-Bench 2.1 — 87,9 (aperçu : 72,1).

• DeepSWE — 62.7 (aperçu : 12.8) — soit un bond d'environ 5x, qui est l'affirmation la plus frappante de la fiche.

• CyberGym — 83,3 (aperçu : 52,7).

• Humanity's Last Exam — 42.7 sans outils, 60.0 avec outils (aperçu : 37.7 / 48.2).

• Toolathlon-Verified — 74,1 (aperçu : 55,9).

• AutomationBench (public) — 31,8 (aperçu : 12,8).

• DSBench-FullStack — 71,1 ; DSBench-Hard — 67,2 (aperçu : 41,8 / 31,1).

• NL2Repo — 61.5 (aperçu : 38.5).

• Agents' Last Exam — 25,7 (aperçu : 16,5).

Le schéma à remarquer est celui de la concentration des gains : les benchmarks agentiques et de cybersécurité. C'est exactement le type de tableau de bord qu'un laboratoire produit lorsqu'il veut promouvoir un modèle d'agent — et exactement le type qui nécessite une nouvelle exécution neutre avant d'y consacrer de l'argent de production.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

L'ensemble de codage étendu du rapport technique de DeepSeek

Au-delà de la carte agentique, le rapport technique Deep​Seek (tel qu'agrégé par BenchLM le 16 août 2026) ajoute un ensemble plus large de codage et de contexte long. Également déclaré par le fournisseur, et étiqueté « Provider exact » par BenchLM — aucun test indépendant :

• SWE-bench Verified — 80,6 % ; SWE-bench Pro — 55,4 %.

• LiveCodeBench Pass@1-CoT — 93.5 % — le meilleur vérifié dans le catalogue de BenchLM.

• Rating Codeforces — 3206 — également le meilleur vérifié du catalogue.

• BrowseComp — 83,4 % ; Terminal-Bench 2.0 — 67,9 %.

• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — tous deux les meilleurs du catalogue en matière de récupération sur 1M de jetons, ce qui importe pour un modèle qui annonce une fenêtre de contexte de 1M de jetons.

• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (répertorié sur la page du modèle OrcaRouter).

Ce que les évaluateurs indépendants mesurent réellement

Trois sources indépendantes ont exécuté DeepSeek V4 Pro, et leurs verdicts se regroupent sous la fiche du fournisseur :

• Artificial Analysis Intelligence Index — 53 (reportage de SCMP, août 2026 ; la page modèle d'OrcaRouter affiche 53,2, classé 20e sur 132). À égalité avec GLM 5.2, quatre points derrière GPT-5.6 Terra, sept derrière Kimi K3.

• Artificial Analysis Coding — 68.8, classé 24e sur 130 (d'après la page du modèle OrcaRouter).

• Vals AI Index — 12e, derrière le GPT-5.5 de la génération précédente et bien loin derrière Kimi K3 et Claude Opus 5 (SCMP). Les propres tests de Vals AI ont mis en évidence deux points faibles concrets : accomplir des tâches dans un environnement de terminal sandboxé, et construire des modèles financiers complexes dans des feuilles de calcul Excel.

• Vibe Code Bench v1.1 — 49.93 (Vals AI, la seule exécution indépendante « Benchmark exact » de l’ensemble).

Le grand livre honnête — ce qui a été reproduit vs ce qui n'est encore que la parole de Deep​Seek

C'est la section qu'un article de référence a pour but de fournir, et la raison pour laquelle vous devriez mettre cette page en favori plutôt que la couverture du lancement. Répartissez chaque score dans l'un des deux groupes :

• De source indépendante : AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI rank 12e, Vibe Code Bench 49.93 — et un run Terminal-Bench 2.1 issu d'une source distincte, de 78.7 qui figure aux côtés du 87.9 de Deep​Seek sur la page du modèle d'OrcaRouter. Cet écart de neuf points entre le chiffre du fournisseur et un run indépendant est la donnée la plus importante de cette page : c'est l'écart de reproduction, quantifié.

• Uniquement rapporté par le fournisseur, non reproduit indépendamment : tous les chiffres de la carte officielle 0813 ci-dessus (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) et l'intégralité de l'ensemble de codage étendu (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Les propres documents de Deep​Seek qualifient la valeur Terminal-Bench 2.1 d'« exécution par le fournisseur ».

Lu de cette manière, l'histoire est cohérente : DeepSeek V4 Pro est un véritable modèle frontalier de milieu de peloton — AA 53, classé dans les rangs 13 à 29 — avec un tableau de bord du fournisseur qui revendique des performances agentiques et de codage proches du sommet. Les deux affirmations sont vraies et ne sont pas en conflit ; l'une est mesurée, l'autre est revendiquée.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Ce que coûte le scorecard

DeepSeek V4 Pro est le modèle phare MoE de 1,6T au total / 49B actifs, avec une fenêtre de contexte de 1M de jetons et une sortie maximale de 384K. Sur OrcaRouter, il est proposé au prix catalogue de Deep​Seek, sans aucune majoration : $0,435 par million de jetons d’entrée et $0,87 par million de jetons de sortie (lecture du cache : $0,060 par million), selon l’annuaire consulté le 15 août 2026 et confirmé sur la page du modèle en ligne. À ce tarif, le calcul du prix par point est l’argument le plus fort en faveur du modèle : son prix de sortie ne représente qu’environ un dixième de celui des modèles qui obtiennent des scores proches du sien sur l’indice indépendant, si bien que vous payez un prix de milieu de gamme pour un palmarès qui, si les affirmations du fournisseur se confirment, se situe près du sommet. Un point de vigilance : Deep​Seek a annoncé un barème de prix heures pleines/heures creuses (heures creuses à 50 % du prix des heures pleines) à compter du 17 août, heure de Pékin, le tarif peut donc évoluer — les chiffres mentionnés ici correspondent au prix catalogue en vigueur à la date de cet article.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

Service DeepSeek V4 Pro : 271 jetons de sortie/s sur H20

Les benchmarks évaluent ce que le modèle sait ; les chiffres de serving évaluent, eux, à quel prix on peut le faire penser. Le 19 août 2026, LMSYS — l'organisation à l'origine de Chatbot Arena — et l'équipe open-source d'Ant Group ont publié le premier travail sérieux de serving sur la build 0813 : une « pile de serving spécifique au scénario » construite sur SGLang, le moteur open-source que LMSYS maintient. Le chiffre clé est 271 tokens/s en sortie avec un batch de taille 1 sur un NVIDIA H20, que l'équipe estime à 1,42× par rapport à un B300 — atteint sur une puce sans Tensor Cores FP4 natifs. Il s'agit des mesures de LMSYS et d'Ant Group eux-mêmes, annoncées dans leur blog et sur X ; aucune n'a été reproduite de manière indépendante.

Le reste des chiffres de la pile, tous auto-déclarés par LMSYS et Ant Group sur leur propre pile :

• Latence de décodage — un composant « optimized DSpark » réduit le temps par jeton de sortie (TPOT) de 74,8 à 78,0 % avec une taille de lot de 1.

• Prefill — un prefill d’un million de jetons s’effectue en 43,7 secondes, soit un gain de débit de prefill de 36,5 % en moyenne géométrique.

• Cache KV — un mécanisme que l'équipe appelle « Humming MXFP4AFP8 + Online C128 » — multiplie par 10,14 la capacité du cache KV complet, le levier qui rend viables les charges de travail d'agents à 1 M de jetons sur cette classe de silicium.

• Décodage par GPU — avec un contexte de 4K, le débit de décodage par GPU passe de 319,9 à 703,2 tokens/s/GPU, soit une amélioration de 2,20×.

Lisez les mises en garde avant de dimensionner une flotte sur cette base. La taille de lot 1 correspond au régime monoflux — ce qu’un agent interactif ou un chat rencontre, pas une API à haute concurrence — et la comparaison de 1.42× par rapport au B300 est un ratio que LMSYS avance sans publier les tokens/s absolus du B300, donc l’écart est affirmé, pas vérifiable. Le résultat mesure aussi la pile, pas la puce : ces gains proviennent d’une optimisation au niveau SGLang sur du matériel qui, autrement, semblerait sous-dimensionné pour un MoE de 1.6T au total. Pour contexte, la page du modèle en direct d’OrcaRouter mesure DeepSeek V4 Pro à 80.8 tokens/s en sortie via un endpoint API partagé — le chiffre du H20 est un benchmark monoflux sur une pile dédiée, un nombre différent avec une signification différente.

Si votre charge de travail est servie via une API, rien de tout cela ne change la façon dont vous appelez le modèle : DeepSeek V4 Pro est une clé compatible OpenAI sur OrcaRouter au prix catalogue de Deep​Seek, avec bascule automatique si le fournisseur ralentit. Les chiffres H20 importent surtout si vous êtes l'équipe qui évalue une flotte H20 auto-hébergée par rapport au paiement de l'API — l'écart que les travaux de LMSYS et d'Ant Group comblent concerne une décision d'achat de matériel, et non un choix de modèle.

Quand cette recommandation est erronée

Les cas honnêtes où DeepSeek V4 Pro ne devrait pas être votre choix :

• Vous avez besoin d'un raisonnement de pointe confirmé de manière indépendante.AA Index 53 est en milieu de peloton — Kimi K3 (60) et GPT-5.6 Terra (57) sont en tête et vérifiés. Si votre décision dépend du plafond mesuré, la fiche du fournisseur n'y change rien.

• Vous pariez votre production sur DeepSWE 62.7 avant qu'une autre personne ne le réexécute. Un passage de 12.8 à 62.7 en une seule version est une affirmation, pas un fait. Attendez une reproduction neutre — l'écart de 87.9 contre 78.7 sur Terminal-Bench montre ce que l'on pourrait trouver.

• Votre charge de travail est l'automatisation de terminaux sandboxés ou la modélisation financière Excel. Vals AI affirme que c'est exactement là où le modèle éprouve des difficultés, indépendamment de tout score de fournisseur.

• Vous prenez une décision en matière de cybersécurité sur la base de CyberGym 83.3. C'est DeepSeek qui teste son propre modèle sur son propre benchmark — un fournisseur de sécurité qui s'appuie sur ce chiffre achète des données non auditées.

• Vous achetez des H20s sur la seule base du chiffre de 271 tokens/s. Ce chiffre est un benchmark auto-déclaré sur une seule pile, avec une taille de lot de 1 — prometteur, non répliqué, et un point sur une courbe de coûts qui inclut aussi l’utilisation, la puissance, et la pile de service que vous feriez réellement tourner.

L'essentiel

DeepSeek V4 Pro 0813 est un véritable modèle de pointe avec un tableau de bord fournisseur qui dépasse son bilan indépendant. La version 0813 a transformé un aperçu textuel en un concurrent agentique sérieux — nous avons couvert la sortie elle-même séparément — et si vous souhaitez l'évaluer aujourd'hui, c'est une clé compatible OpenAI sur OrcaRouter au prix catalogue de Deep​Seek, avec bascule automatique en cas de défaillance du fournisseur. Il suffit de lire le tableau de bord comme le découpe cet article : les contrôles indépendants (AA 53, Vals 12e, le run Terminal-Bench à 78,7) sont ce à quoi vous pouvez faire confiance aujourd'hui ; les 87,9 et 62,7 sont ce que vous devez vérifier avant de construire dessus. La même discipline s'étend désormais au service : les 271 jetons de sortie/s sur H20 de LMSYS et Ant Group sont la meilleure image de débit dont nous disposons, et ce n'est encore que leur parole jusqu'à ce qu'un test neutre le confirme. Achetez-le pour son rapport qualité-prix et son contexte de 1M de jetons, pas pour les chiffres des gros titres non reproduits.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement