Carte de titre principale pour l'article « DeepSeek V4 Pro Benchmarks » : un tableau de scores avec une grande jauge, gros titre « DeepSeek V4 Pro — la fiche de scores des benchmarks », sous-titre « Scores officiels 0813, vérifications indépendantes et ce qui reste non reproduit », et des badges indiquant « TERMINAL-BENCH 2.1: 87.9 », « DEEPSWE: 62.7 », « AA INDEX: 53 », « 1M CONTEXT ». Logo OrcaRouter incrusté en bas à droite.
Guides & Insights

Benchmarks DeepSeek V4 Pro : le scorecard complet 0813, chaque vérification indépendante, et ce que personne n'a encore vérifié

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La réponse en une ligne : DeepSeek V4 Pro affiche un scorecard agentique véritablement solide selon les chiffres de DeepSeek — Terminal-Bench 2.1 à 87,9, DeepSWE à 62,7, CyberGym à 83,3 — mais presque tous les chiffres phares sont rapportés par le fournisseur, et le tableau indépendant est plus mitigé.Artificial Analysis place la build officielle 0813 à 53 sur son Intelligence Index, à égalité avec GLM-5.2, quatre points derrière GPT-5.6 Terra et sept derrière Kimi K3 ; Vals AI la classe en 12e position, en dessous du GPT-5.5 de la génération précédente. Cet article est l'agrégation complète que personne d'autre n'a écrite : le scorecard 0813 complet, l'ensemble de codage étendu du rapport technique, toutes les vérifications indépendantes qui existent, et un bilan honnête des chiffres qui ont été reproduits et de ceux qui ne reposent encore que sur la parole de DeepSeek.

Le tableau de bord officiel 0813 — tous les chiffres de DeepSeek

L'annonce officielle de DeepSeek (documentation API, news260813, 13 août 2026) mentionne la build de production par rapport à l'aperçu d'avril. Chaque chiffre de cette section est rapporté par le fournisseur — aucun n'a été reproduit de manière indépendante au 16 août 2026 :

Terminal-Bench 2.1 — 87,9 (aperçu : 72,1).

DeepSWE — 62.7 (aperçu : 12.8) — soit un bond d'environ 5x, qui est l'affirmation la plus frappante de la fiche.

CyberGym — 83,3 (aperçu : 52,7).

Humanity's Last Exam — 42.7 sans outils, 60.0 avec outils (aperçu : 37.7 / 48.2).

Toolathlon-Verified — 74,1 (aperçu : 55,9).

AutomationBench (public) — 31,8 (aperçu : 12,8).

DSBench-FullStack — 71,1 ; DSBench-Hard — 67,2 (aperçu : 41,8 / 31,1).

NL2Repo — 61.5 (aperçu : 38.5).

Agents' Last Exam — 25,7 (aperçu : 16,5).

Le schéma à remarquer est celui de la concentration des gains : les benchmarks agentiques et de cybersécurité. C'est exactement le type de tableau de bord qu'un laboratoire produit lorsqu'il veut promouvoir un modèle d'agent — et exactement le type qui nécessite une nouvelle exécution neutre avant d'y consacrer de l'argent de production.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

L'ensemble de codage étendu du rapport technique de DeepSeek.

Au-delà de la carte agentique, le rapport technique DeepSeek (tel que compilé par BenchLM le 16 août 2026) ajoute un ensemble plus large de codage et de contexte long. Également déclaré par le fournisseur, et étiqueté « Provider exact » par BenchLM — aucun test indépendant :

SWE-bench Verified — 80,6 % ; SWE-bench Pro — 55,4 %.

LiveCodeBench Pass@1-CoT — 93.5 % — le meilleur vérifié dans le catalogue de BenchLM.

Rating Codeforces — 3206 — également le meilleur vérifié du catalogue.

BrowseComp — 83,4 % ; Terminal-Bench 2.0 — 67,9 %.

MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — tous deux les meilleurs du catalogue en matière de récupération sur 1M de jetons, ce qui importe pour un modèle qui annonce une fenêtre de contexte de 1M de jetons.

GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (répertorié sur la page du modèle OrcaRouter).

Ce que les évaluateurs indépendants mesurent réellement

Trois sources indépendantes ont exécuté DeepSeek V4 Pro, et leurs verdicts se regroupent sous la fiche du fournisseur :

Artificial Analysis Intelligence Index — 53 (reportage de SCMP, août 2026 ; la page du modèle d'OrcaRouter indique 53.2, classé 20e sur 132). À égalité avec GLM-5.2, quatre points derrière GPT-5.6 Terra, sept derrière Kimi K3.

Artificial Analysis Coding — 68.8, classé 24e sur 130 (d'après la page du modèle OrcaRouter).

Vals AI Index — 12e, derrière le GPT-5.5 de la génération précédente et bien loin derrière Kimi K3 et Claude Opus 5 (SCMP). Les propres tests de Vals AI ont mis en évidence deux points faibles concrets : accomplir des tâches dans un environnement de terminal sandboxé, et construire des modèles financiers complexes dans des feuilles de calcul Excel.

Vibe Code Bench v1.1 — 49.93 (Vals AI, la seule exécution indépendante « Benchmark exact » de l’ensemble).

Le registre honnête — ce qui a été reproduit vs ce qui n'est encore que la parole de DeepSeek.

C'est la section qu'un article de référence a pour but de fournir, et la raison pour laquelle vous devriez mettre cette page en favori plutôt que la couverture du lancement. Répartissez chaque score dans l'un des deux groupes :

Source indépendante : AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI classé 12e, Vibe Code Bench 49.93 — et un résultat Terminal-Bench 2.1 de source indépendante de 78.7 qui figure aux côtés du 87.9 de DeepSeek sur la page du modèle d'OrcaRouter. Cet écart de neuf points entre le chiffre du fournisseur et une exécution indépendante est la donnée la plus importante de cette page : c'est l'écart de reproduction, quantifié.

Signalé par le fournisseur uniquement, non reproduit indépendamment : chaque chiffre de la carte officielle 0813 ci-dessus (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) ainsi que l’ensemble du jeu de tests étendu (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). La documentation de DeepSeek elle-même qualifie le chiffre Terminal-Bench 2.1 de « exécution par le fournisseur ».

Lu de cette manière, l'histoire est cohérente : DeepSeek V4 Pro est un véritable modèle frontalier de milieu de peloton — AA 53, classé dans les rangs 13 à 29 — avec un tableau de bord du fournisseur qui revendique des performances agentiques et de codage proches du sommet. Les deux affirmations sont vraies et ne sont pas en conflit ; l'une est mesurée, l'autre est revendiquée.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Ce que coûte le scorecard

DeepSeek V4 Pro est le fleuron MoE de 1,6 T au total / 49 B actifs, avec une fenêtre de contexte de 1 M de jetons et une sortie maximale de 384 K. Sur OrcaRouter, il est proposé au prix catalogue de DeepSeek, sans aucune majoration : 0,435 $ par million de jetons d’entrée et 0,87 $ par million de jetons de sortie (lecture du cache : 0,060 $ par million), selon l’annuaire consulté le 15 août 2026 et confirmé sur la page du modèle en direct. À ce tarif, le calcul du prix par point est l’argument le plus fort en faveur du modèle : c’est environ un dixième du prix de sortie des modèles qui se classent près de lui dans l’indice indépendant, vous payez donc des prix de milieu de gamme pour une fiche de performance qui, si les affirmations du fournisseur se vérifient, se situe près du sommet. Un signal : DeepSeek a annoncé un barème de prix heures pleines/heures creuses (50 % du tarif en heures creuses) à compter du 17 août, heure de Pékin, le tarif peut donc évoluer — les chiffres ici correspondent au prix catalogue en vigueur au moment de la rédaction de cet article.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

Quand cette recommandation est erronée

Les cas honnêtes où DeepSeek V4 Pro ne devrait pas être votre choix :

Vous avez besoin d'un raisonnement de pointe confirmé de manière indépendante.AA Index 53 est en milieu de peloton — Kimi K3 (60) et GPT-5.6 Terra (57) sont en tête et vérifiés. Si votre décision dépend du plafond mesuré, la fiche du fournisseur n'y change rien.

Vous pariez votre production sur DeepSWE 62.7 avant qu'une autre personne ne le réexécute. Un passage de 12.8 à 62.7 en une seule version est une affirmation, pas un fait. Attendez une reproduction neutre — l'écart de 87.9 contre 78.7 sur Terminal-Bench montre ce que l'on pourrait trouver.

Votre charge de travail est l'automatisation de terminaux sandboxés ou la modélisation financière Excel. Vals AI affirme que c'est exactement là où le modèle éprouve des difficultés, indépendamment de tout score de fournisseur.

Vous prenez une décision de cybersécurité sur CyberGym 83.3. C'est DeepSeek qui teste son propre modèle sur son propre benchmark — un fournisseur de sécurité qui achète ce chiffre achète des données non auditées.

En résumé

DeepSeek V4 Pro 0813 est un véritable modèle de pointe avec une fiche fournisseur qui dépasse son bilan indépendant. La version 0813 a transformé un aperçu textuel en un sérieux concurrent agentique — nous avons couvert la sortie elle-même séparément — et si vous voulez l'évaluer aujourd'hui, c'est une clé compatible OpenAI sur OrcaRouter au prix catalogue de DeepSeek, avec basculement automatique si le fournisseur faiblit. Il suffit de lire la fiche comme cet article la découpe : les vérifications indépendantes (AA 53, Vals 12e, le score de 78.7 sur Terminal-Bench) sont ce à quoi vous pouvez faire confiance aujourd'hui ; les 87.9 et 62.7 sont ce que vous devriez vérifier avant de vous appuyer dessus. Achetez-le pour le rapport prix/performance et le contexte de 1 million de tokens, pas pour les chiffres vedettes non reproduits.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube