Carte de titre hero pour la comparaison « Grok 4.6 vs DeepSeek V4 Pro », sous-titrée « Une guerre des prix de pointe, menée à 24 heures d'intervalle », avec un badge « Comparatif · Août 2026 ».
Guides & Insights

Grok 4.6 vs DeepSeek V4 Pro : une guerre des prix de pointe, livrée à 24 heures d'intervalle

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux modèles de pointe sont sortis à moins de 24 heures d’intervalle, et l’écart entre leurs grilles tarifaires est le plus large produit par cette génération. Grok 4.6 a été lancé le 12 août 2026 à 2 $ par million de jetons en entrée et 6 $ par million en sortie. DeepSeek V4 Pro — la version de production officielle du produit phare de D​eepSeek, version DeepSeek-V4-Pro-0813 — a suivi le 13 août 2026 à 3 ¥ par million de jetons d’entrée hors cache et 6 ¥ par million en sortie, soit environ 0,42 $ et 0,85 $. Même catégorie, mêmes ambitions agentiques, un ordre de grandeur d’écart sur le prix. Ce n’est pas une comparaison de deux spécifications ; c’est une comparaison de deux stratégies sur ce que devrait coûter un modèle conçu pour être un agent, et les deux sont sortis cette semaine.

Cet article met les deux grilles tarifaires côte à côte, examine les déclarations de benchmark de chaque fournisseur en sachant de qui elles proviennent, et calcule ce que l'écart coûte réellement sur une charge de travail réelle — car sur le papier, ces modèles sont plus proches en capacités qu'en philosophie, et c'est dans la différence de prix par tâche que se joue la décision.

Le timing est le point.

Le fait que ces deux modèles soient sortis dans la même fenêtre de 48 heures n'est pas un accident de calendrier. Grok 4.6 est la refonte agentique par SpaceXAI de son modèle de fondation de 1,5T — une mise à jour post-entraînement fortement axée sur l'apprentissage par renforcement en matière de codage, de travail sur le noyau et de CAO, tarifée comme le carburant des produits Cursor et Grok Bot que l'entreprise possède. DeepSeek V4 Pro est la formalisation d'un aperçu qui a discrètement redéfini ce que « agentique » signifiait à une fraction du prix, désormais amélioré pour l'économie des agents : les notes de version de DeepSeek pour la build 0813 mettent en avant des capacités agentiques nettement améliorées, ajoutent la prise en charge de l'API Responses et de l'intégration Codex, et conservent les modes de réflexion (par défaut) et de non-réflexion, la sortie JSON, les appels d'outils et le format d'API Anthropic. Deux entreprises très différentes sont arrivées simultanément à la conclusion que le marché qui compte fin 2026 est celui des agents — et ont fixé le prix de leurs entrées pour des portefeuilles très différents.

Les deux listes de prix, côte à côte

Grok 4.6 — 2,00 $ / 6,00 $ / 0,50 $ (entrée en cache) par million de jetons, contexte de 500K, un palier de 4 $ / 12 $ / 1 $ au-dessus d'environ 200K jetons d'entrée, et une variante plus rapide au double du tarif de base.

DeepSeek V4 Pro — ¥3.00 (≈$0.42) l'entrée en échec de cache, ¥0.025 (≈$0.0035) l'entrée en cache, ¥6.00 (≈$0.85) la sortie par million de jetons, avec une fenêtre de contexte d'un million de jetons et jusqu'à 384K jetons de sortie. Son homologue moins cher, V4 Flash, coûte ¥1 / ¥2.

Même face à Grok 4.6 — déjà l'API frontière la moins chère de sa génération — DeepSeek V4 Pro est environ cinq fois moins cher sur l'entrée en cas de cache-miss et sept fois moins cher sur la sortie, et il apporte une fenêtre de contexte 2 fois plus grande et une sortie maximale bien plus grande au même niveau de prix. Les deux ne sont pas en concurrence sur le prix ; D​eepSeek a unilatéralement fixé un nouveau plancher et Grok est désormais l'option premium dans la même phrase. Ce cadrage compte, car le cadrage précédent — « Grok 4.6 est le modèle frontière bon marché » — n'a été vrai que pendant exactement un jour.

Two-column scoreboard: Grok 4.6 AA Index 61 (independent), $2/$6, 500K context, DeepSWE v1.1 65.9% (vendor), Terminal-Bench 26% (v3.0), cache-hit input $0.50 vs DeepSeek V4 Pro AA Index none yet, ≈$0.42/$0.85, 1M context, DeepSWE 62.7% (vendor), Terminal-Bench 87.9% (v2.1), cache-hit input ≈$0.0035.

Ce que DeepSeek V4 Pro a réellement amélioré

Les chiffres de lancement de D​eepSeek sont les plus spectaculaires, car ils sont mesurés par rapport à sa propre préversion, et le bond entre la préversion et la version finale est énorme. Selon les propres évaluations du fournisseur :

DeepSWE — 62,7 % sur la version finale, contre 12,8 % sur l’aperçu — un score de long horizon en génie logiciel que le fournisseur situe entre les 58,0 % d’Opus 4.8 et les 70,0 % de Claude Fable 5.

Cybergym — 83,3 %, en hausse par rapport à 52,7 %, devançant les 83,1 % de Fable 5 et battant les 78,3 % d'Opus 4.8.

Terminal Bench 2.1 — 87,9 %, à moins d’un point de Fable 5 (88,0 %) et devant Opus 4,8 (85,0 %).

AutomationBench (public) — 31,8 %, en hausse par rapport à 12,8 %, devant Fable 5 (29,1 %) et Opus 4.8 (27,2 %).

Toolathlon-Verified, NL2Repo, DSBench-FullStack et DSBench-Hard — 74,1 %, 61,5 %, 71,1 % et 67,2 % respectivement, regroupés dans la fourchette Opus 4.8 / Fable 5 ou à proximité de celle-ci.

Chacun de ces résultats est rapporté par D​eepSeek sur sa propre suite d'évaluation. La direction est sans équivoque — l'aperçu n'était pas prêt pour les boucles d'agent en production et la version finale prétend l'être — mais l'étiquette honnête est qu'aucun laboratoire indépendant n'a encore évalué DeepSeek V4 Pro, et les modèles auxquels il est comparé ne sont pas nommés par une partie externe.

Avec quoi Grok 4.6 répond

L'homologue de Grok 4.6 diffère par nature : c'est le seul des deux à disposer d'un classement indépendant. Artificial Analysis l'a mesuré à 61 sur son indice d'intelligence — à égalité avec GPT-5.6 Sol, devant Kimi K3 (60) — avant même que DeepSeek V4 Pro ne soit sorti. Son tableau de fournisseur revendique la première place avec 65,9 % sur DeepSWE v1.1 et 69,9 % sur CursorBench v3.2, avec un point faible ouvertement admis à 26 % sur Terminal-Bench v3.0. Ce sont des chiffres rapportés par xAI, aucun n'a été reproduit de manière indépendante au 13 août.

Les écarts de version comptent quand on essaie de comparer directement les deux. Le 87,9 de DeepSeek a été obtenu sur Terminal Bench 2.1 ; les 26 % de Grok, sur la v3.0, plus difficile — des examens différents, donc « DeepSeek écrase Grok sur les terminaux » n'est pas une affirmation honnête, pas plus que « Grok est en tête sur DeepSWE » sans préciser que les deux fournisseurs ont utilisé des versions d'évaluation différentes et qu'aucun des deux chiffres n'a été vérifié par un tiers. Ce qui est comparable, c'est la dimension indépendante : Grok 4.6 dispose d'un tableau de résultats vérifié, DeepSeek V4 Pro n'en a encore aucun, et pour une décision de production, cette asymétrie est en soi une information.

Screenshot of the Artificial Analysis page for Grok 4.6 (high) scoring 61 — the independent scorecard DeepSeek V4 Pro does not yet have.

Le coût total d'une longue exécution d'agent

Prenons un travail d'agent réaliste — lire et raisonner sur 500K jetons de contexte, écrire 100K jetons de sortie, ce qui correspond à un refactoring de taille moyenne ou à un long pipeline de documents, dans les fenêtres de contexte des deux modèles :

Grok 4.6 — 0,5 M d’entrée à 2 $ = 1,00 $, plus 0,1 M de sortie à 6 $ = 0,60 $. Total : 1,60 $.

DeepSeek V4 Pro — 0,5M d’entrées en cache-miss à 3 ¥ = 1,50 ¥, plus 0,1M de sorties à 6 ¥ = 0,60 ¥. Total : 2,10 ¥, soit environ $0.29.

C'est un écart de 5,5 fois sur la même tâche nominale, avant même tout avantage de cache — et la fenêtre de 1M de D​eepSeek ainsi que sa sortie maximale de 384K signifient aussi que le travail tient en une seule passe, alors que la fenêtre de 500K de Grok 4.6 peut en exiger deux. Ce qui empêche cette réponse d'être une évidence, c'est le coût du raisonnement et le risque : le mode réflexion de D​eepSeek est activé par défaut, donc chaque requête paie pour une trace de raisonnement complète même quand on n'en veut pas, et la confiance dans les benchmarks du fournisseur n'a été vérifiée par personne d'indépendant. Un prix faible par token avec un raisonnement toujours actif reste un prix faible par tâche à ces tarifs, mais « pas cher » et « vérifié » sont des affirmations différentes, et un seul de ces modèles porte la seconde.

Qui devrait choisir quoi

La décision relève moins de « lequel est le meilleur » que de « quel profil de risque correspond à la charge de travail » :

Grand volume, contraint par les coûts, et prêt à assumer des chiffres non vérifiés — DeepSeek V4 Pro est l’option de prix plancher. Le contexte de 1M et la sortie de 384K en font le candidat le plus solide pour les contextes longs et le traitement par lots, et le taux d’entrée en cache de ¥0.025 rend les pipelines gourmands en récupération quasi gratuits. Faites vos propres évaluations, car aucun indépendant ne l’a fait.

Profondeur agentique avec un tableau de bord indépendant, dans un écosystème compatible OpenAI — Le 61 de Grok 4.6 est vérifié, l'orientation de ses benchmarks de codage et d'agents est cohérente, et la faiblesse terminale est connue d'avance. Le délai de 42 secondes jusqu'au premier jeton est le prix à payer pour cette qualité vérifiée.

Screenshot of the OrcaRouter model page for Grok 4.6, the pass-through endpoint where both models sit behind one key at provider list price.

Trafic mixte — c'est le cas pour le routage plutôt que pour le choix. Sur OrcaRouter, les deux modèles se trouvent derrière une seule clé, avec une tarification en transparence basée sur la liste des fournisseurs — ainsi, les ¥3/¥6 de D​eepSeek restent à ¥3/¥6 sur la facture, et Grok 4.6 reste à $2/$6, sans aucune majoration ni sur l'un ni sur l'autre. Une règle de routage peut envoyer les travaux à contexte long et sensibles au coût vers DeepSeek V4 Pro, et les travaux agentiques vérifiés vers Grok 4.6, répartir le trafic par requête jusqu'à ce que votre propre évaluation fixe la répartition, et s'appuyer sur le basculement automatique si le comportement de l'un ou l'autre fournisseur au cours de la première semaine contredit ses chiffres de lancement. Pour deux modèles vieux d'un jour, aux extrémités opposées d'une guerre des prix, la possibilité de les comparer tous deux sur votre propre charge de travail — et d'inverser la répartition sans modifier le code — n'est pas un confort. C'est la seule façon défendable d'adopter l'un ou l'autre.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube