Carte de titre affichant « Grok 4.7 vs DeepSeek V4 Pro » avec le sous-titre « L'un est nouveau ; l'autre est échangé sous votre nez », et trois cartes : AA Index v4.3.2 46 vs 36, Prix hors pointe par 1M $2/$6 vs $0.66/$1.98, et Contexte 500k vs 1M.
Guides & Insights

Grok 4.7 vs DeepSeek V4 Pro : l'un est nouveau, l'autre est remplacé sous votre nez

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Une note publiée le 10 septembre 2026 modifie l’objet de cette comparaison. « Nous abandonnons progressivement V4-Pro », y lit-on, et à partir de 04:00 UTC le 14 septembre 2026, chaque requête adressée à la chaîne de modèle deepseek-v4-pro est acheminée vers DeepSeek-V4.1-Flash aux tarifs de V4.1-Flash — une situation qui, selon la note, perdure « jusqu’au lancement de V4.1-Pro ». La chaîne de modèle répond toujours. Le modèle derrière n’est pas celui que vous avez évalué. Cela fait d’un face-à-face avec Grok 4.7 — publié par le fournisseur le 21 septembre 2026, un jour avant la rédaction de ce texte — une comparaison avec une date d’expiration d’un côté. Sur la base des chiffres disponibles, Grok 4.7 est le modèle le plus performant et DeepSeek V4 Pro le moins cher. Sur la question qui détermine réellement une intégration, un seul d’entre eux est encore ce qu’il prétend être.

Ce qu’est chaque modèle, avant les scores

DeepSeek V4 Pro a atteint la disponibilité générale le 13 août 2026 en tant que checkpoint DeepSeek-V4-Pro-0813, après une preview du 24 avril. Ses poids sont ouverts sous licence MIT — la licence autorise l’utilisation commerciale, la modification et la redistribution, sans seuil de revenus ni exception régionale — avec 1,7 billion de paramètres au total sur la fiche modèle GA, une fenêtre de contexte de 1 M de tokens et une sortie maximale de 384 K, le plafond de sortie le plus élevé de ce comparatif. Il est uniquement textuel : la page de tarification de DeepSeek indique elle-même que la vision n’est pas prise en charge sur v4-pro, ce qui est une véritable limitation pour quiconque lui soumet des captures d’écran ou des PDF. Il expose un réglage d’effort de raisonnement à low, high et max, et il est plafonné à 500 requêtes simultanées par compte, avec une extension disponible sur demande.

Grok 4.7 est à poids fermés et n'a qu'un jour. Il dispose d'un contexte de 500 000 tokens — la moitié de celui de DeepSeek — accepte du texte et des images en entrée et possède son propre curseur d'effort. Son prix catalogue est de 2,00 $ par million de tokens d'entrée et de 6,00 $ par million de tokens de sortie en dessous de 200 000 tokens d'invite, doublant à 4,00 $ et 12,00 $ à partir de ce seuil, les lectures mises en cache étant à 0,50 $ et 1,00 $. xAI annonce aussi une variante plus rapide, à environ deux fois la vitesse de sortie et deux fois le prix. Aucun des deux fournisseurs ne publie de chiffre maximal de sortie pour Grok 4.7 dans la documentation consultée ici, il faut donc considérer cette dimension comme inconnue plutôt qu'égale.

Sur l'index partagé, l'écart penche dans un seul sens

Les deux modèles sont évalués sur l'Artificial Analysis Intelligence Index v4.3.2, la révision publiée le 19 septembre 2026. La colonne de Grok 4.7 est mesurée avec un effort xhigh ; celle de DeepSeek correspond au checkpoint 0813 avec un effort maximal. Lus ensemble, l'écart composite sous-estime à quel point ces deux modèles sont façonnés différemment.

Composite — Grok 4.7 : 46 sur l'Artificial Analysis Intelligence Index v4.3.2. DeepSeek V4 Pro 0813 : 36 sur la même révision.

Agents de terminal — Grok 4.7 : Terminal-Bench 4.0 26. DeepSeek V4 Pro : 14. Près du double, sur l'évaluation la plus proche du travail logiciel autonome.

Automatisation — Grok 4.7 : AutomationBench-AA 66 %. DeepSeek V4 Pro : 57 %. Les deux sont crédibles ; Grok mène de neuf points.

Connaissances et hallucination — Grok 4.7 : AA-Omniscience 32. DeepSeek V4 Pro : 1. C’est l’anomalie du tableau, et ce n’est pas un artefact d’arrondi — l’indice évalue à la fois ce qu’un modèle sait et la fréquence à laquelle il invente une réponse quand il ne sait pas.

Contexte long — Grok 4.7 : AA-LCR v1.1 77 %, fenêtre 500k. DeepSeek V4 Pro : 80 %, fenêtre 1M. Le seul avantage clair de DeepSeek, et c'est l'axe pour lequel sa fenêtre de 1M a été conçue.

Raisonnement complexe — Grok 4.7 : HLE 43, CritPt 18. DeepSeek V4 Pro : HLE 41, CritPt 18. Égalité sur le benchmark de physique et un avantage de deux points pour Grok sur HLE.

Verbosité — Grok 4.7 : 240 M de jetons de sortie pour exécuter l'index, signalé comme anormalement verbeux. DeepSeek V4 Pro : 163 M. Les deux sont bavards ; Grok l'est davantage.

OrcaRouter model page for DeepSeek V4 Pro showing the deepseek/deepseek-v4-pro identifier, a 1M-token context window, 384K maximum output, text-only input, off-peak list rates of $0.66 per 1M input and $1.98 per 1M output, and 3818.2M tokens of traffic over seven days.

L'histoire du prix n'est pas un seul chiffre, c'est un barème

La tarification de DeepSeek est l'aspect le plus agressif, et le moins stable à citer. Le tarif catalogue pour deepseek-v4-pro est de 0,66 $ par million de tokens d'entrée en cas de défaut de cache et de 1,98 $ par million de tokens de sortie — pendant les heures creuses. Pendant les heures de pointe, ces tarifs doublent pour atteindre 1,32 $ et 3,96 $. Les heures de pointe, selon la documentation de DeepSeek elle-même, sont de 01:00 à 04:00 et de 06:00 à 10:00 UTC, du lundi au vendredi, hors jours fériés chinois ; tout le reste, y compris les week-ends complets, est en heures creuses à exactement la moitié du prix. Les lectures d'entrée mises en cache sont le véritable argument phare : 0,022 $ en heures creuses et 0,044 $ en heures de pointe, trente fois moins chères qu'un défaut de cache, ce qui rend une charge de travail DeepSeek bien mise en cache radicalement moins chère que ne le laisse supposer sa grille tarifaire.

Par comparaison, les 2,00 $ et 6,00 $ de Grok 4.7 paraissent chers — environ 3 fois l'entrée hors pointe de DeepSeek et 3 fois sa sortie hors pointe. La comparaison se resserre de manières qu'il vaut la peine de connaître. Le prix de Grok 4.7 est fixe dans sa tranche plutôt que dépendant de l'heure, de sorte qu'un pic de production à 09:00 UTC coûte le même prix qu'un lot du dimanche soir ; celui de DeepSeek, non. Et au-delà de 200 k tokens de prompt, Grok 4.7 double, ce qui le porte à quatre à six fois le tarif hors pointe de DeepSeek plutôt qu'à trois. Pour le dire simplement : DeepSeek V4 Pro est le modèle le moins cher sur tous les plans, et l'ampleur de la remise dépend du moment où vous exécutez et de l'efficacité de votre mise en cache.

Ce que le 14 septembre a changé

C'est l'élément qui rend l'argument tarifaire plus difficile à faire valoir. À partir du 14 septembre 2026, DeepSeek achemine les requêtes deepseek-v4-pro vers DeepSeek-V4.1-Flash et les facture aux tarifs Flash — qui sont encore plus bas. Le journal des modifications de DeepSeek et sa page de tarification racontent une histoire légèrement différente de celle de l'article d'actualité du 10 septembre : le tableau des tarifs liste encore deepseek-v4-pro comme une ligne active avec ses propres tarifs et aucune étiquette de retrait, et l'entrée du journal des modifications indique que le service API pour V4 Pro se poursuit après le 14 septembre, avec une facturation inchangée. Ce qui n'est pas contesté, c'est la direction prise. Le développement de V4.1-Pro est confirmé, sans date annoncée, et V4.1-Flash — sorti le 10 septembre — est présenté par l'annonce de DeepSeek elle-même comme surpassant V4 Pro en matière de « performance, coût, vitesse et temps d'exécution total », une affirmation du fournisseur qui n'a pas été reproduite indépendamment à cette ampleur.

La question pratique n'est donc pas « Grok 4.7 ou DeepSeek V4 Pro », mais « Grok 4.7 ou le modèle DeepSeek vers lequel cette chaîne se résoudra le trimestre prochain ». Si vous avez évalué V4 Pro en août et dimensionné votre budget de contexte autour d'une fenêtre de 1M avec un plafond de sortie de 384K, le modèle que vous appellerez en novembre n'est peut-être pas celui que vous avez mesuré — et les limites de contexte et de sortie du successeur ne sont pas celles que vous aviez prévues lors de la conception. Grok 4.7 présente un profil de risque inverse : un modèle vieux d'un jour, dont les chiffres sont déclarés par le fournisseur et largement non reproduits, mais dont l'identité ne fait aucun doute.

Two-column scoreboard titled “Grok 4.7 vs DeepSeek V4 Pro - the scoreboard”: AA Index 46 vs 36, Terminal-Bench 4.0 26 vs 14, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $0.66/$1.98 off-peak, and open weights “no” vs “MIT”.

Là où un routeur a sa place, et où il ne l'a pas

OrcaRouter propose DeepSeek V4 Pro, et la page du modèle l'affiche au tarif du fournisseur lui-même — 0,66 $ en entrée et 1,98 $ en sortie, avec une fenêtre de contexte de 1 M et une sortie maximale de 384 k — parce que nous répercutons les tarifs catalogue du fournisseur avec 0 % de marge. Cela compte plus que jamais avec un fournisseur dont les tarifs évoluent selon un calendrier heures pleines/heures creuses et dont l'annonce du 10 septembre s'est accompagnée d'une baisse de prix : un changement de tarif DeepSeek est effectif sur la même clé le jour même, sans délai de réévaluation et sans second contrat. Lorsqu'un fournisseur redirige une chaîne de modèle de son côté, la modification arrive via le même endpoint sans exiger de réintégration du vôtre, et le basculement automatique empêche une limite de débit ou un incident de capacité côté fournisseur de se transformer en panne — utile lorsqu'un côté de votre stack est plafonné à 500 requêtes simultanées. Grok 4.7 ne figure pas dans le catalogue OrcaRouter à l'heure où nous écrivons ces lignes ; pour l'appeler, il faut passer par l'API propre à xAI et par les plateformes tierces qui le proposent.

Le partage que cela suggère est peu glamour mais défendable : gardez DeepSeek V4 Pro sur les charges de travail où la tarification des hits de cache et la fenêtre de 1M font le travail, et fixez vos attentes sur V4.1-Flash plutôt que sur le point de contrôle d'août. Mettez Grok 4.7 sur les tâches où le modèle doit savoir ce qu'il ne sait pas — un indice AA-Omniscience de 1 est un signal fort quant à la propension d'un modèle à répondre avec assurance et à tort, et aucun avantage de prix ne survit à un consommateur en aval qui fait confiance à une réponse fabriquée.

L'appel

Grok 4.7 est le meilleur modèle ici, et ce n’est pas vraiment serré : une avance composite de dix points, un score Terminal-Bench deux fois supérieur, un avantage en matière d’automatisation et un écart de sincérité sur les connaissances assez large pour constituer une différence de catégorie. DeepSeek V4 Pro est environ 3 fois moins cher en heures creuses et dispose d’une fenêtre de contexte deux fois plus grande, ce qui est une raison réelle et défendable de le conserver — mais vous n’achetez pas le modèle que vous avez évalué, vous achetez une chaîne de modèle que DeepSeek a déjà annoncé vouloir rediriger, à des tarifs qui changent d’heure en heure, sous une licence et un ensemble de poids qui font de l’auto-hébergement une véritable troisième option. Si la charge de travail est à contexte long, à fort volume et cacheable, l’équation économique de DeepSeek est difficile à battre et vous devriez concevoir pour le successeur plutôt que pour le checkpoint. S’il s’agit de quoi que ce soit où se tromper coûte cher, payez le tarif 3x et prenez le modèle qui admet l’incertitude.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement