Une carte de titre hero générée pour un article intitulé « Grok 4.7 vs Grok 4.6 — même prix, modèle différent », avec le sous-titre « Ce que la sortie du 21 septembre a réellement changé » et des pastilles de statistiques indiquant Terminal-Bench 4.0 38,0 % vs 20,3 %, AA Index 46 vs 44, et $2/$6 sur les deux.
Guides & Insights

Grok 4.7 vs Grok 4.6 : même prix de 2 $/6 $, un modèle différent sous le capot

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

SpaceXAI a livré Grok 4.7 le 21 septembre 2026, et la première chose à remarquer à son sujet est ce qui n'a pas changé : le prix. Grok 4.7 coûte 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, exactement ce que Grok 4.6 coûte depuis son lancement le 12 août 2026. Même grille tarifaire, même fenêtre de contexte de 500 000 jetons, même entrée texte et image — et pourtant, les deux modèles ne sont pas proches sur les évaluations qui comptent pour le travail agentique. Selon les chiffres publiés par SpaceXAI, Grok 4.7 fait presque le double de Grok 4.6 sur Terminal-Bench 4.0, 38,0 % contre 20,3 %. C'est toute la forme de cette comparaison : un échange générationnel à prix identique où presque tout le gain se situe à un seul endroit, et les parties de Grok 4.6 qui ont ennuyé les équipes de production sont toujours là.

Qu'est-ce qui a réellement changé entre les deux modèles ?

La description que SpaceXAI donne elle-même de cette version est limitée, et il vaut la peine d’en citer la forme plutôt que les adjectifs. Grok 4.7 repose sur un modèle de base plus grand que Grok 4.6, et il a bénéficié d’une session d’apprentissage par renforcement plus longue, ciblée sur des tâches qui « peuvent prendre des heures à accomplir ». L’entreprise affirme que cette session a affûté trois choses : l’auto-vérification, la gestion de contextes longs et le comportement au sein de l’environnement Grok Bot. Aucune affirmation n’est faite concernant une nouvelle architecture, une nouvelle modalité ou une pile de service différente.

Ce cadrage compte parce qu’il prédit où les gains au benchmark se manifestent, et ils se manifestent exactement là. Une passe d’apprentissage par renforcement (RL) plus longue sur des tâches difficiles de plusieurs heures fait bien plus progresser le travail en terminal et sur les dépôts qu’elle ne fait progresser un quiz de connaissances. Si vous espériez que Grok 4.7 soit un modèle plus généraliste que Grok 4.6, les notes de version disent le contraire — c’est la même forme de modèle, entraînée plus loin dans l’extrémité difficile du travail agentique.

L’histoire des paramètres est le seul élément de tout cela qui ne soit pas une divulgation du fournisseur. Musk a déclaré début septembre que Grok 4.7 compte environ 2 100 milliards de paramètres, contre 1 500 milliards pour Grok 4.6, soit une hausse de 40 %, et ce chiffre a été répété partout depuis. Il n’a jamais figuré sur une fiche technique de SpaceXAI. Considérez-le comme une affirmation largement relayée au sujet du modèle de base, et non comme une spécification confirmée — et notez que le nombre de paramètres en dit très peu sur le coût de service ou les capacités lorsque l’architecture est à activation éparse, ce qui est le cas de la gamme Grok.

L’écart au benchmark, avec l’étiquette de source attachée

Chaque chiffre de cette section provient des documents de lancement de SpaceXAI. Aucun n’a été reproduit indépendamment au moment de la rédaction, et la façon honnête de le lire est d’y voir un ensemble d’affirmations qui se trouve être inhabituellement précis — ce qui le rend vérifiable plus tard, mais ne le rend pas vérifié pour autant maintenant.

• Terminal-Bench 4.0 — Grok 4.7 38,0 % (déclaré par le fournisseur) vs Grok 4.6 20,3 %. Le delta le plus important de cette publication, et celui qui correspond à l’affirmation « un RL plus long sur des tâches plus difficiles ».

• CursorBench 4.0 — Grok 4.7 46,3 % (annoncé par le fournisseur) contre Grok 4.6 40,4 %. Un gain réel, mais modeste — moins de six points, sur un benchmark plus proche du travail quotidien dans un éditeur que de sessions terminal autonomes.

• DeepSWE v1.1 — Grok 4.7 71,0 % à effort de raisonnement élevé (rapporté par le fournisseur) contre Grok 4.6 65,2 %. Là encore, une amélioration solide mais peu spectaculaire.

• EEBench — Grok 4.7 64,0 % (rapporté par le fournisseur). Aucun chiffre pour Grok 4.6 n’a été publié à côté, donc celui-ci ne vous apprend rien sur la mise à niveau.

• AA-Briefcase v1.1 — Grok 4.7 à 1 657 Elo (selon le fournisseur), sur l’évaluation du travail intellectuel professionnel.

Lisez la liste comme un ensemble, et la tendance est constante : Grok 4.7 est nettement meilleur là où la tâche est longue et agentique, et marginalement meilleur là où la tâche est courte. Le bond de Terminal-Bench correspond à peu près à un doublement ; les gains sur le travail d’édition se chiffrent en pourcentages à un chiffre. Si votre charge de travail ressemble à de l’autocomplétion, vous payez les mêmes 2 $/6 $ pour une petite amélioration. Si votre charge de travail consiste à « tourner pendant deux heures puis revenir », cette version s’adresse directement à vous.

Ce que dit jusqu'à présent la mesure indépendante

Il existe un chiffre indépendant, et il vaut la peine de l’énoncer avec prudence, car il est facile de mal l’interpréter. Artificial Analysis attribue à Grok 4.7 un score de 46 sur son Intelligence Index, version v4.3.2, ce qui le classe 16e sur 655 modèles du classement. Grok 4.6 se situe à 44 sur la même échelle. Un écart de deux points sur un indice composite n’est pas le doublement que montre Terminal-Bench, et cette divergence est instructive plutôt que contradictoire : l’indice mêle raisonnement, connaissances, mathématiques et codage, de sorte qu’un gain important dans un seul volet agentique est dilué par tout ce que le modèle n’a pas modifié.

Deux autres détails de la même page sont plus utiles que le score principal. Premièrement, Grok 4.7 a généré 240 millions de tokens de sortie lors de l'exécution de l'indice, contre une médiane de 92 millions — c'est un raisonneur verbeux, et sur un tarif de sortie de 6 $ par million, cette verbosité est un poste de coût. Deuxièmement, le composite de l'indice le place parmi les modèles les plus performants de sa gamme de prix, ce qui est la comparaison qui compte réellement pour un acheteur. Artificial Analysis n'a pas publié de prix renseigné pour Grok 4.7 sur la page du modèle, donc ne prenez pas son chiffre de coût par tâche à cet endroit ; utilisez le 2 $/6 $ du fournisseur.

A generated two-column comparison scoreboard for Grok 4.7 and Grok 4.6 with six rows: Terminal-Bench 4.0 38.0% vs 20.3%, CursorBench 4.0 46.3% vs 40.4%, DeepSWE v1.1 71.0% vs 65.2%, AA Intelligence Index 46 vs 44, context 500K on both, and price $2/$6 on both, with a footer noting all benchmark figures are vendor-reported and the index scores are per Artificial Analysis v4.3.2.

Le précipice tarifaire qu'aucun des deux modèles n'a corrigé

Voici la partie de la grille tarifaire de Grok 4.6 que les équipes de production en sont venues à détester, et Grok 4.7 ne l'a pas changée. En dessous de 200 000 jetons d'entrée, le tarif est de 2 $ en entrée et de 6 $ en sortie. Au-dessus, l'intégralité de la requête est refacturée à 4 $ en entrée et 12 $ en sortie. Pas les jetons excédentaires — toute la requête. Un appel de 210 000 jetons coûte le double d'un appel de 199 000 jetons, pour 11 000 jetons supplémentaires.

Avec une fenêtre de contexte de 500 000 tokens sur les deux modèles, il est facile de tomber dans ce précipice. Les exécutions d’agents à long contexte et les invites portant sur un dépôt entier sont précisément les charges de travail pour lesquelles Grok 4.7 a été optimisé, ce qui signifie que le meilleur cas d’utilisation du modèle est aussi celui qui est le plus susceptible de déclencher le doublement. Si vous déplacez des charges de travail vers Grok 4.7 parce qu’il gère mieux les longues sessions agentiques, prévoyez un budget pour la nouvelle tarification avant de migrer, pas après.

Il y a aussi un palier de vitesse à prendre en compte. SpaceXAI propose une variante rapide de Grok 4.7 qui double la vitesse de sortie et double le prix affiché. C'est un compromis légitime pour la programmation interactive, et un mauvais pour le travail par lots — la même tâche, à qualité égale, coûte deux fois plus cher pour un gain de temps réel que personne ne surveille.

Migration depuis Grok 4.6 sans réécriture

La bonne nouvelle, en pratique, c'est qu'il s'agit d'un simple changement de modèle, et non d'une migration de plateforme. Les deux modèles acceptent du texte et des images en entrée et renvoient du texte, tous deux utilisent les mêmes niveaux d'effort de raisonnement, de low à xhigh, et la structure des requêtes est celle que SpaceXAI prend en charge depuis Grok 4.5. Le code qui appelle Grok 4.6 avec un paramètre d'effort n'a pas besoin d'être restructuré pour appeler Grok 4.7.

Là où le remplacement n'est pas gratuit, c'est au niveau de l'évaluation. Les gains de Grok 4.7 sont concentrés dans les longues exécutions agentiques, donc une suite de tests construite à partir de prompts courts à tour unique ne vous montrera presque rien — vous verrez l'amélioration de la taille de CursorBench et conclurez que la mise à niveau ne valait pas l'effort, alors que l'argument en sa faveur réside dans des tâches que votre suite n'exerce jamais. La mesure qui trancherait réellement est l'achèvement des tâches sur un travail multi-étapes : correctifs acceptés, régressions introduites, appels d'outils par tâche terminée, et la fréquence à laquelle une exécution nécessite une intervention humaine. Ce sont les axes que les propres chiffres du fournisseur indiquent, et ce sont ceux qu'aucun benchmark publié ne couvre pour votre base de code.

La verbosité est la deuxième chose à mesurer. Un modèle qui émet 240 millions de jetons sur un index standard émettra plus de jetons sur votre charge de travail que son prédécesseur, et à 6 $ par million de jetons en sortie, cela peut discrètement annuler la valeur d'une mise à niveau à prix identique. Suivez les jetons en sortie par tâche terminée pendant une semaine avant de vous engager.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

Lequel appeler ?

La décision est vraiment simple, ce qui est inhabituel pour une comparaison de modèles. Grok 4.6 reste le bon choix pour le trafic à interactions courtes et sensible aux coûts : chat, classification, synthèse et assistance au code à l’échelle de l’éditeur, où les gains de Grok 4.7 sont faibles et sa verbosité constitue une taxe. Grok 4.7 est le bon choix pour la charge de travail pour laquelle il a été conçu — le codage agentique à long horizon et le travail en terminal, où une tâche dure des heures et où l’auto-vérification fait la différence entre un travail terminé et un travail bloqué.

Ici, faire tourner les deux n'est pas un compromis : c'est la bonne réponse, et c'est peu coûteux. Grok 4.6 figure au catalogue d'OrcaRouter au prix catalogue de SpaceXAI, avec 0 % de marge répercutée telle quelle, donc la grille tarifaire de 2 $/6 $ ci-dessus est ce que vous payez — et comme nous répercutons le prix catalogue du fournisseur au lieu d'y appliquer une marge, toute modification de prix du fournisseur est effective de notre côté le jour même où elle est annoncée. Une seule clé API couvre Grok 4.6 et plus de 200 autres modèles, de sorte que déplacer le trafic entre eux selon la tâche relève d'un simple changement de configuration plutôt que d'un second contrat. Si vous voulez tester Grok 4.7 sur un chemin de production avant de lui faire confiance, le schéma le plus sûr est de conserver le repli sur Grok 4.6 — un modèle que vous pouvez router dès aujourd'hui — et de laisser le basculement automatique entre fournisseurs renvoyer la requête vers celui-ci lorsque le nouveau modèle fait des siennes.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing SpaceXAI's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 500K token context window, and the reasoning and vision capability tags.

Que regarder ensuite

Deux éléments trancheront cette comparaison, et aucun des deux ne s'est encore produit. Le premier est une reproduction indépendante du chiffre de Terminal-Bench 4.0 — 38 % représente un bond suffisamment important pour que quelqu'un le refasse tourner, et s'il tient, l'argument en faveur de Grok 4.7 dans les pipelines agentiques est solide sur le fond plutôt que sur le marketing. Le second est le reste de la feuille de route de Grok : SpaceXAI a publiquement positionné Grok 4.8, Grok 4.9 et Grok 5 après cette version, et la propre durée de vie de Grok 4.6 a été d'environ cinq semaines. Adopter Grok 4.7 comme hypothèse de plateforme à long terme reviendrait à répéter l'erreur que les équipes ont commise avec Grok 4.5.

Pour l'instant, la mise à niveau au même prix est bien réelle et la direction prise est claire. Le chiffre à retenir, c'est que, pour 2 $/6 $, vous obteniez un modèle qui double à peu près sur le travail terminal à long horizon et ne bouge presque pas ailleurs — et c'est là une affirmation précise, utile et vérifiable plutôt qu'un bond générationnel.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement