
Grok 4.7 obtient 46 à l'Artificial Analysis Intelligence Index et place SpaceXAI dans le top quatre
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 217 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Grok 4.7 obtient 46 à l'Artificial Analysis Intelligence Index et place SpaceXAI dans le top quatre
Grok 4.7 est disponible. SpaceXAI l'a publié le lundi 21 septembre 2026 — au même tarif que Grok 4.6, soit 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, avec la même fenêtre de contexte de 500 000 jetons, une date de coupure des connaissances plus récente et un nouveau niveau de raisonnement le plus élevé. Il est disponible dans Cursor et Grok Build, via l'API propre de l'éditeur, ainsi que par l'intermédiaire de harnais de codage, de routeurs de modèles et de plateformes cloud tiers. Grok 4.5, du 8 juillet, reste en dessous en tant qu'option moins chère, et les modèles qu'il doit encore dépasser sont inchangés : Claude Fable 5.1, Claude Opus 5 et GPT-5.6 Sol se situent tous au-dessus de lui dans l'Indice d'intelligence v4.3.2 d'Artificial Analysis, où le premier score indépendant de Grok 4.7 — 46 — se situe deux points au-dessus de Grok 4.6 et sept en dessous de Claude Fable 5.1. Sur le tableau AA-Briefcase du même évaluateur, consacré au travail de connaissance à long horizon, il se classe quatrième, derrière trois entrées Claude et devant Claude Opus 5 en effort xhigh, pour environ la moitié du coût par tâche de Claude Opus 5 — le premier résultat indépendant de cette version qui se lit comme une victoire en matière de rapport prix-performance plutôt que comme un écart. Onze jours plus tard, le tableau s'est élargi sur les bords plutôt qu'au centre : depuis le 1er octobre, il est déployé progressivement dans les propres applications web et mobiles de Grok, où le sélecteur de mode le nomme désormais parmi ses deux entrées les plus difficiles, et il est référencé sur OrcaRouter au tarif de SpaceXAI lui-même, soit 2 $/6 $.
C'est le lancement. Les chiffres plus utiles sont arrivés le jour même, du seul évaluateur de cette histoire qui n'est pas le fournisseur : Artificial Analysis a publié sa première évaluation indépendante de Grok 4.7, et c'est un résultat en trois volets — un 46 sur l'Intelligence Index, à seulement deux points d'avance sur Grok 4.6, un 56 sur le Coding Agent Index, neuf points d'avance sur celui-ci, et un score Elo de 1 657 sur AA-Briefcase, 111 points d'avance. Ces trois chiffres pointent dans des directions différentes, et l'écart entre eux est la chose la plus intéressante de cette version. Ce qui suit est la spécification livrée, le propre tableau de benchmarks du fournisseur avec l'étiquette nécessaire pour chaque ligne, puis les scores indépendants correctement interprétés — y compris ce qu'ils disent de la réserve sur l'état de préparation que SpaceXAI n'a jamais abordée.
Qu’a livré SpaceXAI le 21 septembre ?
Commençons par les caractéristiques techniques, car elles sont inhabituellement proches de celles de son prédécesseur. Grok 4.7 est facturé à l'identique de Grok 4.6 — 2 $ par million de tokens d'entrée et 6 $ par million de tokens de sortie en dessous de 200 000 tokens d'entrée, passant à 4 $ en entrée et 12 $ en sortie dès qu'une requête franchit ce seuil, la même structure que celle introduite par Grok 4.6. La fenêtre de contexte est de 500 000 tokens. La date de coupure des connaissances est mai 2026, soit trois mois plus tard que le 1er février 2026 de Grok 4.6. L'effort de raisonnement se décline en quatre niveaux — faible, moyen, élevé et xhigh — et les chiffres publiés sont donnés au niveau xhigh. Une variante rapide fonctionne à une vitesse de sortie deux fois supérieure, pour un prix deux fois plus élevé.
Sous le capot, xAI décrit trois changements plutôt qu'une nouvelle architecture. Le modèle de base est plus grand que celui de Grok 4.6. La phase d'apprentissage par renforcement a été plus longue et davantage axée sur des tâches qui prennent de nombreuses heures à accomplir. Et le modèle a été entraîné à vérifier son propre travail et à mieux tenir un contexte long, y compris une compréhension native du harnais Grok Bot. Le résumé en une ligne de l'entreprise est « deux fois plus rapide, à moitié prix des modèles comparables » — une affirmation de positionnement vis-à-vis de concurrents plutôt qu'une mesure, et qu'il convient de lire comme telle.
La disponibilité était déjà large dès le premier jour et s'est élargie à deux reprises depuis. Au lancement : Cursor et Grok Build, l'API propre au fournisseur, des harnais de codage tiers, des routeurs de modèles et des plateformes cloud ; la page Grok Build de SpaceXAI elle-même indique désormais sans détour de « commencer à développer avec Grok 4.7 ». Le 28 septembre, Amazon Web Services l'a ajouté à Amazon Bedrock avec la même fenêtre de contexte de 500 000 tokens et les mêmes quatre niveaux d'effort de raisonnement, servi via des profils d'inférence interrégionaux ; le modèle est donc désormais accessible via le catalogue propre d'un hyperscaler, et pas seulement via l'API du fournisseur. Puis, le 1er octobre, il a commencé à être déployé dans les applications web et mobiles grand public de Grok, et deux jours plus tard, c'est encore là qu'il en est. Ce dernier point est d'une discrétion inhabituelle : SpaceXAI a annoncé l'étape équivalente pour Grok 4.5 dans un billet de blog intitulé « Grok 4.5 arrive sur iOS, Android, Web et X », et n'a rien publié pour Grok 4.7, le changement est donc visible dans le produit plutôt qu'annoncé. Il s'agit d'un changement côté serveur plutôt que d'un déploiement livré, ce que confirment les fiches des applications : les fiches iOS et Android de Grok ont toutes deux été modifiées le 1er octobre — la version App Store est la 1.4.47, publiée ce jour-là, et sa note de version ne mentionne que « Améliorations apportées à Chat, Voice et Imagine », tandis que la fiche Play a été mise à jour le même jour. Le changement est poussé depuis le backend plutôt qu'intégré dans un binaire. Comme le déploiement est rapporté plutôt que documenté, il est plus difficile d'en établir la portée exacte que pour le référencement Bedrock, qui s'appuie sur un article AWS daté ; et les informations rapportées ont déjà dérivé : les comptes qui suivent ce sujet décrivent désormais Grok 4.7 comme le modèle de base pour tous les modes — Fast, Expert, Build et Heavy — une liste qui ne correspond pas à ce que grok.com sert réellement. À lire comme un signalement des traqueurs eux-mêmes, et non comme une description du fournisseur. Certains partenaires en cybersécurité sélectionnés bénéficient d'un accès sur invitation uniquement aux capacités de red team du modèle.
Une correction au compte rendu que cet article a conservé. Le nombre de paramètres qui a circulé pendant deux mois — environ 2,1 billions, soit environ 40 % de plus que le 1,5 billion de Grok 4.6 — ne figure toujours sur aucune fiche technique. xAI n'a pas publié de nombre de paramètres pour Grok 4.7, et Artificial Analysis répertorie la taille du modèle comme non divulguée. Ce chiffre a toujours été une affirmation d'un fondateur, et le lancement ne l'a pas converti en spécification.
Le tableau des benchmarks est celui de xAI — voici ce qui ne l'est pas.
Chaque chiffre de la liste ci-dessous provient de l'annonce du fournisseur, et aucun n'a été reproduit de manière indépendante. Lisez-la avec cette étiquette bien accrochée : ce sont les chiffres de xAI sur les évaluations choisies par xAI, publiés le jour de la sortie, et la première semaine de tout lancement est le moment où les benchmarks de fournisseurs sont les moins fiables. Les colonnes de comparaison sont également celles du fournisseur — Grok 4.6 (high), GPT-5.6 Sol (max) et Claude Fable 5.1 (max), chacun exécuté au niveau d'effort choisi par le fournisseur.
• CursorBench 4.0 — Grok 4.7 46,3 %, Grok 4.6 40,4 %, GPT-5.6 Sol 41,7 %, Claude Fable 5.1 51,8 %. Données fournies par le fournisseur.
• DeepSWE v1.1 — Grok 4.7 71,0 % en effort élevé, Grok 4.6 65,2 %, GPT-5.6 Sol 72,7 %, Claude Fable 5.1 70,0 %. Rapporté par le fournisseur.
• Terminal-Bench 4.0 — Grok 4.7 37,6 %, Grok 4.6 20,3 %, GPT-5.6 Sol 37,3 %, Claude Fable 5.1 57,9 %. Rapporté par le fournisseur, puis révisé : la ligne Grok 4.7 indiquait 38,0 % dans le tableau du jour du lancement et indique 37,6 % sur la page du fournisseur aujourd’hui.
• EEBench — Grok 4.7 64,0 %, Grok 4.6 53,0 %, GPT-5.6 Sol 39,4 %, Claude Fable 5.1 56,4 %. Déclaré par le fournisseur.
• Harvey Legal Agent — Grok 4.7 19,6 %, Grok 4.6 15,8 %, GPT-5.6 Sol 2,5 %, Claude Fable 5.1 6,7 %. Déclaré par le fournisseur.
• HealthBench Professional — Grok 4.7 56,7 %, Grok 4.6 48,5 %, GPT-5.6 Sol 60,5 %, Claude Fable 5.1 62,1 %. Données déclarées par les fournisseurs.
• AA Briefcase v1.1 — Grok 4.7 1 657, Grok 4.6 1 546, GPT-5.6 Sol 1 487, Claude Fable 5.1 1 678. C’est la seule ligne du tableau qui ne provient plus uniquement du fournisseur : le propre tableau AA-Briefcase d’Artificial Analysis publie le même 1 657 pour Grok 4.7 à effort xhigh et 1 546 pour Grok 4.6 à high. Les colonnes de comparaison restent le choix du fournisseur en matière de modèles et de niveaux d’effort.
• GDPval Elo — Grok 4.7 1 695, Grok 4.6 1 605, GPT-6 Astra 1 542, Claude Fable 5.1 1 735. Données déclarées par les fournisseurs.
La lecture honnête de cet ensemble n'est pas « Grok 4.7 gagne ». Il bat Grok 4.6 sur les huit, ce qui est le minimum qu'un successeur vous doit. Face au reste du peloton, le bilan est mitigé : devant GPT-5.6 Sol sur CursorBench, Terminal-Bench et EEBench, derrière lui sur DeepSWE ; derrière Claude Fable 5.1 sur CursorBench, Terminal-Bench, HealthBench et les deux mesures de type Elo, devant lui sur EEBench et l'évaluation de l'agent juridique Harvey. Cela illustre aussi à quel point le niveau d'effort compte dans un résultat de benchmark — les 71,0 % de DeepSWE sont un chiffre obtenu en effort élevé dans un tableau autrement cité en xhigh.
La sécurité est le seul domaine où les affirmations du fournisseur sont inhabituellement précises. xAI déclare que Grok 4.7 a été construit sur une pile de protections entièrement nouvelle et le présente comme le modèle le plus robuste que l’entreprise ait testé en matière de refus et de résistance au jailbreak. Sur le benchmark de biosécurité de LatchBio, il annonce 62,4 % ; sur HackerBench v0.3, il annonce laisser passer 3,3 % des invites risquées à double usage tout en bloquant rarement des travaux de sécurité légitimes. Ce sont des évaluations rapportées par le fournisseur sur sa propre version, et aucun tiers ne les a reproduites.
Les premiers chiffres de ce texte qui ne viennent pas du fournisseur sont les trois qu'Artificial Analysis a publiés le 21 septembre, et ils divergent les uns des autres de façon instructive. Sur l'Intelligence Index, Grok 4.7 obtient 46 au niveau d'effort xhigh sur l'échelle v4.3.2 — 16e de ce classement — contre 44 pour Grok 4.6. Ce gain de deux points est, selon Artificial Analysis, suffisant pour faire entrer SpaceXAI dans le top quatre des laboratoires de l'indice. Lisez la position avec précision : il s'agit d'une affirmation sur le meilleur modèle d'un laboratoire, pas sur celui-ci, et le modèle lui-même se situe encore quatre points sous les 50 de Claude Fable 5 et sept sous les 53 que partagent Claude Fable 5.1 et GPT-6 Astra. Un gain de deux points se situe aussi dans la plage que l'on observe entre les niveaux d'effort d'un même modèle, ce qui rappelle qu'un successeur qui obtient un score supérieur à celui de son prédécesseur n'est pas la même chose qu'un successeur qui change ce qui est possible. Une remarque supplémentaire sur la lecture du chiffre : la version de l'échelle compte, car Artificial Analysis a révisé son indice, et les valeurs 61/62/63 qui apparaissent dans la plupart de la couverture de juillet et août appartiennent à l'échelle retirée antérieure à septembre 2026 — elles ne peuvent pas être comparées à celles-ci.
L'indice Coding Agent est le deuxième nombre, et c'est celui qui a bougé. Exécuté dans le propre harness Grok Build de SpaceXAI à effort xhigh, Grok 4.7 obtient 56 contre 47 pour Grok 4.6 — neuf points, pas deux — ce qui le classe quatrième parmi les modèles évalués dans leurs harnesses natifs, derrière Claude Fable 5.1, GPT-6 Astra et Claude Opus 5, et devant GPT-5.6 Sol. L'indice est un composite à pondération égale de DeepSWE v1.1, Terminal-Bench 4.0 et SWE-Atlas-QnA sur 303 tâches, et les trois composantes se sont améliorées : DeepSWE de 65 % à 73 %, Terminal-Bench de 18 % à 33 %, SWE-Atlas-QnA de 58 % à 63 %. C'est la première preuve indépendante que le correctif décrit par xAI — un apprentissage par renforcement plus long, davantage pondéré vers des tâches de plusieurs heures — a fait quelque chose, et c'est le nombre auquel une équipe choisissant un agent de codage devrait accorder le plus de poids, parce qu'il est mesuré dans le harness avec lequel le modèle est réellement livré plutôt que dans le tableau du fournisseur.
La réserve, c'est ce que coûtent les neuf points. Le propre test d'Artificial Analysis a généré 240 millions de jetons de sortie sur l'Intelligence Index, contre une médiane de 94 millions parmi les modèles qu'il suit — plus du double — et a chiffré le coût d'évaluation d'une tâche de l'Index à 3,74 $. À 6 $ par million de jetons de sortie, la verbosité est le poste qui détermine si une boucle agentique est abordable, de sorte qu'un gain de neuf points acheté avec plus du double de la production médiane constitue un véritable compromis plutôt qu'une mise à niveau gratuite. La même mesure signifie aussi que les scores mis en avant ne doivent pas être lus comme un verdict unique : rapporté au jeton, l'avantage de Grok 4.7 sur Grok 4.6 est plus faible que ne le suggère l'écart d'indice, et sur les évaluations de connaissances générales qui composent l'Intelligence Index, il est proche du même modèle avec une facture nettement plus élevée. Le résultat AA-Briefcase de la section suivante fait exception à cela, et l'exception est de taille.

La deuxième instance indépendante : AA-Briefcase, et ce que permet d’obtenir la moitié du coût par tâche
Artificial Analysis a publié un troisième chiffre pour Grok 4.7 le jour même, et c'est celui qui concerne le travail intellectuel plutôt que le code. Sur AA-Briefcase — son propre classement pour le travail intellectuel agentique à long horizon, construit à partir de quatre scénarios de projet de plusieurs semaines et de 91 livrables notés — Grok 4.7 à effort xhigh obtient 1 657 Elo, quatrième au classement et derrière uniquement des entrées Anthropic : Claude Fable 5.1 à effort max (1 678), Claude Opus 5 à effort max (1 673) et Claude Fable 5.1 à xhigh (1 669). Il est à 16 Elo derrière Claude Opus 5 à effort max et, à xhigh, 8 Elo devant Claude Opus 5 à xhigh (1 649). Lisez le positionnement précisément : « derrière uniquement des modèles Anthropic » est la formulation qu'Artificial Analysis elle-même a utilisée, et elle est exacte — mais quatrième n'est pas deuxième, et les trois lignes au-dessus sont toutes du même fournisseur.
Le gain par rapport à la génération précédente constitue la plus grande progression isolée de cette version. Face à Grok 4.6 en high effort (1 546), Grok 4.7 en xhigh gagne 111 points Elo sur AA-Briefcase — soit plus de cinquante fois le gain de deux points sur l'Intelligence Index. Artificial Analysis l'attribue presque entièrement à la qualité analytique : 1 994 points Elo dans ce domaine, contre 1 690 pour Grok 4.6, tandis que la qualité de présentation recule légèrement, à 1 499 contre 1 519. C'est une signature lisible : le modèle raisonne mieux sur l'analyse et met en forme le livrable un peu moins bien. La même tendance apparaît dans les chiffres qu'Artificial Analysis a cités pour AA-Briefcase-Lite, le scénario public de due diligence publié sur Hugging Face — qualité analytique en hausse, de 1 698 à 1 994, présentation en baisse, de 1 531 à 1 499. Deux réserves sur cette comparaison. AA-Briefcase-Lite est explicitement démonstratif : la page de méthodologie d'Artificial Analysis indique que le cinquième scénario public « ne compte pas dans les résultats officiels d'AA-Briefcase ». Et les chiffres de qualité cités pour ce scénario correspondent aux lignes xhigh publiées sur le tableau principal ; il faut donc considérer le paragraphe sur la version Lite comme une illustration de la direction suivie plutôt que comme un tableau de scores distinct.
C'est sur la ligne de coût que ce résultat change une décision. La mesure du coût par tâche d'AA-Briefcase est le coût total de l'exécution de la soumission complète divisé par ses 91 tâches ; en divisant les totaux publiés d'Artificial Analysis, on obtient environ 9,30 $ par tâche pour Grok 4.7 à xhigh contre environ 17,79 $ pour Claude Opus 5 à max effort — environ la moitié, pour un écart de 16 points Elo. Le propre résumé d'Artificial Analysis du résultat est que Grok 4.7 se classe « juste derrière Opus 5 à ~50 % de son coût par tâche ». C'est le même compromis que le reste de cet article décrit, aboutissant à la même réponse par une autre voie : Grok 4.7 ne surpasse pas la frontière, il la sous-tarife. Deux réserves, toutes deux honnêtes. La facture de tokens est bien réelle — sur AA-Briefcase-Lite, Artificial Analysis a estimé le coût API de production des présentations d'exemple à environ 8 $ pour Grok 4.7 à xhigh contre environ 4,40 $ pour Grok 4.6 à xhigh, donc le successeur coûte environ 80 % de plus que le modèle qu'il remplace pour le même travail. Et les chiffres par tâche sont calculés à partir de l'utilisation de tokens aux prix catalogue avec un taux de succès de cache représentatif, donc ils varient avec votre mise en cache : ils constituent un modèle de facture, pas votre facture.
Où se situe Grok 4.7 par rapport à Grok 4.6 et au reste du domaine
• Prix pour 1 M de tokens — Grok 4.7 : 2 $ en entrée / 6 $ en sortie en dessous de 200 K de tokens d’entrée, 4 $/12 $ au-dessus ; Grok 4.6 identique.
• Fenêtre de contexte — 500 000 tokens pour les deux.
• Date limite des connaissances — mai 2026 pour Grok 4.7, contre le 1er février 2026 pour Grok 4.6.
• Effort de raisonnement — faible / moyen / élevé / xhigh pour Grok 4.7 par rapport aux niveaux publiés de Grok 4.6.
• Score indépendant — 46 à effort xhigh contre 44, sur l'Intelligence Index v4.3.2 d'Artificial Analysis. Suffisant, selon Artificial Analysis, pour placer SpaceXAI parmi les quatre meilleurs laboratoires de l'indice.
• Score de codage indépendant — 56 contre 47 sur l’Artificial Analysis Coding Agent Index, chaque modèle dans son harnais natif. Quatrième parmi les modèles à harnais natif, devant GPT-5.6 Sol.
• Score indépendant de travail intellectuel — 1 657 Elo avec un effort xhigh, contre 1 546 pour Grok 4.6 avec un effort high, sur le tableau AA-Briefcase d’Artificial Analysis. Quatrième au classement général, derrière trois entrées Anthropic et devant Claude Opus 5 avec un effort xhigh.
• Coût par tâche AA-Briefcase — environ 9,30 $ contre environ 17,79 $ pour Claude Opus 5 à effort maximal, sur le même classement. Environ la moitié de la facture par tâche pour un écart de 16 points Elo.
• Jetons de sortie par exécution de l’Index — 240 millions contre une médiane de 94 millions parmi les modèles suivis par Artificial Analysis. L’amélioration n’est pas gratuite.
• Évaluation de codage des fournisseurs — CursorBench 4.0 : 46,3 % contre 40,4 %.
• Vitesse de service — une variante rapide à deux fois la vitesse de sortie pour deux fois le prix, par rapport au service standard de Grok 4.6.
• Sécurité — un nouvel ensemble de garde-fous, avec un score annoncé de 62,4 % au benchmark de biosécurité de LatchBio ; Grok 4.6 est sorti sans cette affirmation.
Et le peloton, sur le même classement : Claude Fable 5.1 à 53, Claude Opus 5 à 51, GPT-5.6 Sol à 47, Kimi K3 à 44. La prédiction de Musk lui-même — selon laquelle Grok 4.7 « devrait être à peu près au niveau d’Opus 5.0, pas de 5.1 » — se voit désormais adossée à un chiffre, et ce chiffre a atterri là où il avait dit qu’il le ferait : sous la frontière, pas au-dessus. L’écart mesuré avec Claude Fable 5.1 est de sept points ; l’écart de prix va dans l’autre sens, Claude Fable 5.1 étant affiché à 10 $/50 $ par million de tokens contre 2 $/6 $ pour Grok 4.7 — cinq fois le prix d’entrée et plus de huit fois le prix de sortie. C’est le véritable arbitrage que l’on demande à une équipe de faire, et il s’agit d’un arbitrage prix-performance plutôt que d’un gain de capacités. AA-Briefcase est le seul tableau de cet article où l’ordre change : là, Grok 4.7 en xhigh se place devant Claude Opus 5 en xhigh, 1 657 contre 1 649, bien qu’il reste derrière Opus 5 en effort maximal à 1 673 et derrière Claude Fable 5.1 à 1 678. Il vaut aussi la peine de mettre les trois scores indépendants côte à côte avant de trancher, car ils ne pointent pas dans la même direction : sept points de retard en intelligence générale, devant GPT-5.6 Sol sur l’indice d’agent de codage, 111 Elo d’avance sur son prédécesseur en travail intellectuel, et des gains qui se paient en tokens de sortie. Lequel de ces faits décide de votre choix dépend de si la charge de travail est un agent de codage, un livrable de connaissance ou une requête de chat, et c’est une distinction plus utile qu’un rang unique.
Ce que les fuites ont vu juste, et la seule chose qu’elles n’ont pas tranchée
Les artefacts que cet article a suivis jusqu’en septembre étaient réels, et le lancement en fait un test de ce que vaut cette catégorie de preuves. Voici le registre.
• La pull request du catalogue a indiqué le bon prix. La soumission du 21 septembre, qui ajoutait Grok 4.7 aux catalogues Zen et Go d’un client d’agent open source — ouverte à 05:36 UTC, fermée automatiquement par un bot de conformité à 07:46 UTC en raison d’une section manquante du modèle de pull request, jamais fusionnée — listait le modèle aux tarifs publiés de Grok 4.6. Il s’est avéré exact : $2/$6, inchangé. Mais le mécanisme compte plus que le résultat. Le contributeur a copié les tarifs du modèle situé au-dessus, et cette copie s’est trouvée être la bonne supposition. C’est de la chance, pas de l’autorité, et les revendications de capacités de la même pull request ne portaient aucune information non plus. Une proposition peut être juste et ne pas constituer une preuve pour autant.
• La trace de provisionnement était authentique et ne constituait pas la sortie. La ligne grok-4.7 sur la page des quotas de modèles de la Google Cloud Console, signalée par des trackers communautaires les 16 et 17 septembre, et l'identifiant de build daté grok-4-7-0907 apparu dans une erreur de configuration de Grok Bot, désignaient tous deux un modèle en préparation. Ni l'une ni l'autre n'était associée à une date par quiconque, et ni l'une ni l'autre n'était l'annonce. Ce qu'elles établissent, c'est qu'une infrastructure tierce était en cours de préparation — ce qui, rétrospectivement, était exact et ne constituait toujours pas un calendrier.
• Le nombre de paramètres n’a jamais été confirmé. Environ 2 100 milliards, soit environ 40 % de plus que Grok 4.6, répété par Musk le 2 septembre — et toujours absent de toutes les fiches de spécifications au lancement. C’est le cas le plus clair de toute la saga d’un chiffre qui a circulé assez largement pour être traité comme un fait, alors qu’il n’a jamais eu de source fournisseur.

La fiche ci-dessus consigne l’état d’avant-lancement tel que cet article l’a vérifié en dernier : aucun identifiant de modèle, aucune date de sortie, aucun benchmark publié. Chacune de ses lignes a depuis été supplantée par l’annonce du 21 septembre, et elle est conservée ici parce que l’écart entre cette fiche et le modèle livré constitue l’histoire même des six dernières semaines — un lancement de pointe qui n’a produit aucune spécification confirmée avant le jour de sa livraison.
• La mise en garde sur l'état de préparation est la question ouverte, et elle dispose désormais de preuves partielles. Musk a déclaré à la mi-septembre que Grok 4.7 « s'achève prématurément » sur les tâches de haute difficulté et que sa vérification des réponses « n'est pas assez stricte », ce qu'il a attribué à une pénalité d'apprentissage par renforcement pour les réponses longues fixée trop haut, avec la nuance « peut-être ». L'annonce de lancement n'aborde pas ce point. Le correctif annoncé par xAI est indirect : un apprentissage par renforcement plus long, pondéré en faveur de tâches de plusieurs heures, et une meilleure auto-vérification constituent exactement le changement que l'on apporterait pour remédier à un arrêt prématuré. Le résultat du Coding Agent Index est le premier signe extérieur que cela a fait bouger les lignes — 56 contre 47 pour Grok 4.6, avec Terminal-Bench 4.0 qui a presque doublé, passant de 18 % à 33 %, soit précisément l'extrémité longue durée et à nombreuses étapes du spectre. Ce n'est pas une réponse nette, car ces mêmes scores de banc d'essai sont aussi ceux qui achètent leurs gains avec bien plus de tokens de sortie. Savoir si le modèle abandonne encore les tâches longues et difficiles est vérifiable par quiconque dispose d'un accès à l'API, et cela reste la première chose à tester.
• Le corpus de SpaceX n’est toujours pas vérifié. Le supplément d’entraînement rapporté — télémétrie Starlink, journaux de pression de la chambre de combustion de Raptor, télémétrie de rentrée de Starship, fils de discussion Slack internes, tickets Jira, dépôts GitHub et enregistrements ERP — relève de rapports communautaires sur ce que Musk a dit, et non d’une divulgation de l’entreprise. L’annonce de lancement décrit un modèle de base plus grand et une phase d’apprentissage par renforcement plus longue, et ne dit rien sur le corpus. S’il s’y trouve, aucune fiche de spécifications ne le confirmera ; la seule preuve sera de savoir si le modèle accomplit, sur de vrais travaux d’ingénierie, quelque chose que ses pairs ne peuvent pas faire.
Le calendrier qui s'est trompé quatre fois, et ce sur quoi le marché a vu juste
Grok 4.7 a été promis, en public, sur cinq calendriers distincts, et les quatre premiers ont expiré. Les 24 et 25 juillet, Musk a parlé d’environ quatre semaines, ce qui laissait entendre le 22 août. Le 12 août, il a révisé son estimation à « 3 à 4 semaines », ce qui laissait entendre du 2 au 9 septembre. Le 2 septembre, il a resserré à environ dix jours, ce qui pointait vers le 12 septembre. Le 11 septembre, le jour où ce délai a expiré, il a déclaré « quelques jours de plus ». Le cinquième n’était pas du tout une fenêtre — une ligne grok-4.7 sur une page de quotas Google Cloud — et c’était celui qui était le plus proche de la vérité : le modèle est sorti le 21 septembre, peu après la dernière date à laquelle quiconque s’était engagé, et sans qu’aucune date ne soit attachée à l’artefact qui l’avait précédé.
Les marchés de prédiction ont eu raison sur le calendrier et tort sur le modèle. Le contrat de Kalshi « SpaceXAI sort Grok 4.7 avant le 18 septembre ? » a cessé d'être négocié à 03:59 UTC le 18 septembre, après avoir changé de mains pour la dernière fois à 65 ¢, avec 1 785 contrats échangés et 1 211 ouverts. Tous les contrats réglés sur les deux principaux marchés — les fenêtres du 14, 21, 28 et 31 août et du 4, 8 et 11 septembre de Kalshi, ainsi que les contrats des 12 et 14 septembre de Polymarket — ont été résolus Non. Le contrat de Polymarket « prochain modèle Grok (4.7 ou supérieur) sorti avant le 18 septembre ? » affichait 64 % le 15 septembre après avoir oscillé entre 42 % et 88,5 % sur onze jours. Le marché a eu raison de prendre le contrepied des pics alimentés par les tweets, et raison de penser que la fenêtre du 18 septembre se terminerait vide. Il a eu trois jours d'avance sur le modèle, ce qui est la seule chose qu'un contrat daté ne peut pas tarifer.
Les nombres de vues méritent d’être conservés comme note de calibration. Le compte à rebours de Musk du 2 septembre, « sort dans 10 jours », a attiré 10,29 millions de vues et était faux. Son rétropédalage du 11 septembre a attiré 2,05 millions de vues et était lui aussi faux. Ses publications de feuille de route des 13 et 14 septembre ont attiré environ 1,99 million de vues et étaient les plus proches de la vérité — il y décrivait Grok 4.8, un modèle d’environ 2 500 milliards de paramètres entraîné sur une pile C++ conçue de zéro, comme « une amélioration notable » par rapport à Grok 4.7. La portée a suivi la confiance, pas l’exactitude, tout au long.
Deux points de la feuille de route sont désormais des questions ouvertes plutôt que des prédictions. Grok 4.8 n'a pas d'ID de modèle, pas de tarification, pas de fenêtre de contexte et aucune entrée dans les benchmarks, nulle part. Et l'idée selon laquelle Grok 4.7 aurait été discrètement « rebaptisé » en Grok 4.8 — l'interprétation d'un média à partir du fait que Musk a nommé la 4.8 alors que la 4.7 était en retard — est tranchée dans l'autre sens : la 4.7 est sortie en tant que 4.7, à 46 dans l'Index contre 44 pour Grok 4.6, ce qui est l'incrément d'un successeur et non un relancement.
Ce que cela signifie pour les équipes qui appellent Grok aujourd'hui
Le tableau pratique a changé le 21 septembre, et il a changé de la manière la moins spectaculaire possible : un nouvel ID de modèle avec le même prix, la même fenêtre de contexte, un gain de deux points sur l'Index, un gain de neuf points sur l'agent de codage et un gain de 111 points sur le travail intellectuel. Deux changements depuis lors comptent plus qu'ils n'en ont l'air. Les applications Grok confient désormais le modèle aux utilisateurs ordinaires plutôt qu'aux seuls développeurs, et le catalogue de ce côté le référence désormais — ensemble, ils transforment la couche de routage décrite à la fin de cet article d'un plan en un choix par défaut. Si votre modèle de coûts a été construit sur Grok 4.6 à 2 $/6 $, le prix par token reste correct pour Grok 4.7 — mais le nombre de tokens ne l'est pas. Le propre test d'Artificial Analysis a brûlé 240 millions de tokens de sortie sur l'Intelligence Index, contre une médiane de 94 millions parmi les modèles qu'il suit, de sorte que la même requête peut coûter bien plus du double même si la grille tarifaire est identique, ce qui est le genre de changement qui n'apparaît jamais dans un tableau de prix. Évaluez le coût d'une vraie boucle agentique sur les tokens de sortie, et non sur le tarif par million, avant de conclure que cette version est gratuite. Si votre raison de changer est la frontière prix-performance revendiquée par le fournisseur, la preuve la plus solide en est désormais AA-Briefcase plutôt que le tableau du fournisseur : quatrième à ce classement pour environ la moitié du coût par tâche de Claude Opus 5, face à un écart de sept points à l'Intelligence Index avec Claude Fable 5.1 et un écart de prix allant dans l'autre sens, d'un facteur cinq en entrée et de plus d'un facteur huit en sortie. Et si votre charge de travail est spécifiquement un agent de codage, l'argument est plus fort que ne le suggère l'Index : 56 sur le Coding Agent Index dans le harnais Grok Build, devant GPT-5.6 Sol, relève d'une autre catégorie que 46 en intelligence générale. Lequel de ces éléments compte le plus dépend entièrement de votre charge de travail, et personne en dehors de SpaceXAI n'a exécuté Grok 4.7 sur la vôtre.
Sur le catalogue d'OrcaRouterla gamme Grok fait désormais tourner Grok 4.7 aux côtés de Grok 4.6, Grok 4.5 et Grok 4.3, facturés au prix catalogue du fournisseur avec 0 % de marge — 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, les lectures d'entrée mises en cache à 0,50 $, et le même palier à 4 $ en entrée et 12 $ en sortie dès qu'une requête franchit les 200 000 jetons d'entrée, tels que facturés par SpaceXAI. Voilà ce que permet de faire la transmission de la grille tarifaire sans y toucher : le prix par jeton dans votre modèle de coûts est le prix par jeton figurant sur votre facture, et tous les modèles de la famille répondent à une seule clé, si bien que déplacer une charge de travail de Grok 4.6 vers Grok 4.7 est un simple changement de chaîne plutôt qu'un second contrat. Cette page présente la fenêtre de contexte de 500 000 jetons et la même surface compatible OpenAI — Chat Completions et Responses — que cible déjà une intégration Grok 4.6.

Cette couche de routage est aussi le moyen à faible risque d'évaluer un modèle dont les chiffres indépendants sont tombés le jour même que ceux du fournisseur. La liste de benchmarks ci-dessus reste celle du fournisseur — ses évaluations choisies, ses niveaux d'effort choisis, ses colonnes de comparaison choisies — et rien de tout cela n'a été reproduit. Ce qui a changé, c'est que les trois scores Artificial Analysis ne viennent pas du fournisseur, si bien que la question est passée de « est-ce que tout cela est réel » à « auquel de ces résultats ressemble ma charge de travail » : le 46 qui dit une intelligence générale de milieu de tableau, le 56 qui dit quatrième parmi les agents de codage à harnais natif, ou le 1 657 qui dit quatrième sur le travail de connaissance à la moitié du coût par tâche de la frontière. Et le chiffre qui décide de l'économie n'est pas un benchmark du tout, mais les tokens de sortie qu'une exécution consomme, ce que seul votre propre trafic peut chiffrer — 240 millions par exécution Index selon la mesure d'Artificial Analysis, contre une médiane de 94 millions, et environ 8 $ contre 4,40 $ par ensemble de présentations d'exemple sur son scénario public AA-Briefcase-Lite. Le basculement automatique vous permet de diriger du trafic réel vers le nouveau modèle et de revenir à un fournisseur qui répond encore si la facture de tokens ou le comportement d'abandon prématuré s'avère pire que ce qui est annoncé — c'est la différence entre tester un modèle non éprouvé et parier un pipeline dessus.
Comment savoir en premier (la vérification qui a fonctionné)
Cette section était autrefois une liste de signaux à surveiller pendant l’attente. L’attente est terminée, voici donc la même liste évaluée par rapport à ce qui s’est réellement produit.
• La liste des modèles a été la confirmation, et elle a bougé. Pendant six semaines, le conseil dans cet article était de surveiller la liste des modèles du fournisseur plutôt que les tweets, parce que dès que Grok 4.7 serait réel, la liste gagnerait un ID de modèle avec un prix et une fenêtre de contexte attachés. C'est ce qui s'est passé : grok-4.7 apparaît maintenant avec une fenêtre de contexte de 500K, un prix de 2 $/6 $ en dessous de 200K d'entrée et de 4 $/12 $ au-dessus, une date de coupure des connaissances de mai 2026 et quatre niveaux d'effort. Chaque fenêtre Musk, chaque argument de cadence et chaque date de marché n'ont pas réussi à faire bouger cette liste ; la sortie l'a fait bouger.
• Les catalogues tiers précèdent l’annonce, et ce sont des propositions plutôt que des déploiements. La pull request de catalogue du 21 septembre en était la version la plus claire à ce jour, et sa clôture est instructive : un contributeur s’est préparé pour un modèle, un bot a fermé la modification en raison d’une section de gabarit manquante deux heures plus tard, et le modèle a été livré deux jours après. Lisez cette classe d’artefacts comme une intention avec un horodatage. Elle se situe véritablement en amont de l’annonce, et elle ne constitue pas une disponibilité.
• Consultez le catalogue de modèles OrcaRouter. La donne a désormais changé. Tout au long du mois de septembre, le conseil donné dans cet article était qu'une page du modèle grok-4.7 sur orcarouter.ai constituerait le signal « vous pouvez l'appeler dès aujourd'hui via nous », car un modèle n'est listé qu'une fois qu'un fournisseur l'a intégré. Le catalogue propose désormais Grok 4.7 au tarif du fournisseur, sans marge, donc la vérification que l'on demandait au lecteur d'effectuer a une réponse : il est routable dès aujourd'hui via une seule API.
• En matière de visibilité côté consommateur, l'application Grok a désormais placé Grok 4.7 sous les yeux d'utilisateurs qui n'ouvriront jamais une console d'API. À la relecture du 2 octobre, les données du sélecteur que grok.com sert à un visiteur déconnecté nomment encore le modèle sur deux de ses quatre entrées — Expert affiche « Thinks hard · Grok 4.7 » et Heavy « Team of Experts · Grok 4.7 » — tandis que Fast, qui est le mode dans lequel l'application s'ouvre par défaut, n'est décrit que comme « Quick responses », et Auto comme un choix entre Fast et Expert. Les quatre entrées sont Auto, Fast, Expert et Heavy. Build n'en fait pas partie : Grok Build est un produit terminal distinct, sur sa propre page, et c'est de cette page que provient réellement l'attribution Build du modèle — elle invite les visiteurs à « install now and start building with Grok 4.7 ». Ainsi, l'affirmation qui a circulé le 1er octobre et a été reprise le 2 octobre — selon laquelle Grok 4.7 serait désormais le modèle de base pour « Fast, Expert, Build and Heavy » — énumère un mode que l'application ne propose pas et omet celui dans lequel elle s'ouvre ; et il s'agit de la lecture des traqueurs, non de celle du vendeur, car SpaceXAI n'a rien publié du tout sur ce déploiement. L'étape équivalente pour Grok 4.5 avait eu droit à son propre billet de blog ; celle-ci a un produit qui a changé discrètement, sous une page d'actualité qui, elle, n'a pas changé.
L'état des lieux
Grok 4.7, le 21 septembre 2026, à 2 $ par million de jetons d’entrée et 6 $ par million de jetons de sortie, avec une fenêtre de contexte de 500 000 jetons et une date de coupure des connaissances de mai 2026. Ce qui a changé au cours des onze jours écoulés depuis, c’est la carte des disponibilités plutôt que le modèle : Amazon Bedrock l’a ajouté le 28 septembre, il a commencé à être déployé dans les applications web et mobiles de Grok le 1er octobre et l’était encore le 2 octobre, et il est désormais répertorié sur OrcaRouter au propre tarif de SpaceXAI, sans marge. Ses scores indépendants sont arrivés le jour même du lancement et ne concordent toujours pas : 46 au niveau d’effort xhigh sur l’Indice d’intelligence v4.3.2 d’Artificial Analysis, deux points au-dessus de Grok 4.6 et assez pour placer SpaceXAI parmi les quatre meilleurs laboratoires de l’indice ; 56 sur l’Indice des agents de codage dans le harnais Grok Build, neuf points au-dessus de Grok 4.6 et quatrième parmi les modèles à harnais natif, devant GPT-5.6 Sol ; et 1 657 Elo sur AA-Briefcase, 111 points au-dessus de Grok 4.6 et quatrième du classement, derrière trois entrées d’Anthropic, pour environ la moitié du coût par tâche de Claude Opus 5. Tous les benchmarks du tableau de lancement du fournisseur sont ceux du fournisseur et n’ont pas été reproduits, à une exception près : le tableau AA-Briefcase d’Artificial Analysis publie le même 1 657, et le fournisseur a depuis revu sa propre ligne Terminal-Bench de 38,0 % à la baisse, à 37,6 %. Les gains en codage et en travail intellectuel sont réels et coûtent des jetons de sortie — 240 millions par exécution de l’Index contre une médiane de 94 millions, et environ 8 $ contre 4 $ par ensemble de diapositives d’exemple dans le scénario public de due diligence d’AA — c’est le chiffre qui détermine si cette version est peu coûteuse. Le chiffre d’environ 2 100 milliards de paramètres qui a circulé pendant deux mois n’a toujours aucune source du fournisseur, et la réserve sur l’abandon prématuré n’a jamais été traitée directement, bien que le bond de Terminal-Bench de 18 % à 33 % dans le harnais Grok Build soit la première preuve externe que le correctif a fonctionné. Les deux signaux que cet article demandait aux lecteurs de surveiller se sont déclenchés : la liste de modèles du fournisseur s’est enrichie de grok-4.7 avec un prix et une fenêtre de contexte associés, et le catalogue ici le répertorie au même tarif. Le choix gagnant est donc plus simple qu’en septembre — Grok 4.6 à 2 $/6 $ était la réponse, et Grok 4.7 à 2 $/6 $ est la même réponse avec un identifiant de modèle plus récent, de meilleurs scores en codage et en travail intellectuel, une facture de jetons bien plus élevée et une application grand public qui le nomme dans ses deux modes les plus difficiles.
Comparés dans cet article3
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
