Carte de titre générée indiquant GPT-6 vs Grok 4.6, deux niveaux intermédiaires, une facture qui diverge au-delà de 200 K tokens, avec des cartes de statistiques affichant un prix d'entrée de 2,00 $ vs 2,00 $ par million, un palier de requête longue de 272 K vs 200 K tokens d'entrée, et un prix de sortie au-dessus du palier de 15,00 $ vs 12,00 $ par million, avec un pied de page indiquant les tarifs en contexte court de GPT-6 Sol et de Grok 4.6 selon la carte tarifaire propre à chaque fournisseur ; les paliers en contexte long selon les mêmes cartes.
Guides & Insights

GPT-6 vs Grok 4.6 : deux paliers intermédiaires, une facture qui diverge au-delà de 200 K tokens

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

GPT-6 Sol et Grok 4.6 coûtent le même prix, soit 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie, en tête des deux colonnes. Ce que presque personne n'imprime à côté de cela, c'est que les colonnes cessent de correspondre à des seuils différents de la requête. Grok 4.6 commence à facturer son tarif de contexte long dès qu'une invite dépasse 200 000 jetons d'entrée ; GPT-6 Sol attend 272 000. Au-delà de ces seuils, toute la requête est refacturée — pas seulement le dépassement — et les deux fournisseurs la refacturent dans des directions opposées, ce qui est l'élément qui décide d'une facture pour une longue exécution d'agent. GPT-6 Sol et ses frères GPT-6 Astra et GPT-6 Luna sont sortis le 22 septembre 2026 ; Grok 4.6, le niveau intermédiaire de la gamme de SpaceXAI, est sorti le 12 août 2026 et a déjà été rejoint par Grok 4.7, il s'agit donc d'une comparaison entre deux modèles déjà commercialisés et non du lancement de l'un ou de l'autre.

Une deuxième chose a changé le 7 octobre 2026, et elle est déterminante pour la façon dont vous interprétez GPT-6 : OpenAI a commencé à déployer GPT-6 dans l’onglet Chat principal de ChatGPT, avec une arrivée sur les offres gratuites le 8 octobre, les offres Plus, Pro, Business et Enterprise faisant tourner GPT-6 Sol, et les offres Free et Go faisant tourner GPT-6 Luna. C’est un changement de surface — les mêmes modèles, un public bien plus vaste, et une nouvelle couche d’interface qu’OpenAI appelle Intelligent UI. Cela ne modifie pas le moindre débit d’API. Cela signifie en revanche que si vous évaluez « GPT-6 » par rapport à quoi que ce soit, vous évaluez désormais par rapport à un modèle auquel un très grand nombre de personnes parle aussi dans un onglet de navigateur.

Là où les deux cartes diffèrent réellement

• Entrée en contexte court — GPT-6 Sol 2,00 $ par million vs Grok 4.6 2,00 $ par million
• Sortie en contexte court — GPT-6 Sol 10,00 $ par million vs Grok 4.6 6,00 $ par million
• Seuil des requêtes longues — GPT-6 Sol applique un tarif plus élevé au-delà de 272 000 jetons d'entrée vs Grok 4.6 au-delà de 200 000
• Entrée pour requêtes longues — GPT-6 Sol 4,00 $ par million vs Grok 4.6 4,00 $ par million
• Sortie pour requêtes longues — GPT-6 Sol 15,00 $ par million vs Grok 4.6 12,00 $ par million
• Entrée mise en cache — GPT-6 Sol 0,20 $ par million vs Grok 4.6 0,50 $ par million
• Fenêtre de contexte — GPT-6 Sol 1 050 000 jetons vs Grok 4.6 500 000 jetons
• Modalités d'entrée — les deux acceptent le texte, les images et les fichiers
• Score pour le travail intellectuel — GPT-6 Sol 47,6 vs Grok 4.6 44,3 sur l'Artificial Analysis Intelligence Index
• Terminal-Bench 2.1 — GPT-6 Sol non publié sur la même révision vs Grok 4.6 88,4

Lisez les deux lignes de sortie ensemble et la forme de la décision apparaît. Grok 4.6 est moins cher de 4,00 $ par million de tokens de sortie sur toute requête inférieure à 200 K, et seulement de 3,00 $ au-delà. C'est un écart bien plus faible que ne le suggère le chiffre phare de 40 %, car les deux modèles réévaluent le prix de l'ensemble de la requête plutôt que de la partie au-dessus du seuil — un détail sur lequel il vaut la peine de s'attarder, puisqu'une invite de 200 001 tokens n'est pas facturée comme un token au tarif élevé plus 200 000 au tarif bas.

Alors, le seuil lui-même joue en sens inverse. Grok 4.6 commence à changer de tarif 72 000 tokens plus tôt que GPT-6 Sol. Pour une charge de travail qui se situe constamment entre 200 K et 272 K, Grok 4.6 est le modèle le plus cher malgré son prix par token affiché plus bas, et c'est le seul des deux à avoir bougé, ne serait-ce qu'un peu. De quel côté de cette fenêtre se situent vos prompts est une question plus utile que de savoir quel prix affiché est le plus bas.

Generated comparison scoreboard titled GPT-6 vs Grok 4.6, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, long-request step above 272K input tokens, long-context output $15.00, context window 1,050,000 tokens, Intelligence Index 47.6. Grok 4.6: input $2.00 per million, output $6.00 per million, long-request step above 200K input tokens, long-context output $12.00, context window 500,000 tokens, Intelligence Index 44.3. A footer reads GPT-6 Sol rates per OpenAI's rate card and Intelligence Index per Artificial Analysis; Grok 4.6 rates per SpaceXAI's rate card and Intelligence Index per Artificial Analysis.

L’écart du benchmark est plus petit et plus étroit que l’écart de prix.

Sur l'Intelligence Index d'Artificial Analysis, qui est une mesure tierce plutôt qu'un tableau de fournisseur, GPT-6 Sol se situe à 47,6 et Grok 4.6 à 44,3. Un écart de 3,3 points sur une échelle de 0 à 100 est réel, mais ce n'est pas le genre de distance qui rend un modèle inadapté à une tâche et l'autre adapté. Il est aussi mesuré avec un réglage de raisonnement spécifique à chaque modèle, et GPT-6 Sol expose un effort de raisonnement configurable tandis que Grok 4.6 expose le sien — ainsi, quiconque cite un unique chiffre de comparaison directe ne cite qu'un point dans une grille bidimensionnelle.

Là où les deux se distinguent véritablement, c’est dans le travail agentique de type terminal. Sur Terminal-Bench 2.1, Grok 4.6 affiche 88,4. GPT-6 Sol n’a aucun chiffre publié comparable pour la révision que contient notre catalogue, et l’interprétation honnête d’une cellule vide est que le chiffre n’est pas publié — et non que le modèle a obtenu de mauvais résultats. Si la charge de travail est un agent piloté par shell sur de longues durées, les données publiées favorisent Grok 4.6 et l’absence de données ne compte pas comme preuve pour l’un ou l’autre camp.

L'inverse se vérifie pour la récupération de connaissances sur de longs contextes. GPT-6 Sol obtient 83,7 en rappel sur contexte long, contre 80,3 pour Grok 4.6, et les fournisseurs des deux modèles communiquent leurs propres chiffres ailleurs — SpaceXAI met en avant GPQA Diamond à 94,9 pour Grok 4.6, et les éléments d'OpenAI sur GPT-6 sont en grande partie rapportés par le fournisseur et non reproduits. Deux règles permettent de s'y retrouver : un chiffre de fournisseur est une affirmation, et un chiffre d'indice est une mesure sur une révision nommée. Ils ne sont pas interchangeables et ne doivent jamais être moyennés en un unique score « meilleur ».

Le problème du successeur

Ni l'un ni l'autre n'est le modèle le plus récent de son propre laboratoire, et prétendre le contraire serait la chose la plus trompeuse que cette comparaison puisse faire. SpaceX a lancé Grok 4.7 le 21 septembre 2026 au même tarif de base de 2,00 $ / 6,00 $, l'Artificial Intelligence Index passant de 44,3 à 46,3. OpenAI a lancé GPT-6 Sol le 29 septembre 2026, également au tarif de 2,00 $ / 10,00 $, avec l'Artificial Intelligence Index à 51,8 et un coût réel des entrées qui s'est amélioré, passant de 0,20 $ à 0,10 $ par million. Artificial Analysis signale désormais sa page GPT-6 Sol comme obsolète, en orientant les lecteurs vers GPT-6.1 Sol.

Donc le cadrage équitable n’est pas « lequel de ces deux devez-vous adopter » mais « lequel de ces deux, et êtes-vous sûr qu’il ne s’agit pas d’une génération plus récente d’un côté ou de l’autre. » La raison de rester sur GPT-6 Sol est généralement une intégration précise vieille de huit jours plutôt qu’une revendication de capacité ; la raison de rester sur Grok 4.6 est un chiffre publié pour un agent terminal que son successeur n’a pas encore égalé en public. Les deux sont légitimes, et les deux sont limités dans le temps.

OrcaRouter model page for Grok 4.6 (grok/grok-4.6) by SpaceXAI, dated 2026-08-12, showing the model tagged Vision, Tools, JSON and Reasoning, a 500K-token context window with text, image and file input and text output, a list price of $2.00 per million input and $6.00 per million output, and a p50 time to first token of 4.73 seconds.

Exécuter les deux à partir d'une seule touche.

Les deux modèles sont routés par OrcaRouter, donc la partie mécanique consistant à garder deux candidats en lice ne coûte rien : une seule API devant plus de 200 modèles, la même clé, pas de second contrat et aucun changement de code entre eux. Cela compte ici davantage que d'habitude, car le recours à un second modèle sur cette combinaison particulière n'est pas une assurance de capacités mais une décision de routage — envoyez la fenêtre 200K-272K à GPT-6 Sol et tout ce qui est plus court à Grok 4.6, et la même application obtient la facture la plus avantageuse des deux côtés d'un seuil qu'aucun des deux fournisseurs ne vous laisse choisir.

Le basculement automatique est la moitié ennuyeuse de la même configuration. Les exécutions d'agents à long contexte sont longues précisément parce que quelque chose maintient une session ouverte, et un hoquet d'un fournisseur à la quarantième minute est le type d'échec coûteux. Une seconde route configurée à l'avance transforme cela en une nouvelle tentative plutôt qu'en une réexécution.

Notre catalogue les répertorie tous les deux au prix catalogue de leur propre fournisseur, sans la moindre majoration, de sorte qu'un changement de tarif sur l'une ou l'autre carte arrive de notre côté le jour même où il arrive du leur. Cela mérite d'être dit sans détour plutôt que comme un slogan : la raison de s'en soucier, c'est que la différence de 0,20 $ contre 0,50 $ sur les entrées mises en cache ci-dessus est exactement le genre de ligne que les fournisseurs modifient discrètement, et une répercussion directe signifie que vous n'avez jamais à attendre qu'un revendeur rattrape son retard.

Artificial Analysis model page for GPT-6 Sol (Max), a proprietary OpenAI model released September 2026, carrying a banner stating the model is deprecated and that OpenAI has launched a newer release, GPT-6.1 Sol. The page shows an Intelligence rank of 25 of 225, an output speed of 87.9 tokens per second, $2.00 per million input tokens and $10.00 per million output tokens, a 90% cache discount, a $1.04 blended rate, and a note that the model generated 77 million tokens during the Index evaluation, described as fairly concise.

Qu'est-ce qui décide réellement ?

Si vos prompts sont courts, Grok 4.6 l'emporte sur le prix de sortie avec une marge qu'aucun delta d'indice ne comble, et son score d'agent terminal est le meilleur chiffre publié dans l'une comme dans l'autre colonne. Si vos prompts sont longs, le seuil de réévaluation plus tardif de GPT-6 Sol et sa fenêtre plus longue valent plus que son débit de sortie plus élevé, et la ligne d'entrée mise en cache représente un quart du coût. Si vos prompts se situent entre 200K et 272K, vous avez la seule charge de travail où le modèle qui paraît moins cher est le plus cher, et la solution est la sélection de route plutôt que la sélection de modèle.

Ce qu'il faut surveiller, ce n'est ni l'un ni l'autre de ces modèles, mais les deux successeurs déjà disponibles. Grok 4.7 et GPT-6.1 Sol affaiblissent tous deux l'argument en faveur d'attendre avant de décider ici, et une comparaison qu'il faut refaire toutes les trois semaines est une comparaison qui a sa place derrière un routeur plutôt que dans un document d'architecture.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement