
GPT-5.6 contre Grok 4.6 : à égalité sur l'indice, divisés sur le contexte et le prix
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligence49Code
Sur l'échelle de l'indice Artificial Analysis Intelligence, sur laquelle les deux modèles ont été évalués jusqu'au début septembre 2026, le GPT-5.6 d'OpenAI — dont le niveau phare, GPT-5.6 Sol, est ce que le nom d'API gpt-5.6 désigne — et le Grok 4.6 de SpaceXAI ont obtenu le même score : 61. Un indice indépendant qui place deux flagships rivaux à égalité est le type de résultat le plus rare dans une comparaison de modèles de pointe, et c'est là que cette confrontation devient intéressante plutôt que de s'arrêter. Les modèles qui sont à égalité sont commercialisés très différemment. Le GPT-5.6 Sol, le flagship qu'OpenAI a publié le 9 juillet et repositionné comme son niveau « valeur » lors du lancement de GPT-6 Astra le 3 septembre, affiche un tarif de 4,00 $ par million de jetons d'entrée et de 20,00 $ par million de jetons de sortie après une baisse de prix le 24 août, et prend en charge jusqu'à environ 1,05 million de jetons de contexte. Le Grok 4.6, publié par xAI le 12 août, est proposé à 2,00 $ / 6,00 $ et plafonne à 500 000 jetons. Même score sur le tableau indépendant, puis les deux modèles divergent sur jusqu'où l'on peut pousser une seule requête — et sur ce que coûte cette poussée.
Cette page existe désormais pour une raison concrète : les deux grilles tarifaires et les deux plafonds ont bougé à quelques semaines d'intervalle. Grok 4.6 est sorti le 12 août et, le 28 août, est devenu disponible dans les chats Grok classiques sur le web et mobile, après deux semaines initiales confinées à Grok Build et à l'API. La baisse promotionnelle de GPT-5.6 Sol est arrivée le 24 août, et dix jours plus tard, le lancement de GPT-6 Astra a discrètement rétrogradé Sol de flagship à flagship économique. Les deux modèles ci-dessous sont désormais ceux vers lesquels on se tourne lorsqu'on veut un raisonnement proche de la frontière sans payer les prix de la catégorie Astra — ce qui explique exactement pourquoi l'égalité 61 à 61 est devenue le véritable point de décision plutôt qu'une question de trivia.
Ce que « tied at 61 » signifie, et ce que cela ne signifie pas
Le score a besoin d'une date et d'une échelle. Artificial Analysis a mesuré GPT-5.6 Sol à environ 61 et Grok 4.6 à 61 sur l'échelle d'indice utilisée jusqu'au début septembre — l'échelle que citent les autres confrontations de GPT-5.6 de ce blog — avec Grok classé 11e des 202 modèles que suit AA et Sol à quelques rangs de lui avec le même score. AA a ensuite recalibré l'indice le 7 septembre (v4.3), une version qui resserre les scores : GPT-5.6 Sol y mesure 47, GPT-6 Astra et Claude Fable 5.1 mesurent 53, et aucun score global de Grok 4.6 n'a encore été publié sur la nouvelle échelle. L'égalité ci-dessous est donc une affirmation concernant l'échelle de septembre d'avant la recalibration, et elle se lit mieux comme une position relative : sur l'indice le plus récent qui les a évalués tous les deux, ces deux modèles étaient à égalité, et tous deux se situaient juste derrière la classe Claude Opus 5.
Encore une réserve au sujet de l'égalité, et elle a son importance pour l'usage que vous en ferez. Les deux scores ont été produits avec des réglages d'effort différents — GPT-5.6 Sol en raisonnement maximal, le réglage le plus élevé d'OpenAI (qui lance quatre sous-agents en parallèle pour les requêtes difficiles), et Grok 4.6 en mode élevé, le réglage par défaut de xAI sur son curseur allant de faible à très élevé. Les deux sont des configurations « tout donner », mais il ne s'agit pas de la même configuration, et l'égalité se joue entre ces deux réglages précis plutôt qu'entre tous les réglages que proposent les modèles. Ce que le score égal établit bel et bien, c'est qu'aucun des deux modèles ne détient un avantage d'intelligence générale que l'autre camp pourrait faire valoir à partir d'un indice composite indépendant — un acheteur qui choisit entre eux doit donc regarder au-delà de l'indice, vers le contexte, le prix et les preuves que chaque camp peut réellement présenter.
Deux grilles tarifaires, deux falaises.
Les deux fournisseurs facturent un long prompt comme un événement premium, et les deux facturent l'intégralité de la requête au palier supérieur une fois un seuil franchi — c'est le mécanisme commun qui rend cette comparaison de prix lisible. Le tarif d'OpenAI pour GPT-5.6 Sol est de 4,00 $ / 20,00 $ par million avec des lectures en cache à 0,40 $, et dès qu'une requête dépasse environ 272 000 tokens d'entrée, la requête entière est refacturée à 8,00 $ / 30,00 $ — la structure de long contexte documentée par Epoch AI le 8 septembre. Le tarif de xAI pour Grok 4.6 est de 2,00 $ / 6,00 $ avec des lectures en cache à 0,50 $, et dès qu'un prompt dépasse 200 000 tokens, la requête entière passe à 4,00 $ / 12,00 $.
• Publié — GPT-5.6 : 9 juillet 2026 (API publique ; l'alias gpt-5.6 atteint le palier Sol). Grok 4.6 : 12 août 2026.
• Prix catalogue par 1M (entrée / sortie) — GPT-5.6 Sol : $4.00 / $20.00, lectures en cache $0.40 (promo valable au moins jusqu'au 21 nov. 2026). Grok 4.6 : $2.00 / $6.00, lectures en cache $0.50.
• Palier de prompt long — GPT-5.6 Sol : requête complète à $8.00 / $30.00 au-delà de ~272K d'entrée. Grok 4.6 : requête complète à $4.00 / $12.00 à 200K d'entrée.
• Contexte / plafond de sortieGPT-5.6 Sol : ~1.05M en entrée, 128K en sortie. Grok 4.6 : 500K en entrée, aucun plafond de sortie publié.
• Index (indépendant) — GPT-5.6 Sol (max) ~61 vs Grok 4.6 (high) 61, échelle de septembre avant recalibrage.
• Modalité — les deux acceptent des entrées texte et image et produisent du texte.
Exécutez les chiffres calculés et le schéma est sans ambiguïté : pour chaque longueur de prompt que Grok 4.6 peut traiter, c'est l'option la moins chère, car son plafond réajusté se situe toujours au niveau ou en dessous du tarif standard de GPT-5.6 Sol.
• 100K en entrée / 8K en sortie — GPT-5.6 Sol : 0.10 × $4 + 0.008 × $20 = $0.56. Grok 4.6 : 0.10 × $2 + 0.008 × $6 = $0.25. Grok est environ 55 % moins cher sur la requête.
• 400K en entrée / 30K en sortie (les deux re-tarifés) — GPT-5.6 Sol : 0.40 × $8 + 0.03 × $30 = $4.10. Grok 4.6 : 0.40 × $4 + 0.03 × $12 = $1.96. Grok reste environ deux fois moins cher, même après son propre palier.
• 600K en entrée / 30K en sortie — GPT-5.6 Sol : 0,60 × 8 $ + 0,03 × 30 $ = 5,70 $. Grok 4.6 : impossible — 600K dépasse sa fenêtre de contexte de 500K. C’est la plage où Sol est la seule option, et où son prix cesse de paraître premium.

La géométrie du cliff diffère d'une manière qui favorise GPT-5.6 Sol : son seuil (272K) se situe plus haut que celui de Grok (200K), il existe donc une bande — environ 200K à 272K d'entrée — où Grok a déjà réajusté ses prix et Sol non. Même là, Grok tend à l'emporter en dollars, car son taux de sortie réajusté de 12 $ reste 40 % inférieur au tarif standard de 20 $ de Sol. L'économie ne bascule en faveur de Sol qu'au-delà de 500K jetons, ce qui est exactement la région que la fenêtre de contexte de Grok ne peut pas atteindre. Si vos longueurs de prompt restent sous 200K — ce qui est vrai pour la plupart des trafics de chat, de RAG et d'assistance au code — Grok 4.6 est moins cher à l'échelle, d'un facteur proche de deux sur le coût mixte, et le cliff de requête entière signifie que vous devez traiter 200K comme une limite de planification plutôt qu'une suggestion souple.
À quoi servent réellement les 500 000 jetons supplémentaires de Sol ?
La fenêtre de 500K de Grok 4.6 prend en charge davantage de charges de travail réelles que ce que la fiche technique laisse entendre — lectures de code source entier, longs transcriptions d'agents, grands contextes de récupération — et l'absence de plafond de sortie publié aide côté génération : pour un appel unique qui doit produire un très long artefact, Grok n'a aucun plafond documenté tandis que GPT-5.6 Sol s'arrête à 128K tokens de sortie. L'avantage de GPT-5.6 Sol se situe dans la bande 500K à 1,05M, et les charges de travail qui en ont réellement besoin sont plus étroites que ce que le marketing laisse entendre : des agents qui gardent en contexte un référentiel entier plus une longue historique de tâches, de très longues transcriptions de réunions ou de recherches analysées en une seule passe, et des travaux de récupération sur des corpus trop volumineux pour être découpés en fenêtres de taille Grok. Si aucun de vos pipelines ne touche cette bande, le contexte supplémentaire de Sol est une marge que vous payez au tarif d'entrée de 4,00 $ sans l'utiliser.
Les deux modèles orientent également le raisonnement différemment. GPT-5.6 Sol propose un curseur d'effort low / medium / high / max, où le mode max exécute quatre sous-agents en parallèle qui se coordonnent sur les tâches difficiles — ce qui revient à un petit essaim d'agents pour chaque requête difficile, puissant mais coûteux en jetons de sortie, et c'est le réglage qui se cache derrière le score d'indice d'environ 61. Grok 4.6 fait tourner un seul modèle avec un curseur allant de low à xhigh (high par défaut) et des outils côté serveur pour la recherche et l'exécution de code, ce qui rend son comportement plus prévisible pour le budget : une requête, un modèle, un coût que l'on peut estimer à partir de la grille tarifaire. Pour un développeur qui veut une dépense déterministe, la conception à modèle unique de Grok est opérationnellement plus simple ; pour les tâches les plus difficiles à long horizon, l'essaim à effort maximal de Sol est la configuration la plus capable — et c'est la raison pour laquelle son meilleur score et ses pires factures proviennent du même réglage.
Les preuves que chaque partie peut réellement présenter
Aucun des deux modèles ne présente d'avantage indépendant au classement de codage ; les preuves citables se répartissent donc selon le fournisseur. OpenAI annonce GPT-5.6 Sol à environ 96 % sur SWE-bench Verified — la meilleure référence de codage que l'un ou l'autre modèle puisse montrer, mais une évaluation déclarée sans audit indépendant publié à ce jour — et l'avantage de Sol en conditions réelles tient notamment à son intégration dans les outils Codex et ChatGPT. xAI annonce Grok 4.6 à 94,9 % sur GPQA Diamond, qu'elle présente comme le score le plus élevé jamais testé sur ce benchmark, et cite des évaluations agentiques coûtant en moyenne environ 0,84 $ de coût d'API par tâche complète ; ce sont dans les deux cas des chiffres du fournisseur. En vitesse, les deux modèles sont plus proches que ne le laisse penser l'écart de prix : AA a mesuré Grok 4.6 à 64,9 tokens de sortie par seconde et GPT-5.6 Sol dans la même plage d'environ 65 tokens par seconde, sur un service standard, tandis que l'aperçu « Ultrafast » d'OpenAI, propulsé par Cerebras (jusqu'à environ 750 tokens par seconde), reste limité et non tarifé. Lisez tout le tableau des preuves comme suit : égalité sur l'indice, preuves de codage des deux côtés sans audit indépendant pour aucun des deux, et aucun écart de vitesse de nature à changer la décision.
Quel défaut est rationnel en septembre 2026 ?
Choisissez Grok 4.6 lorsque votre trafic se situe sous 200K tokens d'entrée — le prix est proche de la moitié à chaque longueur desservie, l'indice indépendant indique que les modèles sont au même niveau, et un réglage mono-modèle avec outils côté serveur maintient la facture prévisible. Choisissez GPT-5.6 Sol lorsque vous avez réellement besoin de la bande de contexte de 500K à 1,05M, lorsque votre pile est déjà native Codex ou ChatGPT et que le chiffre rapporté d'environ 96 % sur SWE-bench donne au service achats une preuve de codage, ou lorsque vous voulez l'option de la configuration à quatre sous-agents en effort maximal pour les tâches à long horizon les plus difficiles. Et surveillez deux dates : la promotion à 4 $/20 $ de GPT-5.6 Sol n'est garantie qu'au moins jusqu'au 21 novembre 2026, après quoi cette comparaison évolue, et xAI a déjà laissé entrevoir un Grok 4.7 — l'un ou l'autre événement pourrait modifier la tarification de la confrontation sur laquelle vous vous apprêtez à standardiser.
Exécuter les deux sans réarchitecturer
Parce que l'égalité sur l'indice signifie que c'est une décision de plafond et de prix plutôt que de qualité, l'approche pratique pour la plupart des équipes est de router plutôt que de choisir. GPT-5.6 Sol et Grok 4.6 sont tous deux sur OrcaRouter aux prix catalogue de leurs fournisseurs, répercutés sans marge — les $4/$20 d'OpenAI et les $2/$6 de xAI sont les chiffres de la liste, et lorsque l'un ou l'autre fournisseur modifie un tarif, le nouveau prix est actif sur la même clé le jour même. Avec un endpoint compatible OpenAI, vous pouvez envoyer le trafic sous 200K vers Grok 4.6, faire remonter les requêtes qui nécessitent le contexte plus long de Sol ou sa configuration à effort maximal, et utiliser le basculement automatique afin qu'une limite de débit sur un chemin de fournisseur soit un événement de routage plutôt qu'une panne.

La partie prix de cette comparaison est celle qui bouge — la promotion Sol d'OpenAI n'est garantie que jusqu'au 21 novembre et xAI a un 4.7 sur la feuille de route — donc la référence que ce blog tient à jour est sa page de tarification GPT-5.6 Sol, datée et revérifiée à chaque modification de la grille tarifaire.

La réponse en deux lignes
Si vos prompts tiennent sous 500K tokens — et c'est le cas de la plupart — Grok 4.6 obtient le même score d'index indépendant que GPT-5.6 Sol à près de la moitié du prix, pour chaque longueur qu'il peut traiter, sans plafond de sortie publié et avec un réglage mono-modèle prévisible. GPT-5.6 Sol justifie son premium dans la plage que Grok ne peut pas atteindre : au-delà de 500K tokens de contexte, et dans l'outillage OpenAI où son score rapporté d'environ 96 % sur SWE-bench Verified et les paliers Terra et Luna en dessous vous offrent une famille plutôt qu'un modèle unique. L'égalité sur l'index signifie que cette décision relève des plafonds et des dollars, pas des capacités — alors mesurez vos prompts réels les plus longs avant de vous engager, car ce seul chiffre désigne le gagnant.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
