
GPT-6 vs Grok 4.7 : la colonne de sortie tranche
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
GPT-6 Sol et Grok 4.7 facturent la même chose pour les jetons d'entrée — 2,00 $ par million, les deux — ce qui rend la colonne d'entrée inutile pour choisir entre eux. La décision se situe une colonne à droite. GPT-6 Sol facture 10,00 $ par million de jetons de sortie ; Grok 4.7 facture 6,00 $. Et les deux modèles sont en désaccord sur la quantité de sortie que vous êtes autorisé à produire en un seul appel d'un facteur trois et demi : GPT-6 Sol plafonne à 128 000 jetons, tandis que Grok 4.7 — le fleuron de SpaceXAI, sorti le 21 septembre 2026 comme successeur de Grok 4.6 — va jusqu'à 450 000.
Tout le reste dans cette confrontation découle de ces deux faits, plus un troisième : GPT-6 Sol dispose de la fenêtre de contexte la plus large, 1 050 000 tokens contre 500 000 pour Grok 4.7. Il ne s'agit donc pas de l'histoire d'un modèle meilleur que l'autre. C'est l'histoire de deux modèles aux formes différentes, et de la forme que prend votre charge de travail.
Commencez par donner à votre requête la bonne forme.
La bonne façon de départager GPT-6 et Grok 4.7 consiste à déterminer quelle ressource votre tâche consomme réellement. Trois cas couvrent la majeure partie du trafic de production.
Entrée longue, sortie courte. Vous alimentez un grand document, une base de code ou une longue transcription d'agent et vous obtenez en retour un résumé, un diff ou une décision. Ici, la fenêtre de contexte est la contrainte déterminante, et les 1 050 000 tokens de GPT-6 Sol représentent environ le double des 500 000 de Grok 4.7. Mais notez la ligne des paliers sur les deux fiches : le tarif de 2,00 $ de Grok 4.7 s'applique jusqu'à 200 000 tokens d'entrée et passe à 4,00 $ au-delà, tandis que le tarif de 2,00 $ de GPT-6 Sol s'applique jusqu'à 272 000 et passe à 4,00 $ ensuite. À 200 001 tokens, Grok a déjà changé de tarif et GPT-6 Sol non, donc un document de 250 000 tokens coûte 4,00 $ par million sur Grok 4.7 et 2,00 $ par million sur GPT-6 Sol — le double, avant même de compter la sortie.
Entrée courte, sortie longue. Vous générez : un document long format, un grand fichier de code, un artefact structuré, ou une chaîne d’appels d’outils dont le modèle doit écrire les résultats. C’est le cas pour lequel Grok 4.7 est conçu. Un plafond de sortie de 450 000 tokens dépasse de plus d’un ordre de grandeur ce que la plupart des modèles autorisent, et à 6,00 $ par million de tokens de sortie contre 10,00 $, vous payez 40 % de moins pour chacun de ces tokens. Si votre génération dépasse régulièrement 128 000 tokens de sortie, GPT-6 Sol ne peut pas du tout traiter la requête en un seul appel, et Grok 4.7 le peut.
Équilibré et lourd sur les deux. Une entrée longue et une sortie longue combinées : c'est le cas où les deux cartes interagissent. Une entrée de 400 000 tokens avec une sortie de 200 000 tokens est facturée 4,00 $ en entrée et 12,00 $ en sortie sur Grok 4.7 (les deux au-dessus de son seuil), contre 4,00 $ en entrée et 15,00 $ en sortie sur GPT-6 Sol. C'est la seule configuration où GPT-6 Sol est le modèle le plus cher par token, et il vaut la peine de comparer vos propres moyennes à ce cas avant de conclure que le choix par défaut de l'ère ChatGPT est moins cher.
Ce qu’OpenAI a changé, et pourquoi cela compte ici
GPT-6 est une famille de trois modèles, et le 7 octobre 2026, OpenAI a présenté celui du milieu au public. GPT-6 dans ChatGPT — le déploiement de l'Intelligent UI — est propulsé par GPT-6 Sol pour les offres Plus, Pro, Business et Enterprise, et par GPT-6 Luna pour Free et Go, touchant ainsi plus de 1,2 milliard de personnes qui utilisent ChatGPT chaque semaine. Il s'agit là d'un fait de distribution plutôt que d'un fait de capacité, et cela change ce que « GPT-6 » signifie dans une comparaison : lorsque quelqu'un dit que GPT-6 a battu un autre modèle ou perdu contre lui sur un benchmark donné, il parle en général précisément de GPT-6 Sol, ou du modèle phare GPT-6 Astra, à 10,00 $ / 50,00 $.
Pour cette confrontation, le déploiement de ChatGPT compte d’une manière concrète. Grok 4.7 est sorti le 21 septembre 2026, quatre jours avant GPT-6 Sol, et il s’agit d’un pur modèle API et application, sans équivalent grand public par défaut à un milliard d’utilisateurs. La description qu’en fait SpaceXAI elle-même est restreinte et précise : un fleuron pour l’ingénierie logicielle de longue durée, les flux de travail agentiques avec utilisation d’outils et auto-vérification, et le travail intellectuel. C’est une déclaration sur le travail à forte production de résultats, ce qui correspond exactement au profil où l’atout de Grok est plus fort.
Le tableau des scores, honnêtement étiqueté
L’évaluation indépendante de ces deux produits provient d’Artificial Analysis, et le bilan est qu’ils sont proches sur l’indice composite et divergent sur les tests individuels d’une manière qui correspond aux produits.
• AA Intelligence Index : Grok 4.7 46,4 (16e rang des modèles qu'il évalue), GPT-6 Sol 47,6 — GPT-6 Sol en avance d'environ un point
• Humanity's Last Exam : Grok 4.7 43,1 %, GPT-6 Sol 47,9 %
• SciCode : Grok 4.7 57,4 %, GPT-6 Sol 57,6 % — pratiquement à égalité
• Long-Context Recall : Grok 4.7 76,7 %, GPT-6 Sol 83,7 % — GPT-6 Sol en avance, ce qui est cohérent avec la fenêtre plus grande
• Terminal-Bench (v4.0 sur la fiche de Grok) : Grok 4.7 25,8 %, GPT-6 Sol 43,9 % sur la même famille de harnais d'évaluation
• Codage : Grok 4.7 se classe dans le décile supérieur de l'indice de codage, aux côtés des modèles les plus puissants du classement
Deux réserves, et elles ne sont pas décoratives. Les valeurs d'indice des deux modèles ont été évaluées à des dates différentes ; il ne s'agit donc pas d'une comparaison directe le même jour, et un point d'écart se situe dans la marge de variation qu'une révision produit. Et chaque chiffre de Grok 4.7 ci-dessus est le nombre publié par le fournisseur lui-même, tel que repris dans le catalogue, et non un score que nous avons recalculé — l'interprétation honnête est que Grok 4.7 est un modèle de codage du décile supérieur qui se situe à environ un point derrière GPT-6 Sol sur un composite de raisonnement général, et que l'écart sur terminal-bench est le signal isolé le plus important de l'ensemble.

La latence et la fiabilité, que la fiche technique cache
Les grilles tarifaires publiées et les tableaux de référence omettent tous les deux ce qui détermine la qualité de service en production, il vaut donc mieux examiner les chiffres mesurés plutôt que ceux du marketing.
D'après les propres mesures du playground d'OrcaRouter au cours de la première semaine d'octobre 2026, Grok 4.7 a renvoyé une latence médiane du premier token de 3 825 ms et a produit une sortie à environ 147 tokens par seconde, avec un taux d'erreur d'environ 8 %. La latence médiane mesurée de GPT-6 Sol sur la même fenêtre était plus élevée — 6 363 ms — avec un taux d'erreur bien plus élevé. Il s'agit d'observations de playground sur une route partagée, et non d'un SLA de fournisseur, et un taux d'erreur de 39 % sur la route d'un modèle est un problème de routage plutôt qu'un problème de modèle ; c'est exactement le type d'écart que le mécanisme de bascule existe pour couvrir. Ce qu'il faut retenir pour une comparaison, c'est qu'une route Grok 4.7 semblait nettement plus réactive et plus fiable qu'une route GPT-6 Sol dans cette fenêtre particulière, et qu'aucune fiche publiée par l'un ou l'autre fournisseur ne vous l'aurait dit.
Exécuter les deux sans s’engager ni pour l’un ni pour l’autre.
La tentation, dans un duel aussi serré, est d'en choisir un à l'avance sur la base du prix, puis de découvrir trois mois plus tard que la forme de votre trafic a changé. C'est le problème que le routage résout. Sur OrcaRouter, grok/grok-4.7 et GPT-6 Sol sont tous deux des routes actives dans le même catalogue derrière une seule API, au prix catalogue du fournisseur avec 0 % de marge — ainsi, lorsqu'un tarif évolue chez SpaceXAI ou OpenAI, le changement est actif le jour même plutôt qu'au moment de votre prochain rapprochement de factures. Le basculement automatique entre fournisseurs couvre le cas où une route se dégrade, ce qui est directement pertinent compte tenu de l'écart de taux d'erreur ci-dessus. Et le DSL de routage vous permet de répartir le trafic selon la forme des requêtes plutôt que selon la préférence de modèle : confiez le travail à entrée longue et sortie courte au modèle doté de la plus grande fenêtre, confiez la génération à sortie longue à celui dont le plafond est de 450 K et le tarif de sortie est le plus avantageux, et laissez un prédicat de taille de requête faire le choix à la place d'un humain.
Choisir
Si votre travail consiste en de l’analyse de documents longs, du raisonnement à grand contexte ou quoi que ce soit qui se situe au-dessus de 200 000 tokens d’entrée, GPT-6 Sol est la meilleure carte : deux fois plus de contexte, un indice indépendant plus élevé et un seuil qui se situe 72 000 tokens plus loin. Si votre travail est de la génération — de longs artefacts de code, de la rédaction longue, de longues chaînes d’appels d’outils où le modèle doit écrire ce qu’il a trouvé — Grok 4.7 est la meilleure carte : un plafond de sortie de 450 000 tokens que GPT-6 Sol ne peut pas atteindre, des tokens de sortie 40 % moins chers et un profil de codage dans le décile supérieur pour faire jeu égal. Si vous faites réellement les deux, la réponse n’est pas un modèle. C’est une route.


Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
