
GPT-6 Sol vs Grok 4.7 : Le token moins cher qui coûte trois fois plus cher
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Deux modèles sont sortis à un jour d’intervalle en septembre 2026, et sur l’étiquette, ils ne sont pas proches. Grok 4.7 est arrivé le 21 septembre à 2,00 $ par million de tokens d’entrée et 6,00 $ par million de tokens de sortie. GPT-6 Sol est arrivé le 22 septembre au même tarif de 2,00 $ en entrée et de 10,00 $ en sortie. La sortie de Grok est 40 % moins chère. C’est toute la base sur laquelle la plupart des comparaisons le choisiront, et c’est le mauvais chiffre à regarder.
Le chiffre qui détermine ce duo ne figure sur aucune des deux grilles tarifaires. C’est 240 millions contre 77 millions — les tokens de sortie que chaque modèle a générés pendant qu’Artificial Analysis exécutait son Intelligence Index. Grok 4.7 a brûlé un peu plus de trois fois plus de tokens pour répondre au même ensemble de questions. Multipliez cela par le tarif par token, et le modèle dont la sortie est la moins chère finit par coûter 3,74 $ par tâche accomplie, contre 1,06 $. Moins cher par token, plus de trois fois la facture.
Ce qu'est réellement chaque modèle
Grok 4.7 succède à Grok 4.6 de xAI et est positionné comme son modèle le plus puissant pour le codage et le travail intellectuel, avec une fenêtre de contexte de 500 000 jetons, une entrée texte et image, une sortie texte, et un effort de raisonnement configurable selon les niveaux low, medium, high et xhigh. xAI n'a pas divulgué de nombre de paramètres. Sa date de coupure de pré-entraînement est annoncée comme juin 2026, avec un entraînement complémentaire jusqu'à fin août.
GPT-6 Sol est le modèle GPT-6 de milieu de gamme d'OpenAI — en dessous du modèle phare GPT-6 Astra, au-dessus du modèle économique GPT-6 Luna — avec une fenêtre de contexte de 1 050 000 jetons, une entrée maximale de 922 000 jetons, un plafond de sortie de 128 000 jetons et une date de coupure des connaissances au 20 avril 2026. Il prend en entrée du texte et des images et produit du texte en sortie, avec un effort de raisonnement allant de none à max, et OpenAI a qualifié sa tarification de permanente plutôt que promotionnelle.
Les fenêtres de contexte ne sont pas proches. Celle de Sol est environ le double. Cela compte pour exactement une catégorie de charge de travail, et ce n’est pas celle que la plupart des gens exécutent.
La grille tarifaire, et la ligne qui l'inverse
• Entrée — GPT-6 Sol 2,00 $ par million de jetons vs Grok 4.7 2,00 $ par million de jetons ; identique
• Sortie — GPT-6 Sol 10,00 $ par million de tokens contre Grok 4.7 6,00 $ par million de tokens ; Grok est 40 % moins cher
• Entrée mise en cache — GPT-6 Sol 0,20 $ par million de tokens contre Grok 4.7 0,50 $ par million de tokens ; la lecture du cache de Sol est moins chère d’un facteur deux et demi, ce qui est l’opposé de ce que laisse entendre le tarif de sortie
• Écritures de cache — GPT-6 Sol 2,50 $ par million de jetons contre Grok 4.7, un tarif non publié sur la même feuille
• Fenêtre de contexte — GPT-6 Sol 1 050 000 jetons contre Grok 4.7 500 000 jetons
• Supplément pour contexte long — GPT-6 Sol refacture une requête au-delà de 272 000 jetons d'entrée à 2× les tarifs d'entrée et de cache et 1,5× la sortie pour toute la requête, contre Grok 4.7 qui double tous les tarifs à partir de 200 000 jetons d'entrée, également pour toute la requête
• Date limite des connaissances — GPT-6 Sol : 20 avril 2026 vs Grok 4.7 : une date limite de pré-entraînement annoncée comme étant juin 2026, avec un entraînement complémentaire jusqu'en août
• Effort de raisonnement — GPT-6 Sol none, low, medium (par défaut), high, xhigh, max vs Grok 4.7 low, medium (par défaut), high, xhigh
• Modalité — texte et image en entrée, texte en sortie, pour les deux
La ligne de cache est celle avec laquelle un acheteur devrait rester. Le tarif de sortie de Grok est plus bas, mais son entrée mise en cache est deux fois et demie celle de Sol, et c’est dans l’entrée mise en cache que vivent les longs historiques d’agents et les invites système répétées. Une charge de travail qui consiste surtout à relire un grand contexte stable trouvera les deux bien plus proches que ne le suggère un écart de 6 $ contre 10 $ — et une fois le ratio de volume de tokens appliqué par-dessus, l’ordre s’inverse.

Pourquoi 240 millions de tokens constituent toute l’histoire
Artificial Analysis a mesuré Grok 4.7 à xhigh générant environ 240 millions de tokens de sortie lors de son exécution d’index, contre une médiane d’environ 88 millions pour les modèles du même classement. Son propre résumé qualifie le modèle de « notablement lent et très verbeux ». GPT-6 Sol, mesuré sur le même banc d’essai, a généré 77 millions — décrit dans le classement comme « assez concis ».
Le tableau de bord indique aussi directement la conséquence. Grok 4.7 obtient un score de 46 sur l’Intelligence Index à 3,74 $ par tâche. À son réglage élevé, le score est également de 46 et le coût est de 2,73 $ par tâche. GPT-6 Sol obtient un score de 48 à 1,06 $ par tâche. Même indice, même harnais, et un écart de coût de deux à trois fois et demie qu’aucune grille tarifaire n’affiche.
Deux mises en garde avant de considérer ces chiffres comme une comparaison directe et propre. Les deux pages ont été capturées le même jour, mais les classements affichent des totaux différents — la page de Grok indique une classe de 212 modèles, et une autre fiche Grok rapporte un rang sur 655 — donc les deux scores ne sont pas garantis de provenir de la même version de l’indice. Et aucun des deux chiffres n’est un chiffre de fournisseur : Artificial Analysis exécute son propre banc d’essai, c’est là tout l’intérêt, mais les paramètres de raisonnement diffèrent entre les deux fiches (xhigh pour Grok, max pour Sol), alors considérez l’écart de coût de 500 % comme le constat, et l’écart de deux points sur l’indice comme approximatif.

Ce que xAI a publié, et ce que personne n'a vérifié
Les chiffres de lancement de xAI sont solides et, comme tous les chiffres de lancement d'un fournisseur, non reproduits. CursorBench 4.0 à 46,3 % en xhigh contre 40,4 % pour Grok 4.6. Terminal-Bench 4.0 à 38,0 % contre 20,3 % — la plus grande progression individuelle de cette version. DeepSWE v1.1 à 71,0 % en high contre 65,2 %. EEBench à 64,0 % contre 53,0 %. Il s'agit du harness de xAI, des réglages de xAI, du reporting de xAI.
Les chiffres d'OpenAI pour GPT-6 Sol suivent le même schéma et méritent la même décote. La différence, c'est que Sol dispose d'une preuve indépendante de plus que Grok : le chiffre de coût par tâche d'Artificial Analysis, calculé à partir de la consommation de tokens mesurée plutôt qu'à partir du tableau de scores d'un fournisseur. C'est ce chiffre-là qui survit à cette comparaison.
Ce que personne n'a publié pour l'un ou l'autre modèle, c'est une comparaison directe sur les mêmes tâches, avec le même harnais et le même réglage d'effort. Si vous en voyez une, vérifiez laquelle de ces trois variables a bougé.
Tarification d'un mois de trafic d'agent mis en cache
Prenons une charge de travail constituée en grande partie d’un contexte stable : un agent de codage avec une invite système de 60 000 jetons et un résumé de dépôt, relus lors de 5 000 appels par mois, chacun renvoyant 4 000 jetons de sortie. Supposons que la mise en cache fonctionne et que le préfixe stable soit facturé au tarif mis en cache.
Sur GPT-6 Sol : 300 millions de tokens d'entrée mis en cache à 0,20 $ par million, soit 60,00 $. Vingt millions de tokens de sortie à 10,00 $ par million, soit 200,00 $. Total : 260,00 $.
Sur Grok 4.7 : les mêmes 300 millions de jetons d’entrée mis en cache à 0,50 $ le million coûtent 150,00 $. Vingt millions de jetons de sortie à 6,00 $ le million coûtent 120,00 $. Total : 270,00 $.
Presque identiques — et c'est avec le volume de tokens maintenu constant, ce qui est l'hypothèse généreuse. La verbosité mesurée de Grok 4.7 sur l'exécution de l'indice était trois fois celle de Sol. Appliquez ne serait-ce qu'un multiplicateur de 1,5× au volume de sortie et la facture de Grok passe à 330,00 $ contre 320,00 $ pour Sol, et l'écart se creuse à partir de là. Le tarif de sortie moins cher ne survit pas à la mise en cache combinée à la verbosité ; il ne survit guère à la mise en cache seule.
Rien ici ne constitue une affirmation sur le prix de l’un ou l’autre modèle via OrcaRouter — ni l’un ni l’autre ne figure dans notre catalogue. GPT-6 Sol est accessible via l’API propre d’OpenAI et Grok 4.7 via celle de xAI ; le reste de la gamme Grok, y compris Grok 4.6, est routable via nous au prix catalogue de xAI dans le cadre du modèle de refacturation à l’identique. Le but de ce calcul est que la règle d’escalade que vous rédigez doit être fondée sur le coût par tâche accomplie sur votre propre trafic, et non sur la grille tarifaire — et une couche de routage est ce qui vous permet de tester cette règle sans second contrat.

Où chacun a sa place
• Travail d'agent à fort volume et à contexte mis en cache — GPT-6 Sol. La ligne des entrées mises en cache est 2,5× en faveur de Sol et celle du volume de sortie l'est encore plus en faveur de Grok, et elles se cumulent.
• Travaux de codage où vous voulez la plus forte amélioration publiée sur Terminal-Bench de cette version — Grok 4.7 est le modèle qui affiche le chiffre, et il est élevé. Prévoyez simplement le budget pour les tokens, pas pour le taux.
• Documents longs de plus de 500 000 tokens — GPT-6 Sol, et ce n'est même pas serré. La fenêtre de Grok s'arrête là où celle de Sol est à mi-chemin.
• Chemins sensibles à la latence — ni l’un ni l’autre. Artificial Analysis classe Grok 4.7 à 39,2 jetons de sortie par seconde, ce qu’elle qualifie de particulièrement lent. Vérifiez le chiffre de vitesse de Sol sur le tableau actuel avant de supposer qu’il est meilleur.
• Si l'on vous a montré une comparaison token par token qui se termine par « donc Grok est moins cher » — elle s'est arrêtée une étape trop tôt. L'étape suivante, c'est le nombre de tokens.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
