
GPT-6.1 Sol vs Grok 4.7 : le tarif de sortie le moins cher du marché, et la conversation la plus chère
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Grok 4.7, le successeur de Grok 4.6 chez xAI, est arrivé le 21 septembre 2026 à 2,00 $ par million de tokens en entrée et 6,00 $ par million de tokens en sortie. GPT-6.1 Sol, la mise à jour de milieu de gamme d'OpenAI, est arrivé huit jours plus tard, le 29 septembre, à 2,00 $ en entrée et 10,00 $ en sortie. Les tarifs d'entrée sont identiques, le tarif de sortie est 40 % moins cher sur Grok 4.7, et c'est là que s'arrêtent la plupart des comparaisons. C'est le mauvais endroit pour s'arrêter, car le même organisme indépendant a désormais mesuré les deux modèles de bout en bout : Grok 4.7 a consommé environ 240 millions de tokens en sortie pour terminer l'Artificial Analysis Intelligence Index ; GPT-6.1 Sol en a consommé 67 millions. Multipliez le tarif moins élevé par trois fois et demie le volume, et le modèle dont le prix par token est le plus bas coûte 3,74 $ par tâche achevée, contre 0,72 $.
Deux modèles, à huit jours d’intervalle, et une grille tarifaire qui s’inverse
Grok 4.7 est le modèle de xAI le plus puissant pour la programmation et le travail intellectuel : une fenêtre de contexte de 500 000 tokens, jusqu'à 450 000 tokens de sortie en une seule réponse selon la fiche du fournisseur lui-même, une entrée texte, image et fichier, et un effort de raisonnement configurable parmi low, medium (par défaut), high et xhigh. xAI n'a pas communiqué de nombre de paramètres, et sa date de coupure de pré-entraînement est indiquée comme étant juin 2026, avec un entraînement complémentaire jusqu'en août.
GPT-6.1 Sol est la mise à jour d'un cran du niveau GPT-6 Sol par OpenAI, positionné en dessous de GPT-6 Astra et au-dessus de GPT-6 Luna : 1 050 000 jetons de contexte — environ le double de celui de Grok — avec un plafond de sortie de 128 000 jetons, soit environ un tiers de celui de Grok, une date de coupure des connaissances au 30 avril 2026, et les mêmes entrées texte, image et fichier. Son échelle de raisonnement va de faible à max avec une valeur par défaut de moyen, et il n'accepte plus aucun du tout.
Une ligne par dimension, les deux côtés sur chacune :
• Entrée — GPT-6.1 Sol 2,00 $ par million vs Grok 4.7 2,00 $ par million ; identique
• Sortie — GPT-6.1 Sol 10,00 $ par million vs Grok 4.7 6,00 $ par million ; Grok est 40 % moins cher
• Entrée mise en cache — GPT-6.1 Sol 0,10 $ par million vs Grok 4.7 0,50 $ par million ; Sol est cinq fois moins cher, l’inverse de ce que la ligne de sortie laisse entendre
• Fenêtre de contexte — 1 050 000 jetons vs 500 000
• Sortie maximale en une réponse — 128 000 jetons vs 450 000 annoncés
• Palier de contexte long — la requête entière est re-tarifée au-delà de 272 000 jetons d’entrée, avec l’entrée et le cache à 2× et la sortie à 1,5×, contre tous les tarifs doublés au-delà de 200 000 jetons d’entrée, également pour la requête entière
• Effort de raisonnement — faible, moyen (par défaut), élevé, xhigh, max vs faible, moyen (par défaut), élevé, xhigh
• Poids et paramètres — fermés, non divulgués vs fermés, non divulgués ; aucun des deux ne vous donne de checkpoint
• Indice d’intelligence à l’effort maximal publié — GPT-6.1 Sol 51,8 à max vs Grok 4.7 46,4 à xhigh
• Coût par tâche de l’indice, indépendant — 0,72 $ vs 3,74 $
• Jetons de sortie lors de l’exécution de l’indice — 67 millions vs 240 millions, contre une médiane du classement proche de 81 millions
Deux lignes de cette liste constituent toute la comparaison. Le tarif de sortie de Grok 4.7 est réellement plus bas et sa ligne de cache est réellement cinq fois plus élevée ; et il a généré trois fois et demie plus de tokens à mesurer. La grille tarifaire, lue seule, indique une direction. La mesure indique l'autre, d'un facteur cinq.

Là où Grok 4.7 est réellement en avance
Il serait malhonnête de présenter cet article comme une déroute, car Grok 4.7 gagne sur de véritables évaluations. Notés côte à côte à l'effort maximal publié sur Artificial Analysis v4.3.2 — Grok à xhigh, Sol à max, une différence de configuration qu'il convient de garder à l'esprit tout au long :
• GDPval-AA v2.1 — Grok 4.7 Elo 1715,4 contre GPT-6.1 Sol Elo 1575,1. Une avance de 140 points Elo sur le travail de connaissance à valeur économique, et la plus grande victoire indépendante unique pour le modèle à la grille tarifaire la moins chère.
• AutomationBench-AA — Grok 4.7 0,6556 contre GPT-6.1 Sol 0,6487. En pratique, une égalité, mais nominalement à l'avantage de Grok.
• SciCode — Grok 4.7 0,5741 contre GPT-6.1 Sol 0,5417. Une avance de 3,2 points sur le codage scientifique.
• Terminal-Bench 4.0 — Grok 4.7 0,2576 contre GPT-6.1 Sol 0,5606. Un déficit de 30 points, et le plus grand écart de la paire.
• Humanity's Last Exam — Grok 4.7 0,4314 contre GPT-6.1 Sol 0,5292.
• AA-LCR v1.1, raisonnement à long contexte — Grok 4.7 0,7667 contre GPT-6.1 Sol 0,83.
• AA-Omniscience — Grok 4.7 32,0 contre GPT-6.1 Sol 41,5.
• GDP.pdf — Grok 4.7 0,20 contre GPT-6.1 Sol 0,31.
• CritPt — Grok 4.7 0,1771 contre GPT-6.1 Sol 0,3171.
Trois des neuf évaluations reviennent à Grok 4.7 ou se soldent par une égalité, y compris celle qui est la plus difficile à contester : GDPval-AA est conçu pour évaluer le travail professionnel à valeur économique, et une avance Elo de 140 points n’est pas du bruit. Si votre charge de travail est du type que GDPval a été conçu pour représenter — analyse à forte composante documentaire, livrables professionnels, décisions de jugement avec une réponse correcte —, le modèle à la grille tarifaire moins chère est aussi le meilleur modèle sur le classement neutre, et la pénalité de coût par tâche est ce que vous payez pour cela.
Les propres chiffres de lancement de xAI sont élevés et, comme tous les chiffres de lancement d'un fournisseur, non reproduits. CursorBench 4.0 à 46,3 % en xhigh contre 40,4 % pour Grok 4.6 ; Terminal-Bench 4.0 à 38,0 % contre 20,3 %, la plus forte progression revendiquée de cette version ; DeepSWE v1.1 à 71,0 % en high contre 65,2 % ; EEBench à 64,0 % contre 53,0 %. C'est le harnais de xAI, les réglages de xAI, la communication de xAI — et notez que la revendication de 38,0 % sur Terminal-Bench 4.0 se heurte au 0,2576 du classement indépendant pour le même modèle sur le même benchmark, soit exactement le type d'écart auquel il faut s'attendre entre une configuration ajustée par un fournisseur et une exécution neutre à effort maximal.
Les chiffres d'OpenAI pour GPT-6.1 méritent la même remise et présentent la même. Le seul chiffre de cette comparaison qu'aucun des deux n'a produit est le coût par tâche accomplie, car il est calculé à partir de la consommation de tokens mesurée plutôt qu'à partir d'un tableau de coûts. C'est ce chiffre qui subsiste.
Pourquoi 240 millions de jetons décident tout
Artificial Analysis décrit la verbosité de Grok 4.7 dans son propre résumé, et le nombre de tokens derrière l'exécution de l'indice en est la preuve : 240 millions de tokens de sortie contre une médiane du classement proche de 81 millions, soit environ trois fois ce que produit un modèle typique sur la même suite. Les 67 millions de GPT-6.1 Sol se situent bien en dessous de la médiane. Combinez les deux ratios — 3,6× le volume à 0,6× le prix — et le tarif de sortie moins cher achète plus de tokens plutôt qu'une facture moins élevée, ce à quoi ressemble exactement une différence de coût par tâche de 3,74 $ contre 0,72 $.
La mise en cache modifie l’ampleur de l’effet, mais pas son sens, et c’est le détail qui fait trébucher les gens. L’entrée mise en cache de Grok 4.7 est à 0,50 $ par million, contre 0,10 $ pour Sol — cinq fois plus cher sur la ligne où vivent les longs historiques d’agents et les prompts système répétés. Une charge de travail dominée par la relecture d’un grand préfixe stable trouve donc les deux modèles plus proches que ne le suggère l’écart de 6 $ contre 10 $, et, une fois la verbosité de Grok appliquée par-dessus, plus éloignés que ne le suggèrent les tarifs d’entrée. La ligne du cache et la ligne des jetons vont dans le même sens ici, ce qui est inhabituel et rend ce duo plus net que ne le laissent entendre les grilles tarifaires.
Les clauses de contexte long méritent d'être tarifées séparément, car elles se déclenchent à des seuils différents. GPT-6.1 Sol re-tarife une requête entière au-delà de 272 000 tokens d'entrée ; Grok 4.7 fait de même au-delà de 200 000. Sur un appel de 250 000 tokens, Grok a déjà doublé — 4,00 $ et 12,00 $ avec une lecture de cache à 1,00 $ — tandis que Sol reste sur ses tarifs standards de 2,00 $ et 10,00 $. Entre 200 000 et 272 000 tokens, le modèle à la grille tarifaire la moins chère est le plus cher, et de loin, et cette plage est courante dans le travail documentaire.
Là où Grok gagne véritablement sur la structure plutôt que sur le score, c’est le plafond de sortie. Une réponse maximale de 450 000 tokens contre 128 000 pour Sol relève d’une autre catégorie d’artefact : une base de code entièrement générée, une longue transcription, une synthèse de la longueur d’un livre en un seul appel. Si vous atteignez aujourd’hui les plafonds de sortie, cette ligne décide de la comparaison et rien dans l’arithmétique des coûts ci-dessus ne s’applique — vous ne pouvez pas acheter, à quelque tarif que ce soit, une capacité que l’autre modèle ne possède pas.
Les deux sont sur une seule touche, ce qui est la partie utile.
Grok 4.7 figure sur OrcaRouter au prix catalogue propre à xAI — 2,00 $ et 6,00 $ par million de tokens, avec une lecture de cache à 0,50 $ et le palier de 200 000 tokens à 4,00 $ et 12,00 $ répercuté exactement tel que xAI l’indique — et GPT-6.1 Sol est arrivé sur nos routes le jour de sa sortie au prix d’OpenAI, 2,00 $ et 10,00 $, avec l’entrée mise en cache à 0,10 $ et le palier de 272 000 tokens inchangé. Rien n’est ajouté ni à l’un ni à l’autre : la plateforme répercute le prix catalogue du fournisseur au lieu de le majorer, ce qui signifie qu’une baisse de prix d’un fournisseur, d’un côté comme de l’autre, est effective ici le jour même où elle l’est là-bas, sans deuxième facture et sans revendeur intermédiaire.

Pour cette paire en particulier, cela vaut plus que la commodité. Les deux modèles ne s'accordent pas sur ce en quoi ils excellent — Grok 4.7 mène sur l'Elo de travail professionnel et sur le codage scientifique, GPT-6.1 Sol mène sur l'exécution en terminal, la fiabilité factuelle et la récupération en contexte long — et la frontière entre ces charges de travail est visible dans votre propre trafic avant de l'être dans un benchmark. Envoyer les requêtes de forme GDPval d'un côté et les exécutions d'agents à long horizon de l'autre, derrière un seul endpoint, avec un basculement automatique entre les deux et une règle de routage que vous modifiez dans la configuration plutôt que dans un déploiement, est une façon moins coûteuse de trouver cette frontière qu'un projet d'évaluation. La fusion de modèles, où un panel de modèles répond ensemble, est l'autre option qu'offre la plateforme si vous préférez ne pas choisir du tout à chaque requête.

L'appel
• Travail agentique et en terminal à sortie longue, boucles à préfixe mis en cache — GPT-6.1 Sol. Trente points sur Terminal-Bench 4.0, une ligne de cache cinq fois moins chère et un cinquième du coût par tâche accomplie.
• Travail de connaissance professionnel, analyse de documents, tâches de jugement — Grok 4.7 grâce à une avance Elo de 140 points sur GDPval-AA, avec la facture de tokens budgétée plutôt que supposée.
• Programmation scientifique — Grok 4.7, de justesse, sur la répartition SciCode du tableau. Vérifiez-le par rapport à votre propre suite ; 3,2 points se situent dans la marge qu'un autre ensemble d'invites peut déplacer.
• Réponses uniques au-delà de 128 000 tokens de sortie — Grok 4.7, et aucun calcul ne peut s'y substituer.
• Requêtes entre 200 000 et 272 000 tokens d'entrée — GPT-6.1 Sol, parce que Grok 4.7 a déjà doublé toute sa requête et Sol non.
• Conversation la moins chère possible — ni l'un ni l'autre. Les deux sont des modèles au tarif de pointe avec un appétit en tokens de pointe ; la comparaison porte sur lequel termine votre tâche, pas sur lequel est bon marché dans l'abstrait.
• Si une comparaison se termine par « Grok est moins cher par token » — elle s'est arrêtée une étape trop tôt. L'étape suivante est le nombre de tokens, et il est de 240 millions contre 67.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
