
GPT-6 Sol Pro vs Grok 4.7 : deux fois plus de verbosité, un tiers du prix
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 986 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 196 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Les deux modèles les moins chers proches de la frontière de septembre 2026 sont sortis à un jour d'intervalle, et ce qui est intéressant à leur sujet, ce n'est pas lequel est le plus intelligent. GPT-6 Sol — le modèle vers lequel on se tourne lorsqu'on recherche GPT-6 Sol Pro, qui est ce modèle avec son reasoning.mode réglé sur pro plutôt qu'un produit distinct — est sorti le 22 septembre 2026 à 2,00 $ par million de jetons d'entrée et 10,00 $ par million de jetons de sortie. Grok 4.7 du fournisseur est sorti le 21 septembre au même tarif de 2,00 $ en entrée, et 6,00 $ en sortie. Sur le harnais neutre d'Artificial Analysis, les deux se situent à deux points d'indice d'écart et à environ deux dollars par tâche accomplie d'écart, et la raison de cet écart n'est pas la capacité. C'est le nombre de jetons que chacun brûle pour y parvenir.
Sol a généré 77 millions de tokens de sortie en exécutant l'Intelligence Index. Grok 4.7 en a généré 240 millions. Ce ratio — un peu plus de trois pour un — constitue toute la comparaison, et il inverse la conclusion que vous donne un tableau de prix par token.
Les deux grilles tarifaires, et là où la moins chère n’est pas bon marché
Les deux fournisseurs publient eux-mêmes ces chiffres ; ni l'un ni l'autre n'a fait l'objet d'une réévaluation indépendante.
• Entrée — GPT-6 Sol 2,00 $ par million de jetons vs Grok 4.7 2,00 $ par million de jetons
• Sortie — GPT-6 Sol 10,00 $ par million de jetons contre Grok 4.7 6,00 $ par million de jetons
• Entrée mise en cache — GPT-6 Sol 0,20 $ par million de tokens contre Grok 4.7 0,50 $ par million de tokens ; la lecture du cache de Sol est moins chère d’un facteur de deux et demi, soit l’inverse de ce que laisse penser le tarif de sortie mis en avant
• Fenêtre de contexte — GPT-6 Sol 1 050 000 jetons contre Grok 4.7 500 000 jetons
• Supplément pour contexte long — GPT-6 Sol refacture une requête au-delà de 272 000 jetons d'entrée à 2× les tarifs d'entrée et de cache et 1,5× la sortie pour toute la requête, contre Grok 4.7 qui double tous les tarifs à partir de 200 000 jetons d'entrée, également pour toute la requête
• Date limite des connaissances — GPT-6 Sol : 20 avril 2026 vs Grok 4.7 : une date limite de pré-entraînement annoncée comme étant juin 2026, avec un entraînement complémentaire jusqu'en août
• Effort de raisonnement — GPT-6 Sol none, low, medium (par défaut), high, xhigh, max vs Grok 4.7 low, medium (par défaut), high, xhigh
• Modalité — acceptent tous deux des entrées texte et image et renvoient du texte
La ligne de lecture du cache est celle sur laquelle un acheteur devrait s’attarder. Le tarif de sortie de Grok 4.7 est 40 % inférieur, mais son entrée mise en cache est 150 % supérieure, et c’est dans l’entrée mise en cache que résident les longs historiques d’agents et les prompts système répétés. Une charge de travail qui consiste principalement à relire un vaste contexte stable trouvera les deux modèles bien plus proches que ne le suggère un écart de 6 $ contre 10 $.

Le record indépendant, et l'unique chiffre qui le détermine
Artificial Analysis est le seul harnais à avoir mesuré les deux modèles, et ses chiffres méritent d’être présentés côte à côte, car la divergence est instructive.
• Intelligence Index — GPT-6 Sol 48 à effort maximal contre Grok 4.7 46 à xhigh ; tous deux bien au-dessus de la médiane de 25 des modèles comparables
• Coût par tâche d’indexation — GPT-6 Sol 1,06 $ vs Grok 4.7 3,74 $
Jetons de sortie pour l'exécution de l'index — GPT-6 Sol 77M vs Grok 4.7 240M, contre une médiane de 88M
• Vitesse de sortie — Grok 4.7 mesuré à 39 jetons par seconde, ce que le harnais lui-même qualifie de remarquablement lent ; le chiffre de Sol sur le même tableau n’est pas publié dans la même ligne de résumé
• Coding Agent Index — GPT-6 Sol 57 à 2,99 $ par tâche contre Grok 4.7 56 avec son harnais Grok Build propriétaire, en hausse de neuf points par rapport à Grok 4.6
Deux points d’écart d’indice, trois fois et demie le coût par tâche. Ce n’est pas une anomalie de tarification — c’est l’arithmétique de la verbosité. Grok 4.7 est un modèle qui réfléchit à voix haute longuement ; le harnais le signale comme « très verbeux » par rapport à une médiane de 88 M de tokens, et le coût suit les tokens, pas la grille tarifaire.
La comparaison des agents de codage comporte une réserve que le tableau des scores masque. Le score de 56 de Grok 4.7 est mesuré dans le harnais Grok Build propre à xAI, qui est la configuration que xAI livre et utilise comme référence pour ses benchmarks. Le score de 57 de Sol est mesuré dans un harnais neutre. Un avantage d’un point ou deux lié à un harnais maison se situe bien dans la marge que le choix du harnais explique, ce qui signifie que l’interprétation honnête est que ces deux-là sont à égalité en codage agentique — et non que Sol a un point d’avance.

Ce que chaque fournisseur affirme, et ce qu’aucun des deux n’a démontré
Le matériel de lancement de xAI est précis et il s'agit d'une histoire à long terme : Grok 4.7 est bâti sur un modèle de base plus grand que Grok 4.6 et a bénéficié d'une session d'apprentissage par renforcement plus longue, axée sur des tâches qui « peuvent prendre des heures à accomplir », ce qui affine l'auto-vérification, la gestion de contextes longs et le comportement au sein de l'environnement Grok Bot. Parmi les chiffres rapportés par l'éditeur figurent Terminal-Bench 4.0 à 38,0 % contre 20,3 % pour Grok 4.6, CursorBench 4.0 à 46,3 %, et DeepSWE v1.1 à 71,0 %. Chacun d'entre eux est une mesure de xAI elle-même et aucun n'a été reproduit de façon indépendante ; le chiffre indépendant de Terminal-Bench 4.0 qui circule est nettement inférieur à celui de l'éditeur, ce qui correspond à la forme habituelle de cet écart.
Les affirmations d'OpenAI concernant GPT-6 Sol sont celles déjà abordées ci-dessus, et elles portent la même étiquette. Les chiffres rapportés par le fournisseur sont de 33,2 % sur AutomationBench à effort xhigh contre 26,9 % pour Claude Opus 5 à max, à environ 9 % du coût par tâche, et de 68,8 % sur DeepSWE v1.1 à effort max — à 1,1 point de Claude Fable 5 à xhigh, à un coût par tâche inférieur d'environ 80 %. Notez la cible de comparaison : les propres graphiques d'OpenAI opposent Sol aux modèles d'Anthropic, et non à Grok 4.7. Aucun des deux fournisseurs n'a publié de comparatif direct de l'un contre l'autre.

Où la couche de routage mérite sa place
OrcaRouter ne propose aucun des deux modèles de cette confrontation — Grok 4.7 et GPT-6 Sol sont tous deux absents de notre catalogue, donc rien ici ne constitue une affirmation sur leur prix via notre plateforme. Ce qu'une couche de routage apporte de précieux dans cette association précise, c'est le mode de défaillance plutôt que la grille tarifaire. Ce qui plaide en faveur de Grok 4.7, c'est son comportement agentique sur un horizon long ; ce qui plaide contre, c'est qu'une vitesse de sortie de 39 jetons par seconde rend une longue exécution d'agent suffisamment lente pour compter, et une exécution lente est une exécution qui peut expirer. Basculement automatique entre fournisseurs signifie qu'une tâche longue peut être routée vers le modèle réellement disponible, sans que cette vitesse devienne un point de défaillance unique, et le DSL de routage exprime le choix du modèle sous forme de règle à l'intérieur de l'appel plutôt que comme une migration — ce qui importe ici, car la bonne réponse pour ce couple dépend de si la tâche est gourmande en jetons ou sensible à la latence, et c'est une propriété de la requête, non du trimestre.
La règle de décision
• Codage agentique à budget fixe — GPT-6 Sol. Niveau de capacité sur l’indice de codage neutre, pour environ un tiers du coût par tâche, parce qu’il y parvient avec un tiers des jetons.
• Tâches de longue haleine, où la durée d’exécution est l’essentiel — Grok 4.7. Cette version a été entraînée spécifiquement pour un travail de plusieurs heures, et les chiffres du fournisseur sur SWE-Marathon et CursorBench vont exactement dans cette direction.
• Volume sensible à la latence — aucun des deux, selon les données actuelles. Le coût par tâche de Sol est le meilleur chiffre, mais les 39 tokens par seconde mesurés de Grok 4.7 constituent une contrainte réelle pour toute application interactive.
• Charges de travail à long contexte majoritairement mises en cache — GPT-6 Sol, sur la ligne de lecture du cache plutôt que sur la ligne de sortie. À 0,20 $ contre 0,50 $ par million de tokens mis en cache, et avec une fenêtre deux fois plus grande, l'argument se renforce à mesure que votre prompt est stable.
• Si votre comparaison a été construite à partir de la grille tarifaire par token — reconstruisez-la à partir du coût par tâche. 6,00 $ contre 10,00 $ en sortie est la paire de chiffres la moins informative de cet article, et c’est la paire que chaque page existante met en avant.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
