
Grok 4.7 vs Claude Opus 5 : l’écart de prix est réel, la parité ne l’est pas.
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Vous pouvez appeler Grok 4.7 pour 2,00 $ par million de jetons d’entrée et 6,00 $ par million de jetons de sortie. Vous pouvez appeler Claude Opus 5 pour 5,00 $ et 25,00 $. Cela représente une différence de 4,2x sur la sortie — le genre d’écart qui, d’habitude, tranche une comparaison avant même que les benchmarks soient ouverts. Il ne tranche pas celle-ci. Sur la version de l’Artificial Analysis Intelligence Index à laquelle les deux modèles sont actuellement évalués — v4.3.2, la révision publiée le 19 septembre 2026 — Claude Opus 5 se situe à 51 et Grok 4.7, publié par le fournisseur le 21 septembre 2026, se situe à 46. Cinq points, ce n’est pas une déroute, mais la répartition de ces cinq points est éloquente : Opus 5 remporte huit des dix évaluations de cet index. L’argument du modèle le moins cher, c’est le prix, le contexte est équivalent, et le seul endroit où l’avantage de prix de Grok 4.7 était censé compter le plus est exactement là où il disparaît.
Deux fleurons, deux grilles tarifaires très différentes
Claude Opus 5 est sur le marché depuis le 24 juillet 2026 et constitue le fleuron de la gamme Opus d'Anthropic, se situant sous Claude Fable 5.1 dans la propre gamme de l'entreprise. Il dispose d'une fenêtre de contexte de 1M de tokens à tarification fixe — Anthropic déclare sans détour qu'une requête de 900k tokens est facturée au même tarif par token qu'une requête de 9k tokens, sans aucun supplément pour contexte long — et d'une sortie maximale de 128K, extensible à 300K sur l'API Message Batches. La réflexion est adaptative et activée par défaut, avec une échelle d'effort allant de low, medium, high, xhigh à max, la valeur par défaut étant high. Les poids sont fermés.
Grok 4.7 a un jour. Il dispose d’une fenêtre de contexte de 500 k tokens, accepte du texte et des images en entrée et renvoie du texte, et possède son propre réglage d’effort de raisonnement. Son prix catalogue est de 2,00 $ en entrée et 6,00 $ en sortie par million de tokens pour les invites de moins de 200 k tokens, passant à 4,00 $ et 12,00 $ à ce seuil ou au-delà ; les lectures mises en cache sont à 0,50 $ et 1,00 $ dans les deux mêmes tranches. xAI répertorie aussi une variante plus rapide fonctionnant à environ deux fois la vitesse de sortie pour environ deux fois le prix, bien que cette configuration soit sortie sans mesure de vitesse publiée associée. Les poids sont également fermés ici, ce qui supprime l’échappatoire « exécutez-le vous-même » des deux côtés de cette comparaison.
Le conseil indépendant n'est pas proche, et il n'est pas flatteur
Ces deux modèles sont notés sur l'indice v4.3.2 d'Artificial Analysis, qui intègre dix évaluations couvrant les agents, la programmation, les connaissances générales et le raisonnement scientifique. Mettre les deux colonnes côte à côte fait paraître le score phare de cinq points généreux pour le modèle le moins cher — un seul écart de cinq points dans un score composite peut cacher beaucoup de choses, et ici il cache un quasi-balayage.
• Intelligence composite — Grok 4.7 (xhigh) : 46 sur Artificial Analysis Intelligence Index v4.3.2. Claude Opus 5 (raisonnement adaptatif, effort maximal) : 51 sur la même révision.
• Raisonnement difficile — Grok 4.7 : Humanity's Last Exam 43, CritPt 18. Claude Opus 5 : HLE 55, CritPt 29. Un écart de douze points et de onze points respectivement, tous deux en faveur d'Opus 5.
• Terminaux agentiques — Grok 4.7 : Terminal-Bench 4.0 26. Claude Opus 5 : 49. C'est l'écart le plus large du tableau, et il concerne le benchmark le plus proche d'un véritable travail autonome.
• Automatisation des tâches professionnelles — Grok 4.7 : 66 % sur AutomationBench-AA. Claude Opus 5 : 57 %. La seule victoire nette de Grok 4.7, et une vraie — neuf points sur l'évaluation qui mesure si un agent termine un flux de travail sans déclencher de garde-fou.
• Connaissances et honnêteté — Grok 4.7 : AA-Omniscience 32. Claude Opus 5 : 37. Les deux modèles hallucinent ; Opus 5 le fait moins sur cette mesure.
• Contexte long — Grok 4.7 : AA-LCR v1.1 77 %, fenêtre 500k tokens. Claude Opus 5 : 79 %, fenêtre 1M tokens.
• Coût d'exécution de l'indice — Grok 4.7 : 240 M de tokens de sortie sur l'ensemble de l'évaluation, signalé par Artificial Analysis comme exceptionnellement verbeux. Claude Opus 5 : 140 M. Grok 4.7 dépense 1,7 fois plus de tokens pour obtenir un score inférieur.

Là où l’avantage prix de Grok 4.7 vient mourir
Voici le calcul que la grille tarifaire dissimule. Prenons une requête agentique réaliste : 30 k tokens en entrée, 8 k en sortie. Grok 4.7 facture 0,06 $ en entrée et 0,048 $ en sortie — environ onze cents. Claude Opus 5 facture 0,15 $ en entrée et 0,20 $ en sortie — environ trente-cinq cents. C’est un véritable facteur 3, et à cette échelle, Grok 4.7 est le choix évident sur le seul critère du coût.
Prenez maintenant la requête autour de laquelle le marketing de Grok 4.7 lui-même est construit : une session agentique à long contexte. Poussez le prompt au-delà de 200 k tokens et les tarifs de Grok 4.7 doublent, à 4,00 $ en entrée et 12,00 $ en sortie. Claude Opus 5 ne bouge pas — sa fenêtre de 1 M est facturée à 5,00 $ et 25,00 $ forfaitairement. À 250 k en entrée et 8 k en sortie, Grok 4.7 coûte 1,00 $ en entrée et 0,096 $ en sortie, soit environ 1,10 $. Opus 5 coûte 1,25 $ en entrée et 0,20 $ en sortie, soit environ 1,45 $. L'écart s'est réduit de 3x à environ 1,3x. Poussez plus loin — 400 k, 500 k, le sommet de la fenêtre de Grok 4.7 — et l'écart avec le tarif forfaitaire d'Opus 5 ne cesse de se réduire, tandis que sa fenêtre continue de s'étendre jusqu'à un million de tokens.Grok 4.7 est le modèle bon marché sur les prompts courts et un quasi-égal en prix sur les longs, ce qui inverse l'intuition que la page de tarification est conçue pour créer.
Deux réserves permettent de rester honnête. Premièrement, le palier de contexte long est une structure de prix catalogue documentée dans la propre documentation des modèles de xAI, et non une mesure : les factures réelles dépendent de la mise en cache, et le tarif de 0,50 $ pour la lecture en cache de Grok 4.7 est réellement bon marché. Deuxièmement, Artificial Analysis n'a pas encore publié de mesure de vitesse pour Grok 4.7, de sorte que la moitié « c'est plus rapide » de l'argument bon marché et rapide n'est actuellement pas vérifiée. Ce qui est mesuré, c'est Opus 5 à 59 jetons par seconde avec un délai de 49 secondes avant le premier jeton — lent, cher, et en avance sur presque tous les axes de qualité.
Ce que vous achemineriez réellement
Voici une comparaison où la réponse honnête varie selon la charge de travail, et un routeur est le moyen le moins cher d'agir en conséquence. Claude Opus 5 est disponible sur OrcaRouter, référencé sur sa propre page de modèle, avec le prix du fournisseur répercuté à 0 % de marge — ainsi, les 5,00 $ et 25,00 $ d'Opus 5 dans notre catalogue correspondent au prix catalogue d'Anthropic, et non à une version majorée, et si Anthropic le modifie, le chiffre change sur la même clé le jour même. Grok 4.7 ne figure pas dans le catalogue OrcaRouter à l'heure où nous écrivons ces lignes ; pour l'appeler aujourd'hui, vous passez par l'API propre à xAI et par les plateformes tierces qui le proposent. Cette asymétrie mérite d'être connue avant d'architecturer autour d'elle.

Le schéma de routage qui découle des chiffres est simple. Envoyez le travail à long contexte, à forte intensité de raisonnement et d’agent terminal à Opus 5 — il remporte Terminal-Bench 4.0 avec 23 points d’avance et offre une fenêtre deux fois plus grande à tarification fixe, ce qui correspond exactement au profil d’une tâche difficile et longue. Envoyez les tâches d’automatisation et de workflow à gros volume à Grok 4.7 : il remporte AutomationBench-AA avec neuf points d’avance et coûte trois fois moins cher sur des prompts courts. Comme on accède aux deux via un seul point de terminaison lorsqu’ils figurent au catalogue, cette répartition est une règle de routage plutôt qu’un second contrat fournisseur, et le basculement automatique fait qu’une limite de débit sur un chemin devient un événement de routage plutôt qu’une panne. Lorsqu’une charge de travail a réellement besoin des deux — une première passe peu coûteuse et une passe de vérification coûteuse — le DSL de routage les compose en un seul appel plutôt qu’en deux intégrations.
Le verdict
Si vous choisissez sur la base des preuves, Claude Opus 5 remporte ce duel, et de loin : huit évaluations sur dix, les deux écarts les plus larges, deux fois plus de contexte à tarif constant, et un budget de tokens bien inférieur aux deux tiers pour un meilleur score. Le composite à cinq points sous-estime l'ampleur de son avance. Le dossier de Grok 4.7 est plus étroit que sa grille tarifaire ne le suggère, mais il n'est pas vide — il est réellement moins cher aux tailles de prompt que la plupart des applications utilisent réellement, c'est le meilleur modèle d'automatisation, et il n'a qu'un jour, avec une suite de benchmarks fournisseur encore en cours de reproduction indépendante. Achetez-le pour l'automatisation sensible aux coûts, surveillez ses chiffres de vitesse quand Artificial Analysis les publiera, et considérez le palier tarifaire longue contexte comme l'élément qui détermine si le modèle bon marché reste bon marché.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
