
Grok 4.6 vs Claude Opus 5 : Même 61, deux économies différentes
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
Artificial Analysis soumet chaque modèle de pointe aux mêmes neuf évaluations et publie la facture. Sur son Intelligence Index, Grok 4.6 et Claude Opus 5 se retrouvent sur le même nombre — 61 — ce qui en fait l'un des rares face-à-face où le score composite ne peut pas vous dire lequel utiliser. Ce qui peut le faire, c'est un chiffre moins connu de la même source : sur la suite de travail intellectuel AA-Briefcase, Grok 4.6 a terminé une tâche en environ 53 tours et environ un demi-milliard de jetons d'entrée, tandis que Claude Opus 5 en effort maximal a eu besoin d'environ 103 tours et de deux milliards de jetons pour le même travail. C'est un écart de quatre pour un dans la consommation de jetons entre deux modèles dont le score principal est identique, et il n'apparaît que lorsque l'on cesse de comparer les fiches des modèles et que l'on commence à comparer les factures.
Les deux modèles sont des lancements phares actuels, ce qui fait de cette comparaison un duel propre plutôt qu'un décalage de génération. Grok 4.6 est sorti le 12 août 2026 chez SpaceXAI comme un raffinement de la fondation Grok 4.5 — la même base mixture-of-experts de 1,5 billion de paramètres, réentraînée avec des sessions de supervision et d'apprentissage par renforcement plus longues destinées aux agents à exécution prolongée. Claude Opus 5 est sorti le 24 juillet 2026 chez Anthropic comme un produit phare à date de référence fixe, avec une pensée adaptative, une fenêtre de contexte d'un million de jetons, et une entrée d'images et de fichiers. Ils se situent au même point du classement indépendant et à des points opposés de la grille tarifaire : 2 $ / 6 $ par million de jetons pour Grok 4.6 contre 5 $ / 25 $ pour Claude Opus 5. Le travail intéressant consiste à déterminer quelle moitié de cette phrase décide de votre choix en production.
Le 61 qui cache un écart d'efficacité de quatre pour un.
L'indice d'intelligence est un composite de neuf évaluations, ce qui fait à la fois sa force et son angle mort. Un nombre unique qui fait la moyenne des scores de raisonnement, de mathématiques, de codage et de travail de connaissances masque la manière dont un modèle y parvient — et ces deux modèles y parviennent de manière opposée. La suite professionnelle de type mallette pour le travail de connaissances d'Artificial Analysis est la fenêtre la plus claire sur ce point : elle mesure de véritables tâches à long horizon, et elle a enregistré Grok 4.6 à environ 53 tours et 0,5 milliard de jetons d'entrée par tâche, contre Claude Opus 5 Max à environ 103 tours et 2 milliards de jetons d'entrée. En termes d'économie par tâche, c'est la différence entre un modèle qui termine un travail de recherche et de production avec un quart des jetons et un autre qui les épuise.
La cause est un choix de conception, pas un bug. Grok 4.6 a été spécifiquement entraîné à vérifier son propre travail au fur et à mesure et à s’arrêter lorsqu’une sous-tâche est réellement terminée — xAI décrit de longues trajectoires de tâches avec auto-test comme objectif d’entraînement. Claude Opus 5 est entraîné pour la profondeur du raisonnement et l’étendue des connaissances, et son comportement par défaut est de réfléchir davantage et de consulter plus que strictement nécessaire. Les deux sont des « modèles de raisonnement » ; ils répartissent l’effort différemment, et cette répartition est la spécification qui importe pour les charges de travail d’agent.

L'écart importe le plus pour les agents qui appellent un modèle en boucle — les agents de recherche, les agents de code qui exécutent des dizaines de tours, les pipelines documentaires qui traitent des lots pendant la nuit. Chaque tour est facturé, et chaque jeton d'entrée est un contexte qui doit être renvoyé lors de l'appel suivant. Un modèle qui termine en 53 tours à 0,5B de jetons n'est pas seulement moins cher par jeton ; il est moins cher par tâche d'environ un ordre de grandeur qu'un modèle qui prend 103 tours à 2B de jetons, avant même de multiplier par le prix catalogue.
La fiche technique, les deux côtés.
Là où ils diffèrent sur le papier, sur une ligne chacun :
• Intelligence Index — Grok 4.6 obtient 61, classé #6 sur 184 ; Claude Opus 5 obtient 61, classé à égalité en tête du classement. Une égalité, selon Artificial Analysis.
• Prix catalogue par 1M de jetons — Grok 4.6 à 2 $ en entrée / 6 $ en sortie (doublant à 4 $ / 12 $ pour les invites de 200 000 jetons d'entrée ou plus) ; Claude Opus 5 à 5 $ en entrée / 25 $ en sortie, avec une remise de 50 % sur les lots, soit 2,50 $ / 12,50 $.
• Fenêtre de contexte — 500K tokens pour Grok 4.6 contre 1 000 000 pour Claude Opus 5, l'avantage de spécification le plus net détenu par l'un ou l'autre modèle.
• Sortie maximale — Claude Opus 5 permet jusqu'à 128K tokens de sortie (300K via l'API batch) ; le plafond de sortie de Grok 4.6 est plus bas, de l'ordre d'une réponse longue typique.
• Entrées — les deux acceptent le texte et l'image ; Claude Opus 5 accepte également les fichiers, et la version d'Anthropic de l'entrée multimodale accède plus directement aux documents.
• GDPVal-AA v2 (travail intellectuel) — Grok 4.6 à 1 753 Elo contre Claude Opus 5 à 1 852 Elo. Opus 5 remporte la couronne de la qualité du travail intellectuel sur la métrique où l’efficacité de la mallette favorisait Grok. [Artificial Analysis]
• CursorBench v3.2 — 69,9 % pour Grok 4.6 contre 70,0 % pour Claude Opus 5, pratiquement à égalité sur le benchmark d’agent de codage sur lequel les deux ont été mesurés. [Artificial Analysis]
• Contrôle du raisonnement — Claude Opus 5 expose un curseur d'effort allant de faible à maximal, avec la pensée adaptative activée par défaut ; Grok 4.6 expose l'effort de raisonnement, mais est réglé pour favoriser par défaut les longues trajectoires d'agents.
L'intérêt de les mettre côte à côte est qu'aucun modèle ne domine. Claude Opus 5 est le meilleur généraliste sur le papier : plus de contexte, un plafond de sortie plus élevé, l'entrée de fichiers, une qualité de travail intellectuel supérieure. Grok 4.6 offre le meilleur rapport qualité-prix et est l'agent le plus efficace. La seule question qui reste est de savoir laquelle de ces options correspond au travail que vous avez réellement.

Là où Claude Opus 5 justifie son premium
Les chiffres de lancement d'Anthropic — rapportés par le fournisseur, non reproduits de manière indépendante — donnent à Claude Opus 5 un score de 96,0 % sur SWE-bench Verified et de 79,2 % sur SWE-bench Pro, avec un score OSWorld de 70,6 % pour l'utilisation d'ordinateur. Sur le composite global, son score de 61 fait jeu égal avec Grok 4.6, et sur GDPVal-AA, il est nettement en avance. En pratique, cela se traduit par un modèle qui tient la route sur tout le spectre des tâches d'une journée de travailleur du savoir : rédaction, analyse, raisonnement sur documents longs, tâches mêlant image et texte, et codage, le tout réuni avec un million de jetons de contexte.
La fenêtre de contexte est la raison honnête d'y recourir. Une limite de 500 000 jetons est importante, mais ce n'est pas un codebase entier plus un corpus de recherche plus les résultats intermédiaires d'une longue session d'agent. Les équipes qui effectuent une analyse approfondie en un seul passage sur de très grands corpus — un dépôt complet, une année de documents financiers, une longue pile de PDF — heurteront le plafond de Grok 4.6 et n'atteindront jamais celui de Claude Opus 5. Pour ces charges de travail, le contexte supplémentaire n'est pas un luxe ; c'est la différence entre tenir dans la limite et s'organiser autour d'elle.
Où Grok 4.6 est le meilleur achat
Retournez les mêmes faits et Grok 4.6 est le meilleur achat pour les pipelines d'agents, et de loin. Il est 2,5× moins cher à l'entrée et 4,2× moins cher à la sortie par rapport au prix catalogue d'Opus 5, et son efficacité en tokens par tâche renforce encore cet avantage : les chiffres d'AA-Briefcase suggèrent environ 4× moins de tokens et 2× moins de tours pour le même résultat de travail intellectuel. Multipliez 4× par 2,5× et une tâche qui coûte 1,00 $ selon les tarifs d'Opus 5 coûte de l'ordre de 0,10 $ selon ceux de Grok 4.6 — avant que les remises par lots côté Opus ne comblent une partie de l'écart.
En ce qui concerne spécifiquement le codage agentique, le résultat DeepSWE 1.1 de Grok 4.6 est passé de 54 % à 65,9 % entre les versions 4.5 et 4.6, et son score CursorBench se situe à moins d'un demi-point de celui d'Opus 5, tout en auto-vérifiant son propre travail au passage. Pour une équipe qui traite des milliers d'appels agentiques par jour, où chaque appel est une boucle multi-tours, l'économie par tâche et les trajectoires plus courtes font toute la différence entre un produit viable et un burn rate. C'est l'argument que défend xAI, et les données d'efficacité indépendantes vont dans ce sens.
La décision de routage
Voici le face-à-face où un routeur montre sa valeur, car la bonne réponse est « les deux, avec la répartition définie par la forme de la charge de travail ». Grok 4.6 et Claude Opus 5 sont tous deux en ligne sur OrcaRouter au prix catalogue de chaque fournisseur — 2 $ / 6 $ pour grok/grok-4.6, 5 $ / 25 $ pour anthropic/claude-opus-5 — avec une marge de 0 %, donc le nombre dans votre modèle de coûts est celui qui est facturé. La tuyauterie qui rend la répartition pratique : une seule clé API pour les deux modèles, un basculement automatique si le point de terminaison d'un fournisseur se dégrade au milieu d'une longue exécution d'agent, et un DSL de routage qui peut envoyer les tours courts et à volume élevé à Grok 4.6 et faire remonter le travail à long horizon et gourmand en contexte à Claude Opus 5 en un seul appel. Vous n'avez pas besoin d'un second contrat pour exécuter une architecture à deux niveaux, et vous pouvez réajuster la répartition à mesure que les données de trafic réelles arrivent, au lieu de deviner à partir des fiches techniques des modèles.

La lecture honnête
L'égalité sur l'indice composite est réelle, et c'est un piège. Les modèles à score égal ne sont pas interchangeables ; ils se distinguent précisément là où le score est aveugle. Claude Opus 5 est le choix par défaut le plus sûr pour les travaux de connaissance à large spectre, fortement contextuels, portant sur documents et images, où une fenêtre de 1M de jetons et un raisonnement approfondi comptent plus que le coût. Grok 4.6 est le meilleur choix par défaut pour les boucles d'agents à volume élevé, où l'efficacité en jetons par tâche et un avantage de prix de 2,5× se cumulent pour créer une différence de facture d'un ordre de grandeur. Si votre charge de travail relève du premier cas, payez pour Opus 5 et cessez de vous soucier du prix. Si elle relève du second, la parité de 61 sur le papier est la meilleure raison que vous aurez jamais de tester Grok 4.6 en premier — le benchmark dit qu'ils sont égaux, et la facture dit qu'ils ne le sont pas.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
