
Claude Opus 5.5 vs Grok 4.6 : Un modèle lit, l’autre agit
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 221 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Claude Opus 5.5 et Grok 4.6 sont les deux façons les moins chères d'acheter un modèle de classe frontière capable de tenir un demi-million de tokens de contexte — et ce ne sont pas le même produit. Sur une mesure, Grok 4.6 se situe à trois points du plafond absolu : 94,9 sur GPQA Diamond, un ensemble de questions scientifiques de niveau master où le modèle phare d'Anthropic se trouve dans la même bande. Sur la suivante, il est à trente-huit points derrière. Sur Terminal-Bench 4.0, le benchmark de terminal agentique qui demande à un modèle d'accomplir un vrai travail dans un shell, Artificial Analysis a attribué à Grok 4.6 un score de 21,21 % et à Claude Opus 5.5 de 59,60 %. Ce n'est pas une coquille dans un sens ou dans l'autre, et toute la forme de ce duo réside dans l'explication de pourquoi ces deux chiffres sont vrais en même temps.
Deux sorties, une même gamme de prix, à quatre mois d'intervalle
SpaceXAI a lancé Grok 4.6 le 12 août 2026 comme fleuron actuel de la gamme Grok, à 2,00 $ par million de tokens d'entrée et 6,00 $ en sortie, avec une fenêtre de contexte de 500 000 tokens et des entrées texte, image et fichier. Anthropic a lancé Claude Opus 5.5 le 22 septembre 2026, environ six semaines plus tard, à 4,00 $/20,00 $ avec une fenêtre de contexte de 1 000 000 de tokens et 128 000 tokens de sortie. Les deux prennent en charge un effort de raisonnement configurable, l'appel d'outils et les sorties structurées ; les deux exposent une interface de chat compatible OpenAI ainsi que le format propre à leur fournisseur.
Ainsi, la lecture naïve donne un échange net : Grok 4.6 coûte moitié prix en entrée et environ un tiers en sortie, tandis que Claude Opus 5.5 répond avec une fenêtre de contexte deux fois plus grande. Cet arbitrage est réel et, pour le travail sur de longs documents, il peut être la seule chose qui compte. Ce n’est toutefois pas là que se situe la divergence intéressante, car les deux modèles ont été évalués sur le même banc d’essai indépendant et ne se sont pas placés au même endroit sur les axes qui comptent pour le travail agentique.
Ce que le catalogue indique au sujet des axes sur lesquels les deux ont été mesurés.
Le catalogue d’OrcaRouter porte la provenance des benchmarks ligne par ligne — chaque chiffre nomme l’évaluateur dont il provient — de sorte que les paires ci-dessous proviennent toutes d’une même source pour les deux modèles, Artificial Analysis, plutôt que d’un chiffre fourni par un vendeur d’un côté et d’un tiers de l’autre :
• GPQA Diamond — Claude Opus 5.5 ne figure pas sur cet axe dans notre catalogue ; Grok 4.6 obtient un score de 94,9 %
• Humanity's Last Exam — 61,4 % pour Claude Opus 5.5 contre 42,9 % pour Grok 4.6
• SciCode — 66,9 % contre 56,5 %
• Rappel en contexte long — 84,7 % contre 80,3 %
• Terminal-Bench 4.0 — 59,60 % contre 21,21 %
• AA Intelligence Index — 57,6 contre 44,3
La ligne GPQA est délibérément laissée vide du côté d’Anthropic, plutôt que remplie à partir d’une présentation commerciale d’un fournisseur. Le 94,9 de Grok 4.6 à cette ligne est le chiffre le plus fort de sa fiche, et il est authentique — une mesure, non une affirmation de SpaceXAI — et il dit quelque chose de vrai sur le modèle : lorsque la tâche est une question bien défendable avec une seule réponse défendable, Grok 4.6 se situe à la frontière. Lisez-le à côté des 21,21 % de Terminal-Bench 4.0 et la forme devient lisible. Produire une réponse correcte sur un sujet scientifique et exécuter une tâche en cinq étapes dans un shell face à de vrais fichiers sont des compétences différentes, et Grok 4.6 est bien plus avancé sur la première que sur la seconde.
Une réserve sur ce rapprochement avant qu’il ne serve de verdict : les chiffres Artificial Analysis des deux modèles ont été enregistrés à des dates d’évaluation différentes, et ceux de Grok 4.6 constituent le jeu le plus ancien. La comparaison porte entre un modèle évalué en août et un modèle évalué en septembre sur un banc d’évaluation qui a lui-même été révisé durant cette période. Le sens de l’écart est constant sur cinq axes distincts, c’est pourquoi nous le considérons comme un signal, mais les valeurs exactes en points doivent être lues comme une comparaison août-septembre, et non comme une comparaison effectuée le même jour.
Un indice construit par quelqu'un qui ne vend pas non plus
Il existe une seconde mesure indépendante, et elle s’accorde sur la direction tout en étant beaucoup moins encline à faire des distinctions fines. L’Epoch Capabilities Index, construit par Epoch AI comme un composite de plus de cinquante benchmarks et remis à l’échelle afin que Claude 3.5 Sonnet se situe à 130 et GPT-5 à 150, place Claude Opus 5.5 à 167,35 dans le fichier que nous avons lu le 2 octobre 2026. Grok 4.6 est à 156,61, d’après une évaluation du 12 août. Cela représente un écart de 10,74 points sur une échelle où environ cinq points correspondaient, d’après les observations, à un doublement de la mesure d’horizon temporel de METR au lancement de l’indice — un écart large, et nettement en dehors des intervalles publiés des deux modèles, 164,0 à 172,0 et 154,66 à 158,93, qui ne se chevauchent pas du tout.
Il vaut la peine de noter ce que cet indice ne tranche pas. Il place Claude Sonnet 5.5 à 165,2 et Claude Fable 5.1 à 164,82, tous deux au-dessus de Grok 4.6, et ces deux modèles coûtent moins cher par million de jetons de sortie que le tarif de deuxième palier de Grok 4.6. Quiconque choisit uniquement selon le rapport capacité-prix dispose d’une troisième et d’une quatrième option dans la même famille de fournisseurs, et la comparaison dans cet article porte sur autre chose : ce en quoi chacun des deux modèles est bon.
Les cartes de tarifs et la ligne qui n'apparaît que sur l'une d'elles.

La grille tarifaire de Grok 4.6 comporte un palier que celle de Claude Opus 5.5 n’a pas : les requêtes dépassant 200 000 tokens de prompt sont facturées au double du tarif de base, donc l’entrée passe de 2,00 $ à 4,00 $ et la sortie de 6,00 $ à 12,00 $, la lecture du cache passant de 0,50 $ à 1,00 $. Claude Opus 5.5 facture 4,00 $/20,00 $ avec des lectures de cache à 0,20 $ forfaitaires sur toute la fenêtre de 1 000 000 de tokens. Cette inversion est la conséquence pratique de l’achat de contexte long auprès de l’un ou l’autre modèle, et elle inverse la comparaison des prix affichés dès qu’une charge de travail augmente réellement :
• Tarif à 30 000 tokens d'entrée — Claude Opus 5.5 est le plus cher, à environ 28 cents pour 30 000 en entrée et 8 000 en sortie, contre environ 11 cents pour Grok 4.6
• Prix à 250 000 jetons d’entrée — l’ordre s’inverse, car Grok 4.6 est passé à son palier doublé, tandis que Claude Opus 5.5 ne l’a pas fait
• Lectures du cache — 0,20 $ par million pour Claude Opus 5.5, contre 0,50 $ pour Grok 4.6, passant à 1,00 $ au-delà du palier.
• Sortie maximale — 128 000 jetons pour Claude Opus 5.5 ; le plafond de sortie de Grok 4.6 n’est pas indiqué dans la fiche du catalogue
Grok 4.6 présente aussi une lacune qu'il vaut mieux énoncer clairement plutôt que de la laisser être découverte plus tard. Sa fiche ne mentionne aucune valeur de sortie maximale — le champ n'est pas mesuré, et non pas zéro — de sorte qu'une charge de travail qui dépend de réponses uniques très longues n'a aucun chiffre publié sur lequel s'appuyer pour planifier de ce côté de la comparaison.
La colonne de performance qui ne doit pas être lue
Notre catalogue comporte également un panneau de performance de service par modèle, et sur Grok 4.6, c’est l’élément le plus trompeur de la page. La fiche indique une latence p50 de 10 000 millisecondes et un taux d’erreur de 97,58 % sur une fenêtre de sept jours, avec 26 184 jetons servis durant cette période. Ces champs ne décrivent pas un modèle lent. Ils décrivent un modèle qui a été à peine appelé : à ce niveau de trafic, l’échantillon est trop mince pour qu’une distribution de latence signifie quoi que ce soit, et le taux d’erreur reflète une poignée de tentatives plutôt qu’une qualité de service. Considérer ce bloc comme la preuve que Grok 4.6 est lent reviendrait à lire un artefact de mesure comme une mesure.
Le panel de Claude Opus 5.5, en revanche, a une population derrière lui — un p50 de l'ordre de 4,4 secondes sur une fenêtre de sept jours avec des échantillons quotidiens, et 156 millions de tokens servis sur la même période. Même cela doit être interprété pour ce que c'est : notre propre trafic de playground, qui est un échantillon de nos utilisateurs plutôt qu'une propriété du modèle.
Lequel router, et comment le découvrir par vous-même dans votre propre travail
Le clivage que décrivent les chiffres est suffisamment stable pour qu'on puisse agir dessus. Claude Opus 5.5 est le choix pour le travail agentique et à long horizon — l'écart de 59,60 % contre 21,21 % sur Terminal-Bench 4.0 est la plus grande séparation sur tout axe sur lequel les deux modèles ont été mesurés, et c'est l'axe qui prédit si l'on peut confier à un modèle une tâche plutôt qu'une question. C'est aussi le choix lorsque le prompt est réellement long, car la grille tarifaire ne change pas par palier et la fenêtre est deux fois plus grande. Grok 4.6 est le choix pour le travail en forme de question à grande échelle : un score de 94,9 % à GPQA Diamond à 2,00 $/6,00 $ dans les premiers 200 000 tokens est une très bonne affaire pour les charges de travail de récupération-réponse qui ne basculent jamais dans le palier doublé.
Les deux sont sur OrcaRouter au prix catalogue du fournisseur, avec 0 % de marge — Claude Opus 5.5 à 4,00 $/20,00 $, avec des lectures de cache à 0,20 $, Grok 4.6 à 2,00 $/6,00 $, avec le palier au-delà de 200 K appliqué exactement comme SpaceXAI le définit — derrière une seule clé, afin que la répartition ci-dessus puisse être testée sur votre propre jeu de prompts plutôt que de faire l'objet de débats. Là où les deux sont routés, le basculement automatique se trouve en dessous, ce qui est bon à avoir quand c'est le modèle le moins cher qui porte le chemin agentique.
Le verdict que ce duo obtient : Grok 4.6 est le meilleur lecteur et Claude Opus 5.5 est le meilleur exécutant. Le 94,9 sur GPQA Diamond et le 21,21 sur Terminal-Bench sont le même modèle mesuré deux fois, et savoir auquel de ces deux nombres ressemble votre charge de travail, c'est toute la décision.


Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
