Carte de titre principale générée pour Claude Opus 5.5 vs Grok 4.6, divisée par un séparateur vertical : « Claude Opus 5.5 » avec « $4.00 / $20.00 » à gauche, « Grok 4.6 » avec « $2.00 / $6.00 » à droite, et le slogan « UN MODÈLE LIT, L'AUTRE AGIT » en bas, avec le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Claude Opus 5.5 vs Grok 4.6 : Un modèle lit, l’autre agit

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Claude Opus 5.5 et Grok 4.6 sont les deux façons les moins chères d'acheter un modèle de classe frontière capable de tenir un demi-million de tokens de contexte — et ce ne sont pas le même produit. Sur une mesure, Grok 4.6 se situe à trois points du plafond absolu : 94,9 sur GPQA Diamond, un ensemble de questions scientifiques de niveau master où le modèle phare d'Anthropic se trouve dans la même bande. Sur la suivante, il est à trente-huit points derrière. Sur Terminal-Bench 4.0, le benchmark de terminal agentique qui demande à un modèle d'accomplir un vrai travail dans un shell, Artificial Analysis a attribué à Grok 4.6 un score de 21,21 % et à Claude Opus 5.5 de 59,60 %. Ce n'est pas une coquille dans un sens ou dans l'autre, et toute la forme de ce duo réside dans l'explication de pourquoi ces deux chiffres sont vrais en même temps.

Deux sorties, une même gamme de prix, à quatre mois d'intervalle

SpaceXAI a lancé Grok 4.6 le 12 août 2026 comme fleuron actuel de la gamme Grok, à 2,00 $ par million de tokens d'entrée et 6,00 $ en sortie, avec une fenêtre de contexte de 500 000 tokens et des entrées texte, image et fichier. Anthropic a lancé Claude Opus 5.5 le 22 septembre 2026, environ six semaines plus tard, à 4,00 $/20,00 $ avec une fenêtre de contexte de 1 000 000 de tokens et 128 000 tokens de sortie. Les deux prennent en charge un effort de raisonnement configurable, l'appel d'outils et les sorties structurées ; les deux exposent une interface de chat compatible OpenAI ainsi que le format propre à leur fournisseur.

Ainsi, la lecture naïve donne un échange net : Grok 4.6 coûte moitié prix en entrée et environ un tiers en sortie, tandis que Claude Opus 5.5 répond avec une fenêtre de contexte deux fois plus grande. Cet arbitrage est réel et, pour le travail sur de longs documents, il peut être la seule chose qui compte. Ce n’est toutefois pas là que se situe la divergence intéressante, car les deux modèles ont été évalués sur le même banc d’essai indépendant et ne se sont pas placés au même endroit sur les axes qui comptent pour le travail agentique.

Ce que le catalogue indique au sujet des axes sur lesquels les deux ont été mesurés.

Le catalogue d’OrcaRouter porte la provenance des benchmarks ligne par ligne — chaque chiffre nomme l’évaluateur dont il provient — de sorte que les paires ci-dessous proviennent toutes d’une même source pour les deux modèles, Artificial Analysis, plutôt que d’un chiffre fourni par un vendeur d’un côté et d’un tiers de l’autre :

• GPQA Diamond — Claude Opus 5.5 ne figure pas sur cet axe dans notre catalogue ; Grok 4.6 obtient un score de 94,9 %

• Humanity's Last Exam — 61,4 % pour Claude Opus 5.5 contre 42,9 % pour Grok 4.6

• SciCode — 66,9 % contre 56,5 %

• Rappel en contexte long — 84,7 % contre 80,3 %

• Terminal-Bench 4.0 — 59,60 % contre 21,21 %

• AA Intelligence Index — 57,6 contre 44,3

La ligne GPQA est délibérément laissée vide du côté d’Anthropic, plutôt que remplie à partir d’une présentation commerciale d’un fournisseur. Le 94,9 de Grok 4.6 à cette ligne est le chiffre le plus fort de sa fiche, et il est authentique — une mesure, non une affirmation de SpaceXAI — et il dit quelque chose de vrai sur le modèle : lorsque la tâche est une question bien défendable avec une seule réponse défendable, Grok 4.6 se situe à la frontière. Lisez-le à côté des 21,21 % de Terminal-Bench 4.0 et la forme devient lisible. Produire une réponse correcte sur un sujet scientifique et exécuter une tâche en cinq étapes dans un shell face à de vrais fichiers sont des compétences différentes, et Grok 4.6 est bien plus avancé sur la première que sur la seconde.

Une réserve sur ce rapprochement avant qu’il ne serve de verdict : les chiffres Artificial Analysis des deux modèles ont été enregistrés à des dates d’évaluation différentes, et ceux de Grok 4.6 constituent le jeu le plus ancien. La comparaison porte entre un modèle évalué en août et un modèle évalué en septembre sur un banc d’évaluation qui a lui-même été révisé durant cette période. Le sens de l’écart est constant sur cinq axes distincts, c’est pourquoi nous le considérons comme un signal, mais les valeurs exactes en points doivent être lues comme une comparaison août-septembre, et non comme une comparaison effectuée le même jour.

Un indice construit par quelqu'un qui ne vend pas non plus

Il existe une seconde mesure indépendante, et elle s’accorde sur la direction tout en étant beaucoup moins encline à faire des distinctions fines. L’Epoch Capabilities Index, construit par Epoch AI comme un composite de plus de cinquante benchmarks et remis à l’échelle afin que Claude 3.5 Sonnet se situe à 130 et GPT-5 à 150, place Claude Opus 5.5 à 167,35 dans le fichier que nous avons lu le 2 octobre 2026. Grok 4.6 est à 156,61, d’après une évaluation du 12 août. Cela représente un écart de 10,74 points sur une échelle où environ cinq points correspondaient, d’après les observations, à un doublement de la mesure d’horizon temporel de METR au lancement de l’indice — un écart large, et nettement en dehors des intervalles publiés des deux modèles, 164,0 à 172,0 et 154,66 à 158,93, qui ne se chevauchent pas du tout.

Il vaut la peine de noter ce que cet indice ne tranche pas. Il place Claude Sonnet 5.5 à 165,2 et Claude Fable 5.1 à 164,82, tous deux au-dessus de Grok 4.6, et ces deux modèles coûtent moins cher par million de jetons de sortie que le tarif de deuxième palier de Grok 4.6. Quiconque choisit uniquement selon le rapport capacité-prix dispose d’une troisième et d’une quatrième option dans la même famille de fournisseurs, et la comparaison dans cet article porte sur autre chose : ce en quoi chacun des deux modèles est bon.

Les cartes de tarifs et la ligne qui n'apparaît que sur l'une d'elles.

A two-column scoreboard comparing Claude Opus 5.5 and Grok 4.6 across six rows. Left column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K max output, AA Intelligence Index 57.6, Epoch Capabilities Index 167.35. Right column Grok 4.6: input $2.00 doubling to $4.00 above 200K tokens, output $6.00 doubling to $12.00, cache read $0.50, context 500K tokens, AA Intelligence Index 44.3, Epoch Capabilities Index 156.61. A footer line reads 'Prices and catalogue figures per the OrcaRouter catalogue; Index figures per Artificial Analysis and the Epoch Capabilities Index.'

La grille tarifaire de Grok 4.6 comporte un palier que celle de Claude Opus 5.5 n’a pas : les requêtes dépassant 200 000 tokens de prompt sont facturées au double du tarif de base, donc l’entrée passe de 2,00 $ à 4,00 $ et la sortie de 6,00 $ à 12,00 $, la lecture du cache passant de 0,50 $ à 1,00 $. Claude Opus 5.5 facture 4,00 $/20,00 $ avec des lectures de cache à 0,20 $ forfaitaires sur toute la fenêtre de 1 000 000 de tokens. Cette inversion est la conséquence pratique de l’achat de contexte long auprès de l’un ou l’autre modèle, et elle inverse la comparaison des prix affichés dès qu’une charge de travail augmente réellement :

• Tarif à 30 000 tokens d'entrée — Claude Opus 5.5 est le plus cher, à environ 28 cents pour 30 000 en entrée et 8 000 en sortie, contre environ 11 cents pour Grok 4.6

• Prix à 250 000 jetons d’entrée — l’ordre s’inverse, car Grok 4.6 est passé à son palier doublé, tandis que Claude Opus 5.5 ne l’a pas fait

• Lectures du cache — 0,20 $ par million pour Claude Opus 5.5, contre 0,50 $ pour Grok 4.6, passant à 1,00 $ au-delà du palier.

• Sortie maximale — 128 000 jetons pour Claude Opus 5.5 ; le plafond de sortie de Grok 4.6 n’est pas indiqué dans la fiche du catalogue

Grok 4.6 présente aussi une lacune qu'il vaut mieux énoncer clairement plutôt que de la laisser être découverte plus tard. Sa fiche ne mentionne aucune valeur de sortie maximale — le champ n'est pas mesuré, et non pas zéro — de sorte qu'une charge de travail qui dépend de réponses uniques très longues n'a aucun chiffre publié sur lequel s'appuyer pour planifier de ce côté de la comparaison.

La colonne de performance qui ne doit pas être lue

Notre catalogue comporte également un panneau de performance de service par modèle, et sur Grok 4.6, c’est l’élément le plus trompeur de la page. La fiche indique une latence p50 de 10 000 millisecondes et un taux d’erreur de 97,58 % sur une fenêtre de sept jours, avec 26 184 jetons servis durant cette période. Ces champs ne décrivent pas un modèle lent. Ils décrivent un modèle qui a été à peine appelé : à ce niveau de trafic, l’échantillon est trop mince pour qu’une distribution de latence signifie quoi que ce soit, et le taux d’erreur reflète une poignée de tentatives plutôt qu’une qualité de service. Considérer ce bloc comme la preuve que Grok 4.6 est lent reviendrait à lire un artefact de mesure comme une mesure.

Le panel de Claude Opus 5.5, en revanche, a une population derrière lui — un p50 de l'ordre de 4,4 secondes sur une fenêtre de sept jours avec des échantillons quotidiens, et 156 millions de tokens servis sur la même période. Même cela doit être interprété pour ce que c'est : notre propre trafic de playground, qui est un échantillon de nos utilisateurs plutôt qu'une propriété du modèle.

Lequel router, et comment le découvrir par vous-même dans votre propre travail

Le clivage que décrivent les chiffres est suffisamment stable pour qu'on puisse agir dessus. Claude Opus 5.5 est le choix pour le travail agentique et à long horizon — l'écart de 59,60 % contre 21,21 % sur Terminal-Bench 4.0 est la plus grande séparation sur tout axe sur lequel les deux modèles ont été mesurés, et c'est l'axe qui prédit si l'on peut confier à un modèle une tâche plutôt qu'une question. C'est aussi le choix lorsque le prompt est réellement long, car la grille tarifaire ne change pas par palier et la fenêtre est deux fois plus grande. Grok 4.6 est le choix pour le travail en forme de question à grande échelle : un score de 94,9 % à GPQA Diamond à 2,00 $/6,00 $ dans les premiers 200 000 tokens est une très bonne affaire pour les charges de travail de récupération-réponse qui ne basculent jamais dans le palier doublé.

Les deux sont sur OrcaRouter au prix catalogue du fournisseur, avec 0 % de marge — Claude Opus 5.5 à 4,00 $/20,00 $, avec des lectures de cache à 0,20 $, Grok 4.6 à 2,00 $/6,00 $, avec le palier au-delà de 200 K appliqué exactement comme SpaceXAI le définit — derrière une seule clé, afin que la répartition ci-dessus puisse être testée sur votre propre jeu de prompts plutôt que de faire l'objet de débats. Là où les deux sont routés, le basculement automatique se trouve en dessous, ce qui est bon à avoir quand c'est le modèle le moins cher qui porte le chemin agentique.

Le verdict que ce duo obtient : Grok 4.6 est le meilleur lecteur et Claude Opus 5.5 est le meilleur exécutant. Le 94,9 sur GPQA Diamond et le 21,21 sur Terminal-Bench sont le même modèle mesuré deux fois, et savoir auquel de ces deux nombres ressemble votre charge de travail, c'est toute la décision.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.Screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the context window of 500,000 tokens, the text, image and file input surface, the capability tags, and the input and output price figures per million tokens.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement