Carte hero intitulée Claude Sonnet 5.5 vs Grok 4.6, sous-titrée « la grille tarifaire dit une chose, la facture de tokens en dit une autre », avec des pastilles indiquant sortie 10 $ vs 6 $, coût par tâche 7,60 $ vs 1,86 $, et Indice 56 vs 44, et un pied de page citant Artificial Analysis v4.3.2 et les tarifs des fournisseurs.
Guides & Insights

Claude Sonnet 5.5 vs Grok 4.6 : Le tarif affiché dit une chose, la facture de tokens en dit une autre

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

L’arithmétique du titre semble déjà tranchée avant même que l’article ne commence. Grok 4.6 coûte 2 $ par million de jetons d’entrée et 6 $ par million de jetons de sortie ; Claude Sonnet 5.5 coûte 2 $ et 10 $. Le modèle de Space​XAI est 40 % moins cher en sortie, fait jeu égal en entrée, et est disponible en disponibilité générale depuis le 12 août 2026 — assez longtemps pour que ses bizarreries soient documentées plutôt que l’objet de rumeurs. Le modèle d’Anthro​pic est arrivé le 28 septembre 2026, un jour avant la rédaction de cet article, et est de loin le plus récent de la catégorie.

Puis on arrive aux chiffres d’efficacité indépendants, et l’ordre s’inverse. Artificial Analysis mesure les modèles de la classe GPT et Claude sur une base coût par tâche, parallèlement à son Intelligence Index, et dans la révision v4.3.2, les deux modèles dont il est question ici coûtent 1,86 $ par tâche de l’indice pour Grok 4.6 et 7,60 $ pour Claude Sonnet 5.5. Le modèle dont la grille tarifaire est la moins chère est le plus coûteux à exploiter, dans un rapport de quatre. Comprendre pourquoi, et quand cette inversion tient ou ne tient pas, constitue toute la comparaison.

Deux modèles, deux positions dans leurs propres familles

Grok 4.6 est le fleuron actuel de la gamme Grok — la documentation destinée aux développeurs de SpaceXAI elle-même le répertorie comme le plus récent, et il a succédé à Grok 4.5 avec la même fenêtre de contexte de 500 000 tokens, la même surface d'entrée texte, image et fichier, et la même tarification de base. Il prend en charge un effort de raisonnement configurable, l'appel d'outils natif, les sorties structurées et l'ensemble complet des paramètres d'échantillonnage, et, en tant que modèle OpenAI Responses de premier ordre, il s'intègre aux frameworks d'agents existants sans couche de traduction. Artificial Analysis le classe à un Intelligence Index de 44, au 31e rang des 216 modèles qu'elle mesure, avec un score GPQA Diamond de 94,9 %.

Two-column scoreboard for Claude Sonnet 5.5 and Grok 4.6 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, verbosity 410M output tokens. Right column Grok 4.6: input $2.00 per million, output $6.00 per million, 500K-token context, AA Intelligence Index 44, cost per Index task $1.86, verbosity 94M output tokens. A footer line reads Index, cost per task and verbosity per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 est la deuxième entrée de la génération 5.5 d'Anthropic et le modèle que l'entreprise a positionné comme la meilleure combinaison de vitesse et d'intelligence de sa gamme. Il est proposé sous claude-sonnet-5-5/ sur l'API Claude et les trois principaux clouds, avec une fenêtre de contexte de 1 M de tokens et un plafond de sortie synchrone de 128 K, conserve les tarifs de 2 $ / 10 $ de Claude Sonnet 5 pour l'entrée, la sortie et la mise en cache, et est disponible avec une rétention nulle des données. Sur la même révision de l'indice, il obtient un score de 56 et se classe troisième sur 216.

Donc les deux ne sont pas vraiment sur le même marché. L’un est un modèle frontière à 500 000 tokens, en vente depuis sept semaines à un tarif réduit. L’autre est une gamme polyvalente à 1 million de tokens qui ne coûte pas plus cher par token que son prédécesseur et obtient douze points de plus au score composite. La comparaison mérite tout de même d’être faite, car les deux sont des modèles à 2 $ en entrée, et c’est là que les décisions d’achat commencent réellement.

L'écart d'un facteur quatre que personne ne met sur une diapositive

Les grilles tarifaires facturent les tokens. Les factures sont libellées en tâches, et le nombre de tokens qu’un modèle dépense pour parvenir à une réponse relève d’un choix de conception plutôt que d’une constante. C’est là que ces deux éléments divergent, et les chiffres mesurés sont saisissants :

• Tarif de sortie — Claude Sonnet 5.5 10 $ par million vs Grok 4.6 6 $ par million

• Coût par tâche de l’Intelligence Index — Claude Sonnet 5.5 7,60 $ vs Grok 4.6 1,86 $

• Verbosité sur l'Index — Claude Sonnet 5.5 410 M tokens de sortie contre Grok 4.6 94 M

• Indice d'intelligence — Claude Sonnet 5.5 56 contre Grok 4.6 44, tous deux sur v4.3.2

• Vitesse de sortie — Grok 4.6 mesuré à 67,7 jetons par seconde, contre une médiane de 82,7 ; Anthropic indique que Claude Sonnet 5.5 génère une sortie plus de 30 % plus rapide que Claude Sonnet 5, qu'Artificial Analysis a chronométré à 78,7 jetons par seconde

La ligne de verbosité est le mécanisme. Un modèle qui émet quatre fois plus de tokens n'a pas besoin d'un taux de sortie 67 % plus élevé pour coûter quatre fois plus cher par tâche — mais cela aide, et les deux effets vont dans le même sens ici. La formulation d'Anthropic elle-même soutient l'interprétation plutôt qu'elle ne la contredit : le contenu de lancement affirme que Claude Sonnet 5.5 « coûte jusqu'à 30 % de moins par tâche » que Claude Sonnet 5 à des tarifs par token identiques, ce qui est une affirmation sur le nombre de tokens, et non sur les tarifs. Face à une base de référence externe bien plus légère, la même propriété devient le plus grand risque de coût du modèle.

Rien de tout cela ne fait disparaître l’écart d’indice. Douze points sur le composite représentent une véritable différence de capacité, et une tâche moins coûteuse qui échoue n’est pas moins coûteuse. Cela signifie que la question honnête n’est pas « quel taux est le plus bas » mais « combien de tokens la tâche plus difficile consomme-t-elle », et ce nombre n’existe qu’une fois que vous exécutez votre propre charge de travail.

Artificial Analysis model page for Claude Sonnet 5 (Adaptive Reasoning, Max Effort), released June 2026, showing an Intelligence Index of 38, an output speed of 78.7 tokens per second against an average of 83, a cost of $2.00 per million input tokens and $10.00 per million output tokens, $5.09 per Intelligence Index task, a verbosity of 370M output tokens, and a 1M-token context window.

Contexte, effort et la forme de l'intégration

La deuxième divergence est architecturale, et elle détermine lequel des deux vous pouvez adopter sans rien réécrire.

OrcaRouter model page for grok/grok-4.6, attributed to SpaceXAI and dated 2026-08-12, showing a 500K-token context window, text, image and file input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 3.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 modifie six comportements par rapport à Claude Sonnet 5, dont cinq sont des ruptures de compatibilité. L'envoi de thinking: {"type": "disabled"}/ renvoie désormais une erreur 400 et doit être remplacé par between_tools/. L'utilisation forcée d'outils — tool_choice/ de "any"/ ou d'un outil nommé — est rejetée d'emblée, donc une boucle qui force un appel valide selon le schéma doit passer à auto/ avec l'utilisation stricte d'outils ou des sorties structurées. L'ancien computer_20251124/ outil d'utilisation d'ordinateur est refusé sur l'API Claude et Google Cloud. Les blocs de réflexion sont désormais liés au modèle et au compte qui les ont produits, donc une conversation peut transmettre son raisonnement depuis Claude Sonnet 5, mais pas le transférer latéralement vers une autre famille de modèles. Et l'outil advisor n'accepte plus Claude Opus 4.8, Claude Opus 4.7 ou Claude Sonnet 5 comme conseillers derrière un exécuteur Sonnet 5.5.

Grok 4.6 ne demande rien de tout cela. C'est un modèle au format OpenAI dont la surface d'échantillonnage est intacte, et la migration depuis Grok 4.5 se résume à un changement de chaîne de modèle. Sa propre structure de coûts comporte toutefois un piège, et elle est l'exact miroir de celle d'Anthropic : le tarif de 2 $ / 6 $ s'applique jusqu'à 200 000 jetons d'entrée, et tout ce qui dépasse est facturé à 4 $ / 12 $. Claude Sonnet 5.5 facture au tarif standard sur toute la fenêtre de 1 M.

Mettez les deux structures côte à côte et le choix ne se résume plus à savoir quel fournisseur est le moins cher :

• Prompts courts, sortie dense — la consommation de tokens plus économe de Grok 4.6 et son débit de sortie plus faible l’emportent de manière décisive

• Entrées très longues — le tarif forfaitaire de 1 M de Claude Sonnet 5.5 commence à surpasser un palier doublant bien avant la limite de contexte

• Des sorties uniques volumineuses — le plafond de 128 K de Sonnet 5.5 correspond à celui de Grok 4.6, et il atteint 300 K sur l'API Message Batches derrière l'en-tête output-300k-2026-03-24/ en-tête

• Code existant au format OpenAI — Grok 4.6 ne nécessite aucune modification ; Sonnet 5.5 nécessite le travail sur l'utilisation des outils et le raisonnement ci-dessus

Réunir les deux sur un seul identifiant

Garder une comparaison entre deux fournisseurs en tête est facile. C’est au moment de la mener que le coût se cache : deux comptes, deux ensembles de limites, deux surfaces de facturation, et un décompte de tokens qu’il faut mesurer deux fois avant qu’il ne signifie quoi que ce soit.

OrcaRouter réduit tout cela à un seul point de terminaison compatible OpenAI couvrant plus de 200 modèles, avec le prix catalogue du fournisseur répercuté sans marge, de sorte qu'un changement de tarif côté Grok ou côté Claude est effectif ici le jour même, et non à la prochaine renégociation de contrat. Toute la gamme Grok 4.x figure au catalogue aux tarifs propres du fournisseur, et Claude Sonnet 5 est routable depuis le 30 juin aux tarifs Anthropic de 2 $ / 10 $ — le modèle sur lequel passe encore l'essentiel du trafic de l'API Claude, mesuré à 150 jetons de sortie par seconde avec un temps p50 jusqu'au premier jeton d'environ cinq secondes.

Claude Sonnet 5.5 en particulier ne figure pas encore dans notre catalogue. Tant qu'il n'y est pas, la voie pour l'atteindre est l'API propre du fournisseur, et la façon de le tester sans miser une charge de travail sur un modèle que personne n'a évalué indépendamment au-delà d'un seul composite, c'est de lui envoyer un pourcentage du trafic derrière un basculement automatique, avec Grok 4.6 ou Claude Sonnet 5 qui rattrapent ce qu'il laisse tomber. Essayer un tout nouveau palier est une décision de routage, pas un projet de migration.

Que faire des chiffres

Grok 4.6 est le modèle à privilégier lorsque la tâche est courte, que la sortie est dense et que l’intégration parle déjà OpenAI. Il est, de façon mesurable, plus économe par tâche que tout autre modèle de cette gamme de prix, ses contrôles d’échantillonnage sont intacts, et sept semaines de disponibilité signifient que ses modes de défaillance ont déjà été découverts par d’autres.

Claude Sonnet 5.5 est le meilleur modèle lorsque l'entrée est énorme, lorsque le score composite est ce que vous achetez, ou lorsque le travail est suffisamment agentique pour qu'un écart de douze points dans l'indice et un plafond de sortie de 128K importent plus qu'une différence d'un facteur quatre dans le coût par tâche. La liste de vérification de migration est bien réelle, et elle représente une journée de travail plutôt qu'une simple modification d'une chaîne de modèle.

Ce qui trancherait la question, c’est une mesure de jetons par tâche sur votre propre trafic, effectuée sur les deux. Chaque chiffre de cet article qui détermine l’issue — 1,86 $ contre 7,60 $, 94 M contre 410 M — est un indicateur indirect de ce seul chiffre, et c’est le seul d’entre eux que vous pouvez produire vous-même.

Comparés dans cet article4

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement