
Tarification de Claude Opus 5.5 : la grille tarifaire complète, la ligne de cache et ce que coûte réellement une tâche
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 177 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1323 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Claude Opus 5.5s'affiche à 4,00 $ par million de tokens d'entrée et 20,00 $ par million de tokens de sortie, soit une baisse uniforme de 20 % par rapport aux 5,00 $/25,00 $ que Claude Opus 5a pratiqués, avec les lectures de cache en recul de 60 %, à 0,20 $ par million. Ce sont là les tarifs publiés d'Anthropic, issus de la documentation tarifaire d'Anthropic elle-même, en date du 24 septembre 2026, deux jours après la sortie du modèle. Le prix affiché, c'est la partie facile. Anthropic affirme aussi que le modèle coûte « environ 40 % de moins à exploiter » sur des charges de travail typiques, et ce chiffre ne figure pas sur la grille tarifaire — c'est une caractérisation du fournisseur, construite à partir de la baisse par token et de l'hypothèse que le modèle consomme moins de tokens et moins de tours pour accomplir le même travail. Cette page sépare les deux : chaque tarif que vous pouvez vérifier sur la grille dès aujourd'hui, et l'arithmétique qui sous-tend celui que vous ne pouvez pas vérifier. Claude Fable 5.1, le palier à 10 $/50 $ situé au-dessus, apparaît tout au long comme la comparaison que fait Anthropic elle-même.
La grille tarifaire complète, chaque ligne telle qu'Anthropic la publie
Tout le contenu de cette section a été lu à partir de la documentation tarifaire d'Anthropic sur platform.claude.com et claude.com le 24 septembre 2026. Rien ici n'est repris d'un autre texte.
• Entrée — 4,00 $ par million de tokens (tarif publié d'Anthropic).
• Sortie — 20,00 $ par million de jetons. Les jetons de réflexion sont facturés comme des jetons de sortie, et la réflexion adaptative de Claude Opus 5.5 est toujours activée et ne peut pas être désactivée.
• Lecture du cache — 0,20 $ par million de tokens. Anthropic le documente comme 0,05x le prix d'entrée de base, sa propre dérogation en note de bas de page pour ce modèle.
• Écriture de cache de 5 minutes — 5,00 $ par million de tokens, le multiplicateur standard de 1,25x pour les entrées de base qu'Anthropic applique à chaque modèle du tableau.
• Écriture de cache de 1 heure — 8,00 $ par million de jetons, le multiplicateur standard de 2x appliqué à l'entrée de base.
• Batch API — 50 % de réduction dans les deux sens : 2,00 $ en entrée et 10,00 $ en sortie par million. Anthropic publie directement les tarifs réduits plutôt que de vous laisser les diviser par deux.
• Fast mode — 8,00 $ en entrée et 40,00 $ en sortie par million, soit exactement 2 fois le tarif standard. La page de la documentation d'Anthropic est intitulée « Fast mode (research preview) ».
• Inférence réservée aux États-Unis — un multiplicateur de 1,1x appliqué aux entrées, aux sorties, aux écritures de cache et aux lectures de cache lorsque inference_geo: "us" est défini. Le routage global, qui est la valeur par défaut, utilise la tarification standard.
• Contexte et plafond de sortie — 1 M de tokens de contexte et 128 K de sortie synchrone au tarif standard, sans surcoût lié au contexte long. Antrhopic affirme qu'une requête de 900 k tokens est facturée au même tarif par token qu'une requête de 9 k tokens. Avec l'API Batch, le plafond de sortie monte à 300 K derrière l'en-tête bêta output-300k-2026-03-24.
Anthropic affirme également que les multiplicateurs de mise en cache « se cumulent avec d'autres modificateurs de tarification tels que la remise Batch API et la résidence des données » — ainsi, une requête traitée par lots, mise en cache et épinglée aux États-Unis multiplie ces trois facteurs, et l'arithmétique se compose plutôt que de se substituer.
Voici ce que les lecteurs des deux modèles évaluent réellement en termes de coût sur la même feuille :
• Claude Opus 5 — 5,00 $ en entrée, 25,00 $ en sortie, 0,50 $ en lecture de cache, 6,25 $ pour une écriture de cache de 5 minutes, 10,00 $ pour une écriture d'une heure, 2,50 $/12,50 $ en mode Batch (tarifs publiés d'Anthropic, consultés le 2026-09-24).
• Claude Fable 5.1 — 10,00 $ en entrée, 50,00 $ en sortie, 0,25 $ en lecture de cache, 12,50 $ pour une écriture de cache de 5 minutes, 20,00 $ pour une écriture d'une heure, 5,00 $/25,00 $ en mode Batch (tarifs publiés d'Anthropic, relevés le 2026-09-24).

La ligne de cache est l'endroit où la facture d'un agent est réellement décidée
La couverture de lancement traite la lecture du cache comme une note de bas de page. C’est le plus grand levier unique de la feuille pour toute charge de travail qui renvoie un grand préfixe, ce qui concerne la plupart des charges de travail de codage et d’agents.
La note de bas de page d'Anthropic elle-même est inhabituellement explicite sur les ratios : les hits de cache et les rafraîchissements coûtent 0,1x le prix d'entrée de base sur la plupart des modèles Claude, 0,025x sur Claude Fable 5.1, et 0,05x sur Claude Opus 5.5. Le ratio de cache de Claude Opus 5.5 est donc deux fois pire que le ratio standard, et deux fois pire que celui de Claude Fable 5.1.
En dollars, il gagne de toute façon, et c’est l’élément qui mérite d’être intériorisé : un meilleur multiplicateur ne l’emporte pas en dollars lorsque le taux de base est deux fois et demie plus élevé.
• Claude Fable 5.1 — 2,5 % d'une base de 10,00 $ équivaut à 0,25 $ par million de tokens mis en cache.
• Claude Opus 5.5 — 5 % d’une base de 4,00 $ équivaut à 0,20 $ par million de tokens mis en cache.
• Claude Opus 5 — 10 % d'une base de 5,00 $ correspond à 0,50 $ par million de jetons mis en cache.
La même inversion s'applique aux écritures. Claude Fable 5.1 facture 12,50 $ pour écrire un million de tokens dans le cache de 5 minutes et 20,00 $ pour la fenêtre de 1 heure ; Claude Opus 5.5 facture 5,00 $ et 8,00 $. Les lectures de cache constituent le seul poste où Claude Opus 5.5 dépasse ses deux homologues en dollars absolus, bien qu'il affiche le ratio intermédiaire.
Deux règles déterminent si l’écriture vaut la peine d’être payée. La documentation d’Anthropic indique qu’une écriture de 5 minutes coûte 1,25 fois le tarif de base des entrées et qu’elle est donc rentabilisée après une seule lecture du cache, tandis qu’une écriture d’une heure coûte 2 fois le tarif de base des entrées et nécessite deux lectures pour être rentabilisée. Et le cache est lié au préfixe qui l’a produit : Anthropic note que le passage entre la vitesse rapide et la vitesse standard invalide le cache, car les requêtes à différentes vitesses ne partagent pas les préfixes mis en cache. Changer de modèle, de niveau d’effort ou de définitions d’outils a le même effet. Un modèle moins cher qui impose une réécriture du préfixe à chaque changement peut coûter plus cher que le modèle plus cher qu’il a remplacé.
Ce que coûte réellement une longue boucle d'agent
Prenez un agent de codage de 40 tours qui renvoie un préfixe de 120 000 jetons — invite système, schémas d’outils, arborescence de fichiers — à chaque tour, ajoute 1 000 jetons d’entrée frais par tour à partir des résultats d’outils, et produit 800 jetons de sortie par tour. L’important ici, c’est la substitution : modifiez n’importe lequel de ces quatre nombres pour correspondre à votre propre trafic et l’arithmétique ci-dessous tient toujours.
À propos de Claude Opus 5.5 :
• Écriture du cache, une fois — 120 000 jetons à 5,00 $ par million = 0,60 $
• Lectures de cache, 39 tours — 4 680 000 tokens à 0,20 $ par million = 0,94 $
• Entrée fraîche, 40 tours — 40 000 jetons à 4,00 $ par million = 0,16 $
• Sortie, 40 tours — 32 000 tokens à 20,00 $ par million = 0,64 $
• Total de la session — 2,34 $, dont les lectures de cache représentent environ 40 %.
Sur Claude Opus 5, à nombre de tokens identique : 0,75 $ d'écriture de cache, 2,34 $ de lectures de cache, 0,20 $ d'entrée fraîche et 0,80 $ de sortie — 4,09 $.
Sur Claude Fable 5.1, à nombre de tokens identique : 1,50 $ d'écriture de cache, 1,17 $ de lecture de cache, 0,40 $ d'entrée fraîche et 1,60 $ de sortie — 4,67 $.
Mêmes tokens, mêmes tours, aucun gain d’efficacité à revendiquer : Claude Opus 5.5 revient 43 % moins cher que Claude Opus 5 et 50 % moins cher que Claude Fable 5.1. Et 1,40 $ des 1,75 $ d’écart par rapport à Claude Opus 5 — quatre-vingts pour cent de l’économie — provient de la seule ligne de lecture du cache, et non du tarif d’entrée affiché.
Maintenant, exécutez le scénario inverse : un appel en un seul passage avec 20 000 jetons d'entrée et 8 000 en sortie, sans mise en cache. Claude Opus 5.5 coûte 0,08 $ en entrée plus 0,16 $ en sortie — 0,24 $. Claude Opus 5 coûte 0,10 $ plus 0,20 $ — 0,30 $. C'est exactement la baisse de 20 % du prix affiché, et pas un point de plus.
Donc, la grille tarifaire seule offre quelque part entre 20 % et 43 %, selon la part de votre facture correspondant aux lectures de cache. Toute affirmation au-dessus de cette plage provient du nombre de tokens, pas des prix.
D'où vient l'affirmation d'Anthropic selon laquelle il est « environ 40 % moins cher à exécuter »
Les documents de lancement d’Anthropic indiquent que Claude Opus 5.5 « nécessite moins de ressources de calcul pour être servi qu’Opus 5 » et que ses tests montrent qu’il « coûtera 40 % de moins qu’Opus 5 sur les charges de travail typiques » avec les paramètres par défaut. La décomposition donnée par Anthropic est que le modèle « coûte moins cher par token qu’Opus 5 et utilise moins de tokens par tâche, ce qui aboutit au final à une baisse de 40 % des coûts ».
Appelez cela pour ce que c'est : une caractérisation par le fournisseur d'une moyenne sur des charges de travail sélectionnées par Anthropic, et non un résultat audité ni un tarif publié sur la grille tarifaire. La moitié vérifiable est la première — 20 % de réduction sur l'entrée et la sortie, 60 % sur les lectures de cache, toutes deux lisibles sur la grille aujourd'hui. La seconde moitié dépend du fait que le modèle consomme moins de tokens et moins de tours sur votre charge de travail, ce qui ne peut être vérifié qu'en l'exécutant.
Les preuves qu’Anthropic avance pour le volet des tokens sont un ensemble de déclarations de clients au moment du lancement. Tous les éléments suivants sont publiés par le fournisseur et décrivent des charges de travail que le fournisseur et ses clients ont choisies :
• Box — le modèle « a utilisé un tiers des tokens qu'Opus 5 a utilisés », avec des réponses « 40 % moins verbeuses sans perte de précision ».
• Kiro — il « a résolu plus de problèmes qu'Opus 5 tout en effectuant environ 40 % d'appels en moins et en utilisant deux fois moins de tokens. »
• Factory — il « égalait Opus 5 en effort élevé, tout en utilisant 20 à 25 % de jetons de sortie en moins. »
• GitHub — il a « utilisé l’un des plus petits nombres de tokens et d’étapes que nous ayons mesurés », et dans VS Code, il a « résolu plus de tâches de terminal qu’Opus 5 en moins de la moitié des étapes ».
• Analyse de fusion, un exemple concret — deux sociétés fictives de logiciels RH, chacune élaborant un modèle Excel et une présentation pour la direction. Anthropic rapporte que Claude Opus 5.5 a terminé en 63 minutes, contre 93 pour Claude Opus 5, et a « coûté 50 % de moins à produire ». Données rapportées par le fournisseur, n=1.
Le contrepoids indépendant est important ici, car il pointe dans l'autre direction.environ 119 000 jetons de sortie par tâche de l'Intelligence Index, contre environ 73 000 pour Claude Opus 5 à effort maximal — le nombre de jetons vaaugmenter, pas diminuer. Son résumé de cette configuration est que Claude Opus 5.5 est « au même niveau qu'Opus 5 en coût par tâche malgré 1,6 fois plus de jetons de sortie », à un coût publié de 5,98 $ par tâche de l'Intelligence Index. Il s'agit d'une mesure indépendante à effort maximal, et ce n'est pas une contradiction de l'affirmation d'Anthropic — c'est l'autre extrémité de l'échelle d'effort.
Ce qui amène la mise en garde qui régit chaque chiffre de cette section. Anthropic indique que, sauf indication contraire, tous ses résultats Claude Opus 5.5 utilisent la réflexion adaptative avec un effort maximal. Claude Opus 5.5 utilise par défaut le niveau d'effort moyen ; Claude Opus 5 utilisait par défaut le niveau d'effort élevé, et le même niveau nommé ne correspond pas au même budget de réflexion entre les deux modèles. Ainsi, un tableau du fournisseur exécuté avec un effort maximal et un tableau indépendant exécuté avec un effort maximal avec le repli par défaut activé ne constituent pas la même configuration, et le paramètre par défaut n'est pas non plus celui qu'un lecteur déploierait réellement. Une moyenne de 40 % mesurée sur un ensemble sélectionné de charges de travail, avec des paramètres que vous n'utiliserez peut-être pas, est une hypothèse de départ — pas une ligne budgétaire.
Le mode rapide est un aperçu de recherche, pas un niveau.
Le mode rapide sur Claude Opus 5.5 est 8,00 $ par million de jetons d'entrée et 40,00 $ par million de jetons de sortie — soit exactement le double du tarif standard — pour un débit pouvant atteindre 2,5 fois plus de jetons de sortie par seconde. Il n'améliore pas le délai avant le premier jeton ; le gain porte sur la vitesse de sortie, et il est surtout visible en streaming.
Disons le reste clairement, car il est facile d'inscrire cela au budget comme un palier alors que ce n'en est pas un. Anthropic qualifie le mode rapide d'aperçu de recherche. L'accès se demande auprès d'un account manager ou via la liste d'attente. Il nécessite l'en-tête bêta fast-mode-2026-02-01 et speed: "fast" dans la requête. Il est disponible uniquement sur l'API Claude — pas sur Amazon Bedrock, Google Cloud, Microsoft Foundry ni Claude Platform sur AWS. Il ne peut pas être combiné avec l'API Batch ni avec un engagement Priority Tier. Il se cumule en revanche avec la mise en cache des prompts et les multiplicateurs de résidence des données, si bien qu'une requête en mode rapide, mise en cache et épinglée aux États-Unis paie 1,1x en plus du 2x. Et le fait de basculer une charge de travail entre la vitesse rapide et la vitesse standard invalide le cache de prompts, ce qui, sur une longue boucle d'agent, peut coûter plus que ce que la vitesse fait économiser.
Claude Opus 5 et Claude Opus 4.8 prennent également en charge le mode rapide, à 10,00 $/50,00 $. Claude Opus 4.7 rejette purement et simplement le paramètre.
L’unité qui détermine la facture est le coût par tâche terminée.
Chacun des tarifs ci-dessus est un prix par token. Personne n'achète des tokens. Un prix par token ne devient un coût que lorsqu'il est multiplié par les tokens qu'une tâche consomme et par le nombre de tentatives nécessaires pour l'achever.
Faites le calcul sur l’exemple peu gourmand en cache mentionné plus tôt. À 0,24 $ par passage, un modèle qui termine une tâche du premier coup coûte 0,24 $. La même tâche chez un concurrent à 0,30 $ le passage coûte 0,30 $ — ainsi, le modèle moins cher semble avoir 20 % d’avance. Supposons maintenant que le modèle moins cher ait besoin de 1,2 passage par tâche terminée, ce qui est un taux de réussite généreux pour du travail agentique : 1,2 × 0,24 $ = 0,288 $, contre 0,30 $ pour l’alternative à passage unique. L’économie a disparu. À trois passages, on est à 0,72 $, et le modèle qui semblait 20 % moins cher par jeton est 140 % plus cher par tâche terminée.
C'est pourquoi les propres affirmations d'efficacité d'Anthropic — moins de tokens, moins d'appels, moins d'étapes — sont formulées dans la bonne unité. C'est aussi pourquoi aucune d'entre elles ne devrait être considérée comme une ligne budgétaire avant que vous ne les ayez reproduites. La vérification est mécanique : prix par passe, multiplié par les passes par tâche terminée, mesuré sur votre propre trafic. Les deux chiffres sont à produire par vous, et aucun fournisseur ne publie le second pour votre charge de travail.
Si vous voulez un point de référence unique venant d’un tiers, Artificial Analysis situe Claude Opus 5.5 à 5,98 $ par tâche de l’Intelligence Index dans sa configuration à effort maximal — un chiffre indépendant pour un réglage que la plupart du trafic de production n’utilisera pas, utile comme plafond plutôt que comme prévision.

Lignes que le tarif principal n’inclut pas
• Résidence.L'inférence réservée aux États-Unis est de 1,1x sur chaque catégorie de tokens, y compris les lectures et écritures de cache. Elle se cumule avec le mode rapide et avec la remise Batch.
• Définitions d'outils. Anthropic publie un surcoût de prompt système d'utilisation d'outils par modèle : déclarer des outils ajoute 286 tokens à chaque requête Claude Opus 5.5. C'est peu à 4,00 $ le million, mais c'est facturé par requête, et une boucle d'agent génère beaucoup de requêtes.
• Invalidation du cache. Un préfixe réécrit après un changement de modèle, d'effort, de définition d'outil ou de vitesse est facturé au tarif d'écriture — 5,00 $ ou 8,00 $ par million sur Claude Opus 5.5 — et non au tarif de lecture de 0,20 $.
• Le modèle en dessous.Claude Sonnet 5 se situe à 2,00 $ en entrée et 10,00 $ en sortie par million, ce que la note de bas de page tarifaire d'Anthropic confirme être désormais le prix standard plutôt que le tarif d'introduction sous lequel il a été annoncé. Claude Opus 5.5 correspond exactement à 2x Sonnet 5 dans les deux sens.

Appeler Claude Opus 5.5 au prix catalogue d'Anthropic
Claude Opus 5.5 est disponible sur OrcaRouter sous anthropic/claude-opus-5.5à 4,00 $ en entrée et 20,00 $ en sortie par million — le prix catalogue d'Anthropic lui-même, répercuté à 0 % de marge. Cette répercussion mérite d'être énoncée avec précision sur une page de tarification : parce que le tarif du fournisseur est transmis plutôt que mis en cache dans un tableau, une modification du tarif du fournisseur est effective ici le jour même de sa publication, et non après une fenêtre de synchronisation. Si Anthropic modifie cette grille, le tarif appliqué à vos appels évolue avec elle.
La même clé donne accès aux niveaux auxquels cette page la compare — anthropic/claude-opus-5 à 5,00 $/25,00 $ et anthropic/claude-fable-5.1 à 10,00 $/50,00 $ — aux côtés du reste de la gamme Claude et de plus de 200 autres modèles, si bien que vérifier si le tarif par jeton moins cher résiste au contact de vos propres nombres de passes ne nécessite ni un second contrat ni une modification du code. Le basculement automatique est là pour le cas où vous voulez exécuter un modèle peu familier sur un chemin de production sans miser ce chemin sur lui.
La réponse en deux lignes à ce dont traite cette page : la grille tarifaire est de 4,00 $ en entrée, 20,00 $ en sortie et 0,20 $ par million de lectures mises en cache, et la réduction de 20 % est réelle et vérifiable dès aujourd'hui. Les 40 % correspondent à la moyenne d'Anthropic sur les charges de travail qu'elle a sélectionnées. Faites tourner l'une de vos propres boucles d'agents dessus avant d'établir votre budget sur le deuxième chiffre.
Comparés dans cet article3
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
