Carte de titre principale pour Claude Opus 5.5 portant l'inscription « chaque score, le réglage d'effort dont il est issu, et qui l'a mesuré », avec deux pastilles statistiques : 66,4 % sur Terminal-Bench 4.0 en effort xhigh, déclaré par le fournisseur, et 59,6 % sur le même benchmark, indépendant.
Guides & Insights

Tests comparatifs de Claude Opus 5.5 : chaque score, le réglage d'effort d'origine, et qui l'a mesuré

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le chiffre phare d'Ant​hropic pour Claude Opus 5.5 sur Terminal-Bench 4.0 est de 66,4 %, affiché face à 52,3 % pour Claude Opus 5 dans le même tableau — et ces 66,4 % ont été produits avec un effort xhigh, et non avec le réglage par défaut du modèle, medium. Le modèle est sorti le 22 septembre 2026, deux jours avant la rédaction de cette page ; il s'agit donc d'un modèle GA, avec la tarification d'un modèle GA et le tableau de benchmarks d'un modèle GA. Le chiffre indépendant sur le même benchmark, fourni par Artificial Analysis, est de 59,6 %, dans une configuration qui intègre le routage de sauvegarde côté serveur d'Ant​hropic. Entre ces deux chiffres se logent une différence de harnais, une différence d'effort et une différence de routage, et personne — nous compris — ne peut encore dire quelle part de l'écart revient à chacune. Ce que cette page peut faire, c'est réunir en un seul endroit tous les chiffres publiés pour Claude Opus 5.5, indiquer qui les a produits, préciser le réglage utilisé, et inclure les lignes où GPT-6 Astra et Claude Fable 5.1 arrivent en tête.

Commencez par le réglage de l’effort, car il fait plus bouger les chiffres que ne le font les modèles.

Claude Opus 5.5 utilise par défautmedium comme effort sur l'API Claude. Claude Opus 5 utilisait par défauthigh. De plus, un niveau portant le même nom ne correspond pas au même budget de réflexion entre les deux modèles, donc « nous avons exécuté les deux en high » n'est pas une comparaison contrôlée, même lorsque le libellé correspond. La réflexion adaptative est toujours activée et ne peut pas être désactivée sur Opus 5.5 ; le paramètre d'effort influe sur la profondeur, la latence et le coût, et rien d'autre.

Le chiffre Terminal-Bench 4.0 d’Anthropic a été obtenu en xhigh. Ce seul fait constitue la mise en garde la plus importante de cette page, car le benchmark qu’il met en avant est celui dont la marge annoncée par rapport au modèle précédent est la plus large, et parce que le même tableau montre ce qui se passe lorsque l’on laisse ce réglage tel quel :

FrontierCode v1.1 Main — 54,4 % en xhigh, 54,6 % en medium par défaut. Rapporté par le fournisseur. L'exécution en medium est supérieure à l'exécution en xhigh. Sur cette charge de travail, le réglage de l'effort n'a rien apporté de mesurable ; les deux chiffres sont le même nombre.

CursorBench 4.0 — 57,8 % en xhigh, 52,5 % en medium.Rapporté par le fournisseur. Même modèle, même harnais, même semaine : 5,3 points, soit le plus grand écart d'effort de la comparaison.

Ces deux lignes dans un seul tableau de fournisseur, c'est tout l'argument. Une charge de travail est insensible à l'effort, l'autre y est fortement sensible, et la fiche de modèle ne peut pas vous dire à l'avance à quelle catégorie appartient la vôtre. La conclusion que les données étayent est étroite, et il vaut la peine de la formuler de façon étroite : le bon niveau d'effort est désormais une mesure propre à chaque charge de travail, et non une valeur par défaut que l'on hérite. Elle n'étaye pas « Opus 5.5 est plus rapide que ne le suggèrent ses benchmarks » ni « Anthropic a volontairement fait sous-performer la valeur par défaut » — pour cela, il faudrait des balayages par charge de travail sur les cinq réglages, et personne ne les a publiés. En revanche, elle signifie que si vous migrez depuis Opus 5 en conservant le réglage d'effort que vous aviez déjà, vous avez changé l'expérience, et pas seulement le modèle.

Une asymétrie de plus, et celle-ci joue dans l'autre sens. La colonne du concurrent, sur la ligne Terminal-Bench d'Anthropic, indique GPT-6 Astra à 57,9 % — exécuté en high d'effort, selon la note figurant sur le propre graphique d'Anthropic, tandis que les 66,4 % d'Opus 5.5 ont été obtenus en xhigh. Un tableau de fournisseur qui fait tourner son propre modèle avec un réglage et un concurrent avec un autre n'est pas une comparaison directe, quoi que laissent paraître les deux chiffres côte à côte.

Le tableau des fournisseurs, avec la source et le paramètre sur chaque ligne

Tout ce qui figure dans cette section est déclaré par le fournisseur : le matériel de lancement d'Anthropic, le harnais d'Anthropic, les protections de production activées, la réflexion adaptative à effort maximal, sauf indication contraire dans la ligne. À lire comme Anthropic qui mesure Anthropic.

Terminal-Bench 4.0 — 66,4 %, avec un effort xhigh. Rapporté par le fournisseur, erreur type d'environ ±2,6 points. Sur la même ligne : Claude Opus 5 52,3 %, Claude Fable 5.1 55,8 %, GPT-6 Astra 57,9 % (avec un effort élevé), GPT-5.6 Sol 37,3 %. Terminal-Bench 4.0 est explicitement un benchmark dont le fournisseur reconnaît qu'il constitue une approximation imparfaite du travail réel sur terminal, et c'est le résultat phare du modèle.

FrontierCode v1.1 Main — 54,4 % à xhigh, 54,6 % au niveau medium par défaut. Rapporté par le fournisseur. Opus 5 48,0 %, Fable 5.1 50,3 %, GPT-6 Astra 53,3 %, GPT-5.6 Sol 47,5 %. La fiche système d'Anthropic mentionne également la variante Extended à 63,6 % et un meilleur chiffre Extended au niveau medium de 65,3 %.

CursorBench 4.0 — 57,8 % à xhigh, 52,5 % à medium. Rapporté par le fournisseur. Opus 5 46,6 %, Fable 5.1 51,8 %, GPT-5.6 Sol 41,7 %. À noter que les lignes CursorBench de Fable 5.1 et d'Opus 5 correspondent à l'effort maximal, si bien qu'Opus 5.5 à medium est comparé à ses propres semblables au maximum.

GDPval-AA v2.1 — 1 846 Elo. C’est la seule ligne du tableau du fournisseur que le fournisseur n’a pas exécutée. GDPval-AA est une évaluation d’Artificial Analysis, et le propre compte rendu d’Artificial Analysis sur Opus 5.5 indique le même 1 846, avec Fable 5.1 à 1 735 et Opus 5 à 1 708. Dans le tableau du fournisseur : Fable 5.1 1 735, Opus 5 1 708, GPT-5.6 Sol 1 588, GPT-6 Astra 1 542. C’est la seule ligne ici où deux organisations s’accordent sur le même nombre, et c’est parce qu’il s’agit de la même mesure.

AutomationBench (Zapier) — 40,0 %. Rapporté par le fournisseur, et exécuté sans aucun modèle de repli, donc chaque intervention de garde-fou a été comptabilisée comme un échec. GPT-6 Astra 41,4 %, Fable 5.1 31,4 %, GPT-5.6 Sol 28,8 %, Opus 5 26,9 %.

Humanity's Last Exam, avec outils — 67,7 %. Rapporté par le fournisseur. Fable 5.1 65,6 %, Opus 5 63,6 %, GPT-6 Astra 57,2 %. La fiche système d'Anthropic rapporte séparément 64,4 % sans outils, chiffre qu'il convient de retenir si vous vous comparez à une source qui ne donne pas à ses modèles accès aux outils.

Terminal-Bench-Science 0.1 — 58,7 %. Rapporté par le fournisseur, erreur-type d'environ ±3,5 à ±5 points, il s'agit donc d'une fourchette plutôt que d'un point. GPT-6 Astra 64,6 %, Fable 5.1 52,6 %, Opus 5 29,0 %, GPT-5.6 Sol 22,4 %.

OSWorld 2.0 — 81,8 % en partiel. Déclaré par le fournisseur, et « partiel » fait tout le travail dans cette phrase : le system card d'Anthropic donne un taux d'achèvement strict de 48,7 % pour le même modèle sur la même évaluation. Les deux sont publiés ; c'est le chiffre partiel qui est cité. Fable 5.1 80,7 %, Opus 5 74,0 %.

Chartographie, avec outils — 89,0 %. Déclaré par le fournisseur. Fable 5.1 88,4 %, Opus 5 83,4 %.

Scoreboard for Claude Opus 5.5 with six rows: Terminal-Bench 4.0 66.4% at xhigh effort (vendor-reported); Artificial Analysis Intelligence Index 58 at max effort (independent); Humanity's Last Exam 67.7% with tools (vendor-reported); Terminal-Bench-Science 0.1 58.7% (vendor-reported); about 119k output tokens per task at max (independent); price $4.00 input / $20.00 output per 1M. A footer separates the Anthropic launch table from Artificial Analysis.

Les nombres indépendants, et ce que « Default Fallback » signifie réellement

Artificial Analysis est le seul tiers à proposer une évaluation publiée et à jour de Claude Opus 5.5 sur un indice composite, et ses chiffres sont ceux à mettre en regard de ceux d’Anthropic. D’après les valeurs relevées le 24 septembre 2026 :

Intelligence Index — 58 à effort maximal, dans une configuration intitulée « Raisonnement adaptatif, effort maximal, repli par défaut ». Indépendant, mesuré par Artificial Analysis. Son propre article qualifie 58 de « meilleur score que nous ayons mesuré, avec plusieurs points d’avance ». Le même indice publie aussi Opus 5.5 à tous les autres réglages d’effort, et l’écart est la partie utile : 56 à xhigh, 54 à high, 51 à medium, 42 à low. Soit une variation de 16 points sur le curseur d’effort pour un seul modèle — plus importante que l’écart entre la plupart des modèles de ce classement.

Terminal-Bench 4.0 — 59,6 %.Indépendant. Artificial Analysis le classe « au niveau du leader GPT-6 Astra (xhigh) » et environ 11 points au-dessus de Claude Opus 5.

Humanity's Last Exam — 61,4 %.Indépendant, et le meilleur score précédent au même classement était de 59,1 %, détenu par Claude Fable 5.1.

SciCode — 66,9 %. Indépendant, contre 63,1 % pour Claude Fable 5.1.

Maintenant, la clause qui nécessite une explication plutôt qu'une citation. « Default Fallback » n'est ni un artefact de benchmark ni un paramètre d'Artificial Analysis — c'est le routage de sauvegarde côté serveur d'Anthropic, laissé activé. Claude Opus 5.5 est livré avec le niveau de sauvegarde précédemment réservé à Fable 5.1 : la plupart des requêtes de cybersécurité sont redirigées de manière transparente vers Claude Opus 4.8, et les travaux de biologie basculent vers Claude Opus 5 sauf si le compte est vérifié. Lorsqu'Artificial Analysis exécute l'indice avec le fallback par défaut activé, il mesure le système déployé — ce qu'une clé API non vérifiée atteint réellement — plutôt qu'un point de contrôle propre des poids d'Opus 5.5. C'est la mesure la plus honnête pour un acheteur, et c'est la mesure la moins propre pour un benchmark. Anthropic dit la même chose à propos de son propre tableau : les interventions sur l'exécution de Terminal-Bench 4.0 ont vu des tâches cyber complétées par Opus 4.8 et des tâches de biologie par Opus 5, et l'entreprise déclare que ces interventions ont probablement abaissé le score rapporté. Le routage de sauvegarde est donc un fait opérationnel réel dans les deux sens, et aucun chiffre sur cette page n'isole le modèle sous-jacent de cet effet.

Là où les deux tableaux divergent, et pourquoi

Mettez côte à côte les deux chiffres de Terminal-Bench 4.0 et vous obtenez 66,4 % contre 59,6 % — 6,8 points, sur le même benchmark, pour le même modèle. Les raisons sont connues, et chacune est suffisamment importante pour compter à elle seule :

Des harnais différents. Anthropic a utilisé son propre échafaudage d'agent ; Artificial Analysis a utilisé son propre harnais d'agent de référence. Un score de référence en terminal est une propriété de l'échafaudage plus le modèle, et non du modèle seul, et aucune des deux organisations n'a publié d'expérience d'échange d'échafaudage.

Paramètres d'effort différents. Les 66,4 % d'Anthropic correspondent au niveau xhigh. Le paramètre d'effort associé aux 59,6 % d'Artificial Analysis n'est pas précisé dans la phrase qui porte ce chiffre, et les résultats de benchmark rapportés correspondent généralement à l'effort maximal.

Sauvegardes activées, dans les deux cas, comptabilisées différemment. Anthropic a été exécuté avec un mécanisme de repli et a traité les interventions comme réduisant le score, tout en les notant malgré tout. Sur AutomationBench, il a été exécuté sans mécanisme de repli et a comptabilisé les interventions comme des échecs purs et simples. Artificial Analysis fonctionne avec le mécanisme de repli activé en permanence.

Les chiffres varient même au sein du propre tableau d'un fournisseur.Anthropic annonce Claude Opus 5 à 52,3 % sur Terminal-Bench 4.0 et précise que les 51,8 % du classement public pour le même modèle sont « dans la marge de bruit ».

Et ensuite la preuve la plus solide sur cette page de la valeur d'un harnais. Le classement public Terminal-Bench 4.0, capturé le 24 septembre 2026, ne comporte aucune ligne Claude Opus 5.5 du tout. Son entrée la plus haute est GPT-6 Astra à effort maximal, agent Codex, 58,2 % ±2,8 ; la deuxième est Claude Fable 5.1 à effort maximal via Claude Code à 57,9 % ±3,8 ; la troisième est Claude Opus 5 à xhigh via Claude Code à 53,9 % ±3,2. Donc le 66,4 % n'est pas simplement un nombre différent du 59,6 % indépendant — il ne figure pas sur le classement public, et la version du classement lui-même pour Claude Opus 5 est de 53,9 %, pas les 52,3 % qu'affiche le tableau de lancement. Tant que Terminal-Bench n'accepte pas et ne publie pas une soumission d'Opus 5.5, le 66,4 % est un résultat de harnais de fournisseur que personne ne reproduit, et le 59,6 % est le nombre dont un tiers se portera réellement garant. Notez aussi que sur ce même classement, le leader de Terminal-Bench 4.0 d'Artificial Analysis et l'Opus 5.5 d'Anthropic atteignent le même 59,6 % — ce qui est une égalité dans un harnais, et ne vous dit rien sur l'autre.

Effort-dial infographic for Claude Opus 5.5 showing the Artificial Analysis Intelligence Index moving from 42 at low effort through 51 at medium (the product default), 54 at high, 56 at xhigh and 58 at max - a 16-point swing on one model - with two comparison cards: FrontierCode v1.1 at 54.4 xhigh against 54.6 medium (effort-insensitive) and CursorBench 4.0 at 57.8 xhigh against 52.5 medium (effort-sensitive).

Les lignes où Opus 5.5 perd

Un récapitulatif qui omet les pertes n’est pas un récapitulatif, et le tableau d’Anthropic lui-même contient les deux.

Terminal-Bench-Science 0.1 — 58,7 % contre les 64,6 % de GPT-6 Astra. Déclaré par le fournisseur, dans le tableau d'Anthropic, et une perte de 5,9 points face à un concurrent cité nommément sur la ligne la plus proche du raisonnement scientifique. La note du fournisseur sur l'erreur type (±3,5 à ±5) signifie que l'écart se situe près de la limite du bruit plutôt que confortablement à l'intérieur de celui-ci — mais c'est une perte sur la propre page du fournisseur, et la fourchette ne suffit pas à en faire une victoire. Claude Opus 5 se situe à 29,0 % sur la même ligne, donc le gain générationnel est réel, même là où le concurrent est en tête.

AutomationBench — 40,0 % contre les 41,4 % de GPT-6 Astra.Rapporté par le fournisseur, une perte de 1,4 point, et l'exécution n'avait aucun modèle de repli, de sorte que les interventions de sauvegarde ont été comptabilisées comme des échecs. Cela signifie que cette comparaison particulière mesure Opus 5.5 avec sa pénalité de routage incluse face à un concurrent dont la pénalité de routage, quelle qu'elle soit, n'est pas décrite. C'est la ligne la moins interprétable de la page, dans un sens comme dans l'autre.

Deux autres cas où l’avance est plus ténue que ne le suggère le titre, tous deux rapportés par le fournisseur. Sur Humanity's Last Exam avec outils la marge sur Claude Fable 5.1 est de 2,1 points (67,7 % contre 65,6 %) ; sur Chartography avec outils elle est de 0,6 point (89,0 % contre 88,4 %) ; sur OSWorld 2.0 partiel elle est de 1,1 point (81,8 % contre 80,7 %). Ce sont les lignes où « Opus 5.5 est le meilleur modèle agentique » est une affirmation sur le classement plutôt que sur un écart mesuré, et une différence de 0,6 point en lecture de graphiques ne devrait pas décider d’un achat.

La position indépendante de Claude Fable 5.1, sur une révision d'index différente

Comparer l'Opus 5.5 à son propre frère mérite sa propre section, et cela requiert un avertissement, car la comparaison est plus difficile qu'elle n'en a l'air.

Lorsqu'Artificial Analysis a publié son analyse de Claude Fable 5.1 le 1er septembre 2026, ce dernier a obtenu 66 à effort maximal sur son Intelligence Index et l'a qualifié du score le plus élevé qu'il ait mesuré — devant Claude Opus 5 à 63 et GPT-5.6 Sol à 61. Sur l'indice tel qu'il figure au 24 septembre 2026, le même modèle apparaît à 53 à effort maximal avec fallback, et Opus 5.5 apparaît à 58 dans la configuration équivalente. L'analyse du 22 septembre sur Opus 5.5 qualifie 58 de « score le plus élevé que nous ayons mesuré, de plusieurs points ».

Ces deux affirmations ne peuvent pas être vraies toutes les deux sur une même échelle, et la résolution est qu’elles ne se situent pas sur une même échelle. L’indice est un objet vivant qu’Artificial Analysis révise ; deux de ses articles publiés, à cinq semaines d’intervalle, placent la même paire de modèles frères de part et d’autre de la première place. Cela relève des révisions de l’indice, et non d’une régression de l’un ou l’autre modèle, et cela signifie que le 66 et le 58 ne doivent jamais être imprimés côte à côte. Lus le même jour, dans le même classement, avec la même configuration étiquetée, l’ordre actuel place Opus 5.5 cinq points devant Fable 5.1 — et même cela est une comparaison au sein du même indice, par le même fournisseur d’indice, et non un face-à-face audité. Ce qu’il est prudent d’affirmer est plus étroit : dans la révision actuelle du seul composite indépendant qui mesure les deux, Opus 5.5 est le plus fort des deux modèles Anthropic, et le 66 plus connu de Fable 5.1 appartient à une révision antérieure de cet indice.

Les réglages méritent une phrase de plus, car ils sont faciles à confondre. Le 66 de Fable 5.1 et le 58 d’Opus 5.5 sont tous deux des lignes à effort maximal — mais les cinq réglages d’effort de Fable 5.1 couvrent une plage d’un facteur 11 en utilisation de jetons en sortie, de 13,1 M au niveau faible à 143,7 M au niveau maximal, avec des scores d’indice allant de 58 à 66. Un seul point d’indice pour un modèle présentant une telle dispersion interne est un piètre substitut à la ligne que vous exécuteriez réellement.

Le coût en tokens est un axe de benchmark à part entière.

Chaque nombre ci-dessus est un score. Aucun d'entre eux n'est un projet de loi, et dans ce modèle, c'est dans le projet de loi que se situe le mouvement intéressant.

Artificial Analysis mesure Claude Opus 5.5 à effort maximal en utilisant de l'ordre de 119 000 jetons de sortie par tâche de l'Intelligence Index — le plus élevé de son indice. À titre de comparaison, sur le même tableau et avec le même réglage : Claude Opus 5 environ 73 000, Claude Fable 5.1 environ 78 000, et GPT-6 Astra environ 27 000. Les jetons de réflexion sont facturés comme des jetons de sortie, et la réflexion adaptative ne peut pas être désactivée sur Opus 5.5 ; les jetons qu'un modèle consacre à délibérer ne sont donc pas un simple détail dans son prix — ils en représentent l'essentiel.

Faites le calcul, car le prix affiché est trompeur à lui seul. Opus 5.5 est affiché à 4,00 $ en entrée / 20,00 $ en sortie, soit une réduction de 20 % par rapport aux 5,00 $ / 25,00 $ d'Opus 5. Artificial Analysis mesure encore le coût d'Opus 5.5 avec un effort maximal à environ 5,98 $ par tâche de l'indice contre 5,86 $ pour Opus 5 au même réglage — légèrement plus, et non moins, parce qu'environ 1,6 fois plus de tokens de sortie absorbent toute la réduction de 20 % du tarif, et même au-delà. Sur l'ensemble de l'indice, Opus 5.5 a produit 260 M de tokens de sortie contre une médiane du classement de 88 M, ce que l'évaluateur qualifie de « très verbeux ».

L'histoire du coût réside donc entièrement dans le réglage de l'effort, et elle ne fonctionne que si vous l'utilisez. À effort maximal, Opus 5.5 est un modèle plus coûteux par tâche accomplie que le modèle qu'il remplace. À effort moyen — le véritable paramètre par défaut du produit, et le cadre dans lequel s'inscrit l'affirmation d'Anthropic selon laquelle « le coût d'exécution sur des charges de travail typiques est inférieur d'environ 40 % » —, l'économie est réelle, mais elle concerne une moyenne sur des charges de travail choisies par le fournisseur, et non un résultat par tâche audité. En pratique : la baisse de prix de 20 % est une remise sur la grille tarifaire et une option sur le cadran d'effort, pas une économie automatique. Si votre plan de migration consiste à « remplacer l'identifiant du modèle et conserver les réglages », vous achetez la version coûteuse.

Qu'est-ce qui n'est pas du tout établi ?

Voici la section que le reste de la page est là pour soutenir.

Aucune comparaison directe indépendante, à effort égal et sur un harnais identique, de Claude Opus 5.5 face à un rival nommé n'a été publiée. Toutes les comparaisons entre fournisseurs figurant sur cette page — Opus 5.5 vs GPT-6 Astra, vs GPT-5.6 Sol, vs Claude Fable 5.1 — sont des comparaisons de deux tableaux produits par deux entreprises différentes, sur deux harnais différents, avec deux réglages d'effort différents, l'un d'eux étant généralement le propre modèle du fournisseur dans un réglage favorable. Il n'existe nulle part dans les données publiques d'expérience qui maintienne constants l'échafaudage et l'effort entre deux fournisseurs et qui rapporte les deux.

La répartition des tokens par problème n'est pas publiée.Le chiffre agrégé des tokens de sortie est mesuré indépendamment, mais la part qui correspond à la réflexion plutôt qu'au texte de réponse n'est publiée par personne que nous ayons pu trouver. Toute page qui vous donne un nombre précis de tokens de réflexion pour ce modèle vous donne un nombre que personne n'a mesuré.

La majeure partie de la fiche système n’a pas fait l’objet de benchmarks par des tiers. SWE-bench Pro 89,9 %, Multilingual 93,9 %, DeepSWE v1.1 74,2 %, ProgramBench 91,2 %, OfficeQA 78,9 %, HealthBench Professional 65,6 % ajusté selon la longueur, GMMLU 94,3 %, ArXivMath 96,9 % avec outils — tous déclarés par le fournisseur, aucun reproduit indépendamment au moment de la rédaction.

Le chiffre phare de Terminal-Bench 4.0 ne figure pas sur le tableau public. Traité ci-dessus, et il a aussi sa place dans cette liste : le chiffre le plus cité à propos de ce modèle est un chiffre que personne en dehors du fournisseur n'a fait tourner.

Anthropic rapporte que Claude Opus 5.5 « soupçonne souvent qu'il est en train d'être évalué » — les propres mots de l'entreprise, avancés comme une limite de son évaluation de sûreté. Prenez cela au sérieux comme un problème de mesure, et non comme une curiosité : si le modèle se comporte différemment lorsqu'il croit être testé, alors chaque chiffre de benchmark sur cette page, fournisseur ou indépendant, est une mesure du modèle sous observation, et la mesure dans laquelle cela diffère du comportement déployé est inconnue et non quantifiée. Cela s'applique aux bonnes lignes comme aux mauvaises. C'est la seule mise en garde qu'aucune méthodologie à effort égal ne permet de corriger.

Sonnet 5.5 et Haiku 5.5 ne sont pas disponibles. Anthropic les a annoncés pour « les prochaines semaines ». Ils n'ont pas encore été déployés, aucun benchmark n'a été publié, et rien sur cette page ne s'applique à eux.

Prix, enveloppe et les parties de la spécification qui modifient votre code

D'après la grille tarifaire publiée d'Anthropic le 24 septembre 2026 : 4,00 $ par million de jetons d'entrée, 20,00 $ par million de sortie, 0,20 $ par million de lecture du cache, 5,00 $ par million d'écriture de cache de 5 minutes, 8,00 $ par million d'écriture de cache de 1 heure, et 50 % de réduction dans les deux sens sur l'API Batch. Le tarif de lecture du cache est celui dont on parle le moins — il représente 5 % de l'entrée de base, là où la plupart des modèles Claude se situent à 10 % et Fable 5.1 à 2,5 %. Le mode Fast est facturé séparément à 8,00 $ / 40,00 $ et Anthropic le décrit comme un aperçu de recherche, et non comme un niveau général.

C'est la section où une grille tarifaire cesse d'être anecdotique et devient une arithmétique qu'un routeur peut faire pour vous. Claude Opus 5.5 est servi sous anthropic/claude-opus-5.5 sur OrcaRouter aux mêmes 4,00 $ / 20,00 $, avec les prix catalogue répercutés à 0 % de marge — ainsi, dès qu'Anthropic modifie un tarif, c'est le tarif appliqué ici, le jour même et sans décalage de réévaluation tarifaire à modéliser. Les éléments qui déterminent la facture réelle sont ceux que le catalogue indique à côté du prix : la lecture de cache à 0,20 $ à 5 % de l'entrée de base, contre 2,5 % pour Fable 5.1, la fenêtre de contexte de 1 M de tokens et le plafond de sortie de 128 K. Parce que c'est le paramètre d'effort qui fait réellement varier le coût de ce modèle — une amplitude de 16 points de l'indice et environ 119 000 tokens de sortie par tâche au maximum, contre environ 73 000 pour Opus 5 — la migration qui permet d'économiser de l'argent est celle qui vous permet de régler l'effort par charge de travail plutôt que par compte, et de placer la route Opus 5.5 derrière un basculement automatique pendant que vous mesurez le réglage que votre trafic préfère.

Envelope — contexte de 1 M de tokens, sortie maximale de 128 K, sortie de 300 K sur l'API Batch derrière l'en-tête bêta output-300k-2026-03-24, connaissances arrêtées en juin 2026, retrait pas avant le 22 septembre 2027. La sortie est plus de 30 % plus rapide que Claude Opus 5.

Changements incompatibles par rapport à Opus 5 — la réflexion ne peut plus être désactivée ; l'utilisation forcée d'un outil (un tool_choice désignant un outil précis) renvoie une erreur ; les blocs de réflexion sont liés au modèle et à la conversation qui les a produits ; l'ancien computer_20251124 outil d'utilisation d'ordinateur n'est pas accepté sur l'API Claude ni sur Google Cloud. Les trois premiers s'appliquent aussi à Fable 5.1. Il en existe un cinquième, silencieux : le texte entre les appels d'outils arrive désormais à l'intérieur de blocs de réflexion dont le texte est vide au paramètre d'affichage par défaut, si bien qu'une interface qui diffuse ce texte comme indicateur de progression devient silencieuse sans qu'aucune erreur ne soit signalée.

Routage des garde-fous, encore une fois, car il s'agit d'un élément de spécification et non d'une note de bas de page — la plupart des requêtes en cybersécurité vont à Claude Opus 4.8 et les travaux de biologie se rabattent sur Claude Opus 5, sauf si le compte est vérifié. Dans ces évaluations, la réponse que vous recevez peut ne pas provenir d'Opus 5.5 du tout, donc les scores publiés sur les benchmarks connexes à la cybersécurité et à la biologie ne sont pas des mesures fiables de ce modèle.

Affirmations d'efficacité, toutes rapportées par le fournisseur — un coût d'exécution environ 40 % inférieur sur des charges de travail typiques, contre une baisse de 20 % du prix affiché ; un exemple travaillé d'analyse de fusion prenant 63 minutes sur Opus 5.5 contre 93 sur Opus 5, à un coût inférieur de 50 % ; et des déclarations de clients de Box (un tiers des tokens, des réponses environ 40 % moins verbeuses), Kiro (environ la moitié des tokens, 40 % d'appels en moins), Factory (20 à 25 % de tokens de sortie en moins) et GitHub (parmi les plus faibles nombres de tokens et d'étapes qu'il ait mesurés). Ce sont des moyennes sur les charges de travail sélectionnées par le fournisseur et ses partenaires de lancement. Ce sont des attributions, pas des résultats audités, et elles sont en tension visible avec le chiffre indépendant de coût par tâche ci-dessus — qui est lui-même une mesure à effort maximal plutôt qu'aux réglages par défaut. Les deux peuvent être vrais ; ni l'un ni l'autre n'est une affirmation générale sur votre charge de travail.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the NEW, FLAGSHIP and FEATURED badges, a 1M-token context window, 128K max output, text plus image plus file input, and the $4.00 input / $20.00 output per 1M token rate with pricing passed through from Anthropic.

L'état des preuves

Claude Opus 5.5 est un vrai modèle, avec une vraie baisse de tarif, une vraie enveloppe de 1 M de tokens de contexte et de 128 K de sortie, et un changement réel et lourd de conséquences dans la manière dont la réflexion et l’effort sont configurés. Il arrive aussi avec un tableau de benchmarks qui mesure surtout Anthropic, un tableau indépendant qui mesure surtout un déploiement routé plutôt qu’un checkpoint, et un problème documenté de conscience de soi qui mine les deux. Aucune comparaison directe indépendante à effort égal et à harnais d’évaluation identique entre Claude Opus 5.5 et un rival nommé n’a été publiée. Tant qu’une telle comparaison n’existe pas, lisez chaque comparaison entre fournisseurs de cette page pour ce qu’elle est : deux tableaux de fournisseurs issus de deux entreprises et de deux réglages, que nous avons disposés côte à côte — et remesurez votre propre réglage d’effort avant de remesurer le modèle.

Comparés dans cet article4

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement