Carte de titre principale pour Claude Opus 5.5 vs Claude Opus 5, avec le titre « Les niveaux d'effort ne signifient pas la même chose », avec des badges indiquant medium vs high par défaut, 4,00 $ vs 5,00 $, et 0,20 $ vs 0,50 $ pour le cache, et le logo OrcaRouter dans le coin inférieur droit.
Engineering & Research

Claude Opus 5.5 vs Claude Opus 5 : les niveaux d'effort ne signifient pas la même chose

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La première chose à savoir avant de comparer Claude Opus 5.5 à Claude Opus 5, c'est que les deux modèles ne partagent pas la même échelle d'effort, et presque toutes les comparaisons directes que vous lirez cette semaine l'ignorent. Opus 5 utilise par défaut l'effort élevé. Opus 5.5 utilise par défaut le niveau moyen, et à niveau nominal identique, il réfléchit davantage par tour que ne le faisait son prédécesseur. Ainsi, « Opus 5.5 aux réglages par défaut face à Opus 5 aux réglages par défaut » n'est pas une expérience contrôlée — c'est une comparaison entre deux quantités de réflexion différentes. Le fournisseur le dit lui-même dans son guide de migration : testez plusieurs niveaux d'effort, et ne réutilisez pas les réglages d'Opus 5, car des niveaux portant le même nom ne correspondent pas au même budget de réflexion. Une fois ce paramètre maîtrisé, l'écart entre les deux modèles se resserre à certains endroits, s'élargit à d'autres, et la décision de mise à niveau repose sur autre chose que la capacité brute — le coût par tâche terminée, et quatre changements d'API qui casseront le code qui tourne aujourd'hui sur Opus 5.

Qu’est-ce qui diffère réellement, spécification par spécification

A two-column scoreboard for Claude Opus 5.5 and Claude Opus 5. Left column: price $4.00 / $20.00, cache read $0.20 per million, default effort medium, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.6% at medium effort, GDPval-AA 1846 Elo. Right column: price $5.00 / $25.00, cache read $0.50 per million, default effort high, Terminal-Bench 4.0 52.3%, FrontierCode v1.1 48.0%, GDPval-AA 1708 Elo. A sourcing footer notes the figures are vendor-reported and the effort settings differ between runs.

Les deux modèles sont plus proches sur le papier que ne le suggèrent les numéros de version :

• Prix — Claude Opus 5.5 à 4,00 $ en entrée / 20,00 $ en sortie par million de tokens, contre Claude Opus 5 à 5,00 $ / 25,00 $

• Lecture du cache — 0,20 $ par million contre 0,50 $ par million, soit une réduction de 60 % sur le poste qui domine les exécutions agentiques

• Écriture de cache — 5 $ par million pour la fenêtre de 5 minutes et 8 $ pour la fenêtre d’une heure sur 5.5, contre 6,25 $ sur Opus 5

• Contexte et sortie — 1 M de tokens de contexte et 128 K de sortie sur les deux ; les deux atteignent 300 K de sortie sur l'API Batch derrière output-300k-2026-03-24l'en-tête bêta

• Effort par défaut — moyen sur Opus 5.5 vs élevé sur Opus 5

• Réflexion — adaptative et toujours active dans les deux, mais sur Opus 5.5, elle ne peut plus du tout être désactivée

• Date limite des connaissances — juin 2026 vs mai 2026

• Latence — Anthropic classe Opus 5.5 comme « modéré » par rapport à la gamme actuelle, et affirme qu'il génère sa sortie plus de 30 % plus rapidement qu'Opus 5

• Retrait — pas avant le 22 septembre 2027 pour Opus 5.5, et pas avant le 24 juillet 2027 pour Opus 5

Notez ce qui n'est pas différent : la fenêtre de contexte, le plafond de sortie, la remise par lot et le modèle de réflexion adaptative toujours actif. Opus 5.5 n'est pas un modèle à contexte plus large ni à sortie plus longue. C'est un modèle moins cher, plus rapide et plus économe en tokens, dans la même enveloppe.

Benchmarks, et l'astérisque de l'effort sur chacun d'entre eux

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

Ces chiffres proviennent des documents de lancement d’Anthropic — rapportés par le fournisseur, exécutés sur ses propres modèles — et le réglage de l’effort compte davantage ici que le nom du modèle :

• Terminal-Bench 4.0 — 66,4 % contre 52,3 %, avec l'exécution d'Opus 5.5 en effort xhigh plutôt que par défaut

• FrontierCode v1.1 (Main) — 54,4 % contre 48,0 %, et 54,6 % pour Opus 5.5 à l'effort moyen par défaut

• CursorBench 4.0 — 57,8 % contre 46,6 %, et 52,5 % en medium

• GDPval-AA v2.1 — 1846 Elo contre 1708

• AutomationBench — 40,0 % contre 26,9 %

• Humanity's Last Exam, avec outils — 67,7 % vs 63,6 %

• Terminal-Bench-Science 0.1 — 58,7 % contre 29,0 %, l’écart le plus large de l’ensemble

• OSWorld 2.0 — 81,8 % partiel contre 74,0 %

• Cartographie, avec outils — 89,0 % vs 83,4 %

Le résultat de FrontierCode est celui à étudier. Opus 5.5 obtient 54,4 % à xhigh et 54,6 % à medium — statistiquement le même chiffre, pour une fraction du budget de réflexion. Quelle que soit l’amélioration apportée par Anthropic, sur ce benchmark, elle ne vient pas d’une réflexion plus poussée. CursorBench va dans l’autre sens : 57,8 % à xhigh contre 52,5 % à medium, un écart de cinq points qui dit que l’effort permet encore de gagner en exactitude réelle sur certaines tâches. La leçon n’est pas « utilisez medium » ou « utilisez xhigh » ; c’est que le bon niveau d’effort est désormais une mesure par charge de travail, et la vieille habitude de laisser Opus 5 sur son réglage high par défaut ne vous apprend plus rien sur le nouveau modèle.

Anthropic ajoute une mise en garde qui mérite d’être répétée : à ce niveau de capacité, les écarts dans les benchmarks sont « un guide moins fiable pour les différences dans le monde réel », et l’entreprise affirme que son écart interne avec Claude Fable 5.1 est plus étroit que ne le laissent entendre les scores publiés. C’est un fournisseur qui vous dit de ne pas surinterpréter son propre tableau.

Le coût par tâche terminée est la comparaison qui tranche.

Le prix par token est la mauvaise unité pour un agent, et c'est dans cette confrontation que cela se voit. L'exemple concret d'Anthropic lui-même : une analyse de fusion qui a pris 63 minutes à Opus 5.5 et a coûté 50 % de moins que la même tâche sur Opus 5, laquelle a pris 93 minutes. La grille tarifaire explique une partie de cet écart — une baisse de 20 % sur l'entrée et la sortie, de 60 % sur les lectures de cache — mais pas la totalité. Le reste tient au fait que le modèle utilise moins de tokens et moins de tours pour arriver au même résultat. Les témoignages de clients publiés avec le lancement vont dans le même sens : Box rapporte un tiers des tokens et des réponses environ 40 % moins verbeuses, Kiro environ la moitié des tokens avec 40 % d'appels en moins, Factory 20 à 25 % de tokens de sortie en moins, GitHub parmi les plus faibles volumes de tokens et d'étapes qu'il ait mesurés.

Ce sont des déclarations de clients publiées par le fournisseur, et non des résultats audités, et l’agrégat « environ 40 % moins cher sur des charges de travail typiques » est la caractérisation par Anthropic d’une moyenne sur les charges de travail qu’elle a sélectionnées. La version honnête pour votre propre planification : partez du principe que la baisse de 20 % affichée est réelle et exploitable, et considérez les 20 % supplémentaires comme une hypothèse que vous pouvez tester en un après-midi en exécutant la même tâche sur les deux modèles et en comptant les tokens.

Une remarque structurelle sur la raison pour laquelle la baisse du cache a un effet disproportionné. Un agent qui renvoie un long prompt système et une arborescence de fichiers à chaque tour paie des tarifs de lecture du cache sur la majeure partie de son entrée, et non des tarifs d’entrée fraîche. Faire passer cela de 0,50 $ à 0,20 $ par million change l’économie des sessions de longue durée bien plus que le tarif affiché — et c’est la raison pour laquelle une charge de travail à peine viable sur Opus 5 peut devenir clairement viable sur Opus 5.5 sans aucune modification de vos prompts.

Les quatre changements majeurs, sous forme de liste de contrôle de migration

Opus 5.5 est un nouveau modèle, et non un Opus 5 renommé, et les notes de migration d'Anthropic recensent quatre changements qui casseront du code déjà en production :

• La réflexion ne peut pas être désactivée. Tout chemin de code qui désactivait la réflexion entraînera une erreur ou modifiera le comportement, et la profondeur n’est désormais contrôlée que via le paramètre effort.

• L'utilisation forcée d'un outil renvoie une erreur. Un tool_choice qui force un outil nommé n'est pas pris en charge.

• Les blocs de réflexion sont liés au modèle qui les a produits et à la conversation, de sorte qu’ils ne peuvent pas être rejoués d’un modèle à l’autre comme certains pipelines le supposent.

• L'outil précédent computer_20251124 d'utilisation de l'ordinateur n'est pas accepté sur l'API Claude ni sur Google Cloud.

Il existe un cinquième changement qui ne fait échouer aucun test et qui est donc plus dangereux. Le texte entre les appels d’outils revient désormais à l’intérieur de blocs de réflexion dont le texte est vide au paramètre d’affichage par défaut. Si votre application diffuse ce texte aux utilisateurs sous forme de mises à jour de progression, elle devient silencieuse entre les appels d’outils jusqu’à ce que vous définissiez une valeur d’affichage qui renvoie le texte. Tous les tests passent ; l’interface cesse simplement de raconter.

Les trois premiers s'appliquent également à Claude Fable 5.1, donc une équipe déjà migrée vers ce modèle a fait une partie de ce travail. Une équipe encore sur Opus 5 ne l'a pas fait.

Quand Opus 5 est encore le bon choix

La mise à niveau n’est pas automatique, et il y a quatre vraies raisons de rester :

• Prévisibilité des coûts. Opus 5 est un modèle que vous avez déjà caractérisé. Si votre budget est modélisé sur sa consommation de tokens, passer à un modèle qui réfléchit d'une quantité différente au même niveau d'effort nommé invalide le modèle jusqu'à ce que vous fassiez de nouvelles mesures.

• Compatibilité. Si une partie de votre stack dépend de la désactivation de la réflexion, du forçage d’un outil ou de l’ancien outil d’utilisation de l’ordinateur, la migration est un travail de code, pas un simple remplacement de chaîne.

• Routage de protection. Opus 5.5 est fourni avec des protections de la classe Fable 5.1, ce qui signifie que la plupart des requêtes en cybersécurité sont redirigées vers Claude Opus 4.8 et que les travaux en biologie reviennent à Claude Opus 5, sauf si votre compte est vérifié. Si votre produit relève de l'un ou l'autre de ces domaines, une « mise à niveau » peut signifier que vos utilisateurs reçoivent des réponses d'un modèle plus petit. Opus 5 ne dispose pas de ce routage.

• Longévité. Opus 5 ne va pas disparaître de sitôt — Anthropic indique que son retrait n’interviendra pas avant le 24 juillet 2027, soit dans dix mois.

Pour tous les autres, le calcul est simple : plus de capacités, un prix plus bas, moins de tokens, et une liste de contrôle de migration qu’un seul ingénieur peut parcourir en une journée.

Exécuter les deux pendant le basculement

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'by Anthropic - 2026-07-24', and the model description.

La partie délicate de toute migration de modèle phare, c'est le milieu : vous voulez Opus 5.5 sur le nouveau trafic sans parier la voie de production sur un modèle que vous n'avez pas caractérisé avec vos propres réglages d'effort, et vous voulez continuer à servir Opus 5 pendant que vous tirez les choses au clair. C'est un problème de routage plutôt qu'une re-plateformisation, et il vaut la peine d'être précis sur ce qui se trouve où. Claude Opus 5 est disponible sur OrcaRouter aujourd'hui au prix catalogue d'Anthropic lui-même, avec 0 % de marge — le prix catalogue du fournisseur est répercuté tel quel, si bien qu'un changement de tarif d'un fournisseur est actif de notre côté le jour même plutôt qu'après une synchronisation. Claude Opus 5.5 ne fait pas encore partie de nos routes ; il est disponible via l'API d'Anthropic elle-même et les principaux clouds. Quand il arrivera, il deviendra une route de plus sur la même clé au lieu de un second contrat et d'un second SDK, ce qui vous permet de placer un pourcentage du trafic sur le nouveau modèle pendant que le basculement automatique maintient le reste sur celui que vous avez déjà caractérisé. Composer un appel sur les deux — une ébauche avec l'un et une passe de vérification avec l'autre — tient en une ligne de DSL de routage.

Soyez précis sur ce que cela vous apporte. Cela ne vous fournit pas un benchmark indépendant d’Opus 5.5 ; rien ne le fait encore, car les seuls comparatifs directs publiés sont ceux d’Anthropic, et les organismes de suivi indépendants n’ont pas encore arrêté de configurations d’effort. Ce que cela vous apporte, c’est la seule mesure qui soit réellement prédictive de votre facture, sur vos prompts, au niveau d’effort que vous déploierez.

La règle de décision

Si vous démarrez quelque chose de nouveau, utilisez Claude Opus 5.5 et commencez au niveau d'effort moyen, puis mesurez si le niveau faible tient la route pour votre tâche — Anthropic rapporte que le niveau faible approche ses réglages supérieurs sur plusieurs évaluations de codage, à un coût bien moindre, et les chiffres FrontierCode ci-dessus suggèrent que la valeur par défaut ne laisse pas grand-chose sur la table.

Si vous utilisez Claude Opus 5 en production, le déclencheur pour migrer n’est pas le tableau de benchmarks. C’est de savoir si vous pouvez absorber quatre changements d’API et si votre charge de travail relève de la cybersécurité ou de la biologie, où le routage des garde-fous confiera discrètement une partie de votre trafic à un modèle plus petit. Tout le reste de cette mise à niveau est une baisse de prix déguisée en sortie de modèle, et celles-ci valent la peine d’être acceptées.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement