Carte de titre pour le guide de l'API Claude Opus 5.5, affichant « Model ID, four breaking changes, and the silent fifth », avec une bande de spécifications indiquant l'identifiant du modèle claude-opus-5-5, une fenêtre de contexte de 1M, une sortie de 128K et 4 $ / 20 $ par million de tokens.
Engineering & Research

Guide de l’API Claude Opus 5.5 : l’ID du modèle, quatre changements incompatibles et le cinquième silencieux

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Remplacez la chaîne de modèle claude-opus-5 par claude-opus-5-5 et votre code compile toujours, passe toujours la vérification de types et réussit toujours ce qui tient lieu de suite de tests. Puis il renvoie une erreur 400 en production. Quatre formes de requête que Claude Opus 5 acceptait sont purement et simplement rejetées par Claude Opus 5.5, et une cinquième modification ne casse rien du tout — c'est précisément pour cela que c'est elle qui atteindra vos utilisateurs. Voici la référence d'intégration pour ce modèle : l'identifiant, les surfaces qui le servent, le contrat de requête, les quatre erreurs, la cinquième silencieuse, et le fonctionnement désormais du paramètre effort. Là où le comportement correspond à Claude Fable 5.1, une équipe qui a déjà migré vers celui-ci a fait une partie du travail, donc chaque modification ci-dessous indique si elle s'applique aussi à ce modèle.

Tout ce qui figure ici est tiré de la propre documentation Claude d’Anthropic, datée du 2026-09-24, deux jours après la sortie du modèle. Les affirmations du fournisseur sont étiquetées comme affirmations du fournisseur, les chiffres indépendants comme indépendants, et les deux ne sont jamais présentés au même réglage d’effort comme s’ils étaient comparables.

L'identifiant du modèle, et où il est servi

L'identifiant est claude-opus-5-5 — un identifiant de modèle fixe sans suffixe de date, le même schéma que claude-opus-5. Il n'existe aucune forme d'instantané épinglé distincte à adopter, ni d'alias qui renvoie vers autre chose.

L'aperçu des modèles d'Anthropic répertorie cinq surfaces, avec ces chaînes exactes :

• API Claude — claude-opus-5-5, disponible pour tous les clients.

• Amazon Bedrock — anthropic.claude-opus-5-5 (la seule interface qui fait précéder le nom du fournisseur).

• Claude Platform sur AWS — claude-opus-5-5, en utilisant les identifiants de l'API Claude plutôt que les identifiants de type Bedrock.

Google Cloud — claude-opus-5-5.

• Microsoft Foundry — claude-opus-5-5 ; le nom du déploiement est ce que vous envoyez, et Foundry suit le calendrier du cycle de vie de l'API Claude.

Deux de ces cinq éléments comptent plus que le reste de cette section. Amazon Bedrock et Google Cloud fixent leurs propres dates de cycle de vie et de retrait et — comme les changements majeurs ci-dessous le montrent — Bedrock est aussi la seule plateforme où l’ancien outil d’utilisation de l’ordinateur fonctionne encore. Si vous êtes sur Bedrock, vous n’êtes pas sur la même migration que tout le monde.

Ce que chaque requête doit désormais satisfaire

Le guide de migration d'Anthropic énonce le contrat sous forme de liste, et la liste est suffisamment courte pour vérifier votre propre client par rapport à elle. Quel que soit le modèle dont vous venez, une requête adressée à claude-opus-5-5 doit :

• N'envoyez soit aucun thinking champ, soit thinking: {"type": "adaptive"} — les deux sont équivalents, car la réflexion adaptative est toujours activée.

• Contrôlez la profondeur de réflexion avec le paramètre effort, le seul paramètre de requête qui le permet ; les cinq niveaux sont pris en charge et le niveau par défaut est moyen.

• Utilisez tool_choice avec {"type": "auto"} (la valeur par défaut) ou {"type": "none"}. Forcer un outil est refusé.

• Omettre temperature, top_p et top_k, ou les laisser à leurs valeurs par défaut. Toute autre valeur est rejetée, sur ce modèle comme sur tous les modèles à partir de Claude Opus 4.7.

• Ne pas terminer les messages par un tour d’assistant prérempli ; cela a déjà été rejeté sur Opus 4.6 et les versions ultérieures.

• Déclarez l'utilisation de l'ordinateur comme computer_toolset_20260801, l'ensemble d'outils sur l'API Claude et Google Cloud.

• N'envoyez aucun en-tête bêta de fenêtre de contexte. La fenêtre de contexte de 1 M est la valeur par défaut, et un en-tête écrit pour un modèle plus ancien n'a aucun effet.

Lorsque le guide indique qu’un paramètre est rejeté, l’API renvoie HTTP 400. C’est tout le mode de défaillance du passage à ce modèle : pas une sortie dégradée, pas un avertissement dans un journal — une requête qui ne s’exécute jamais.

Anthropic's Migrating to Claude Opus 5.5 documentation page, showing the 'What every request to Claude Opus 5.5 must satisfy' list: the claude-opus-5-5 model id with no date suffix, thinking adaptive-only, the effort parameter with five levels low through max defaulting to medium, tool_choice auto or none, sampling parameters at their defaults, no prefilled assistant turn, the computer_toolset_20260801 toolset on the Claude API and Google Cloud, and a 1M-token context window requiring no beta header.

Les quatre modifications avec rupture

1. La réflexion ne peut pas être désactivée

La réflexion adaptative est toujours activée. thinking: {"type": "disabled"} renvoie une erreur 400, et un budget manuel aussi — thinking: {"type": "enabled", "budget_tokens": N}. Le texte d’erreur nomme le type que vous avez envoyé, puis nomme le remplacement :

• "thinking.type.disabled" n'est pas pris en charge pour ce modèle. Utilisez "thinking.type.adaptive" et "output_config.effort" pour contrôler le comportement de réflexion.

• "thinking.type.enabled" n'est pas pris en charge pour ce modèle. Utilisez "thinking.type.adaptive" et "output_config.effort" pour contrôler le comportement de réflexion.

La conséquence pratique n'est pas l'erreur, c'est ce qui se passe après l'avoir corrigée. Sur Claude Opus 4.8 et versions antérieures, une requête dépourvue du champ thinking s'exécutait sans réflexion. Sur Claude Opus 5.5, chaque requête réfléchit, et max_tokens reste une limite stricte couvrant la réflexion plus le texte de la réponse. Les jetons de réflexion sont facturés comme des jetons de sortie, même lorsque le texte de réflexion ne vous est jamais renvoyé. Un point de terminaison qui s'exécutait auparavant sans réflexion peut donc produire plus de jetons de sortie par requête après le « correctif » qu'avant. Les recommandations d'Anthropic sont de réduire l'effort là où vous désactiviez auparavant la réflexion et, — aux niveaux d'effort xhigh ou max, — de commencer max_tokens à 64k, puis d'ajuster à partir de là.

La forme de la réponse change elle aussi. Une réponse peut commencer par un ou plusieurs blocs de réflexion avant le premier bloc de texte, de sorte que le code qui lit la réponse selon la position — content[0].text, ou un gestionnaire de flux qui traite le premier content_block_start comme du texte — échoue sur ces réponses même lorsque la requête a réussi. Sélectionnez plutôt les blocs par leur champ type.

2. L'utilisation forcée d'un outil renvoie une erreur

tool_choiceLes types any et tool renvoient un 400, et la même validation s'applique au point de terminaison de comptage de jetons, donc un comptage préalable échoue de la même manière que l'appel réel :

• tool_choice : les types « tool » et « any » ne sont pas pris en charge pour ce modèle.

Auto et none ne sont pas affectés. Le remplacement documenté consiste à conserver tool_choice: {"type": "auto"}, à marquer les outils avec strict: true pour des arguments valides selon le schéma, ou à déplacer le schéma vers les sorties structurées — et à préciser dans le prompt quand l’outil s’applique, car auto ne garantit pas un appel. L’utilisation stricte des outils accepte un sous-ensemble de JSON Schema : chaque objet dans l’input_schema d’un outil doit définir additionalProperties: false, donc vérifiez chaque schéma avant d’activer l’option. Et notez la lacune que cela laisse : si votre code dépendait du fait de forcer un appel plutôt que de simplement le permettre, auto restaure la permission et non la garantie. Vérifiez qu’un bloc tool_use est réellement revenu.

3. Les blocs de réflexion sont liés au modèle et à la conversation

Chaque bloc de réflexion enregistre quel modèle l’a produit, et chaque modèle lit ses propres blocs ainsi qu’un ensemble défini de ceux d’autres modèles. Les règles s’appliquent dans les deux sens :

• Claude Opus 5.5 lit les blocs de réflexion de Claude Opus 5 et des modèles Opus, Sonnet et Haiku antérieurs — mais pas des modèles Claude Fable ou Claude Mythos.

• Sur l'API Claude, Claude Fable 5.1 et Claude Mythos 5.1 lisent les blocs Claude Opus 5.5. Aucun autre modèle ne le fait.

• Une conversation passant de Claude Opus 5.5 à autre chose que ces deux-là déroule ses tours ultérieurs sans le raisonnement antérieur.

Un routeur ou un mécanisme de repli qui déplace une conversation est la façon évidente d'y parvenir. La moitié plus subtile, c'est que le bloc est aussi lié au préfixe de la conversation — le prompt système, les outils et chaque message qui le précède. Anthropic applique la vérification du préfixe par défaut pour les comptes créés à partir du 2026-08-31 00:00 UTC, sur l'API Claude et sur les plateformes cloud : rejouez un bloc après avoir modifié le prompt système, la liste d'outils ou un message antérieur, et la requête renvoie 400. Deux solutions de contournement existent. Envoyez l'en-tête bêta thinking-binding-controls-2026-08-01 et définissez thinking.block_binding.prefix_mismatch_behavior sur "drop_block" pour abandonner les blocs concernés au lieu de faire échouer la requête. Ou gardez la conversation en mode ajout uniquement et modifiez les instructions à l'aide d'un message système en milieu de conversation plutôt que par une modification — ce que font déjà Claude Code, claude.ai, Claude Managed Agents et le SDK Claude Agent.

Il y a une bonne nouvelle facile à manquer : lorsqu’une requête contient un bloc que le modèle cible ne peut pas lire, l’API le supprime avant que le modèle ne le voie. La requête réussit, et les blocs supprimés ne sont pas facturés.

4. L'ancien outil d'utilisation d'ordinateur est rejeté sur l'API Claude et Google Cloud

Une entrée tools de type computer_20251124 renvoie un 400 sur l'API Claude et Google Cloud. Le message nomme le type rejeté, puis liste les types que le modèle accepte :

• 'claude-opus-5-5' ne prend pas en charge les types d'outils : computer_20251124.

Le remplacement est le computer_toolset_20260801 toolset : supprimez l'en-tête bêta computer-use-2025-11-24, et envoyez l'entrée tools sans nom ni dimensions d'affichage. Il ne s'agit pas seulement d'un changement de requête — la boucle de l'agent change avec lui. Les actions arrivent sous forme de blocs tool_use membres plutôt que d'un seul outil computer, il peut y en avoir plusieurs dans un même tour, l'action est le name du bloc plutôt que input.action, et chaque résultat doit renvoyer toolset_name en retour. Sur Amazon Bedrock, computer_20251124 continue de fonctionner exactement comme sur Claude Opus 5 et aucun changement n'est nécessaire.

Lesquels des quatre s'appliquent aussi à Claude Fable 5.1

Anthropic indique que les trois premiers s'appliquent aussi à Claude Fable 5.1 — réflexion toujours active, aucun choix d'outil forcé, et blocs de réflexion liés au modèle et à la conversation. Le changement lié à l'utilisation de l'ordinateur, lui, ne s'applique pas : il est spécifique à ce modèle sur l'API Claude et Google Cloud. Ainsi, une équipe déjà passée à Claude Fable 5.1 a retiré ses chemins de code à réflexion désactivée et ses choix d'outils forcés, et suit un modèle de conversation en ajout seul ; ce qui reste, c'est l'identifiant du modèle et l'ensemble d'outils d'utilisation de l'ordinateur. Une équipe venant de Claude Opus 5 doit affronter les quatre d'un coup. C'est la migration qui mérite d'être planifiée, et la charge de travail varie selon le point de départ.

Le cinquième changement : aucune erreur, et votre fil de progression se tait.

Sur Claude Opus 5, les courtes notes que le modèle rédige entre les appels d'outils reviennent sous forme de blocs de texte ordinaires. Sur Claude Opus 5.5 — comme sur Claude Fable 5.1 — cette narration revient sous forme de blocs de réflexion de mise à jour de progression, un bloc au maximum avant chaque appel d'outil. Et thinking.display a pour valeur par défaut « omitted », de sorte que ces blocs arrivent avec un champ thinking vide, en plus de leur signature.

Aucune requête n’échoue. Aucune erreur n’est journalisée. Une application qui diffuse à ses utilisateurs le texte entre les appels d’outils comme indicateur de progression cesse simplement d’afficher la progression entre les appels d’outils et se met à ne plus rien afficher. Le symptôme visible est une interface utilisateur qui semble figée pendant précisément la période de travail où l’utilisateur a le plus besoin d’être rassuré, et elle sera signalée comme un problème de performance, un problème de réseau ou un blocage — pas comme un bug de migration. C’est le changement qui part en production.

Le correctif est un paramètre d'affichage, plus une lecture qui y correspond :

• Réglez thinking.display sur "updates" — bêta, derrière l'en-tête thinking-display-updates-2026-08-18 — pour retrouver les mises à jour de progression pendant que le raisonnement lui-même reste masqué. C'est le réglage que recherche un flux de progression.

• Ou définissez-le sur « résumé » pour recevoir des mises à jour de progression et des résumés de raisonnement mélangés dans les mêmes blocs.

• Ensuite, lisez le texte à partir des blocs de réflexion plutôt que des blocs de texte, affichez chaque bloc de réflexion non vide avant le bloc tool_use qu’il précède, puis renvoyez les blocs inchangés avec le reste du tour de l’assistant.

La note d’Anthropic à ce sujet mérite d’être citée dans l’esprit : une interface qui affiche du texte entre les appels d’outils est censée définir une valeur d’affichage plutôt que de se fier à la valeur par défaut. Si votre intégration ignore entièrement les blocs de réflexion aujourd’hui, c’est le seul endroit où la valeur par défaut est sûre.

A single-column scoreboard titled 'Claude Opus 5.5 — the migration at a glance' listing six rows: thinking always on and cannot be disabled; forced tool use returning a 400 error; thinking blocks bound to the model and the conversation; the old computer tool rejected on the Claude API and Google Cloud; progress text hidden by default; and the fix of setting thinking.display to summarized. Footer reads: per Anthropic's Claude Opus 5.5 migration guide, read 2026-09-24; vendor-reported.

L’effort est la surface de l’API

Comme la réflexion ne peut pas être désactivée, output_config.effort devient le seul levier sur l'ampleur du raisonnement du modèle, et donc le seul levier sur le coût et la latence pour une tâche donnée. Quatre points méritent d'être connus avant de recopier un réglage depuis l'ancien modèle.

La valeur par défaut a changé. Claude Opus 5.5 utilise par défaut le niveau d’effort medium, alors que Claude Opus 5 et les modèles Opus antérieurs étaient paramétrés par défaut sur high. Une requête qui omet l’effort s’exécute désormais un niveau plus bas qu’avant le changement. Anthropic documente également que le modèle a tendance à réfléchir davantage par tour, pour un niveau d’effort donné, que ne le faisait Claude Opus 5, surtout à xhigh et max. Ces deux effets poussent dans des directions opposées, ce qui explique précisément pourquoi la consigne du fournisseur est de lancer un nouveau balayage des niveaux d’effort sur vos propres évaluations plutôt que de transposer un réglage.

L’échelle est low / medium / high / xhigh / max, les cinq sont pris en charge ici. Le niveau nommé n’est pas, à la base, un budget de tokens fixe — Anthropic décrit l’effort comme un signal comportemental, et non comme un budget strict — et l’allocation de tokens derrière chaque niveau a changé d’un modèle à l’autre, donc « high » sur Claude Opus 5.5 n’est pas « high » sur Claude Opus 5. Régler l’effort sur la valeur par défaut du modèle revient à l’omettre.

Deux détails opérationnels, car tous deux coûtent de l'argent lorsqu'ils sont négligés. Premièrement, modifier la valeur d'effort de niveau supérieur entre les requêtes invalide le cache de prompt : choisissez un niveau et maintenez-le constant dans une conversation qui dépend des succès de cache, et faites-le plutôt varier d'une charge de travail à l'autre. Deuxièmement, ce modèle prend en charge effort par message (en-tête bêta mid-conversation-output-config-2026-07-01), qui modifie le niveau à partir d'un tour ultérieur sans redémarrer le cache. Le minimum de cache de prompt ici est de 512 jetons, contre 1 024 sur la génération précédente, donc les prompts qui étaient auparavant trop courts pour être mis en cache peuvent désormais créer des entrées sans modification du code.

Plafonds de sortie : 128K en synchrone, 300K en mode Batch

L'API Messages synchrone plafonne la sortie à 128K tokens. L'API Message Batches atteint 300K tokens de sortie derrière l'en-tête output-300k-2026-03-24 bêta — cette chaîne exacte. Par défaut, l'entrée correspond à la fenêtre de contexte complète de 1M tokens, sans en-tête requis.

Lecture pratique : le plafond de 128K est inchangé par rapport à Claude Opus 5, donc rien dans une intégration synchrone ne nécessite de re-budgétisation sur ce seul axe. Ce qui nécessite une re-budgétisation, c'est la réflexion à l'intérieur. Étant donné que max_tokens couvre désormais la réflexion ainsi que le texte à chaque requête, une valeur qui était juste pour le texte de réponse sur Claude Opus 5 est plus serrée ici — et à un effort xhigh ou max, le fournisseur suggère de commencer à 64k et d'ajuster. Si une tâche de longue durée a été dimensionnée par rapport au plafond synchrone de 128K et qu'elle tronque maintenant, ce n'est pas le plafond qui a bougé.

Le routage de protection fait partie de la spécification.

Ceci est un fait d’intégration, et non une note de bas de page de politique : sur certaines invites, la chaîne de modèle que vous envoyez ne décrit pas ce qui a répondu.

Claude Opus 5.5 est livré avec des classificateurs de sécurité, et une requête refusée revient en HTTP 200 avec stop_reason: "refusal" et un objet stop_details nommant le domaine de politique concerné. Ce modèle couvre davantage de catégories que Claude Opus 5 — attendez-vous à bio, frontier_llm et reasoning_extraction aux côtés des familiers cyber. Le refus reasoning_extraction est bloqué d'emblée plutôt que réessayé : le repli côté serveur d'Anthropic ne le réessaie pas, et le refus vous est renvoyé.

Pour les catégories qui effectuent une nouvelle tentative, le mécanisme est un paramètre. Définissez fallbacks sur "default" avec l'en-tête bêta server-side-fallback-2026-07-01 et l'API réexécute une requête refusée sur le modèle qu'Anthropic recommande pour cette catégorie, au sein d'un seul appel, en renvoyant une seule réponse. Le centre d'aide d'Anthropic nomme directement le routage pour ce modèle : les requêtes signalées de cybersécurité basculent vers Claude Opus 4.8, et ses classificateurs de biologie — l'ensemble de style Fable-5 — provoquent un basculement vers Claude Opus 5 pour les travaux à double usage en sciences de la vie. Un ensemble restreint de capacités de développement de LLM de frontière est également routé vers Claude Opus 5. Anthropic note aussi que les contrôles examinent tout ce que le modèle lit, pas seulement votre dernier message, de sorte que la mémoire, le contenu des connecteurs, les résultats de recherche et les fichiers peuvent déclencher un changement.

Trois conséquences pour votre intégration. Lisez le champ de premier niveau model sur chaque réponse, car il indique le modèle qui a réellement produit le message, et un fallback bloc de contenu marque chaque point de transfert. Vérifiez les limites de débit propres au fallback, car un fallback soumis à une limite de débit n'est pas tenté et c'est le refus qui est renvoyé à la place — les fallbacks se dégradent en refus sous charge. Et considérez toute exécution de benchmark publiée avec les garde-fous activés comme une mesure du système routé plutôt que de Claude Opus 5.5 seul, ce qui correspond exactement à ce qu'Anthropic dit de ses propres chiffres ci-dessous.

Le fallback côté serveur est en bêta et réservé à l'API Claude : il n'est pas pris en charge sur l'API Message Batches et n'est pas disponible sur Amazon Bedrock, Google Cloud ou Microsoft Foundry, où le middleware SDK constitue la voie documentée à la place. Du côté de la vérification, des voies d'accès existent pour les deux catégories — le Cyber Verification Program et le Life Sciences Verification Program — mais notez l'asymétrie que le centre d'aide d'Anthropic documente à l'heure où nous écrivons : Claude Opus 5.5 n'est actuellement pas répertorié dans le Cyber Verification Program, tandis que le programme des sciences de la vie est décrit comme donnant aux organisations vérifiées l'accès aux modèles les plus performants.

Contexte, seuil, retrait et mode rapide

Le reste de l'enveloppe, provenant de la page du modèle et du tableau des dépréciations :

• Fenêtre de contexte — 1 M de tokens, par défaut, sans en-tête bêta.

• Date limite des connaissances — juin 2026, qui correspond également à la date limite des données d'entraînement.

• Retrait — pas avant le 2027-09-22 sur les plateformes exploitées par Anthropic, avec un préavis d'au moins 60 jours. Amazon Bedrock et Google Cloud fixent leurs propres dates. Claude Opus 5 est actif au moins jusqu'au 2027-07-24, il n'y a donc aucun basculement forcé.

• Grille tarifaire — 4,00 $ par million de tokens d'entrée, 20,00 $ par million de tokens de sortie, 5,00 $ par million d'écritures dans le cache de 5 minutes, 8,00 $ par million d'écritures dans le cache de 1 heure, 0,20 $ par million de lectures de cache. Batch est à moitié prix dans les deux sens, à 2,00 $ / 10,00 $.

• Les lectures de cache sont l’exception à remarquer : 0,20 $ représente 5 % de l’entrée de base, alors que la plupart des modèles Claude se situent à 10 % et Claude Fable 5.1 à 2,5 %. Les charges de travail mixtes à forte réutilisation du cache y voient une véritable réduction.

• Mode rapide — toujours documenté comme un aperçu de recherche, API Claude uniquement, facturé séparément à 8,00 $ en entrée / 40,00 $ en sortie par million. À activer avec speed: "fast" et l'en-tête bêta fast-mode-2026-02-01. Il n'est pas disponible sur Bedrock, Claude Platform sur AWS, Google Cloud ou Microsoft Foundry, ni avec l'API Batch, ni avec un engagement Priority Tier. Notez que Claude Opus 5.5 ne prend pas du tout en charge Priority Tier.

Ce que disent les benchmarks, et à quel réglage

Les paramètres d’effort sont la raison pour laquelle un tableau de fournisseur et un tableau indépendant ne peuvent pas être comparés ligne par ligne, et pour laquelle chaque chiffre ci-dessous est accompagné de son paramètre.

Rapporté par le fournisseur, harnais propre d'Anthropic. La note de lancement d'Anthropic indique que, sauf mention contraire, tous les résultats de Claude Opus 5.5 utilisent le raisonnement adaptatif à effort maximal ; l'exception est Terminal-Bench 4.0, rapporté à xhigh pour Claude Opus 5.5 et à high pour GPT-6 Astra, car il s'agit du meilleur score de chaque modèle. Sur cette base, le fournisseur rapporte Terminal-Bench 4.0 à 66,4 %, FrontierCode v1.1 Main à 54,4 %, CursorBench 4.0 à 57,8 %, GDPval-AA v2.1 à 1 846 Elo, AutomationBench à 40,0 %, Humanity's Last Exam avec outils à 67,7 %, Terminal-Bench-Science 0.1 à 58,7 %, OSWorld 2.0 à 81,8 % partiel, et Chartography avec outils à 89,0 %. À l'effort moyen par défaut du modèle, le fournisseur donne FrontierCode à 54,6 % et CursorBench à 52,5 %. Notez ce que la même note divulgue : les évaluations ont été exécutées avec les garde-fous de production activés, et lorsque ceux-ci se déclenchaient, les tâches de cybersécurité étaient réalisées par Claude Opus 4.8 et les tâches de biologie et de développement de LLM de pointe par Claude Opus 5 — Anthropic précise que cela réduit probablement les performances de Claude Opus 5.5 sur ces benchmarks. Les scores publiés pour les évaluations concernées ne constituent donc pas des mesures propres de ce modèle.

Indépendant, Artificial Analysis. Sur l'Intelligence Index v4.3.2, Claude Opus 5.5 obtient 58 dans la configuration qu'Artificial Analysis désigne sous le nom « Adaptive Reasoning, Max Effort, Default Fallback » — son meilleur score mesuré, et de plusieurs points, et il arrive en tête de six des dix évaluations constitutives. Sur le même index et le même harnais, Claude Fable 5.1 obtient 53 et Claude Opus 5 obtient 51. Artificial Analysis publie l'intégralité de l'échelle d'effort, qui est l'artefact indépendant le plus utile ici : max 58, xhigh 56, high 54, medium 51, low 42. Ses propres mesures situent Claude Opus 5.5 à environ 119 000 jetons de sortie par tâche de l'index à effort maximal, contre environ 73 000 pour Claude Opus 5, 78 000 pour Claude Fable 5.1 et 27 000 pour GPT-6 Astra — des jetons facturés comme jetons de sortie — et sa page indique un coût de 5,98 $ par tâche de l'index. Il mesure également Terminal-Bench 4.0 à 59,6 % et Humanity's Last Exam à 61,4 %, contre les 66,4 % et 67,7 % du fournisseur à effort maximal sur un harnais différent.

Lisez ces deux paragraphes l’un par rapport à l’autre, et la conclusion honnête est étroite. Le score de 66,4 % au Terminal-Bench du fournisseur et le 59,6 % indépendant correspondent au même benchmark exécuté par des personnes différentes avec des paramètres dont l’équivalence n’est pas garantie, et ni l’un ni l’autre ne constitue une preuve concernant votre charge de travail. C’est l’échelle d’effort qui constitue le constat transférable : sur un indice indépendant, les propres paramètres de ce modèle s’étalent sur seize points, soit une amplitude plus large que l’écart entre lui et son prédécesseur. Le choix d’un niveau d’effort importe davantage que le choix entre ces modèles, et la clause « Default Fallback » de ce libellé est le routage de sauvegarde décrit ci-dessus, non un artefact de benchmark.

Efficacité rapportée par le fournisseur, attribuée. Anthropic affirme que Claude Opus 5.5 atteint le niveau de Claude Fable 5.1 sur la plupart des tâches pour un coût d’exécution inférieur d’environ 40 %, et que les charges de travail typiques coûtent environ 40 % de moins que sur Claude Opus 5, alors que le prix affiché baisse de 20 %. La sortie est plus de 30 % plus rapide. Il s’agit de caractérisations par le fournisseur de moyennes sur des charges de travail qu’il a sélectionnées. Les déclarations de clients au moment du lancement relèvent du même type de preuves : Box rapporte un tiers des tokens et des réponses environ 40 % moins verbeuses, Kiro environ la moitié des tokens et environ 40 % d’appels en moins, Factory 20 à 25 % de tokens de sortie en moins, GitHub parmi les plus faibles volumes de tokens et d’étapes qu’il ait mesurés. Anthropic rapporte aussi un test interne de vérification des faits dans lequel 16 de ses 18 rapports ont dépassé un seuil de qualité que ni Claude Fable 5.1 ni Claude Opus 5 n’ont franchi, et ce à aucune tentative. Tout cela est rapporté par le fournisseur et rien de tout cela n’est audité. La limitation divulguée est d’une franchise inhabituelle et mérite d’être retenue : Anthropic affirme que Claude Opus 5.5 « soupçonne fréquemment qu’il est en train d’être évalué ».

Enfin, les modèles frères : Anthropic indique que Claude Sonnet 5.5 et Claude Haiku 5.5 arriveront « dans les semaines à venir ». Aucun des deux n’est commercialisé, aucun n’a de tarif, et aucun n’est disponible sur une quelconque plateforme aujourd’hui.

Tester les quatre changements sans basculement complet

Le risque de migration ici n’est pas la qualité — c’est qu’un chemin de code que vous n’avez jamais emprunté en préproduction soit celui qui renvoie 400 en production. Les quatre changements incompatibles sont tous des modifications de la forme des requêtes, ce qui signifie qu’ils échouent de manière déterministe et immédiate, et le seul moyen de trouver les chemins que vous avez manqués est de faire passer du trafic réel à travers eux.

Claude Opus 5.5 est disponible sur OrcaRouter sous anthropic/claude-opus-5.5au prix catalogue d'Anthropic, avec 0 % de marge — le prix catalogue du fournisseur est répercuté tel quel, si bien qu'un changement de tarif du fournisseur est effectif ici le jour même.

The OrcaRouter model page for Claude Opus 5.5, showing the identifier anthropic/claude-opus-5.5, input at $4.00 and output at $20.00 per 1M tokens, a 1M-token context window, 128K max output, text plus image and file input, and OpenAI-compatible and Anthropic Messages endpoints served from api.orcarouter.ai.

Cela vous permet de diriger un pourcentage du trafic de production vers le modèle pendant que le reste continue de tourner sur Claude Opus 5, d'observer quelles requêtes échouent et pourquoi, puis de les corriger une par une. Les quatre erreurs se décrivent d'elles-mêmes : chacune nomme le paramètre qu'elle a rejeté et, dans trois cas sur quatre, son remplacement. Le basculement automatique comble le vide tant qu'un chemin reste cassé — une requête qui échoue face à un modèle que vous n'avez pas entièrement caractérisé est redirigée vers un modèle que vous maîtrisez, plutôt que d'exposer l'erreur 400 à un utilisateur.

Un ordre de travail pratique : échangez d’abord l’identifiant du modèle et définissez explicitement l’effort, puisque la valeur par défaut est passée à medium ; retirez ensuite les chemins thinking-disabled et forced-tool-choice ; corrigez alors le lecteur de streaming — sélection des blocs par type et paramètre thinking.display — car c’est celui qui échoue silencieusement plutôt que bruyamment ; et réservez la migration de l’ensemble d’outils computer-use pour la fin si vous êtes sur Bedrock, car c’est celle qui ne s’y applique pas. Tout le reste — prix, fenêtre de contexte, tarifs de cache et valeur par défaut de 1 M de jetons — est déjà là où vous l’avez laissé.

Acheminez une part du trafic en direct vers le nouveau modèle sans bascule complète : Claude Opus 5.5 sur OrcaRouterfonctionne au prix catalogue d'Anthropic, avec un basculement automatique vers un modèle que vous avez déjà caractérisé.

Comparés dans cet article4

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement