Carte de titre principale générée pour Claude Sonnet 5.5 vs Claude Opus 5.5, sous-titrée « Les benchmarks convergent, la facture non », affichant 2,00 $ et 10,00 $ par million de tokens à gauche contre 4,00 $ et 20,00 $ à droite, avec le logo OrcaRouter intégré dans le coin inférieur droit.
Guides & Insights

Claude Sonnet 5.5 vs Claude Opus 5.5 : les benchmarks convergent, la facture non

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Claude Sonnet 5.5 est passé en disponibilité générale le 28 septembre 2026, à 2,00 $ par million de jetons d'entrée et 10,00 $ par million de jetons de sortie. Claude Opus 5.5, le modèle phare d'Anthro​pic, est sorti six jours plus tôt, le 22 septembre, à 4,00 $ et 20,00 $ — exactement le double sur les deux lignes. La lecture évidente est qu'Opus 5.5 constitue le plafond et que Sonnet 5.5 est le compromis que l'on accepte quand le budget est réel. Le tableau de lancement d'Anthro​pic lui-même ne conforte pas cette lecture. Selon les chiffres publiés par l'entreprise, Claude Sonnet 5.5 affiche 1844 contre 1846 pour Opus 5.5 sur GDPval-AA v2.1, 1811 contre 1822 sur AA-Briefcase v1.1, et 70,6 % contre 66,4 % sur Terminal-Bench 4.0 — il remporte le seul benchmark qui mesure le travail réellement accompli dans un terminal. Deux lignes sous ces chiffres, la propre légende d'Anthro​pic indique qu'Opus 5.5 « reste nettement plus fort sur les tâches complexes et ouvertes ». Les deux affirmations sont vraies, et déterminer comment les tenir ensemble simultanément, c'est l'essentiel de l'objet de cette comparaison.

Ce que dit la table de lancement, et ce qu’elle refuse de dire

La tendance qui se dégage du bloc de benchmarks d’Anthropic est celle d’un modèle qui a comblé la majeure partie de l’écart plutôt que d’un modèle qui a pris la tête. GDPval-AA v2.1, un ensemble de tâches pondéré économiquement, se joue à deux points. AA-Briefcase v1.1, une évaluation de documents et de livrables, se joue à onze points. CursorBench 4.0 va dans l’autre sens : 55,5 % pour Sonnet 5.5 contre 57,8 % pour Opus 5.5. OSWorld 2.1 se situe à 80,1 % contre 81,8 %, et Humanity's Last Exam à 64,5 % avec outils contre 67,7 %. Seul Terminal-Bench 4.0 brise la tendance, et il la brise radicalement — 70,6 % contre 66,4 %, un avantage de quatre points pour Sonnet sur le travail agentique en ligne de commande.

Lisez les libellés de ligne plutôt que les chiffres, et autre chose apparaît. Plusieurs de ces entrées Opus 5.5 portent une annotation d'effort — 66,4 % à Xhigh — et une note de bas de page indique que la configuration Max obtient un score inférieur à Xhigh sur FrontierCode, et non supérieur. Un effort plus élevé n'est pas monotone. Une équipe soucieuse de son budget qui suppose que l'« effort maximal » est une mise à niveau gratuite achète des tokens pour une réponse moins bonne à au moins un des propres tests d'Anthropic. Et sur FrontierCode 1.1, la même note de bas de page place Sonnet 5.5 à 46,2 % en configuration Max, contre 54,4 % pour Opus 5.5 : c'est le chiffre isolé le plus clair de l'endroit où le modèle phare conserve son avance, à savoir le travail de code sur un horizon long selon une définition de tâche qui valorise la persévérance.

Il y a une réserve supplémentaire qu’il vaut mieux énoncer clairement plutôt que de l’enterrer. Anthropic note que les exécutions GDPval-AA et AA-Briefcase qu’elle publie ont été réalisées sur un déploiement préliminaire qui comportait un bogue de sorties structurées. Cela affecte les deux modèles du même tableau, donc la comparaison n’est pas invalidée, mais cela signifie que les chiffres absolus doivent être considérés comme un instantané plutôt qu’un résultat définitif. Les tableaux de benchmarks des fournisseurs sont des artefacts marketing accompagnés d’une annexe méthodologique, et celui-ci est livré avec son annexe jointe.

Où se situe la mesure indépendante

Artificial Analysis évalue les deux modèles sous un même harnais, dans la même configuration qu’il nomme « Adaptive Reasoning, Max Effort, Default Fallback », sur l’Intelligence Index v4.3. Claude Opus 5.5 se situe à 58. Claude Sonnet 5.5 se situe à 56. Cela représente un écart de deux points sur une échelle où le même évaluateur place Opus 5 à 51, Sonnet 5 à 38, DeepSeek V4 Pro à 36 et Gemini 3.1 Pro Preview à 30. L’arrivée d’un nouveau Sonnet à deux points sous le modèle phare et cinq points au-dessus de la génération Opus précédente constitue l’affirmation substantielle de cette version, et il s’agit d’une affirmation d’un tiers plutôt que du fournisseur.

Ensuite, la même page inverse l'économie de la chose. Artificial Analysis rapporte qu'une exécution d'évaluation de Sonnet 5.5 coûte 7,60 $ par tâche, contre 5,98 $ pour Opus 5.5, même si Sonnet 5.5 est deux fois moins cher par token. La cause est juste là, dans la page : Sonnet 5.5 a généré 410 millions de tokens sur l'ensemble de l'indice, contre une médiane de 88 millions pour les modèles qu'il suit — « très verbeux », selon les mots de l'évaluateur. Opus 5.5 a généré 260 millions sur le même ensemble. À 10 $ par million de tokens de sortie contre 20 $, le facteur de verbosité d'environ 1,6 laisse tout de même Sonnet 5.5 payer environ 27 % de plus par tâche accomplie.

C'est la partie de la comparaison qu'un tableau de prix par token ne peut pas vous montrer, et c'est la raison pour laquelle les deux chiffres coexistent sans contradiction. Par token, Sonnet 5.5 est deux fois moins cher. Par tâche terminée, sur une suite d'évaluation avec des prompts ouverts et sans discipline de longueur de sortie, il peut être plus cher. Lequel de ces cas décrit votre charge de travail constitue la véritable décision.

Niveaux d'effort, plafonds de sortie et forme de l'intégration

Pour un acheteur, les propriétés importantes sur le plan mécanique sont quasiment identiques entre ces deux modèles.

• Contexte — 1 000 000 de tokens sur les deux, du même fournisseur, donc les hypothèses d’ingénierie de prompt se transposent sans changement

• Sortie maximale — 128 000 tokens sur les deux ; la génération en masse n'est pas un facteur différenciant ici

• Modalité — saisie de texte, d’image et de fichier sur les deux ; aucun des deux n’accepte l’audio ni la vidéo

Contrôle du raisonnement — pensée adaptative sur les deux, avec une profondeur définie par un paramètre d'effort plutôt que par un budget de jetons de réflexion. Sur la Claude Platform, la valeur par défaut est élevée ; dans les Claude apps, elle est moyenne.

• Écriture de cache — 5,00 $ par million pour Claude Opus 5.5 contre 2,50 $ pour Claude Sonnet 5.5, la seule ligne où le modèle le moins cher est aussi le moins cher à alimenter avec un préfixe reconstruit

• Lecture du cache — 0,20 $ par million pour les deux, une égalité parfaite sur la ligne qui domine les longues exécutions d'agents

Parce que les surfaces correspondent, la migration de l’une à l’autre se résume à un changement de chaîne de modèle et à une réévaluation de l’effort, et non à un projet d’intégration. C’est inhabituel d’un fournisseur à l’autre, et c’est la raison pour laquelle ce duo particulier mérite d’être comparé : les deux candidats diffèrent par le prix et par la profondeur, pas par l’API que vous devez écrire.

Une différence opérationnelle mérite une ligne à part. Anthropic indique que Claude Sonnet 5.5 est le premier Sonnet à être lancé avec des garde-fous et des mécanismes de repli en cybersécurité au même niveau que ses modèles haut de gamme, ce qui signifie que les demandes de cybersécurité à risque plus élevé sont visiblement acheminées vers le Sonnet précédent plutôt que traitées par le modèle que vous avez nommé. Si votre charge de travail touche ce domaine, la chaîne de modèle ne garantit pas quel modèle a répondu — et ce, quel que soit le niveau. Anthropic note également que si vous exécutez Sonnet avec la réflexion désactivée, vous devez passer à un comportement entre outils, ce qui constitue une modification du code plutôt qu’un indicateur de configuration. Aucun de ces deux points n’est une raison d’éviter le modèle ; ce sont tous deux des raisons de le savoir avant de livrer.

Sur OrcaRouter, Claude Opus 5.5 est routable dès aujourd'hui avec les mêmes identifiants que tous les autres modèles du catalogue, au prix catalogue du fournisseur avec 0 % de marge, avec un basculement automatique disponible en dessous. Claude Sonnet 5.5 n'est pas encore une route sur notre plateforme — le modèle est âgé d'un jour, et tant qu'il n'est pas répertorié, l'affirmation honnête est que vous y accéderiez via l'API d'Anthropic elle-même. Toute personne qui exécute actuellement Opus 5.5 via nous peut chiffrer le changement le jour où il arrive sans rien changer d'autre à son intégration.

Lequel mettre où ?

La répartition qui découle des chiffres : Claude Sonnet 5.5 pour le travail d'agent lié au terminal, où il est le plus performant des deux sur le score Terminal-Bench 4.0 d'Anthropic et pour moitié prix ; Claude Sonnet 5.5 pour tout ce qui est de nature à privilégier le débit, car l'écart de coût ne se réduit que lorsque la tâche impose de longues sorties ; Claude Opus 5.5 pour le travail de la classe FrontierCode, les refactorisations à long terme sur de grandes bases de code, et toute charge de travail où l'écart de 54,4 % à 46,2 % reflète la forme de votre problème réel plutôt qu'une ligne de classement.

Si vos tâches sont ouvertes et que vous ne pouvez pas prévoir la longueur de la sortie, considérez le prix par token comme étant complètement le mauvais chiffre. Mesurez les tokens par tâche terminée sur votre propre trafic pendant une semaine avant de vous engager dans un sens ou dans l’autre ; le chiffre d’artificial-analysis de 7,60 $ contre 5,98 $ est un avertissement que le modèle bon marché peut perdre sur la métrique que vous payez réellement.

Le verdict honnête : il ne s'agit plus d'un arbitrage entre capacité et coût. C'est une question de savoir si votre travail est borné. Pour les tâches bornées, à fort volume et pilotées par des outils, le modèle moins cher est aussi le meilleur au vu des preuves disponibles, et le modèle phare ne vaut pas le double. Pour le travail ouvert, à long horizon, la phrase d'Anthropic elle-même — selon laquelle Opus 5.5 reste nettement plus fort — est celle à croire, et aucune convergence des benchmarks n'y change rien pour l'instant.

A two-column scoreboard for Claude Sonnet 5.5 and Claude Opus 5.5 across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56 at $7.60 per task, Terminal-Bench 4.0 (vendor) 70.6%, GDPval-AA v2.1 (vendor) 1844. Right column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, cache write $5.00, 1M context with 128K max output, AA Intelligence Index v4.3 score 58 at $5.98 per task, Terminal-Bench 4.0 (vendor) 66.4%, GDPval-AA v2.1 (vendor) 1846. The card heading reads "Claude Sonnet 5.5 against Claude Opus 5.5: eight rows, two of them on a different instrument", and a footer line reads "Per-token prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Terminal-Bench and GDPval-AA rows are Anthropic's own launch table, run on a pre-release deployment, and are not the same instrument as the index."Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.Screenshot of the OrcaRouter model page for Anthropic Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 4.57-second p50 time to first token, and the $4.00 input and $20.00 output prices per million tokens.