
Claude Sonnet 5.5 vs Claude Opus 5.5 : les benchmarks convergent, la facture non
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 984 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 195 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Claude Sonnet 5.5 est passé en disponibilité générale le 28 septembre 2026, à 2,00 $ par million de jetons d'entrée et 10,00 $ par million de jetons de sortie. Claude Opus 5.5, le modèle phare d'Anthropic, est sorti six jours plus tôt, le 22 septembre, à 4,00 $ et 20,00 $ — exactement le double sur les deux lignes. La lecture évidente est qu'Opus 5.5 constitue le plafond et que Sonnet 5.5 est le compromis que l'on accepte quand le budget est réel. Le tableau de lancement d'Anthropic lui-même ne conforte pas cette lecture. Selon les chiffres publiés par l'entreprise, Claude Sonnet 5.5 affiche 1844 contre 1846 pour Opus 5.5 sur GDPval-AA v2.1, 1811 contre 1822 sur AA-Briefcase v1.1, et 70,6 % contre 66,4 % sur Terminal-Bench 4.0 — il remporte le seul benchmark qui mesure le travail réellement accompli dans un terminal. Deux lignes sous ces chiffres, la propre légende d'Anthropic indique qu'Opus 5.5 « reste nettement plus fort sur les tâches complexes et ouvertes ». Les deux affirmations sont vraies, et déterminer comment les tenir ensemble simultanément, c'est l'essentiel de l'objet de cette comparaison.
Ce que dit la table de lancement, et ce qu’elle refuse de dire
La tendance qui se dégage du bloc de benchmarks d’Anthropic est celle d’un modèle qui a comblé la majeure partie de l’écart plutôt que d’un modèle qui a pris la tête. GDPval-AA v2.1, un ensemble de tâches pondéré économiquement, se joue à deux points. AA-Briefcase v1.1, une évaluation de documents et de livrables, se joue à onze points. CursorBench 4.0 va dans l’autre sens : 55,5 % pour Sonnet 5.5 contre 57,8 % pour Opus 5.5. OSWorld 2.1 se situe à 80,1 % contre 81,8 %, et Humanity's Last Exam à 64,5 % avec outils contre 67,7 %. Seul Terminal-Bench 4.0 brise la tendance, et il la brise radicalement — 70,6 % contre 66,4 %, un avantage de quatre points pour Sonnet sur le travail agentique en ligne de commande.
Lisez les libellés de ligne plutôt que les chiffres, et autre chose apparaît. Plusieurs de ces entrées Opus 5.5 portent une annotation d'effort — 66,4 % à Xhigh — et une note de bas de page indique que la configuration Max obtient un score inférieur à Xhigh sur FrontierCode, et non supérieur. Un effort plus élevé n'est pas monotone. Une équipe soucieuse de son budget qui suppose que l'« effort maximal » est une mise à niveau gratuite achète des tokens pour une réponse moins bonne à au moins un des propres tests d'Anthropic. Et sur FrontierCode 1.1, la même note de bas de page place Sonnet 5.5 à 46,2 % en configuration Max, contre 54,4 % pour Opus 5.5 : c'est le chiffre isolé le plus clair de l'endroit où le modèle phare conserve son avance, à savoir le travail de code sur un horizon long selon une définition de tâche qui valorise la persévérance.
Il y a une réserve supplémentaire qu’il vaut mieux énoncer clairement plutôt que de l’enterrer. Anthropic note que les exécutions GDPval-AA et AA-Briefcase qu’elle publie ont été réalisées sur un déploiement préliminaire qui comportait un bogue de sorties structurées. Cela affecte les deux modèles du même tableau, donc la comparaison n’est pas invalidée, mais cela signifie que les chiffres absolus doivent être considérés comme un instantané plutôt qu’un résultat définitif. Les tableaux de benchmarks des fournisseurs sont des artefacts marketing accompagnés d’une annexe méthodologique, et celui-ci est livré avec son annexe jointe.
Où se situe la mesure indépendante
Artificial Analysis évalue les deux modèles sous un même harnais, dans la même configuration qu’il nomme « Adaptive Reasoning, Max Effort, Default Fallback », sur l’Intelligence Index v4.3. Claude Opus 5.5 se situe à 58. Claude Sonnet 5.5 se situe à 56. Cela représente un écart de deux points sur une échelle où le même évaluateur place Opus 5 à 51, Sonnet 5 à 38, DeepSeek V4 Pro à 36 et Gemini 3.1 Pro Preview à 30. L’arrivée d’un nouveau Sonnet à deux points sous le modèle phare et cinq points au-dessus de la génération Opus précédente constitue l’affirmation substantielle de cette version, et il s’agit d’une affirmation d’un tiers plutôt que du fournisseur.
Ensuite, la même page inverse l'économie de la chose. Artificial Analysis rapporte qu'une exécution d'évaluation de Sonnet 5.5 coûte 7,60 $ par tâche, contre 5,98 $ pour Opus 5.5, même si Sonnet 5.5 est deux fois moins cher par token. La cause est juste là, dans la page : Sonnet 5.5 a généré 410 millions de tokens sur l'ensemble de l'indice, contre une médiane de 88 millions pour les modèles qu'il suit — « très verbeux », selon les mots de l'évaluateur. Opus 5.5 a généré 260 millions sur le même ensemble. À 10 $ par million de tokens de sortie contre 20 $, le facteur de verbosité d'environ 1,6 laisse tout de même Sonnet 5.5 payer environ 27 % de plus par tâche accomplie.
C'est la partie de la comparaison qu'un tableau de prix par token ne peut pas vous montrer, et c'est la raison pour laquelle les deux chiffres coexistent sans contradiction. Par token, Sonnet 5.5 est deux fois moins cher. Par tâche terminée, sur une suite d'évaluation avec des prompts ouverts et sans discipline de longueur de sortie, il peut être plus cher. Lequel de ces cas décrit votre charge de travail constitue la véritable décision.
Niveaux d'effort, plafonds de sortie et forme de l'intégration
Pour un acheteur, les propriétés importantes sur le plan mécanique sont quasiment identiques entre ces deux modèles.
• Contexte — 1 000 000 de tokens sur les deux, du même fournisseur, donc les hypothèses d’ingénierie de prompt se transposent sans changement
• Sortie maximale — 128 000 tokens sur les deux ; la génération en masse n'est pas un facteur différenciant ici
• Modalité — saisie de texte, d’image et de fichier sur les deux ; aucun des deux n’accepte l’audio ni la vidéo
Contrôle du raisonnement — pensée adaptative sur les deux, avec une profondeur définie par un paramètre d'effort plutôt que par un budget de jetons de réflexion. Sur la Claude Platform, la valeur par défaut est élevée ; dans les Claude apps, elle est moyenne.
• Écriture de cache — 5,00 $ par million pour Claude Opus 5.5 contre 2,50 $ pour Claude Sonnet 5.5, la seule ligne où le modèle le moins cher est aussi le moins cher à alimenter avec un préfixe reconstruit
• Lecture du cache — 0,20 $ par million pour les deux, une égalité parfaite sur la ligne qui domine les longues exécutions d'agents
Parce que les surfaces correspondent, la migration de l’une à l’autre se résume à un changement de chaîne de modèle et à une réévaluation de l’effort, et non à un projet d’intégration. C’est inhabituel d’un fournisseur à l’autre, et c’est la raison pour laquelle ce duo particulier mérite d’être comparé : les deux candidats diffèrent par le prix et par la profondeur, pas par l’API que vous devez écrire.
Une différence opérationnelle mérite une ligne à part. Anthropic indique que Claude Sonnet 5.5 est le premier Sonnet à être lancé avec des garde-fous et des mécanismes de repli en cybersécurité au même niveau que ses modèles haut de gamme, ce qui signifie que les demandes de cybersécurité à risque plus élevé sont visiblement acheminées vers le Sonnet précédent plutôt que traitées par le modèle que vous avez nommé. Si votre charge de travail touche ce domaine, la chaîne de modèle ne garantit pas quel modèle a répondu — et ce, quel que soit le niveau. Anthropic note également que si vous exécutez Sonnet avec la réflexion désactivée, vous devez passer à un comportement entre outils, ce qui constitue une modification du code plutôt qu’un indicateur de configuration. Aucun de ces deux points n’est une raison d’éviter le modèle ; ce sont tous deux des raisons de le savoir avant de livrer.
Sur OrcaRouter, Claude Opus 5.5 est routable dès aujourd'hui avec les mêmes identifiants que tous les autres modèles du catalogue, au prix catalogue du fournisseur avec 0 % de marge, avec un basculement automatique disponible en dessous. Claude Sonnet 5.5 n'est pas encore une route sur notre plateforme — le modèle est âgé d'un jour, et tant qu'il n'est pas répertorié, l'affirmation honnête est que vous y accéderiez via l'API d'Anthropic elle-même. Toute personne qui exécute actuellement Opus 5.5 via nous peut chiffrer le changement le jour où il arrive sans rien changer d'autre à son intégration.
Lequel mettre où ?
La répartition qui découle des chiffres : Claude Sonnet 5.5 pour le travail d'agent lié au terminal, où il est le plus performant des deux sur le score Terminal-Bench 4.0 d'Anthropic et pour moitié prix ; Claude Sonnet 5.5 pour tout ce qui est de nature à privilégier le débit, car l'écart de coût ne se réduit que lorsque la tâche impose de longues sorties ; Claude Opus 5.5 pour le travail de la classe FrontierCode, les refactorisations à long terme sur de grandes bases de code, et toute charge de travail où l'écart de 54,4 % à 46,2 % reflète la forme de votre problème réel plutôt qu'une ligne de classement.
Si vos tâches sont ouvertes et que vous ne pouvez pas prévoir la longueur de la sortie, considérez le prix par token comme étant complètement le mauvais chiffre. Mesurez les tokens par tâche terminée sur votre propre trafic pendant une semaine avant de vous engager dans un sens ou dans l’autre ; le chiffre d’artificial-analysis de 7,60 $ contre 5,98 $ est un avertissement que le modèle bon marché peut perdre sur la métrique que vous payez réellement.
Le verdict honnête : il ne s'agit plus d'un arbitrage entre capacité et coût. C'est une question de savoir si votre travail est borné. Pour les tâches bornées, à fort volume et pilotées par des outils, le modèle moins cher est aussi le meilleur au vu des preuves disponibles, et le modèle phare ne vaut pas le double. Pour le travail ouvert, à long horizon, la phrase d'Anthropic elle-même — selon laquelle Opus 5.5 reste nettement plus fort — est celle à croire, et aucune convergence des benchmarks n'y change rien pour l'instant.



