Une carte de titre pour Claude Sonnet 5.5 intitulée « même prix, moins de travail », avec pour sous-titre « 2 $ / 10 $ par million de jetons, inchangé par rapport à Sonnet 5 », et trois cartes de statistiques affichant 56 (indice d’intelligence AA), n° 3 / 216 (classement sur cet indice) et 7,60 $ (coût par tâche à effort maximal).
Guides & Insights

Claude Sonnet 5.5 : l'affirmation d'une réduction de coût de 30 %, et les six changements qui cassent le code de Sonnet 5

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Claude Sonnet 5.5 est sorti le 28 septembre 2026 à exactement les mêmes tarifs que Claude Sonnet 5 — 2 $ par million de jetons d'entrée, 10 $ par million de jetons de sortie, 0,20 $ par million de lectures mises en cache — tandis que l'annonce d'Anthro​pic met en avant « court 30 % plus vite et coûte jusqu'à 30 % de moins pour la plupart des tâches ». Les deux affirmations sont vraies, et l'écart entre elles, c'est toute l'histoire. Les économies ne se trouvent pas dans la grille tarifaire, parce que la grille tarifaire n'a pas bougé. Elles viennent du fait d'exécuter le modèle à un niveau d'effort inférieur à celui dont son prédécesseur avait besoin, ce qui signifie que le chiffre de 30 % est une affirmation sur un point de fonctionnement que vous devez choisir, et non un prix que vous héritez. Une mesure indépendante rend la bifurcation nette : sur Artificial Analysis, Claude Sonnet 5.5 à effort maximal coûte 7,60 $ par tâche sur l'Intelligence Index, contre 5,09 $ pour Claude Sonnet 5 à effort maximal — soit environ 49 % de plus, et non 30 % de moins. Ce n'est pas une contradiction du chiffre d'Anthro​pic. C'est l'autre extrémité de la même courbe, et c'est là que la plupart des migrations aboutiront par défaut si personne ne refait son balayage des niveaux d'effort.

Deux affirmations sous un même numéro

L’article d’Anthropic formule l’affirmation par tâche à trois endroits, et chacune s’appuie sur le niveau d’effort. La version la plus forte : sur Terminal-Bench 4.0, au niveau d’effort Medium — la valeur par défaut dans les applications Claude — Sonnet 5.5 « dépasse largement le meilleur score de Sonnet 5 pour moins d’un dixième du coût par tâche. » Sur AA-Briefcase v1.1, au niveau d’effort Medium, il bat le meilleur de Sonnet 5 pour environ un neuvième du coût. Sur CursorBench 4.0, au niveau d’effort Low, il dépasse le meilleur de Sonnet 5 pour moins d’un dixième.

Lisez-les comme un ensemble et le mécanisme est évident. Le plancher de Sonnet 5.5 se situe au-dessus du plafond de Sonnet 5 sur plusieurs évaluations. Vous n’obtenez pas les 30 % en payant moins par token ; vous les obtenez en n’ayant plus besoin du réglage coûteux. Anthropic le dit dans la documentation de migration, à une page du marketing : « Les niveaux d’effort sont recalibrés. Un niveau d’effort ne produit pas la même quantité de réflexion qu’il n’en produisait sur Claude Sonnet 5. Relancez votre balayage des niveaux d’effort plutôt que de reconduire un réglage. »

Cette phrase est la ligne la plus importante sur le plan opérationnel qu'Anthropic ait publiée cette semaine, et c'est celle qui n'a pas trouvé sa place dans la plupart des articles consacrés au lancement.

Ce qu'Anthropic a publié — rapporté par le fournisseur, non reproduit

Tout dans cette section provient des propres mesures d’Anthropic, issues de l’annonce de Sonnet 5.5 et de sa fiche système. Il s’agit d’une affirmation de fournisseur, et non d’un résultat indépendant, et la trace des notes de bas de page importe autant que les chiffres mis en avant.

• Terminal-Bench 4.0 (codage agentique) — Sonnet 5.5 70,6 % contre Sonnet 5 10,3 %. C'est un bond d'un facteur sept sur la ligne la plus citée, et c'est le chiffre que la plupart des articles ont mis en avant.

• FrontierCode 1.1 (Main) — Sonnet 5.5 52,1 % à Xhigh et 46,2 % à Max ; Sonnet 5 42,4 % ; Claude Opus 5.5 54,4 % ; GPT-6 Sol 49,3 %. Notez l'inversion : Sonnet 5.5 obtient un score plus faible à Max qu'à Xhigh.

• CursorBench 4.0 — 55,5 % pour Sonnet 5.5 contre 34,1 % pour Sonnet 5 et 57,8 % pour Opus 5.5. CursorBench 4.0 ne communique pas publiquement les résultats de GPT-6 Sol.

• GDPval-AA v2.1 (travail intellectuel) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.

• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 sur les quatre mêmes modèles.

• Humanity's Last Exam (avec outils) — 64,5 % / 54,9 % / 67,7 %.

• OSWorld 2.1 (utilisation d'un ordinateur, crédit partiel) — 80,1 % / 57,0 % / 81,8 %.

• Chartographie (reconnaissance visuelle de graphiques, sans outils) — 61,6 % / 15,6 % / 64,4 % / 53,6 %.

Trois notes de bas de page méritent de voyager avec ces lignes plutôt que de figurer en dessous. Premièrement, le chiffre de 66,4 % d'Opus 5.5 sur Terminal-Bench 4.0 est rapporté pour un effort Xhigh, la configuration la plus performante d'Opus 5.5. Deuxièmement, l'inversion de FrontierCode Max s'explique : en mode Max, Sonnet 5.5 exécutait plus souvent la compétence de revue de code de Claude Code, qui répartit la revue entre de nombreux sous-agents, et dans deux cas, cela a produit un dépassement de délai ou des modifications au-delà du périmètre de la tâche — FrontierCode pénalise les modifications hors périmètre, même lorsqu'elles sont bonnes. Troisièmement, et c'est le point le plus inconfortable pour le fournisseur, Artificial Analysis a exécuté GDPval-AA et AA-Briefcase sur un déploiement préliminaire de Sonnet 5.5 dont Anthropic affirme qu'il comportait un bug dégradant les réponses aux requêtes de sortie structurée. Anthropic s'attend à ce que l'effet soit faible et qu'il sous-évalue Sonnet 5.5, et affirme que le bug est corrigé. Elle note également qu'OpenAI a récemment corrigé un bug de compréhension d'images dans GPT-6 Sol, de sorte que les chiffres de GPT-6 Sol figurant dans ces lignes pourraient ne pas encore refléter le modèle actuel.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56 at rank #3 of 216, $2.00 input and $10.00 output per 1M tokens, and a $7.60 average cost per index task with 410M tokens generated.

Ce que dit l’exécution indépendante à propos du même modèle

Artificial Analysis a mesuré Sonnet 5.5, et sa page indique la configuration exacte : « Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback) ». Sur la même révision de l’index, 216 modèles dans la classe :

• Claude Sonnet 5.5 — Indice d'intelligence 56, classé n°3 sur 216. Coût de 7,60 $ par tâche d'indice. Il a généré 410 M de tokens de sortie pendant l'exécution de l'indice, contre une médiane de 88 M.

• Claude Sonnet 5 — Indice 38, classé n°58 sur 216, sur sa propre page intitulée « (Raisonnement adaptatif, effort maximal) ». 5,09 $ de coût par tâche. 370 M de jetons de sortie.

• Claude Opus 5.5 — Indice 58, classé n°1 sur 216. 5,98 $ par tâche. 95,3 jetons de sortie par seconde.

• GPT-6 Sol — Index 48, classé 20e sur 216, au tarif catalogue de 2 $/10 $. 1,06 $ par tâche, 89,8 jetons de sortie par seconde.

L'écart de l'Intelligence Index — 56 contre 38, dix-huit points — est la confirmation indépendante la plus solide de cet article, et c'est le chiffre que le lecteur devrait réellement retenir. Le chiffre de coût, lui, est celui qui appelle une mise en garde, et il vaut la peine de le formuler précisément : les deux points correspondent à des configurations en effort maximal, et l'effort maximal sur un modèle qui raisonne plus longtemps est une position délibérément coûteuse. Sonnet 5.5 a brûlé 410 M de tokens lors de l'exécution sur l'index, là où Sonnet 5 en a brûlé 370 M, et tous deux sont très au-dessus de la médiane de 88 M. Un modèle qui réfléchit plus longtemps au réglage le plus élevé coûte plus cher au réglage le plus élevé. Ce que ce chiffre réfute, ce n'est pas « moins cher par tâche », mais toute lecture qui y verrait une propriété du modèle plutôt que du réglage.

Artificial Analysis n'a pas encore publié de chiffre de vitesse de sortie pour Sonnet 5.5 — sa page indique N/A pour les tokens de sortie par seconde, contre 78,7 pour Sonnet 5 et 95,3 pour Opus 5.5. Ainsi, la partie « 30 %+ plus rapide » de l'affirmation d'Anthropic n'est, à ce stade, rapportée que par le fournisseur. Considérez-la comme indicative jusqu'à ce qu'un tiers la mesure.

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Sonnet 5 - the cost-per-task fork'. The left column, Claude Sonnet 5.5, reads AA Intelligence Index 56, rank #3 of 216, cost per task at max effort $7.60, 410M output tokens on the index run, $2 / $10 input and output price, default effort high. The right column, Claude Sonnet 5, reads 38, #58 of 216, $5.09, 370M, $2 / $10, high.

D'où proviennent réellement les économies, et comment les obtenir

Si vous acceptez le mécanisme, les instructions de migration s'écrivent d'elles-mêmes, et Anthropic les a publiées :

• Commencez par high par défaut, et non selon ce qu'indiquait votre configuration de Sonnet 5. Les recommandations d'Anthropic préconisent high, sauf si votre charge de travail est agentique ou sensible à la latence.

• Codage agentique et utilisation d'outils à plusieurs étapes — commencez au niveau moyen pour les tâches bien spécifiées, puis passez au niveau élevé pour les tâches plus difficiles ou plus longues.

• Chat et autres tâches sensibles à la latence — commencez à moyen ou faible. C’est la plage où se trouvent les affirmations de « dixième du coût ».

Il existe une explication cohérente expliquant pourquoi le réglage plus bas fonctionne, et ce n’est pas du marketing. Les premiers testeurs d’Anthropic ont rapporté que Sonnet 5.5 regroupe davantage les appels d’outils que ne le faisait Sonnet 5, ce qui produit moins d’étapes par tâche. La note de CodeRabbit dans l’annonce est inhabituellement précise pour une citation de lancement : la « tendance à recourir trop souvent à la recherche web et la consommation élevée de tokens » de Sonnet 5 « ont toutes deux disparu dans ce nouveau modèle ». Sonnet 5.5 a également conservé le même tokenizer que Sonnet 5, donc un texte identique coûte le même nombre de tokens — la réduction vient de moins de tours et de moins d’appels redondants, pas d’un vocabulaire moins coûteux. Cela signifie aussi que les nombres de tokens dans vos journaux restent comparables après la mise à niveau, ce qui rend la mesure avant/après simple.

Les six changements qui cassent ou modifient le code de Sonnet 5

C'est la partie de la version qui coûte du temps d'ingénierie, et c'est là que le guide de migration vaut plus que le graphique de benchmark. Cinq des six renvoient des erreurs franches ; le sixième échoue silencieusement.

• thinking: {"type": "disabled"} renvoie désormais une erreur 400. Le remplacement est thinking: {"type": "between_tools"}, qui désactive la réflexion en amont et constitue le réglage de réflexion le plus bas sur ce modèle. Il fonctionne avec un effort faible, moyen ou élevé, ne nécessite aucun en-tête bêta et est disponible sur toutes les plateformes servant Sonnet 5.5. À un effort xhigh ou max, between_tools renvoie lui-même une erreur 400 — utilisez la réflexion adaptative (omettez le champ ou envoyez {"type": "adaptive"}) si vous avez besoin de ces niveaux. Avec between_tools, vous ne pouvez pas non plus modifier l'effort en cours de conversation.

• L'utilisation forcée d'un outil n'est pas prise en charge. tool_choice défini sur {"type": "any"} ou {"type": "tool", "name": "..."} renvoie une erreur 400 avec le message « tool_choice: type 'tool' and 'any' are not supported for this model. ». Le même contrôle s'applique au point de terminaison de comptage de jetons. Le remplacement documenté pour une entrée valide selon le schéma est tool_choice: {"type": "auto"} accompagné de strict: true sur l'outil, ou le déplacement du schéma vers les sorties structurées.

• Les blocs de réflexion sont liés au modèle et à la conversation. Sonnet 5.5 lit les blocs de réflexion de Sonnet 5, Opus 4.8, Haiku 4.5 et versions antérieures — mais pas d'Opus 5, d'Opus 5.5, ni d'aucun modèle Fable ou Mythos. Aucun autre modèle ne lit les blocs de Sonnet 5.5. Déplacez une conversation de Sonnet 5 vers 5.5 et le raisonnement est conservé ; déplacez-la de Sonnet 5.5 vers autre chose et les tours suivants s'exécutent sans lui. Par ailleurs, l'API vérifie désormais si le prompt système, la liste d'outils ou un message antérieur a changé depuis qu'un bloc de réflexion a été produit, et sur les comptes créés le 31 août 2026 ou après, elle renvoie un 400 lorsque c'est le cas. Conservez les conversations en mode ajout uniquement, ou envoyez l'en-tête bêta thinking-binding-controls-2026-08-01 avec prefix_mismatch_behavior: "drop_block".

• computer_20251124 est rejeté sur l'API Claude et Google Cloud. L'utilisation d'un ordinateur y nécessite le toolset computer_toolset_20260801. Amazon Bedrock accepte toujours l'ancien outil — une divergence entre plateformes qu'il vaut la peine de signaler si vous exécutez le même agent sur les deux.

• Certains appariements de conseillers ont disparu. Un exécuteur Sonnet 5.5 accepte Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 ou Sonnet 5.5 lui-même comme conseiller. Les conseillers Opus 4.8, Opus 4.7 et Sonnet 5, qui fonctionnent avec un exécuteur Sonnet 5, renvoient une erreur 400 avec un exécuteur Sonnet 5.5. Tous les conseillers acceptés par Sonnet 5.5 renvoient des conseils chiffrés, de sorte que votre client ne peut pas lire le texte des conseils.

• Le texte entre les appels d’outils arrive désormais à l’intérieur de blocs de réflexion — et avec la valeur d’affichage par défaut « omitted », il est vide. C’est le cas silencieux. Les notes plus longues qu’une phrase ou deux entre les appels d’outils reviennent sous forme de blocs de réflexion de mise à jour de progression plutôt que de texte. Une application qui diffuse cette narration à ses utilisateurs devient silencieuse entre les appels d’outils, sans erreur et sans rien dans les journaux. Le correctif consiste soit à définir thinking.display pour que le texte soit renvoyé, soit à passer à between_tools, auquel cas le texte revient sous forme de texte ordinaire.

Deux autres éléments qu'une migration touche, sans qu'il s'agisse d'une erreur pour autant. La surveillance des refus : Sonnet 5.5 renvoie stop_reason: "refusal" avec un objet stop_details nommant l'un des cinq domaines de politique — cyber, bio, frontier_llm, reasoning_extraction, general_harms — et le repli côté serveur d'Anthropic réessaiera les refus cyber et frontier_llm sur Sonnet 5, mais pas les trois autres. Et la posture de sécurité a réellement changé : Sonnet 5.5 est le premier modèle Sonnet livré avec des garde-fous cyber et des mécanismes de repli comme la classe Opus, ce qui signifie que les requêtes de cybersécurité à risque élevé basculent visiblement vers Sonnet 5, et le premier Sonnet doté de classificateurs contre l'extraction de raisonnement. Si la proposition de valeur de votre produit est un outil de sécurité, testez cette limite avant de déployer le changement de modèle.

Tarification, et ce qui se trouve réellement sur notre route aujourd’hui

La grille tarifaire est inchangée depuis Sonnet 5 et sa forme complète publiée est assez courte pour être énoncée simplement :

• Entrée — 2,00 $ par million de tokens. Sortie — 10,00 $ par million de tokens. Les deux identiques à Sonnet 5, confirmés sur la page du modèle Sonnet 5.5 d'Anthropic.

• Lecture du cache — 0,20 $ par million, une réduction de 90 % sur l'entrée ; Écriture de cache de 5 minutes 2,50 $ par million ; Écriture de cache de 1 heure 4,00 $ par million. L'invite minimale pouvant être mise en cache est de 512 jetons sur Sonnet 5.5, contre 1 024 sur Sonnet 5.

• Batch — 50 % de réduction dans les deux sens, soit 1,00 $ / 5,00 $ par million. Sur l'API Message Batches, la sortie peut atteindre 300 K tokens avec l'en-tête bêta output-300k-2026-03-24.

• Face à Opus 5.5 — Sonnet 5.5 coûte exactement la moitié : 2 $/10 $ contre 4 $/20 $, avec des écritures de cache à moitié prix et des lectures de cache identiques à 0,20 $. C'est la migration qui est rentable, et Anthropic le dit sans détour : les deux modèles se complètent au mieux lorsque Sonnet fonctionne à effort réduit, et Opus « reste nettement plus fort sur les tâches complexes et ouvertes exigeant un jugement soutenu. »

• Contexte et sortie — contexte de 1 M de tokens, sortie maximale de 128 K, réflexion adaptative activée par défaut, effort par défaut élevé, date limite de connaissances fiable : juin 2026, rétention nulle des données disponible, retrait pas avant le 28 septembre 2027.

Une note de disponibilité que nous préférons préciser plutôt que sous-entendre : Claude Sonnet 5.5 ne figure pas dans notre catalogue de modèles au 29 septembre 2026. Son prédécesseur anthropic/claude-sonnet-5 et son grand frère anthropic/claude-opus-5.5 y figurent tous les deux, et ses tarifs de notre côté sont ceux du fournisseur lui-même — 2,00 $ en entrée, 10,00 $ en sortie, 0,20 $ en lecture de cache, 2,50 $ en écriture de cache pour Sonnet 5, sans aucune marge ajoutée, de sorte qu'un changement de prix du fournisseur est appliqué ici le jour même où il intervient, et non lors du cycle de facturation suivant. C'est cette dernière propriété qui fait d'une lecture de grille tarifaire quelque chose d'utile plutôt que de décoratif.

OrcaRouter model page for anthropic/claude-sonnet-5, attributed to Anthropic and dated 2026-06-30, showing a 1M-token context window, up to 128K output tokens, and the unchanged rates of $2.00 per million input tokens and $10.00 per million output tokens. The page carries a link reading 'the Claude Sonnet 5 API'.

Ce que vous pouvez faire avec ceci aujourd'hui

La séquence honnête pour une équipe qui exécute déjà Claude Sonnet 5 en production comporte trois étapes, et aucune d’elles n’est « remplacer la chaîne du modèle et regarder le graphe ».

Premièrement, relancez le balayage des niveaux d'effort. Si vous avez conservé un réglage high ou max depuis Sonnet 5 parce que c'est ce qu'exigeait votre seuil de qualité, vous payez désormais pour un raisonnement que vous n'avez plus besoin d'acheter. Les chiffres indépendants de coût par tâche indiquent que le haut de l'échelle est devenu plus cher, et non moins cher, et les propres affirmations de coût du fournisseur décrivent toutes le milieu de l'échelle. Deuxièmement, corrigez les deux chemins d'erreur avant le déploiement — la réflexion désactivée et l'utilisation forcée d'outils — car tous deux échouent bruyamment et immédiatement, ce qui est la bonne nouvelle. Troisièmement, surveillez le chemin de narration, car il échoue silencieusement.

Si le modèle n’est pas encore sur la route que vous utilisez, la façon la moins risquée de l’évaluer est de le faire tourner en parallèle, et non à la place : gardez Sonnet 5 épinglé comme solution de repli sur la même clé afin qu’un refus, un délai d’attente ou une mauvaise évaluation renvoie la requête vers le modèle auquel vous faites déjà confiance, et le basculement automatique ferme la boucle sans une seconde intégration. C’est tout l’argument en faveur de l’évaluation d’un modèle non éprouvé derrière un point de terminaison plutôt que devant vos utilisateurs — et il s’applique doublement ici, car les catégories de refus de Sonnet 5.5 sont nouvelles et son calibrage d’effort n’est explicitement pas le même que celui de son prédécesseur. Lorsque vous serez prêt à changer la valeur par défaut, le catalogue sur une seule clé s’étend à plus de 200 modèles, ce qui fait de la comparaison un simple changement de configuration plutôt qu’un second contrat.

Que regarder

Trois éléments permettront de répondre aux questions en suspens dans cet article, et aucun d'entre eux ne s'est encore produit.

Une mesure indépendante de la vitesse de sortie est la première. Anthropic revendique une vitesse supérieure de plus de 30 % à celle de Sonnet 5 ; Artificial Analysis n'a pas publié de chiffre pour Sonnet 5.5, et cette affirmation joue un rôle réel dans l'argumentaire de coût, car un modèle plus rapide termine la même tâche en moins de temps réel et souvent en moins de tokens. Claude Haiku 5.5 est le deuxième — Anthropic dit qu'il arrive « dans les prochaines semaines » et qu'il se situera sous Sonnet 5.5, ce qui change le calcul pour le segment de chat à fort volume où les efforts moyens et faibles rendent déjà Sonnet 5.5 compétitif. Le troisième est la passe de correction : Artificial Analysis a exécuté GDPval-AA et AA-Briefcase sur une version préliminaire avec un bug de sortie structurée, Anthropic s'attend à ce que ces scores sous-estiment le modèle, et aucun des deux chiffres n'a été recalculé. S'ils augmentent, l'écart de travail intellectuel par rapport à Opus 5.5 se réduit encore et l'argument du « moitié prix » se renforce.

D'ici là, le résumé défendable est plus étroit que l'annonce et plus utile que le graphique de référence. Claude Sonnet 5.5 représente un gain d'intelligence de dix-huit points par rapport à Sonnet 5 sur l'indice indépendant, aux mêmes tarifs publiés, avec une économie réelle et mesurable à la disposition de quiconque descend d'un cran sur l'échelle d'effort — et une pénalité réelle et mesurable pour quiconque ne le fait pas.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement