Une carte principale intitulée « Claude Haiku 5.5 vs Claude Sonnet 5.5 » avec le sous-titre « Six jours et un palier d’écart ». Deux cartes arrondies sont côte à côte : celle de gauche intitulée « Claude Haiku 5.5 » avec des lignes indiquant Indice 43, 0,21 $ par tâche et Sorti le 7 octobre 2026 ; celle de droite intitulée « Claude Sonnet 5.5 » avec des lignes indiquant Indice 56, 7,60 $ par tâche et Sorti le 28 septembre 2026. Entre elles, un badge centré indique « écart de coût mesuré de 36x ». Une ligne de pied de page indique « Coût par tâche et Indice d’intelligence selon Artificial Analysis ; les deux modèles ont un contexte de 1M. »
Guides & Insights

Claude Haiku 5.5 vs Claude Sonnet 5.5 : une grille tarifaire 20x, une facture mesurée 36x

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Claude Haiku 5.5 et Claude Sonnet 5.5se situent à six jours et un palier d’écart dans la même famille, partagent une fenêtre de contexte d’un million de jetons et répondent sur la même forme d’API. Sur la grille tarifaire publiée, le moins cher coûte un cinquième du plus cher dans la fourchette où atterrit la plupart des requêtes. Sur le tableau indépendant Artificial Analysis, l’écart est plus large encore : 0,21 $ pour terminer une tâche de l’Intelligence Index sur Claude Haiku 5.5 contre 7,60 $ sur Claude Sonnet 5.5, pour un Intelligence Index de 43 contre 56. Le signal à l’origine de cet article le formulait ainsi : Claude Haiku 5.5 étant « bien meilleur que GPT-6 Luna » et « proche (ou plus proche) de Sonnet 5.5 ». La première moitié de cela correspond à peu près à ce que montre le comparatif du fournisseur lui-même. La seconde moitié est là où les mesures cessent de concorder avec le marketing, et il vaut la peine de préciser en quoi.

Deux modèles, six jours et un échelon d'écart

Claude Haiku 5.5 est sorti le 7 octobre 2026 sous l'identifiant de modèle claude-haiku-5-5. Il remplace directement Claude Haiku 4.5, accepte du texte et des images en entrée et renvoie du texte, et c'est le premier modèle de la classe Haiku auquel Anthropic attribue un réglage d'effort ajustable — Low, Medium, High, Xhigh et Max, avec medium comme valeur par défaut de l'API. Anthropic le présente comme « le petit modèle le moins cher, le plus rapide et le plus performant que nous ayons jamais publié », et sa note de bas de page nuance cela : il est le plus rapide à la vitesse standard de chaque modèle, mais reste derrière les modèles Opus lorsque ceux-ci tournent en Fast Mode.

Claude Sonnet 5.5 est arrivé six jours plus tôt, le 28 septembre 2026, sous le nom de claude-sonnet-5-5 — le niveau qu'Anthropic présente comme la meilleure combinaison de vitesse et d'intelligence, et celui qu'elle recommande pour le codage agentique complexe. Même fenêtre d'un million de tokens. Contrairement à Claude Haiku 5.5, il n'a pas de palier tarifaire lié à la longueur du prompt, ce qui s'avère compter davantage que les six jours d'avance.

Les deux sont désormais disponibles sur toutes les plateformes, y compris Amazon Web Services, Google Cloud et Microsoft Azure, et tous deux bénéficient d'un engagement de retrait d'au moins un an après leur lancement — le 7 octobre 2027 pour Claude Haiku 5.5, le 28 septembre 2027 pour Claude Sonnet 5.5. Anthropic indique que Claude Sonnet 5.5 est disponible avec une rétention des données nulle, à l'image de Claude Opus 5.5 et Claude Sonnet 5.

La grille tarifaire, recto verso, en un seul endroit.

Par million de jetons, en dollars américains, aux tarifs publiés d'Anthropic :

• Entrée — Claude Haiku 5.5 0,10 $ pour les prompts jusqu'à 100 000 tokens, 0,50 $ au-delà de ce seuil ; Claude Sonnet 5.5 2,00 $ forfaitaire, sans palier.

• Sortie — Claude Haiku 5.5 : 0,50 $ jusqu'à 100 000 jetons, 2,50 $ au-delà ; Claude Sonnet 5.5 : 10,00 $ forfait.

• Lectures de cache — Claude Haiku 5.5 0,01 $ dans la tranche inférieure et 0,05 $ au-dessus ; Claude Sonnet 5.5 0,10 $. Anthropic a réduit de moitié les lectures de cache de Claude Sonnet 5.5, les faisant passer de 0,20 $, en même temps que le lancement de Haiku, et indique que, comme les lectures de cache représentent une part importante de l’utilisation de jetons agentiques, Claude Sonnet 5.5 coûte désormais environ 20 % de moins sur la plupart des travaux agentiques.

• Écritures de cache — Claude Haiku 5.5 : $0.125 pour une écriture de cinq minutes et $0.20 pour une écriture d'une heure dans la tranche inférieure, $0.625 et $1.00 au-dessus ; Claude Sonnet 5.5 : $2.50 pour une écriture de cinq minutes et $4.00 pour une heure.

• Batch — l’API Batch bénéficie d’une réduction de 50 %, à la fois sur l’entrée et sur la sortie. Cela place Claude Haiku 5.5 à 0,05 $ et 0,25 $ sous le seuil des 100 000 jetons, et à 0,25 $ et 1,25 $ au-dessus, Sonnet 5.5 à 1,00 $ et 5,00 $.

Si l'on lit ces lignes, la forme est cohérente : dans la bande inférieure, vous observez un écart de 20x en entrée et un écart de 20x en sortie ; au-dessus de la ligne, 4x et 4x. Le message phare d'Anthropic est « environ 75 % moins coûteux à exécuter » en moyenne par rapport à Claude Haiku 4.5, précisé dans une note de bas de page à 90 % moins cher en dessous de 100 000 tokens et 50 % moins cher au-dessus, avec le changement de tokenizer intégré dans cette moyenne.

L’étape des 100 000 tokens est celle où l’arithmétique bascule.

Deux éléments tirent en sens opposé, et un seul d'entre eux figure sur la grille tarifaire. Les prix chutent fortement face à Claude Haiku 4.5. En parallèle, Claude Haiku 5.5 embarque un tokeniseur mis à jour, semblable à ceux de Claude Sonnet 5.5 et Claude Opus 5.5, dont Anthropic affirme qu'il « utilise légèrement plus de jetons par tâche » — ainsi, une invite identique arrive sous la forme d'un nombre plus élevé de jetons facturables qu'elle ne l'aurait fait sur la génération précédente. La moyenne de 75 % est le résultat net des deux, et c'est un chiffre du fournisseur.

La barre des 100 000 tokens est ce qui surprend les gens. Anthropic facture Claude Haiku 5.5 en fonction de la longueur du prompt : une requête dont le prompt dépasse 100 000 tokens paie les tarifs plus élevés sur l'ensemble de la requête, et pas seulement sur les tokens au-delà du seuil. La longueur du prompt compte tous les tokens d'entrée, y compris les lectures et écritures du cache, et chaque requête est facturée individuellement — une requête longue paie la tranche supérieure même lorsqu'une partie de son prompt est un cache hit, et les requêtes antérieures conservent les tarifs auxquels elles ont été facturées. Un pipeline de récupération qui se situe confortablement à 90 000 tokens paie $0.10 et $0.50. Décalez la fenêtre d'un cran et toute la requête est refacturée à $0.50 et $2.50. Claude Sonnet 5.5 ne fait pas cela, car la fenêtre complète d'un million de tokens est facturée au tarif standard.

Deux conséquences s’ensuivent, qui pointent dans des directions opposées. Premièrement, le basculement auquel on s’attend — un contexte long qui fait du modèle coûteux le modèle le moins cher — ne se produit pas : Claude Haiku 5.5 au-dessus de la ligne reste un quart de Claude Sonnet 5.5 sur la grille tarifaire. Deuxièmement, l’écart sur lequel vous comptiez se réduit de 20x à 4x exactement lorsque votre charge de travail s’alourdit, c’est-à-dire exactement quand les chiffres absolus commencent à compter. Le palier est la raison pour laquelle un pipeline sensible aux coûts a besoin de sa propre ligne budgétaire plutôt que d’un tarif par token.

Ce que chaque fournisseur déclare obtenir comme score

Tout ce qui figure dans cette section est déclaré par le fournisseur et n’a pas été reproduit par un tiers. Anthropic publie le même ensemble de comparaisons sur ses pages Claude Haiku 5.5 et Claude Sonnet 5.5, et là où les deux pages se recoupent, elles concordent :

• GDPval-AA v2.1, travail intellectuel — 1 620 pour Claude Haiku 5.5, contre 1 840 pour Claude Sonnet 5.5, 735 pour Claude Haiku 4.5 et 1 437 pour GPT-6 Luna.

• AA-Briefcase v1.1 — 1 578 pour Claude Haiku 5.5, contre 1 824 pour Claude Sonnet 5.5, 614 pour Claude Haiku 4.5 et 1 336 pour GPT-6 Luna.

• OSWorld 2.1, utilisation d'un ordinateur, sous-ensemble hors ligne — 72,4 % pour Claude Haiku 5.5, contre 83,9 % pour Claude Sonnet 5.5, 15,7 % pour Claude Haiku 4.5 et 48,9 % pour GPT-6 Luna.

• Terminal-Bench 4.0, codage agentique — 39,2 % pour Claude Haiku 5.5, contre 70,6 % pour Claude Sonnet 5.5, 0,0 % pour Claude Haiku 4.5 et 16,4 % pour GPT-6 Luna.

FrontierCode 1.1, Main — 46,4 % pour Claude Haiku 5.5, contre 52,4 % pour Claude Sonnet 5.5 avec un effort Xhigh, 42,4 % pour GPT-6. Anthropic signale également que Claude Sonnet 5.5 obtient un score inférieur avec un effort Max qu’avec un effort Xhigh sur ce test, ce qu’Anthropic attribue à une utilisation accrue d’une compétence de revue de code entraînant des timeouts ou des cas hors périmètre.

• Chartographie, raisonnement visuel sans outils — 46,4 % pour Claude Haiku 5.5, contre 61,6 % pour Claude Sonnet 5.5, 6,4 % pour Claude Haiku 4.5 et 29,1 % pour GPT-6 Luna.

• Humanity's Last Exam — 45,9 % sans outils et 57,4 % avec eux pour Claude Haiku 5.5 ; 64,5 % avec outils pour Claude Sonnet 5.5, 18,7 % pour Claude Haiku 4.5, et 56,9 % sans outils pour Claude Sonnet 5.5 sur la même page. Anthropic note que les chiffres de la famille GPT-6 peuvent être obsolètes, car OpenAI a corrigé un bug de compréhension d’image et que les scores tiers n’avaient pas tous été mis à jour.

Deux de ces lignes méritent d’être lues deux fois. Sur FrontierCode, les deux modèles sont proches — 46,4 % contre 52,1 % — et sur Chartography, où il n’y a pas d’outils derrière lesquels se cacher, l’écart est de 15 points. Terminal-Bench 4.0 n’est pas proche du tout : 39,2 % contre 70,6 % relève d’une autre classe de capacités, c’est pourquoi la page Claude Sonnet 5.5 d’Anthropic pointe toujours vers Claude Sonnet 5.5 et Claude Opus 5.5 pour le codage agentique complexe et présente Claude Haiku 5.5 comme le modèle pour les tâches étroites et à fort volume.

Ce que le conseil indépendant apporte

Les chiffres d’Anthropic comparent ses propres modèles entre eux et à un concurrent. Un classement indépendant confronte les deux à l’ensemble du secteur, et le chiffre qu’il indique, que les fournisseurs n’indiquent pas, est le coût par tâche terminée.

Artificial Analysis attribue à Claude Haiku 5.5 en mode Max effort un Indice d'intelligence de 43, bien au-dessus de la médiane de 13 parmi les modèles comparables, générant 440 M de jetons de sortie sur l'Indice contre une médiane de 100 M — très verbeux — à 0,10 $ en entrée et 0,50 $ en sortie par million, et 242 jetons de sortie par seconde. Son coût mesuré est de 0,21 $ par tâche de l'Indice d'intelligence.

Le même classement attribue à Claude Sonnet 5.5 un score de 56, contre une médiane de 26, générant 410 M de jetons de sortie contre une médiane de 88 M, à 2,00 $ en entrée et 10,00 $ en sortie, avec une remise de 90 % sur le cache. Son coût mesuré est de 7,60 $ par tâche de l’Intelligence Index.

A headless capture of the Artificial Analysis model page for Claude Haiku 5.5 at Max effort, showing the header 'Claude Haiku 5.5 (Max)' with the Anthropic vendor label and release month October 2026, a rank strip reading Intelligence #2/182, Speed #8/182, Cost #46/182 and Verbosity #62/182, the price strip In $0.10, Out $0.50 and $0.21 per task, a Comparison Summary stating an Artificial Analysis Intelligence Index of 43 against a median of 13 with 440M output tokens generated, and an output-token speed of 242 tokens per second described as notably fast. A specification panel confirms a 1M-token context window, reasoning enabled, text and image input and text output.A headless capture of the Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), showing the Anthropic vendor label and release month September 2026, a rank strip reading Intelligence #3/216, Cost #98/216 and Verbosity #102/216, the price strip In $2.00, Out $10.00, a 90% cache discount and $7.60 per task, a Comparison Summary stating an Intelligence Index of 56 against a median of 26 with 410M output tokens generated against a median of 88M, and a specification panel showing a 1M-token context window and text and image input.

Mettez ces deux lignes côte à côte, et le ratio raconte tout. 0,21 $ contre 7,60 $, c'est un peu plus de 36x, et les deux modèles sont quasiment à égalité sur la verbosité — 440 M de jetons de sortie contre 410 M — donc ce multiplicateur est presque entièrement le fait de la grille tarifaire qui fait exactement ce qu'elle annonce. Sur la grille tarifaire du fournisseur lui-même, la même comparaison donne 20x. Le surplus vient de ce qu'un prix au jeton ne peut pas montrer : le modèle moins cher parvient à sa réponse avec moins de jetons facturés par tâche à ce niveau d'effort, et les lectures de cache sont facturées à un dixième du tarif de Claude Sonnet 5.5. Même harnais, mêmes tâches, mesurés de façon indépendante.

A generated two-column comparison scoreboard titled 'Claude Haiku 5.5 vs Claude Sonnet 5.5 - the scoreboard'. The left column, headed Claude Haiku 5.5, reads AA Intelligence Index: 43; Cost per Index task: $0.21; Input / output per 1M: $0.10 / $0.50; Output speed: 242 tok/s; Context window: 1M; Terminal-Bench 4.0: 39.2%. The right column, headed Claude Sonnet 5.5, reads AA Intelligence Index: 56; Cost per Index task: $7.60; Input / output per 1M: $2.00 / $10.00; Output speed: not published; Context window: 1M; Terminal-Bench 4.0: 70.6%. A footer line reads 'Index, cost per task and speed per Artificial Analysis; Terminal-Bench vendor-reported.'

Où l’offre économique s’épuise réellement

Les chiffres clients publiés par Anthropic déterminent la répartition plus souvent que les benchmarks, et ils vont tous dans le même sens. Asana rapporte une latence inférieure de plus de 30 % sur l'achèvement des tâches et une inférence jusqu'à 2,5 fois plus rapide par tour d'agent. Box rapporte un score supérieur de 11 points à celui de Claude Haiku 4.5 pour environ la moitié de la latence. HubSpot rapporte le meilleur score qu'il ait observé sur sa propre suite, 92,8 % en moyenne sur trois exécutions, avec le taux de réussite le plus élevé et le taux de faux positifs le plus faible. AlphaSense effectue environ 8 millions d'appels par semaine via « Ask in Document » et rapporte une amélioration statistiquement significative par rapport à Claude Haiku 4.5, 0,84 contre 0,76. Cognition rapporte qu'avec Claude Haiku 5.5 comme acolyte, son agent Fusion obtient un score FrontierCode de 66,2.

Aucun d'entre eux n'est un agent à long horizon. Ce sont des solutions ponctuelles — une étape bien définie, de plus en plus rapide et de moins en moins coûteuse. C'est le profil pour lequel Claude Haiku 5.5 est conçu, et c'est aussi le profil où l'avantage de coût de 36x représente de l'argent réel plutôt qu'une erreur d'arrondi. L'avantage s'accroît avec le volume d'appels et s'évapore avec la profondeur des appels : cent mille appels de classification par jour à 0,10 $ en entrée et 0,50 $ en sortie constituent une ligne budgétaire dont on remarque la disparition, tandis que cent tours d'agent par session, chacun relisant le contexte accumulé, constituent une ligne budgétaire qui croît de façon superlinéaire, car chaque tour au-delà du seuil paie la tranche supérieure.

Le contre-argument de Claude Sonnet 5.5 est le coût par tentative plutôt que le coût par token. Anthropic affirme qu’il s’exécute au moins 30 % plus vite que Claude Sonnet 5 et coûte jusqu’à 30 % de moins pour la plupart des tâches, l’économie venant du fait qu’il nécessite moins de tokens plutôt que de tarifs inférieurs. Des testeurs tiers avancent des chiffres : Slack rapporte environ 14 % de tokens de sortie en moins, Balyasny environ 121 k tokens par réponse contre 497 k, Box 2,4 fois plus rapide avec 12 % de tokens en moins, Lovable environ un tiers d’appels d’outils en moins et environ la moitié des exécutions shell, Atlassian jusqu’à 30 % plus rapide pour Rovo Agents, et Base44 3,6 itérations par build contre 7,7 pour Claude Opus 5. Un tour qui aboutit vaut mieux que quatre qui n’aboutissent pas.

Un troisième facteur joue en sens inverse. Anthropic a fait passer l'effort à un réglage au niveau du modèle sur cette génération — le paramètre d'effort de Claude Haiku 5.5 est défini une fois par requête plutôt que dimensionné comme un budget de réflexion par requête, et l'ancien budget_tokens mode est obsolète sur les modèles 4.6 et n'est pas accepté sur les suivants. Pour une flotte qui appelle un même identifiant de modèle depuis de nombreux services, c'est une simplification. Pour tout ce qui dimensionnait son propre raisonnement à chaque appel, c'est une réécriture.

Exécuter les deux derrière un seul point de terminaison

Si cette décision mérite d'être bien prise, c'est parce que se tromper sur la moitié de celle-ci coûte cher à défaire : faire passer un chemin de production d'un ID de modèle à un autre oblige à toucher chaque site d'appel qui présupposait le comportement de l'ancien. Pour déterminer à quel palier une charge de travail appartient, le moyen le moins coûteux consiste à exécuter les deux derrière un même point de terminaison et à déplacer le trafic entre eux par configuration plutôt que par refactorisation.

C'est à cela que sert OrcaRouter. Claude Sonnet 5.5 figure au catalogue sous anthropic/claude-sonnet-5.5, aux côtés de Claude Sonnet 5, Claude Opus 5.5 et Claude Haiku 4.5 — le palier Haiku plus ancien reste disponible comme point de référence pendant que vous vous en détachez. La plateforme répercute le prix catalogue du fournisseur sans aucune marge, donc les 2,00 $ et 10,00 $ ci-dessus sont les tarifs que vous payez, et l'inverse est vrai aussi : lorsqu'un fournisseur change ses prix, le nouveau tarif est en ligne ici le jour même, et c'est ainsi que la baisse du prix de lecture du cache de Claude Sonnet 5.5 nous est parvenue. Deux fonctionnalités font le travail qu'exige cette décision précise. Le basculement automatique maintient un modèle que vous évaluez encore à l'écart de votre chemin critique de lui-même, et le DSL de routage vous permet d'envoyer les appels de moins de 100 000 tokens vers le palier bon marché et de confier ceux à contexte long ou à horizon long au palier plus cher dans le même flux de requêtes, sans second contrat ni second SDK.

Pour être précis sur ce qui est hébergé et ce qui ne l'est pas : Claude Sonnet 5.5 peut être routé via nous dès aujourd'hui. Claude Haiku 5.5 n'est pas encore au catalogue. En attendant, il est hébergé sur l'API d'Anthropic elle-même et les trois plateformes cloud listées ci-dessus.

Comment décider

Choisissez Claude Haiku 5.5 lorsque la tâche est étroite, à fort volume et vérifiable — classification, extraction, routage, résumé, le travail à chaque tour au sein d'un agent que vous avez déjà construit. L'écart de tarif de 20x est tout l'intérêt ici, le palier de 100 000 jetons est évitable par conception, et le coût de 0,21 $ par tâche mesuré indépendamment prouve que l'avantage tient en dehors du propre laboratoire du fournisseur. Réglez le curseur d'effort par classe de tâche plutôt que de le laisser sur la valeur par défaut ; sur un modèle de la classe Haiku, la différence entre Low et Max est un multiplicateur de coût, non une préférence de qualité.

Choisissez Claude Sonnet 5.5 lorsque la tâche est à long horizon, agentique ou non vérifiable — du code qui doit compiler, de l’utilisation d’ordinateur qui doit laisser l’écran dans un état connu, tout ce pour quoi une mauvaise réponse coûte plus cher que l’appel. Terminal-Bench 4.0 à 70,6 % contre 39,2 % n’est pas une nuance, c’est une classe de capacité différente, et la grille tarifaire forfaitaire signifie qu’un long contexte ne revoit pas silencieusement le prix de toute la requête. Si votre charge de travail se situe véritablement entre les deux, la réponse honnête est qu’aucun des deux modèles ne dispose encore d’un large corpus de reproduction par des tiers, que les scores d’indice proviennent d’un seul banc d’essai, et que les chiffres du fournisseur cités ci-dessus sont ceux du fournisseur lui-même.

Qu’est-ce qui changerait cette réponse ?

Trois choses méritent d'être surveillées, et aucune d'elles n'est une sortie de benchmark. La première est de savoir si des évaluations indépendantes de Claude Haiku 5.5 aux niveaux d'effort Low, High et Xhigh — pas seulement Max — montrent le même ratio coût par tâche, car le curseur d'effort est le levier le moins coûteux de la comparaison et le moins mesuré. La deuxième est de savoir si le palier de 100 000 tokens survit ; une troisième tranche, ou aucune tranche du tout sur la prochaine génération, changerait l'arithmétique pour chaque pipeline de récupération au niveau de la ligne plus que n'importe quel score de benchmark isolé. La troisième est le tokeniseur. Si un checkpoint ultérieur tokenise le même texte à l'ancien taux, la moyenne de 75 % d'Anthropic devient un plancher plutôt qu'un objectif, et l'écart avec Claude Sonnet 5.5 se creuse sans qu'aucun des deux prix ne bouge.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement