
Claude Haiku 5.5 vs Claude Haiku 4.5 : une réduction de prix de 90 % n'est pas une économie de 90 %
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Claude Haiku 5.5 coûte 0,10 $ par million de jetons d'entrée et 0,50 $ par million de jetons de sortie pour les invites allant jusqu'à 100 000. Claude Haiku 4.5 coûte 1 $ et 5 $, en tarif fixe, pour toute la fenêtre de 200 000 jetons qu'il a toujours eue. Anthropic situe l'écart à « 90 % de moins » dans une note de bas de page et à « environ 75 % moins cher à exécuter » dans la phrase juste au-dessus — et les onze mois qui séparent les deux modèles correspondent exactement à la distance entre ces deux chiffres.
Ce n’est pas un tour de passe-passe marketing. C’est la forme honnête d’une génération de modèles qui a changé son tokeniseur, son mode de réflexion par défaut et sa fenêtre de contexte en même temps que son prix, et cela signifie que quiconque remplace l’identifiant du modèle et s’attend à ce que la facture soit divisée par dix sera déçu par l’arithmétique plutôt que par le produit.
Les deux modèles, tels qu'expédiés
Tout ce qui suit est indiqué pour un million de jetons, en dollars américains, et provient de la documentation de tarification et de modèles d'Anthropic elle-même, consultée le 2026-10-08, sauf indication contraire.

• Entrée — Claude Haiku 5.5 : 0,10 $ jusqu’à 100 000 tokens, 0,50 $ au-delà ; Claude Haiku 4.5 : 1,00 $ quelle que soit la longueur.
• Sortie — Claude Haiku 5.5 0,50 $ jusqu'à 100 000 tokens, 2,50 $ au-delà ; Claude Haiku 4.5 5,00 $ quelle que soit la longueur.
• Lectures du cache — Claude Haiku 5.5 0,01 $ jusqu'à 100 000 tokens et 0,05 $ au-delà ; Claude Haiku 4.5 0,10 $. Écritures du cache — 0,125 $ et 0,625 $ contre 1,25 $.
• Contexte — 1 M de tokens contre 200 000. Sortie maximale — 128 000 tokens contre 64 000.
• Thinking — Claude Haiku 5.5 est adaptatif et activé par défaut, avec un réglage d'effort par défaut sur moyen ; Claude Haiku 4.5 reprend l'ancienne forme manuelle et n'a aucun paramètre d'effort.
• Score indépendant — l'Artificial Analysis Intelligence Index v4.3.2 place Claude Haiku 5.5 (Max) à 43,40, deuxième sur 182 modèles, et Claude 4.5 Haiku à 16,88, trentième sur 61 — l'évaluateur signalant que le score de 4.5 est estimé.
• Vitesse — la même source mesure 242 jetons de sortie par seconde pour Claude Haiku 5.5, contre 89,7 pour la génération 4.5, le seul domaine où l'ancien modèle semble encore à l'aise.
Là où le récit du dixième du prix s'effondre
Trois choses rognent sur la part, et seule la première d’entre elles est l’avertissement propre à Anthropic.
Le tokenizer est le point crucial. Claude Haiku 5.5 utilise le tokenizer plus récent introduit avec Claude 4.7, et la documentation d'Anthropic indique que le même texte « compte environ 30 % de tokens en plus que sur Claude Haiku 4.5 ». Vous ne payez pas un dixième du tarif sur le même nombre de tokens ; vous payez un dixième du tarif sur environ 1,3 fois plus de tokens. Le guide de migration du fournisseur en fait le deuxième point de sa checklist, avant toute modification de code : recomptez vos prompts, puis revoyez max_tokens et vos estimations de coûts.
Les tokens de réflexion sont facturés comme des tokens de sortie, et Claude Haiku 5.5 réfléchit par défaut. La page de lancement d'Anthropic indique explicitement que le modèle est « très verbeux » à lui seul sur les graphiques, et la mesure indépendante le confirme plus nettement que le fournisseur : en évaluant l'Intelligence Index, Artificial Analysis a enregistré 440 millions de tokens de sortie de Claude Haiku 5.5, contre une médiane de 100 millions, tous modèles confondus, et a signalé le modèle comme très verbeux. Un tarif d'entrée bon marché n'aide pas une charge de travail dont la facture est majoritairement composée de sortie.
Le palier des 100 000 tokens est le troisième. Au-dessus, les tarifs sont de 0,50 $ et 2,50 $ — la moitié de ce que facturait Claude Haiku 4.5, pour la même requête, ce qui est une bonne affaire et n'est pas l'affaire dont la plupart des lecteurs auront entendu parler. Anthropic affirme que les prompts sous le seuil représentaient environ 90 % des requêtes adressées au précédent modèle Haiku, ce qui est le chiffre qui rend la baisse tenable comme gros titre ; c'est aussi la répartition du trafic du fournisseur lui-même, pas la vôtre.

Ce que le même travail coûte aux deux modèles
Le coût par tâche terminée est la métrique qui survit aux trois effets ci-dessus, car elle facture au modèle tout ce qu’il a émis, et pas seulement ce que vous lui avez envoyé.
Artificial Analysis situe Claude Haiku 5.5 (Max) à 0,21 $ par tâche de l’Intelligence Index — le chiffre qu’il publie aux côtés d’un tarif d’entrée de 0,10 $ et d’un tarif de sortie de 0,50 $. Il ne publie aucun chiffre de coût par tâche pour la génération 4.5 ; la tuile indique inconnu, car le modèle n’a jamais été exécuté sur l’Index dans une configuration de raisonnement. Ce que la page publie, c’est un prix affiché brut de 1,00 $ et 5,00 $ et un score mesuré différent, plus faible.
Donc, la comparaison honnête pour un acheteur n'est pas un facteur 10 sur les tokens, mais quelque chose de plus proche de ceci : un dixième du tarif d'entrée sur 30 % de tokens en plus, la moitié du tarif de sortie lorsque vous dépassez 100K, et un modèle qui dépense plus de tokens de sortie par réponse que son prédécesseur — face à un bond de capacités de 16,88 à 43,40 sur le même classement indépendant. Le chiffre de 75 % qu'Anthropic cite pour les charges de travail moyennes est le chiffre de planification raisonnable. Il s'agit aussi d'une estimation fournisseur combinée sur un mix de trafic que vous ne contrôlez pas.
La migration n'est pas un simple échange d'identifiant de modèle.
Le guide de migration d’Anthropic comporte dix points pour quiconque abandonne Claude Haiku 4.5, et plusieurs sont des échecs critiques plutôt que des conseils.
• La réflexion manuelle échoue — thinking: {"type": "enabled", "budget_tokens": N} renvoie une erreur. La réflexion adaptative la remplace, et thinking.display doit être défini sur "summarized" si vous voulez voir le raisonnement, tout simplement.
• Les paramètres d'échantillonnage ne fonctionnent plus — temperature, top_p et top_k doivent tous être retirés de la requête.
• Le préremplissage de l'assistant ne fonctionne pas — une conversation qui se termine sur un tour de l'assistant renvoie une erreur ; terminez-la sur un tour de l'utilisateur.
• L'ordre des blocs change — une réponse peut commencer par des blocs de réflexion, donc le code qui lit le premier bloc de contenu comme la réponse doit sélectionner par type à la place.
• Les refus sont une nouveauté — le modèle exécute des classificateurs de sécurité, peut renvoyer stop_reason: "refusal", et il n'existe aucun repli côté serveur.
• Replay est limité — les blocs de réflexion fonctionnent uniquement dans le compte qui les a produits, ou dans un compte qui y est lié.
• Le niveau Priorité n'est pas reporté — les organisations disposant d'un engagement de niveau Priorité sur Claude Haiku 4.5 doivent planifier leur capacité séparément, car ce niveau n'est pas pris en charge sur Claude Haiku 5.5.
Deux d’entre eux méritent plus d’attention que les autres. Le motif d’arrêt de refus est un changement de flux de contrôle dans toute boucle qui supposait que chaque réponse a du contenu, et les blocs de réflexion liés au compte cassent toute file d’attente qui stocke des conversations et les rejoue à travers un pool d’identifiants. Ni l’un ni l’autre ne se manifeste avant la production.
Faire fonctionner les deux niveaux avec une seule clé
La question pratique pour la plupart des équipes n'est pas de savoir lequel de ces deux modèles est meilleur, car la réponse dépend entièrement de l'appel que vous effectuez. Il s'agit de savoir si l'étape bon marché d'une cascade peut être mise à niveau indépendamment de tout ce qui l'entoure.
Claude Haiku 4.5 est dès aujourd'hui au catalogue d'OrcaRouter au prix catalogue d'Anthropic, avec 0 % de marge, si bien que le tarif du fournisseur est répercuté tel quel et que toute modification qu'Anthropic y apporte apparaît de notre côté le jour même. Claude Sonnet 5.5 et Claude Opus 5.5 y figurent aussi, ce qui signifie qu'un pipeline à deux niveaux — un petit modèle pour la majorité des tâches de routine, un modèle plus grand pour l'escalade — peut être mis en place dès maintenant avec une seule clé, un seul SDK et un basculement automatique sous le capot, le petit segment pouvant ensuite être remplacé par Claude Haiku 5.5 par un simple changement d'identifiant de modèle plutôt que par une réécriture.
Claude Haiku 5.5 n'est pas encore au catalogue, et cela vaut la peine de le dire clairement plutôt que de le laisser sous-entendu. Un décalage le jour du lancement entre la sortie d'un modèle et le fait qu'il soit routable est normal, et ce n'est pas une promesse quant au moment où il se résorbera ; les modèles que l'on peut appeler chez nous ce matin sont ceux nommés ci-dessus.

Qui devrait basculer, et quel appel basculer en premier ?
Si votre trafic Haiku 4.5 relève de la classification, de l'extraction, du routage, de la compaction ou de la synthèse avec des prompts de moins de 100 000 tokens, migrez — le tarif est divisé par dix, la fenêtre est cinq fois plus large, et le curseur d'effort vous offre un levier de coût que l'ancien modèle n'a jamais eu. Prévoyez un budget inférieur d'environ 75 % et rapprochez-le de vos propres comptages de tokens au bout d'une semaine.
Si vos prompts dépassent régulièrement 100 000 tokens, vous obtenez une réduction de 50 % plutôt que de 90 %, et le deuxième palier modifie la comparaison d’une manière qui justifie de comparer les offres : le tarif de sortie de 2,50 $ au-delà de 100 K est supérieur à ce que plusieurs petits modèles concurrents facturent pour toute la fenêtre.
Et si vous êtes sur Haiku 4.5 parce que c’était la seule option bon marché qui convenait à un document de 200 000 tokens, notez ce qui a changé. La fenêtre est désormais d’un million de tokens, ce qui en fait un produit différent, et la raison de garder l’ancien modèle a discrètement disparu en même temps que la raison pour laquelle il était bon marché.
