
La vraie histoire de Claude Haiku 5.5, c'est la falaise des 100K : ce que le nouveau Haiku facture au-delà de 100 000 tokens
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Claude Haiku 5.5 est arrivé le 7 octobre 2026 avec un prix d'appel de 0,10 $ par million de jetons d'entrée et de 0,50 $ par million de jetons de sortie, et le chiffre qui a été répété partout était celui qu'Anthropic elle-même a mis dans l'annonce : une baisse de 90 % par rapport au tarif de Haiku 4.5 pour les deux mêmes postes. Les 90 % sont réels. Ils sont aussi limités à la moitié d'une seule dimension de la facture, et dès qu'une requête franchit 100 000 jetons, chaque tarif qu'elle contient fait quelque chose que la couverture du lancement a généralement passé sous silence. Cet article porte sur cette ligne de démarcation — ce qu'elle coûte, quelles charges de travail la franchissent réellement, et pourquoi « 90 % moins cher » est une affirmation sur une tranche de la facture plutôt que sur votre facture.
Les deux prix, et où ils s'inversent
Anthropic publie deux colonnes pour le modèle, et le basculement entre elles repose sur un seul seuil lié à la taille de la requête, plutôt que sur un quelconque paramètre du modèle que vous choisissez :
• Palier court, à 100 000 jetons ou moins — 0,10 $ par million de jetons d'entrée, 0,50 $ par million de jetons de sortie (grille tarifaire Anthropic) • Palier long, plus de 100 000 jetons — 0,50 $ par million de jetons d'entrée, 2,50 $ par million de jetons de sortie (grille tarifaire Anthropic) • Lectures du cache — 0,01 $ par million (palier court) et 0,05 $ par million (palier long) • Batch API — 50 % de réduction sur chaque colonne, et une longueur de sortie maximale de 300 000 jetons • Sortie maximale standard — 128 000 jetons, avec une fenêtre de contexte de 1 million de jetons dans les deux paliers

Ce sont les tarifs publiés par Anthropic elle-même, et non des tarifs mesurés, et il s'agit de la grille tarifaire actuelle : le prix d'un modèle aussi récent n'a pas eu le temps d'évoluer, bien qu'Anthropic ne soit tenue par aucun engagement de le maintenir.
Lisez ces quatre nombres dans l’ordre et la forme de la chose est évidente. Chaque tarif du palier à contexte long est exactement cinq fois le tarif à contexte court, et le seuil est le même — 100 000 tokens — pour tous en même temps. Il n’y a pas de courbe progressive, pas d’interpolation, pas de bande intermédiaire — une requête de 99 000 tokens et une requête de 101 000 tokens diffèrent d’un facteur cinq sur chaque token de la facture, pas seulement sur les 2 000 tokens qui ont franchi la limite. C’est ce qui en fait une falaise plutôt qu’une pente, et c’est ce que le cadrage « 90 % moins cher » ne peut pas voir.

Pourquoi la coupure paraît plus grande qu'elle ne l'est
Dans la comparaison qu'Anthropic a faite face à Haiku 4.5, le palier court constitue une véritable réduction de 90 % tant en entrée qu'en sortie — Haiku 4.5 coûtait 1,00 $ et 5,00 $ par million pour les deux mêmes colonnes. Le palier long, c'est une autre histoire : 0,50 $ et 2,50 $ face aux mêmes 1,00 $ et 5,00 $, c'est une réduction de 50 %, pas une réduction de 90 %. Ainsi, la version honnête de l'affirmation de lancement est que Claude Haiku 5.5 est 90 % moins cher que Haiku 4.5 en dessous de 100 000 jetons et 50 % moins cher au-dessus, ce qui correspond exactement à la répartition que la documentation d'Anthropic elle-même donne dès qu'on lit les deux colonnes au lieu d'une seule. Le pourcentage unique n'est pas faux ; c'est le pourcentage du palier court, présenté sans sa condition.
Il y a une deuxième chose qui tire en sens inverse, et c'est la plus intéressante, car elle est facile à manquer et difficile à contourner. Claude Haiku 5.5 est livré avec un nouveau tokenizer, et les propres recommandations d'Anthropic situent le nombre de tokens d'un texte donné environ 30 % au-dessus de ce que produisait Haiku 4.5 pour le même contenu. Ce que vous payiez par token a baissé, et ce que vous payez par token de *votre* texte a augmenté d'environ un tiers, par rapport à la comptabilisation de l'ancien modèle. Le chiffre net annoncé par Anthropic, selon lequel le modèle coûte environ 75 % moins cher à exécuter en moyenne, intègre déjà cet effet — une baisse de 90 % du prix catalogue moins une inflation d'environ 30 % des tokens donne à peu près ce résultat sur du trafic à contexte court — mais les deux effets sont séparables et il vaut la peine de les séparer. Le changement de prix est une modification du prix catalogue que vous pouvez lire sur une page ; le changement de tokenizer modifie le nombre d'unités de ce prix que consomment vos prompts existants, et il apparaît dans vos propres décomptes de tokens avant d'apparaître ailleurs.
Pour une charge de travail qui restait déjà confortablement sous les 100 000 tokens par appel, l’effet pratique est une réduction directe du coût par appel, en partie compensée par le tokeniseur. Pour celle qui ne l’était pas, l’arithmétique joue en sens inverse deux fois sur la moitié longue.
Qu'est-ce qui vit réellement au-dessus de 100 000 tokens
Le réflexe consiste à classer la tarification du contexte long sous « codage agentique et RAG, pas nous ». C’est aller trop vite, car la ligne des 100 000 tokens est une ligne par requête, et la taille par requête n’est pas la même chose que la taille de la tâche. Quelques schémas la franchissent régulièrement :
• Un agent de lecture de base de code qui conserve en contexte un large ensemble de travail tout au long d'une session, plutôt que de le récupérer à chaque étape
• Analyse de documents et de contrats où l'entrée est un PDF volumineux accompagné de ses propres instructions et d'exemples few-shot — le genre de prompt qui faisait 60 000 tokens avant que quiconque n'ajoute les exemples
• Pipelines d’ingestion qui regroupent de nombreux petits éléments en un seul appel afin d’amortir le surcoût par appel, et ce faisant font passer tout le lot au-dessus du seuil
• Produits de chat qui conservent un historique complet de conversation en ligne au lieu de le résumer, où la requête croît de manière monotone jusqu’à ce que quelque chose la tronque
• Des entrées de type transcription audio et vidéo longue, soit exactement le trafic qu'une fenêtre de 1 million de jetons est censée permettre de traiter
La fenêtre de contexte d'un million de jetons est l'élément de la fiche technique qui rend la falaise digne d'être évoquée. Anthropic vend la possibilité de confier au modèle une requête très volumineuse, et la tarification est structurée de telle sorte que les 900 000 derniers jetons de cette requête coûtent cinq fois ce que coûtaient les 100 000 premiers. Ces deux faits sont délibérés ; ils sont simplement annoncés à des endroits différents. Si la fenêtre de contexte long est la raison même pour laquelle vous vous intéressez à ce modèle, alors la colonne du contexte long est la vôtre, et le pourcentage de lancement est celui de quelqu'un d'autre.
La pression que le prix exerce sur le niveau Flash
L’intention déclarée d’Anthropic derrière le modèle est d’occuper le segment bon marché et à haut débit de la pile, et la grille tarifaire reflète clairement cette intention. La couverture du lancement par Bloomberg l’a présenté comme Anthropic défendant sa position à moindre coût face à des concurrents à poids ouverts moins chers, et la présentation du côté fournisseur allait plus loin : le nouveau Haiku est proposé à un prix nettement inférieur à celui de ses rivaux directs.
La comparaison n’est vraiment nette qu’au palier court, où les tarifs de 0,10 $ et de 0,50 $ sont extrêmement bas. Au-delà de 100 000 jetons, les tarifs de 0,50 $ et de 2,50 $ ne sont plus inférieurs au palier court de qui que ce soit ; ce sont des montants ordinaires de milieu de gamme. L’affirmation de « large marge » du fournisseur porte sur la première colonne de la grille tarifaire, et Anthropic est en droit de la formuler à cet endroit : c’est une lecture exacte des chiffres qu’elle publie. Ce n’est pas une affirmation sur ce que paie une charge de travail à contexte long, et elle ne doit pas être citée comme telle.
Le reste du modèle, en bref
Claude Haiku 5.5 conserve les fonctionnalités déjà proposées sur les gammes Sonnet et Opus plutôt que de les réduire pour cette catégorie de taille. La réflexion adaptative avec un réglage d'effort par défaut sur moyen est présente, et il s'agit du premier modèle de la classe Haiku doté d'un réglage d'effort ajustable allant de Low à Max. La date limite de connaissances est juin 2026 et l'identifiant du modèle est claude-haiku-5-5. Anthropic annonce une date de retrait au plus tôt le 7 octobre 2027 — la même date que la sortie, un an plus tard — et le modèle est référencé sur Amazon Bedrock, Google Cloud et Microsoft Azure aux côtés de l'API d'Anthropic elle-même.

Du côté des benchmarks, tout dans l’article de lancement porte la même étiquette de provenance, et à juste titre : ce sont des chiffres rapportés par le fournisseur, mesurés par l’entreprise qui vend le modèle, sans reproduction indépendante publiée au moment de la rédaction.
• GDPval-AA v2.1 — 1 620 déclarés par le fournisseur pour Claude Haiku 5.5, contre 735 pour Haiku 4.5 dans le même harnais d’évaluation
• AA-Briefcase v1.1 — 1 578 annoncés par le fournisseur, contre 614 pour la génération précédente
• OSWorld 2.1 — 72,4 pour cent rapportés par le fournisseur, contre 15,7 pour cent
• Terminal-Bench 4.0 — 39,2 rapporté par le fournisseur, contre 0,0
• Humanity's Last Exam — 45,9 % déclarés par le fournisseur, ou 57,4 avec utilisation d'outils
L'ampleur de ces écarts est la raison pour laquelle il faut les signaler plutôt que les citer. Un bond de 15,7 à 72,4 sur un benchmark d'agent OS mesuré par le fournisseur du modèle lui-même est un chiffre à prendre avec des pincettes jusqu'à ce qu'un tiers exécute le même harnais. Artificial Analysis a publié son propre indice pour le modèle en date du début octobre 2026 — un chiffre indépendant de 43,395, avec 0,329 sur Terminal-Bench Hard et 0,444 sur HLE — et c'est cet ensemble qu'il faut citer lorsque l'affirmation doit résister à une contestation. Les chiffres du fournisseur et les chiffres indépendants ne sont pas en conflit ; ce sont simplement des harnais différents, et les mélanger dans une même phrase est ainsi qu'un billet de blog finit par présenter une évaluation de fournisseur comme un fait.
La note sur l’infrastructure, puisque nous en exploitons une.
Anthropic vend Claude Haiku 5.5 via sa propre API et via Bedrock, Google Cloud et Azure. Si vous hésitez sur lequel appeler, ou si vous l'ajoutez à côté des autres modèles déjà présents dans votre stack, sachez que le prix catalogue du fournisseur est le même partout où il est vendu, et OrcaRouter est conçu pour répercuter ce prix catalogue sans marge — ainsi, une évolution tarifaire d'Anthropic sur ce modèle est effective de notre côté le jour même plutôt qu'avec un décalage. Notre catalogue propose aussi qwen/qwen3.8-flash à 0,15 $ et 0,47 $ par million et z-ai/glm-5.3-flash à 0,15 $ et 0,50 $, le duo qui se retrouve le plus souvent dans l'emplacement à côté d'un modèle de la classe Haiku, avec la même clé et la même facture — ce qui fait qu'une stack mixte coûte un seul contrat au lieu de trois. Nous ne proposons pas Claude Haiku 5.5 lui-même ; pour cela, appelez Anthropic directement.
Un corollaire pratique de cette falaise, si vous routez plus d’un modèle : la frontière des 100 000 jetons est un point où une requête qui était bon marché devient coûteuse sans que rien dans la requête ne change de façon significative. Si votre couche de routage peut basculer en cas de défaillance, la configuration judicieuse consiste à maintenir le trafic à contexte long dirigé vers le modèle qui est réellement bon marché au-dessus du seuil et à laisser le trafic à contexte court retomber sur celui qui est bon marché en dessous, plutôt que de supposer que le tarif affiché d’un seul modèle s’applique aux deux.
Que retenir du lancement
La baisse de prix est réelle et elle est importante, en dessous de 100 000 tokens. Le modèle est le premier Haiku à disposer d’un ensemble de fonctionnalités livré de bout en bout et d’un réglage d’effort, ce qui compte davantage pour l’usage agentique que le prix. Les écarts de benchmark sont rapportés par le fournisseur et doivent être signalés comme tels chaque fois qu’ils sont répétés. Et la grille tarifaire comporte un palier à 100 000 tokens qui multiplie d’un coup chaque tarif par cinq — la chose, au sujet de ce lancement, qu’un lecteur de votre stack, plutôt qu’un lecteur du communiqué de presse, a le plus besoin de savoir avant que le budget de tokens du prochain sprint ne soit fixé.
Si vous voulez vérifier les calculs par rapport à votre propre trafic, les deux chiffres à extraire sont le 95e percentile de la taille de vos requêtes et votre part de dépenses sur les requêtes dépassant 100 000 tokens. Si le premier est sous la barre, les 90 % s'appliquent à vous et la couverture du lancement avait vu juste pour votre situation. Si le second représente une part significative de la facture, le chiffre qui compte est le 50, et il vaut la peine de refaire l'estimation des coûts pour le modèle de la stack que vous avez choisi sur l'hypothèse des 90.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
