
Claude Haiku 5.5 est disponible à 0,10 $ par million de jetons : l'affirmation des 75 %, et ses deux notes de bas de page
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Anthropic a lancé Claude Haiku 5.5en disponibilité générale le 7 octobre 2026, à 0,10 $ par million de jetons d'entrée et 0,50 $ par million de jetons de sortie — les deux mêmes chiffres qu'OpenAI facture pour GPT-6 Luna, et un cinquième de ce que Claude Haiku 4.5coûte depuis 2025, année où il a été lancé à 1,00 $ et 5,00 $. Le titre de l'article de lancement d'Anthropic annonce que le nouveau modèle coûte « environ 75 % de moins à exploiter » en moyenne que son prédécesseur, et c'est le chiffre que toutes les synthèses depuis ont repris. Il s'accompagne de deux notes de bas de page que la plupart de ces synthèses ont laissées de côté : en dessous de 100 000 jetons, la réduction est de 90 %, au-dessus, elle est de 50 %, et Claude Haiku 5.5 utilise le tokeniseur plus récent partagé avec Claude 4.7 et les versions ultérieures, si bien qu'un même texte compte environ 30 % de jetons en plus que sur Claude Haiku 4.5. Les 75 % décrivent donc une facture, pas une grille tarifaire, et pour quiconque a des prompts longs, ce sont deux choses différentes. Le tableau comparatif du fournisseur lui-même présente aussi GPT-6 Luna et Claude Sonnet 5.5 en colonnes à côté de lui, ce qui rend la documentation de lancement particulièrement facile à contester.
L'arithmétique derrière « 75 % de moins »
Prenez d'abord la grille tarifaire, car elle n'est pas uniforme. L'entrée est à 0,10 $ par million jusqu'à 100 000 tokens, puis à 0,50 $ par million au-delà — cinq fois plus. La sortie est à 0,50 $ puis à 2,50 $. La mise en cache suit le même palier : une écriture de cache de cinq minutes coûte 0,125 $ par million en dessous du seuil et 0,625 $ au-dessus, une écriture d'une heure coûte 0,20 $ et 1,00 $, et une lecture de cache coûte 0,01 $ et 0,05 $. L'API Message Batches applique une réduction de 50 % sur les deux compteurs, et sur la voie par lots, le modèle prend en charge jusqu'à 300 000 tokens de sortie avec l'output-300k-2026-03-24en-tête bêta
Maintenant, ajoutez le tokenizer par-dessus, car c'est là que l'affirmation phare devient intéressante. Une invite qui comptait 90 000 tokens avec le tokenizer de Claude Haiku 4.5 en mesure environ 117 000 avec le nouveau. Sa taille n'a pas changé, mais elle a franchi le seuil des 100 000 tokens, elle est donc facturée à 0,50 $ par million de tokens d'entrée au lieu de 0,10 $. Sur Claude Haiku 4.5, ce même contenu coûtait 0,09 $ d'entrée (1,00 $ par million × 0,09 million). Sur Claude Haiku 5.5, il coûte 0,0585 $. Cela représente une réduction de 35 % — bien réelle, et loin d'atteindre 90 %. Le chiffre de 90 % s'applique aux requêtes qui restent sous le seuil après leur expansion par le tokenizer, ce qui correspond à une grande partie du trafic des appels courts : un appel de classification de 20 000 tokens devient 26 000 tokens, reste dans le premier palier, et là le prix d'entrée est réellement un dixième de ce qu'il était.
Trois choses en découlent, et elles méritent d’être distinguées plutôt que moyennées :
• Les appels courts bénéficient de la remise complète. Extraction, routage, classification, résumé d'un document qui reste sous la barre — ceux-ci se voient appliquer le taux de 90 % en entrée comme en sortie, moins l'expansion du tokeniseur.
• Les appels longs bénéficient d'environ un tiers de réduction, et non de trois quarts. Une requête qui dépasse 100 000 tokens après re-tokenisation paie 0,50 $ et 2,50 $ par million — soit toujours la moitié des tarifs de Claude Haiku 4.5, mais le palier dans lequel elle se situe est cinq fois celui affiché sur l'étiquette.
• Le « 75 % de moins en moyenne » est un chiffre pondéré par le trafic, et c’est celui d’Anthropic. Il s’agit de la description par le fournisseur lui-même de sa propre répartition attendue, et Anthropic précise explicitement qu’un prompt sous le seuil représentait environ 90 % des requêtes adressées au Haiku précédent. Si votre répartition ne ressemble pas à cette répartition, votre moyenne ne ressemblera pas à cette moyenne — et le seul moyen de le savoir est de compter les tokens sur votre propre trafic, avec le nouveau tokenizer, avant de fixer un budget.

Quoi d'autre a été livré avec ?
Le modèle n'est pas seulement un prix. Plusieurs des détails de lancement changent la façon dont vous écrivez du code pour l'utiliser, et l'un d'eux cassera un client existant.
• La réflexion adaptative est activée par défaut, avec un réglage d’effort de Faible à Max et une valeur par défaut de moyen. Il s’agit du premier modèle de la classe Haiku doté d’un réglage d’effort ajustable, et c’est le principal levier à la fois sur la qualité et le coût par réponse.
• Les paramètres d'échantillonnage sont rejetés. Envoyer une valeur non par défaut pour temperature, top_p ou top_k renvoie un 400. Toute migration qui a transmis ces arguments échouera bruyamment dès la première requête plutôt que de se dégrader silencieusement, ce qui est au moins un mode d'échec honnête.
• Contexte de 1 M de tokens et jusqu'à 128 000 tokens de sortie dans l'API Messages synchrone, avec une date limite de connaissances en juin 2026 et un engagement de retrait au plus tôt le 7 octobre 2027.
• Cinq plateformes dès le premier jour : l'API Claude, Amazon Bedrock, Google Cloud, Microsoft Foundry et Claude Platform sur AWS. Il s'agit d'un déploiement le jour même plutôt que de la disponibilité échelonnée que prennent souvent ces lancements.
• L'outillage a aussi évolué. Les SDK Python et TypeScript d'Anthropic prennent désormais en charge l'utilisation de l'ordinateur et du navigateur en version bêta, et l'entreprise a ajouté des crédits API mensuels pour les abonnés Max 5x (100 $), Max 20x (200 $) et Team (jusqu'à 500 $ mutualisés).
• La posture de sécurité est plus restrictive que ne le suggère le prix. Anthropic indique que les garde-fous cyber de Claude Haiku 5.5 sont plus restrictifs que ceux de Claude Haiku 4.5, mais moins restrictifs que ceux des récents modèles de pointe — un usage défensif plus large que ce que permet Claude Sonnet 5.5, les tests d'intrusion restant bloqués — et que les garde-fous biologiques correspondent à ceux de Claude Sonnet 5, Claude Sonnet 5.5 et Claude Opus 5. Les évaluations d'alignement se sont globalement améliorées par rapport au prédécesseur sur la propre suite d'Anthropic.
Ce que dit le tableau du fournisseur, et ce que dit le comité indépendant
Anthropic a publié un tableau de benchmark à trois colonnes de comparaison, et il vaut la peine d’être lu comme un document sur la manière dont les fournisseurs argumentent. Chaque chiffre ci-dessous est rapporté par le fournisseur, produit sur les harnais d’Anthropic, et aucun n’a été reproduit de manière indépendante ; là où GPT-6 Luna apparaît, c’est Anthropic qui exécute ses propres évaluations contre le modèle d’un concurrent.
• Travail du savoir — GDPval-AA v2.1 à 1620 pour Claude Haiku 5.5, contre 735 pour Claude Haiku 4.5, 1437 pour GPT-6 Luna et 1840 pour Claude Sonnet 5.5. AA-Briefcase v1.1 à 1578, 614, 1336 et 1824.
• Utilisation de l'ordinateur — OSWorld 2.1 hors ligne à 72,4 % contre 15,7 %, 48,9 % et 83,9 %.
• Raisonnement — Humanity's Last Exam à 45,9 % sans outils et 57,4 % avec, contre 10,2 % et 18,7 % pour Claude Haiku 4.5 et 56,9 % et 64,5 % pour Claude Sonnet 5.5.
• Codage agentique — Terminal-Bench 4.0 à 39,2 % contre 0,0 %, 16,4 % et 70,6 %. FrontierCode 1.1 (Main) à 46,4 % contre 42,4 % pour GPT-6 Luna et 52,1 % pour Claude Sonnet 5.5.
• Lecture de graphiques — Chartographie à 46,4 % sans outils contre 6,4 %, 29,1 % et 61,6 %.
Sur ce tableau, Claude Haiku 5.5 l’emporte sur chaque ligne face à la fois au Haiku précédent et à GPT-6 Luna, et perd la plupart d’entre elles face à Claude Sonnet 5.5 — ce qui correspond à la forme honnête d’un petit échelon : un grand bond générationnel, et toujours un échelon en dessous du modèle intermédiaire sur les tâches les plus difficiles. Anthropic en dit autant dans son article, en recommandant Claude Sonnet 5.5 et Claude Opus 5.5 pour le codage agentique complexe, tout en positionnant Haiku pour la compaction, le résumé, la classification et les rôles de sous-agent.
Le tableau indépendant est plus nuancé et réclame davantage d'attention. Artificial Analysis mesure Claude Haiku 5.5 en effort Max à 43 sur son Intelligence Index v4.3.2, deuxième sur 182 modèles, et à 241,9 jetons de sortie par seconde — rapide, comme annoncé. Il mesure aussi un coût de 0,21 $ par tâche Index complétée, parce que le modèle a généré 440 millions de jetons de sortie pour exécuter la suite, contre une médiane de 100 millions ; l'évaluateur le qualifie de très verbeux. GPT-6 Luna, à 38 sur le même index, coûte 0,07 $ par tâche. Même prix affiché, facture trois fois plus élevée. Ce n'est pas une contradiction de la promesse de lancement — c'est le même phénomène que décrit la promesse de lancement, vu de l'autre bout : la grille tarifaire, c'est ce que vous payez par jeton, et le montant que vous payez réellement, c'est le tarif multiplié par les jetons, et Claude Haiku 5.5 en dépense plus par réponse que ses rivaux. L'effort est le levier ; la valeur par défaut du modèle est medium, pas Max, et une équipe qui la fixe plus bas verra à la fois une facture plus petite et un score plus petit.
L'appeler depuis un seul endroit
La question de migration que ce lancement crée n'est pas « est-ce que c'est mieux ? » mais « combien coûte mon trafic dessus ? », et cette réponse dépend de la longueur de vos prompts, de votre taux de succès du cache et du réglage d'effort que vous choisissez. Pour y parvenir, il faut faire passer votre propre jeu de prompts dans les deux générations — ce qui est peu coûteux à faire derrière un seul endpoint et fastidieux à faire sur deux.
Claude Haiku 5.5 lui-même n'est pas encore au catalogue d'OrcaRouter, et le dire clairement est plus utile que de laisser entendre le contraire. Le reste de la gamme Anthropic : Claude Haiku 4.5, Claude Sonnet 5.5 et Claude Opus 5.5 sont tous appelables chez nous dès aujourd'hui au prix catalogue du fournisseur, avec 0 % de marge répercutée, de sorte que le volet « avant » d'un test de migration tourne sur la même clé que celle que vous conserveriez ensuite, et une baisse tarifaire du fournisseur sur ce volet est effective de notre côté le jour même. Le volet « après » est l'API d'Anthropic jusqu'à ce que le nouveau modèle atteigne un runtime que nous routons. Ce que l'endpoint partagé vous apporte entre-temps, c'est un basculement automatique sous l'appel, afin qu'un nouveau modèle puisse porter le trafic de production sans que le chemin dépende de lui, et le DSL de routage pour le cas où l'escalade de Haiku vers Sonnet a sa place dans la route plutôt que dans le code de votre application.

Deux résultats clients du lancement méritent d’être retenus comme pistes plutôt que comme preuves. Asana rapporte une réduction de plus de 30 % de la latence et une inférence jusqu’à 2,5 fois plus rapide par tour d’agent ; HubSpot rapporte 92,8 % en moyenne sur trois exécutions sur sa suite CRM ; AlphaSense rapporte 0,84 contre 0,76 sur 400 requêtes. Ce sont des chiffres clients sélectionnés par le fournisseur dans sa propre annonce, et leur valeur consiste à vous indiquer quelles charges de travail tester en premier, non à vous dire ce que vous obtiendrez.
Qu'est-ce qui changerait la donne
Le chiffre de 75 % sera tranché de la même manière que toute affirmation de fournisseur pondérée par le trafic : par votre propre facture. Ce qui reste véritablement en suspens du côté indépendant, c'est le chiffre du coût par tâche. S'il tient à mesure que les exécutions s'accumulent, le résumé honnête de ce lancement est qu'Anthropic a réduit sa grille tarifaire de 80 % et construit un modèle qui consomme plus de tokens par réponse, de sorte que l'économie effective est réelle, importante, dépendante de la charge de travail, et rarement le chiffre affiché sur l'affiche. S'il baisse avec les réglages d'effort et la mise en cache, l'offre paraît encore meilleure. Dans un cas comme dans l'autre, le chiffre à vérifier avant un basculement est votre propre nombre de tokens par tâche avec le nouveau tokenizer — c'est la seule donnée que l'article de lancement ne peut pas vous fournir.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
