
Claude Haiku 5.5 : une réduction de prix de 90 %, un nouveau tokenizer et la vidéo qu'Anthropic n'a pas publiée
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Quelqu'un a tapé une seule phrase dans Claude Haiku 5.5et en a récupéré un film de lancement terminé. Le prompt, publié sur X le soir du 7 octobre 2026, se lit intégralement : « fais une vidéo de lancement 10 fois plus dingue qui montre à quel point tu es un bon motion designer. » La légende du post fait trois mots — « One shotted this video » — et il contient le clip en pièce jointe. Aucun nouvel essai, aucun storyboard, aucun monteur. Si c'est ce que fait aujourd'hui le modèle le moins cher de la gamme Claude, ce niveau de gamme n'est plus un compromis.
C'est la moitié intéressante du lancement. L'autre moitié est arithmétique, et c'est là que se trouve la véritable nouvelle : Claude Haiku 5.5 coûte 0,10 $ par million de jetons d'entrée et 0,50 $ par million de jetons de sortie pour les prompts allant jusqu'à 100 000 jetons, contre Claude Haiku 4.5 aux tarifs uniques de 1 $ et 5 $. La note de bas de page d'Anthropic elle-même qualifie cela de 90 % moins cher dans le cas courant — puis dit, du même souffle, que le chiffre sur lequel un acheteur devrait tabler est plus proche de 75 %. Les deux chiffres sont corrects, et l'écart entre eux est l'élément le plus important de cette annonce.
Ce qu’Anthropic a déclaré publiquement le 7 octobre
Le billet de lancement du fournisseur et sa documentation tarifaire s'accordent sur la nature de la chose, et il s'agit là d'un pas plus grand que ce qu'une baisse de prix entraîne habituellement.

• Prix — 0,10 $ par million de tokens d'entrée et 0,50 $ par million de tokens de sortie pour les prompts allant jusqu'à 100 000 tokens. Au-delà de ce seuil, la même requête est facturée à 0,50 $ et 2,50 $. Les lectures de cache coûtent 0,01 $ par million jusqu'à 100 K et 0,05 $ au-delà ; les écritures de cache coûtent 0,125 $ et 0,625 $.
• Contexte — 1 M de tokens, avec une sortie maximale de 128 000 tokens. C'est la même fenêtre et le même plafond de sortie que ceux de Claude Fable 5.1, Claude Opus 5.5 et Claude Sonnet 5.5, reproduits sur le palier le moins cher.
• Réflexion — réflexion adaptative avec le paramètre effort, par défaut sur moyen. Anthropic déclare qu’il s’agit du premier modèle de la classe Haiku doté d’un réglage d’effort ajustable, ce qui signifie que le même identifiant de modèle peut être exécuté à moindre coût ou avec minutie sans rien changer d’autre.
• Tokenizer — le tokenizer plus récent partagé avec Claude 4.7 et versions ultérieures, qui « produit environ 30 % de tokens en plus pour le même texte ». La documentation d’Anthropic indique que l’augmentation exacte dépend du contenu et de la forme de la charge de travail.
• Cycle de vie — date limite des connaissances : juin 2026, et un engagement de retrait « pas avant le 7 octobre 2027 ».
• Disponibilité — l'API Claude, Amazon Web Services, Google Cloud, Microsoft Azure et Claude Platform on AWS, tous disponibles en même temps dès le premier jour.
L'étiquette 10x et la réalité à 75 %
Dix fois moins cher est le chiffre qui se propagera le plus loin, et c’est celui qui a le plus de chances de finir au mauvais endroit dans le modèle budgétaire de quelqu’un. Il s’applique aux prompts jusqu’à 100 000 tokens. Haiku 5.5 ne maintient pas ce tarif sur toute la fenêtre.
• Jusqu’à 100 000 tokens — 0,10 $ en entrée et 0,50 $ en sortie, contre 1 $ et 5 $ pour Haiku 4.5. Cela représente la réduction de 90 %, et Anthropic affirme que 90 % des requêtes adressées au modèle Haiku précédent se situaient dans cette tranche.
• Plus de 100 000 tokens — 0,50 $ en entrée et 2,50 $ en sortie. Toujours exactement la moitié de ce que facturait Haiku 4.5, sur la même requête, sans plafond à atteindre.
• Le tokenizer — le même texte produit environ 30 % de tokens en plus que sur Haiku 4.5, donc la réduction par token ne se traduit pas un pour un par une facture moins élevée.
• La moyenne propre du fournisseur — Anthropic présente la combinaison comme « environ 75 % de moins à faire tourner ». C’est son chiffre, pas une mesure indépendante, et c’est celui qu’il faut mettre dans une prévision.
• Économie du cache — les lectures de cache sont passées de 0,10 $ à 0,01 $ par million dans la bande courante, ce qui compte davantage que le tarif d'entrée pour tout pipeline qui renvoie un long préfixe partagé.
Le chiffre de 75 % explique aussi quelque chose qu’un lecteur pourrait sinon prendre pour une contradiction. Les deux chiffres phares ne sont pas en conflit ; l’un est un taux sur une forme de requête, l’autre une estimation mixte sur un trafic réel qui inclut la minorité au-delà de 100 K et les tokens supplémentaires du tokenizer. Si vous modélisez les dépenses, utilisez 75 % et vérifiez votre propre distribution de longueur de prompts avant de croire à mieux.
Ce que la vidéo affirme, et ce qu’elle n’affirme pas
Le clip est authentique, le prompt est cité textuellement ci-dessus, et l'horodatage — 19:49 UTC le 7 octobre, à peu près le jour où le modèle a été mis en ligne — est vérifiable. L'attribution revient à un utilisateur individuel, et non à Anthropic.
Cette distinction compte ici, car la page produit d'Anthropic elle-même pour Claude Haiku 5.5 ne comporte aucune vidéo intégrée : ni lecteur, ni fichier multimédia, seulement un lien vers la chaîne YouTube de l'entreprise. Si un film de lancement a été réalisé avec le modèle, le fournisseur ne l'a pas déclaré. Ainsi, l'affirmation exacte est limitée : un utilisateur rapporte avoir généré une vidéo de lancement en une seule prise avec Claude Haiku 5.5, et a publié le prompt. Qu'il s'agisse d'une seule prise, ce que cela a coûté et quelle part en a survécu au montage sont autant d'affirmations provenant d'une seule source. Considérez le clip comme une démonstration, non comme un benchmark.
La raison pour laquelle cela vaut quand même la peine d’être mentionné, c’est que la génération vidéo ne figure pas dans les spécifications du modèle. Haiku 5.5 prend en entrée du texte et des images et renvoie du texte. Un résultat de motion design de cette qualité implique que le modèle pilotait autre chose — une voie de génération de code, un pipeline de rendu, une boucle d’outils — plutôt que de produire lui-même les images. C’est une affirmation sur l’orchestration agentique à 0,10 $ en entrée, ce qui est la partie réellement surprenante.
Les chiffres publiés par Anthropic
Le tableau de lancement du fournisseur est un avant-après face à Haiku 4.5, avec GPT-6 Luna et Claude Sonnet 5.5 dans les mêmes colonnes pour l'échelle. Chaque chiffre ci-dessous est le propre résultat d'évaluation rapporté par Anthropic, exécuté sur le harnais d'Anthropic, et est reproduit mais non vérifié indépendamment.

• Travail intellectuel — GDPval-AA v2.1 à 1620 contre 735 pour Haiku 4.5, 1437 pour GPT-6 Luna et 1840 pour Sonnet 5.5. AA-Briefcase v1.1 à 1578 contre 614, 1336 et 1824.
• Utilisation de l’ordinateur — OSWorld 2.1 à 72,4 % sur le sous-ensemble hors ligne, contre 15,7 % pour Haiku 4.5, 48,9 % pour GPT-6 Luna et 83,9 % pour Sonnet 5.5.
• Raisonnement multidisciplinaire — Humanity's Last Exam à 45,9 % sans outils et 57,4 % avec, contre 10,2 % et 18,7 % pour Haiku 4.5.
• Codage agentique — Terminal-Bench 4.0 à 39,2 % contre 0,0 %, 16,4 % et 70,6 %. FrontierCode 1.1 (Main) à 46,4 % contre 42,4 % pour GPT-6 Luna et 52,1 % pour Sonnet 5.5.
• Raisonnement visuel — Chartography à 46,4 % sans outils, contre 6,4 %, 29,1 % et 61,6 %.
Anthropic se montre également d'une franchise inhabituelle sur les cas où la gamme compacte ne l'emporte pas. Son propre commentaire sur le graphique Terminal-Bench indique que Sonnet 5.5 et Opus 5.5 « restent de meilleurs choix pour les tâches de codage agentique complexes », et positionne plutôt Haiku 5.5 pour le compactage, le résumé et le travail de sous-agent. Les citations de clients dans l'article vont dans le même sens et comportent la même mise en garde : il s'agit de partenaires à accès anticipé décrivant leurs propres évaluations, et non des audits : Asana rapporte plus de 30 % de latence en moins pour la réalisation des tâches et jusqu'à 2,5 fois plus rapide en inférence par tour d'agent ; HubSpot rapporte 92,8 % en moyenne sur trois exécutions sur une suite de portails CRM ; AlphaSense rapporte 0,84 contre 0,76 sur 400 requêtes pour une charge de travail effectuant environ 8 M d'appels par semaine ; Box rapporte 11 points de plus que Haiku 4.5 à environ la moitié de la latence ; Rogo décrit un sous-agent Haiku 5.5 extrayant une ligne de revenus de segment d'un 10-K ; et Cognition rapporte que Devin Fusion obtient un score FrontierCode de 66,2 avec Haiku 5.5 dans le rôle de second.
Ce que dit le conseil indépendant
Les tableaux des fournisseurs appartiennent aux fournisseurs. Le premier positionnement externe est le chiffre le plus utile pour quiconque cherche à déterminer si le palier a suffisamment progressé pour modifier un pipeline de production.

Artificial Analysis attribue à Claude Haiku 5.5 un score de 43 sur son Intelligence Index v4.3.2 dans la configuration Max du modèle, ce qui le classe deuxième des 182 modèles de ce classement et bien au-dessus de la médiane de 13 de ce dernier. La même page mesure 242 tokens de sortie par seconde — neuvième sur 182 — et un coût de 0,21 $ par tâche de l'Intelligence Index.
Deux choses sur cette page valent plus que le titre. La première est la verbosité : en évaluant l'Index, Artificial Analysis a enregistré 440 millions de tokens en sortie, contre une médiane de 100 millions, et décrit le modèle comme « très verbeux ». Un prix affiché est facturé par token, donc un modèle qui réfléchit longuement le paie — c'est exactement pourquoi le coût par tâche se situe à 0,21 $ plutôt que près de zéro, et pourquoi la réduction de 90 % des entrées n'est pas toute l'histoire. La seconde est l'échelle d'effort : la même page expose des configurations de Max à Low, et le réglage par défaut d'Anthropic est medium, pas max. Le 43 du classement est le sommet de cette échelle, pas le réglage que vous obtenez si vous ne faites rien.
Exécuter le palier en dessous du palier que vous pouvez déjà appeler
Claude Haiku 5.5 ne figure pas dans le catalogue d’OrcaRouter, et il vaudrait mieux le dire clairement plutôt que de laisser entendre le contraire : l’écart, au jour du lancement, entre l’existence d’un modèle et sa disponibilité au routage se compte généralement en jours, et parfois davantage.
Ce qui figure aujourd'hui au catalogue d'Anthropic, c'est Claude Haiku 4.5, Claude Sonnet 5.5 et Claude Opus 5.5, chacun au prix catalogue du fournisseur, répercuté avec 0 % de marge, si bien que toute baisse consentie par Anthropic atterrit de notre côté le jour même où elle atterrit chez eux. C'est le pont pratique pour quiconque veut tester dès maintenant le schéma des sous-agents : une cascade qui envoie les tours de routine vers Haiku 4.5 et fait monter les plus difficiles d'un cran fonctionne dès aujourd'hui avec une seule clé et un seul SDK, et remplacer plus tard le petit maillon par Haiku 5.5 relève d'un changement d'identifiant de modèle, et non d'une migration. Le basculement automatique en cas de défaillance se trouve sous les maillons que vous choisissez, de sorte qu'un mauvais après-midi chez un seul fournisseur n'emporte pas tout le pipeline avec lui.
Si vous préférez ne pas attendre du tout, la même tranche d'entrée à 0,10 $ est déjà occupée par GPT-6 Luna, que nous acheminons bel et bien, et qui maintient ce tarif jusqu'à 272 000 tokens avant de passer au palier supérieur.
Qui devrait bouger, et qui ne devrait pas
Si votre charge de travail relève de la classification, de l’extraction, du routage, du compactage ou du résumé en volume, et que vos prompts font moins de 100 000 jetons, le calcul est simple : le tarif est dix fois inférieur à ce qu’il était, la fenêtre est cinq fois plus large, et le curseur d’effort vous permet de basculer dans l’autre sens lorsqu’une requête l’exige. Tablez sur environ 75 % de moins et vous ne serez pas surpris.
Si vos prompts dépassent régulièrement les 100 000 tokens, vous bénéficiez d'une réduction de 50 % plutôt que de 90 %, et comparer les offres pour le contexte profond mérite encore qu'on y consacre un après-midi — le marché propose plusieurs modèles à un tarif égal ou inférieur au prix au-delà de 100 K de cette gamme.
Et si votre évaluation échoue encore sur des tâches du type Terminal-Bench, ce n'est pas le modèle qui y remédiera ; Anthropic le dit elle-même, et les 39,2 % face aux 70,6 % de Sonnet 5.5 constituent la preuve la plus claire dans l'article. Le résumé honnête du 7 octobre, c'est que le plancher de l'intelligence utile a beaucoup baissé et que le plafond n'a pas bougé du tout.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
