
Brief IA quotidien, 8 oct. : Claude Haiku 5.5 arrive à 0,10 $ et les lectures de cache de Sonnet 5.5 diminuent de moitié
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Claude Haiku 5.5 est sorti le 7 octobre 2026, et c'est la chose la moins chère que l'entreprise ait jamais mise derrière une API : 0,10 $ par million de tokens d'entrée et 0,50 $ par million de tokens de sortie sur des prompts allant jusqu'à 100 000 tokens, avec une fenêtre de contexte de 1 M de tokens et un réglage d'effort allant de Low à Max. Le même jour, sans publication de lancement qui lui soit propre, les lectures du cache de prompts sur Claude Sonnet 5.5 sont passées de 0,20 $ à 0,10 $ par million de tokens. L'un de ces éléments est un produit et l'autre est une ligne budgétaire, et c'est la ligne budgétaire qui déplacera le plus d'argent ce trimestre.
Le prix d'abord, car c'est la partie sur laquelle vous pouvez agir dès aujourd'hui. Ensuite l'effort, qui est ce qui détermine discrètement le prix. Puis la baisse des tarifs de cache, dont la moitié des personnes qui paient pour Sonnet 5.5 n'entendront parler qu'à leur prochaine facture.
Ce qu'est Claude Haiku 5.5, dans l'ordre d'importance
La présentation du fournisseur lui-même est « le petit modèle le moins cher, le plus rapide et le plus capable que nous ayons jamais publié », et la date de sortie est le 7 octobre 2026 — un jour avant cette note. L'identifiant du modèle est claude-haiku-5-5. Il accepte du texte et des images en entrée et produit du texte. La fenêtre de contexte est de 1 000 000 de jetons, contre 200 000 pour Claude Haiku 4.5, et la sortie maximale est de 128 000 jetons, avec un en-tête bêta sur l'API Batch qui la porte à 300 000. La date limite d'entraînement est juin 2026, et Anthropic s'engage à ne pas le retirer avant le 7 octobre 2027.
La ligne qui compte le plus pour quiconque achemine du trafic n'est pas la fenêtre de contexte. C'est qu'il s'agit du premier modèle de la classe Haiku doté d'un effort réglable. L'effort se décline en Low, Medium, High, Xhigh et Max, la valeur par défaut est Medium, et la réflexion adaptative est activée par défaut — une fonctionnalité de Sonnet et Opus qui arrive un échelon plus bas. L'article de lancement comporte aussi deux éléments qui relèvent de l'achat plutôt que de la construction : des crédits API mensuels pour les forfaits Claude Max et Team, 100 $ pour Max 5x et 200 $ pour Max 20x, avec jusqu'à 500 $ mutualisés pour Team, et la prise en charge bêta de l'usage de l'ordinateur et du navigateur dans les SDK. La sécurité suit le rythme du niveau : les garde-fous cyber sont plus stricts que ceux de Claude Haiku 4.5, les demandes de tests d'intrusion restant bloquées, et les garde-fous en biologie correspondent à ceux de Claude Sonnet 5, Claude Sonnet 5.5 et Claude Opus 5.

Le prix, et la falaise des 100 000 tokens en son milieu
Le tarif affiché est de 0,10 $ par million de tokens d'entrée et de 0,50 $ par million de tokens de sortie. Lisez l'astérisque : c'est le tarif pour les prompts à 100 000 tokens ou moins. Au-dessus de 100 000, les deux nombres sont multipliés par cinq, soit 0,50 $ en entrée et 2,50 $ en sortie. Les écritures en cache coûtent 0,125 $ par million au palier de cinq minutes et 0,20 $ au palier d'une heure dans la tranche économique, et les lectures de cache coûtent 0,01 $ par million — un dixième du tarif d'entrée, ce qui est la remise de cache la plus profonde qu'Anthropic ait publiée sur n'importe quel modèle. Batch divise encore tout par deux : 0,05 $ et 0,25 $ dans la tranche économique, 0,25 $ et 1,25 $ au-dessus.
Comparez cela à Claude Haiku 4.5, qui figure toujours sur la liste des prix à un tarif forfaitaire de 1,00 $ en entrée et 5,00 $ en sortie, sans paliers liés au contexte, avec une lecture de cache à 0,10 $ et une fenêtre de 200 000 tokens. Le nouveau modèle coûte un dixième du prix pour la même forme de prompt, avec cinq fois plus de contexte. Il n’y a aucun calcul de migration à faire ici ; l’arithmétique n’est même pas serrée.
La falaise tarifaire est l’élément autour duquel concevoir. Une invite de 99 000 tokens coûte 99 cents pour mille appels au tarif d’entrée. Une invite de 101 000 tokens coûte 5,05 $ pour mille appels. Une différence de deux mille tokens représente une facture 5 fois plus élevée, donc tout ce que vous construisez dans la tranche bon marché doit soit rester confortablement sous les 100 000 tokens, soit se situer délibérément et systématiquement au-dessus. Le pire résultat est un pipeline à cheval sur la limite qui paie le tarif élevé sur la moitié de son trafic.
L'effort est désormais un paramètre de tarification, et la valeur par défaut n'est pas la moins chère
Comme l’effort est défini par défaut sur Medium et que la réflexion est activée par défaut, le prix affiché et le prix réel ne sont pas le même nombre. Les jetons de raisonnement sont facturés comme des jetons de sortie. Lors de sa propre exécution publiée de l’Artificial Analysis Intelligence Index — rapportée par le fournisseur, non reproduite par nous — Claude Haiku 5.5 émet environ 162 000 jetons par tâche, dont environ 129 000 de raisonnement. Le modèle médian de l’indice émet de l’ordre de 100 millions de jetons sur toute la suite de tests ; Haiku 5.5 en dépense 440 millions. À 0,50 $ par million de jetons de sortie, cette verbosité est abordable, et c’est précisément là tout l’intérêt : au tarif de Haiku 5.5, réfléchir beaucoup reste moins cher que réfléchir un peu sur un modèle qui facture 5,00 $ la sortie.
Réglez le niveau d’effort sur Faible pour les décisions de classification, d’extraction et de routage lorsque vous voulez une réponse rapide plutôt qu’une réponse réfléchie, et laissez-le sur Moyen pour tout ce qu’un utilisateur lira. Passer à Faible est aussi le moyen fiable de maintenir un agent verbeux dans la plage des 100 000 jetons, car cela réduit les jetons de raisonnement avant de réduire la qualité des réponses.
La ligne plus discrète : les lectures de cache de Sonnet 5.5 réduites de moitié
Le cache de prompt de Claude Sonnet 5.5 est à 0,10 $ par million de tokens, contre 0,20 $ auparavant. Le prix d'entrée de Sonnet 5.5 est de 2,00 $ et son prix de sortie de 10,00 $, de sorte qu'un multiplicateur de lecture du cache de 0,05x est désormais le même que celui de Haiku 5.5, appliqué à un tarif d'entrée vingt fois plus élevé. D'après l'estimation d'Anthropic elle-même, cela réduit le coût de la plupart des tâches agentiques d'environ 20 %, ce qui relève d'une affirmation sur la forme de la charge de travail plutôt que d'un benchmark : elle ne tient que si une grande part de votre entrée est un préfixe stable que vous renvoyez à chaque tour. Si vos prompts sont uniques à chaque appel, ce changement ne vous coûte rien et ne vous fait rien économiser.
Il convient de noter ce que cette réduction implique. Anthropic joue agressivement la carte de la pérennité sur le milieu de gamme au moment où elle lance un petit modèle très bon marché, ce qui se lit comme un argument en faveur d’une architecture à deux modèles : un volet Haiku 5.5 avec un cache chaud pour le travail qui fait appel au jugement, et un volet Haiku 5.5 pour le volume qui ne requiert pas de jugement.
Ce que révèlent les chiffres indépendants, un jour après
Artificial Analysis a évalué Claude Haiku 5.5 le lendemain de son lancement. Son Intelligence Index affiche 43 au global, la configuration Max-effort étant annoncée à 43,40, soit deuxième sur 182 modèles du classement. Le coût par tâche d’index est de 0,21 $, soit le quarante-sixième moins cher. Le prix mélangé pour un ratio 7:2:1 entrée / entrée mise en cache / sortie est de 0,08 $ par million, le chiffre qui fait paraître la comparaison de niveaux précédente injuste envers tout le reste. La vitesse de sortie est de 243,4 tokens par seconde, neuvième plus rapide du classement, avec une latence annoncée du premier token d’environ 0,3 seconde et une remise de 90 % sur le cache.
Ce chiffre de 440 millions de tokens en sortie est la mise en garde attachée au 43. Le score est réel et évalué indépendamment ; la verbosité aussi. Un modèle qui réfléchit autant est bon marché par token, mais pas toujours par tâche, et c’est dans l’écart entre ces deux chiffres que se joue réellement une décision de routage.
Pour donner un ordre de grandeur, les comparaisons publiées par Anthropic elle-même situent Claude Haiku 5.5 à 1620 sur GDPval-AA v2.1, contre 735 pour Claude Haiku 4.5, à 72,4 % sur OSWorld 2.1 contre 15,7 %, à 45,9 % sur Humanity's Last Exam sans outils contre 10,2 %, et à 39,2 % sur Terminal-Bench 4.0 contre 0,0 %. Ce sont des chiffres rapportés par le fournisseur sur des évaluations choisies par le fournisseur, et ils doivent être lus comme indicatifs, mais la direction n'est pas subtile — il ne s'agit pas d'une petite mise à niveau d'un petit modèle.

Accéder à ces modèles sans second contrat
Claude Haiku 5.5 est disponible via l'API d'Anthropic elle-même et, de là, partout où les modèles d'Anthropic sont revendus. Dans le catalogue d'OrcaRouter, la gamme Anthropic comprend aujourd'hui anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 et anthropic/claude-fable-5.1 — nous n'hébergeons pas Claude Haiku 5.5, et cette note ne prétendra pas le contraire. Ce que nous proposons, c'est le palier juste au-dessus, et OrcaRouter répercute le prix catalogue du fournisseur sans aucune marge, ce qui explique pourquoi la réduction sur la lecture du cache de Sonnet 5.5 est apparue dans notre tarification le jour même où Anthropic l'a appliquée, plutôt que selon un cycle de révision tarifaire programmé.
La version pratique : si vous voulez essayer Haiku 5.5 sur un volet de classification pendant que votre volet de jugement reste sur Claude Sonnet 5.5, vous tenez deux clés au lieu d'une, et c'est la couche de routage qui décide de l'A/B. Voilà tout l'argument en faveur d'une passerelle plutôt que d'une intégration directe — un seul point de terminaison, des chaînes de modèles, et un chemin de bascule lorsqu'un fournisseur vacille.

Ce qu'il faut surveiller à partir d'ici
Trois choses. Que des fournisseurs tiers commencent à revendre Haiku 5.5 à un tarif mixte inférieur à 0,10 $, point où la couche de routage gagne sa place plutôt que de simplement simplifier l’approvisionnement. Qu’Anthropic repousse la limite du palier de 100 000 jetons, car une falaise à exactement 100 000 est un endroit étrange pour qu’un modèle doté d’une fenêtre de 1 M de jetons en ait une. Et que le chiffre de verbosité de 440 millions de jetons baisse dans une version corrective, parce que ce seul chiffre est ce qui sépare Haiku 5.5 du statut de choix par défaut évident pour toute la moitié inférieure d’une pile de production.
