
Claude Haiku 5.5 visait le segment Flash chinois. Seule la moitié de cette affirmation résiste à l’examen.
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Un lecteur écrivant en chinois a avancé cette semaine un argument incisif : Claude Haiku 5.5semble conçu pour s'emparer du marché chinois de milieu de gamme, car il bat DeepSeek V4.1 Flash et GLM 5.3 Flash sur le prix et obtient de meilleurs scores que GLM 5.3 Flash sur Terminal Bench 4.0 et l'Artificial Analysis Intelligence Index. C'est une lecture plus fine que la plupart des commentaires de lancement. Ce sont aussi deux affirmations sous un même manteau, et elles ne portent pas la même part de vérité.
Anthropic a lancé Claude Haiku 5.5 le 7 octobre 2026 — un lancement public complet avec une annonce datée, une fiche système et une grille tarifaire publiée. Cela donne à cette affirmation quelque chose que les commentaires de marché de seconde main obtiennent rarement : des chiffres vérifiables.
L’audit ci-dessous constate qu’une moitié est plus solide que ne l’a dit le lecteur et que l’autre moitié est erronée sur le benchmark précis qu’elle cite. Les deux constats valent la peine d’être connus, car ils pointent dans des directions opposées.
L’affirmation, énoncée précisément
Réduit à ses composantes, l’argument comporte trois parties.
• Prix — Claude Haiku 5.5 est moins cher que DeepSeek V4.1 Flash et moins cher que GLM 5.3 Flash.
• Score indépendant — il se situe environ un point au-dessus de GLM 5.3 Flash dans l'Artificial Analysis Intelligence Index.
• Benchmark de codage — il obtient également un point de plus que GLM 5.3 Flash sur Terminal Bench 4.0.
Deux d'entre eux sont vérifiables par rapport à des tableaux publiés et tiennent bon, moyennant des ajustements. Le troisième est vérifiable par rapport au même tableau et donne un résultat différent de celui décrit.

La partie prix : vraie, et sous-estimée dans un sens, surestimée dans l'autre
Le tarif publié par Anthropic pour Claude Haiku 5.5 est de 0,10 $ par million de tokens d’entrée et de 0,50 $ par million de tokens de sortie jusqu’à un prompt de 100 000 tokens, puis passe à 0,50 $ et 2,50 $ au-delà de ce seuil. La lecture des entrées mises en cache coûte 0,01 $ et leur écriture 0,125 $. La fenêtre de contexte est d’un million de tokens ; la sortie maximale est de 128 000.
GLM 5.3 Flash, de Z.ai, est proposé à 0,15 $ et 0,50 $, avec l'entrée mise en cache à 0,026 $. DeepSeek V4.1 Flash est proposé à 0,30 $ et 1,20 $, avec l'entrée mise en cache à 0,006 $.
Sur le tarif affiché, le lecteur a raison. Un tarif d’entrée de 0,10 $ est inférieur d’un tiers à celui de GLM 5.3 Flash et de deux tiers à celui de DeepSeek V4.1 Flash, et un tarif de sortie de 0,50 $ correspond exactement à celui de GLM 5.3 Flash tout en étant bien en dessous de la moitié de celui de DeepSeek. C’est un positionnement qui semble délibéré : s’aligner sur la sortie du rival le moins cher, le surpasser sur l’entrée, et laisser le ratio parler de lui-même.
Là où l'affirmation gagne en crédibilité, c'est sur le coût mesuré par tâche terminée. Sur l'Intelligence Index v4.3.2 d'Artificial Analysis, le coût pour l'ensemble de la tâche s'établit à 0,21 $ pour Claude Haiku 5.5, 0,25 $ pour GLM 5.3 Flash et 0,27 $ pour DeepSeek V4.1 Flash. La grille tarifaire indique que Claude Haiku 5.5 est 1,5 fois moins cher que GLM 5.3 Flash en entrée ; la mesure indique que la tâche terminée est environ un sixième moins chère. Toujours le moins cher des trois — mais pas de l'écart que le prix affiché laisse entendre.
La raison est celle que la plupart des comparatifs de prix omettent. Claude Haiku 5.5 est verbeux. Artificial Intelligence a enregistré 162 164 tokens de sortie pour lui lors de l’exécution de l’Index, contre 68 673 pour GLM 5.3 Flash et 88 574 pour DeepSeek V4.1 Flash. La documentation d’Anthropic elle-même ajoute un second effet : le modèle utilise le tokeniseur plus récent partagé avec Claude 4.7 et les versions ultérieures, de sorte que le même texte compte pour environ 30 % de plus que sur le modèle qu’il utilise. Un tarif moins cher appliqué à davantage de tokens est un tarif moins cher appliqué à davantage de tokens.
Une subtilité qui n’apparaît que sur une facture routée : notre propre catalogue répertorie DeepSeek V4.1 Flash à 0,15 $ en entrée et 0,60 $ en sortie, avec un multiplicateur de 2× appliqué pendant deux plages horaires quotidiennes, 01:00–04:00 et 06:00–10:00 UTC. Pendant dix-huit heures par jour, c’est le tarif de base ; pendant six heures par jour, le tarif de sortie est de 1,20 $. Le trafic par lots qui peut être planifié en dehors de ces plages obtient un prix DeepSeek nettement plus avantageux que ne le laisse entendre le tarif catalogue affiché du fournisseur, et ce n’est pas le cas du trafic interactif. Si vous modélisez vraiment cette comparaison, le calendrier compte autant que la grille tarifaire.

La moitié du score : « environ un point » est 1,6
Sur l'Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 est mesuré à 43,40 dans sa configuration Max. GLM 5.3 Flash est mesuré à 41,81. DeepSeek V4.1 Flash se situe à 39,46.
Ainsi, la composante « indice » de l’affirmation est correcte quant à sa direction et s’arrondit à la baisse : l’écart est de 1,59 point, et non de un. C’est une véritable avance sur un indice qui se situe dans les soixante, et c’est le nombre qui est cité dans chaque résumé de cette confrontation.
Ce dont il ne s'agit pas, c'est d'une affirmation sur les benchmarks sous-jacents. Les deux fournisseurs publient leurs propres ensembles d'évaluation, et ce ne sont pas les mêmes — Anthropic rapporte GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 et FrontierCode pour Claude Haiku 5.5 ; Z.ai rapporte sa propre suite pour GLM 5.3 Flash. Le classement indépendant est la seule ligne véritablement comparable à armes égales, ce qui explique précisément pourquoi l'écart d'indice est autant mis à contribution, et pourquoi la section suivante compte.
La moitié codage : celle-ci est une égalité parfaite, pas une victoire.
Terminal Bench 4.0, sur la mesure indépendante partagée, affiche 0,32828 pour Claude Haiku 5.5 et 0,32828 pour GLM 5.3 Flash. Identique à cinq décimales près.
C'est le nombre le plus citable de cette confrontation, et l'affirmation à son sujet est fausse. La source probable de la confusion est la ligne voisine : le GLM-5.3 complet, la déclinaison sœur non-Flash, obtient 0,4192 sur le même benchmark. Si vous avez vu « GLM » et « Terminal Bench » dans une même phrase à côté d'un nombre un point au-dessus de Claude Haiku 5.5, il s'agit de la déclinaison sœur, pas du Flash.
Les trois autres lignes qu’Artificial Analysis publie pour les deux modèles sont plus intéressantes que l’égalité, et elles ne vont pas toutes dans le même sens :
• SciCode — 0,5498 pour Claude Haiku 5.5 contre 0,5162 pour GLM 5.3 Flash. Un avantage de 3,4 points pour Anthropic.
• Humanity's Last Exam — 0,4439 contre 0,3985. Un avantage de 4,5 points pour Anthropic.
• AutomationBench, score partiel — 0,3541 contre 0,6037. Un avantage de 25 points pour GLM 5.3 Flash, et de loin l'écart le plus important de l'ensemble.
Cette dernière ligne est celle qui intéressera le plus les équipes d'approvisionnement, car l'automatisation agentique est précisément le domaine où les modèles de milieu de gamme sont réellement déployés. Sur un indicateur mesurant la capacité du modèle à mener à bien une tâche en plusieurs étapes, le modèle à poids ouverts, moins coûteux à exécuter, l'emporte avec une marge qui éclipse la différence d'indice de 1,6 point en sens inverse.
La vitesse divise de la même manière que le prix, mais de façon encore plus marquée. Artificial Analysis a mesuré 424,6 secondes par tâche Index pour Claude Haiku 5.5, contre 1 035,4 secondes pour GLM 5.3 Flash. Le modèle d’Anthropic y parvient en moins de la moitié du temps d’horloge, ce qui, sur une boucle d’agent, est un chiffre opérationnel plus important que le débit de tokens.
Ce que l’allégation omet complètement
La comparaison est présentée comme une histoire de prix et de scores, ce qui omet discrètement la dimension où les deux modèles se ressemblent le moins. GLM 5.3 Flash est à poids ouverts, publié sous licence MIT, avec 320 milliards de paramètres au total et 18 milliards actifs. DeepSeek V4.1 Flash est lui aussi à poids ouverts, avec 552 milliards de paramètres au total et 16 milliards actifs. Claude Haiku 5.5 est propriétaire, uniquement accessible via API, sans nombre de paramètres publié et sans dépôt.
Cela ne constitue pas une note de bas de page pour beaucoup d’acheteurs ; c’est la première ligne du document d’exigences. Une équipe qui doit exécuter l’inférence dans son propre tenant, affiner un modèle, ou maintenir une version de modèle figée pendant des années ne choisit pas du tout entre ces trois-là sur des points d’indice — deux des trois sont disqualifiés avant même que la colonne des prix ne soit lue. Le cadrage du lecteur est une observation de positionnement marché, et elle est juste ; il se trouve simplement que la différence structurelle joue contre le modèle que ce cadrage défend.
Exécuter la comparaison vous-même
GLM 5.3 Flash et DeepSeek V4.1 Flash figurent tous deux au catalogue OrcaRouter au prix catalogue du fournisseur, avec 0 % de marge, ce qui fait du volet chinois de cette comparaison quelque chose que vous pouvez appeler dès aujourd'hui plutôt qu'à modéliser dans un tableur. Comme le tarif est répercuté plutôt que lissé, une variation de prix du fournisseur arrive de notre côté le jour même où elle arrive chez lui — et la fenêtre DeepSeek basée sur le calendrier décrite ci-dessus est visible dans le même bloc tarifaire que celui contre lequel vous routeriez. Une clé, un SDK, basculement automatique en dessous, et le DSL de routage si vous préférez exprimer un plafond de coût dans la route plutôt que dans le code de l'application.
Claude Haiku 5.5 ne figure pas dans notre catalogue. Il est accessible via l'API d'Anthropic elle-même, et il vaut mieux le dire clairement plutôt que de le laisser sous-entendu.

Ce que le lecteur a bien compris, et ce qu'il faut en faire
L'instinct est juste. Si vous vouliez que la vague de modèles chinois de milieu de gamme, bon marché et compétents, paraisse coûteuse, voici à peu près la carte que vous joueriez : égaler le débit de sortie du rival moins cher, diviser par deux son débit d'entrée, arriver avec 1,6 point d'indice d'avance, et laisser le chiffre du prix par tâche terminée porter l'argument. Claude Haiku 5.5 fait cela, et il le fait tout en étant plus de deux fois plus rapide par tâche que le modèle qu'il cible.
Ce que le lecteur a mal compris est plus circonscrit et plus intéressant. Terminal Bench 4.0 n'est pas une victoire ; c'est une égalité exacte. L'avantage de prix, lorsqu'on facture l'ensemble du travail plutôt que le token, est d'environ un sixième plutôt que le 1,5× que suggère la grille tarifaire. Et le seul benchmark où les deux modèles sont les plus éloignés est le benchmark agentique, où GLM 5.3 Flash mène de 25 points.
Donc, la version honnête de cette affirmation est la suivante : Claude Haiku 5.5 vise la catégorie flash chinoise ; il l’emporte dans cette comparaison sur l’indice composite, sur le coût par tâche terminée et sur la latence ; il ne l’emporte pas sur l’automatisation agentique ni sur l’ouverture ; et l’avantage spécifique au benchmark de codage qui faisait paraître l’argument décisif n’existe pas.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
