Une carte héros intitulée « À égalité parfaite à 0.32828 », avec Claude Haiku 5.5 et GLM 5.3 Flash de part et d'autre du nombre, une ligne indiquant Terminal Bench 4.0 0.32828, une ligne Index indiquant 43.40 contre 41.81, et le sous-titre « Même nombre, machines différentes ».
Guides & Insights

Claude Haiku 5.5 vs GLM 5.3 Flash : au coude à coude sur le benchmark que les deux fournisseurs citent

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Lancez Claude Haiku 5.5 et GLM 5.3 Flash sur Terminal Bench 4.0 et vous obtenez le même nombre : 0,32828 pour les deux. Pas proches — identiques, à cinq décimales près, sur le benchmark que le fournisseur met en avant dans ses propres supports de lancement et que les supports de lancement de Z.ai mettent eux aussi en avant. Pour deux modèles construits sur des piles technologiques entièrement différentes, par des fournisseurs de pays différents, publiés à six semaines d'intervalle, c'est une coïncidence qui mérite qu'on s'y arrête.

C'est aussi le mauvais chiffre sur lequel fonder une décision. Les deux modèles divergent nettement partout ailleurs, et le schéma de cette divergence est suffisamment inhabituel pour changer la façon dont vous lisez les affirmations phares de l'un ou l'autre fournisseur. L'un d'eux remporte l'indice composite et le chiffre du coût par tâche. L'autre remporte presque tout ce qui ressemble à un déploiement réel.

Ils ne sont pas séparés par la capacité. Ils sont séparés par la forme.

Commencez par le seul nombre qui dit « ceux-ci sont de la même classe de modèle ».

• SciCode — 0,5498 pour Claude Haiku 5.5 contre 0,5162 pour GLM 5.3 Flash. Deux points pour Anthropic, sur un benchmark où deux points ne sont que du bruit.

• Terminal Bench 4.0 — 0,32828 contre 0,32828. Une égalité, exactement.

• Fenêtre de contexte — un million de jetons pour les deux.

• Prix de sortie, premier palier — 0,50 $ par million de tokens pour les deux.

Quatre lignes, des correspondances proches. Si vous vous arrêtiez ici, vous concluriez que ces modèles sont interchangeables et choisiriez en fonction du prix. Cette conclusion serait erronée, et c’est ce que montre la prochaine série de lignes.

Là où ils divergent, la direction est constante.

Les lignes qui les séparent vraiment ne sont pas dispersées. Elles se regroupent en deux groupes, et chaque modèle possède l’un de ces groupes en propre.

Le groupe agentique appartient à GLM 5.3 Flash.Le score partiel d'AutomationBench affiche 0,6037 pour GLM 5.3 Flash contre 0,3541 pour Claude Haiku 5.5 — un écart de 25 points, la plus grande différence entre ces deux modèles sur une même mesure partagée. Tau-Bench Banking affiche 0,4722 pour GLM 5.3 Flash ; Claude Haiku 5.5 n'a aucun chiffre publié sur cette ligne. GPQA affiche 0,9121 pour GLM 5.3 Flash ; là encore, aucun chiffre d'Anthropic auquel se comparer. Sur les mesures de la capacité d'un modèle à tenir une tâche multi-étapes et à utiliser des outils de manière fiable dans un domaine structuré, le modèle de Z.ai est en avance d'une marge qui éclipse la différence d'indice composite allant dans l'autre sens.

Le groupe composite et coût revient à Claude Haiku 5.5.L’Artificial Analysis Intelligence Index v4.3.2 affiche 43,40 contre 41,81 — 1,59 point, et c’est le chiffre que cite chaque résumé de cette confrontation. Le coût par tâche Index terminée s’élève à 0,21 $ contre 0,25 $. Le temps réel par tâche Index s’élève à 424,6 secondes contre 1 035,4 secondes : le modèle d’Anthropic termine en moins de la moitié du temps.

Voilà la forme du choix. Claude Haiku 5.5 est plus rapide, moins cher par tâche terminée, et mieux placé dans l’agrégat. GLM 5.3 Flash est plus fiable sur la classe précise de travail pour laquelle on achète des modèles bon marché.

A two-column scoreboard titled 'Claude Haiku 5.5 vs GLM 5.3 Flash - the scoreboard' with rows Terminal Bench 4.0 0.32828 against 0.32828, SciCode 0.5498 against 0.5162, Humanity's Last Exam 0.4439 against 0.3985, AutomationBench 0.3541 against 0.6037, Index v4.3.2 43.40 against 41.81 and cost per task $0.21 against $0.25, footed 'Both figures per Artificial Analysis v4.3.2; Terminal Bench 4.0 is an exact tie.'

Lequel faut-il croire ?

Ni l’un ni l’autre, en soi — et le désaccord lui-même est l’information.

Un Intelligence Index est un mélange pondéré de catégories de raisonnement, de science, de codage et d'agentique. Il est conçu pour répondre à « dans quelle mesure ce modèle est-il capable » en un seul chiffre, et il s'acquitte de cette tâche. Ce qu'il ne peut pas faire, c'est vous dire si une avance de 1,59 point provient des catégories dans lesquelles vit votre charge de travail ou de celles qu'elle ne touche jamais. Ici, l'avance provient en grande partie de lignes comme SciCode et Humanity's Last Exam — 0,5498 contre 0,5162, et 0,4439 contre 0,3985 — tandis qu'un déficit de 25 points se situe sur AutomationBench, avec le signe opposé.

Une équipe qui développe un assistant de codage sur une boucle de terminal remarquera l’avantage de SciCode. Une équipe qui développe un agent devant accomplir de bout en bout un workflow bancaire remarquera l’écart d’AutomationBench, et elle le remarquera chaque jour. Les deux équipes examinent le même indice et devraient tirer des conclusions opposées.

L’action pratique consiste à lire le composite comme un filtre plutôt que comme un classement. Si deux modèles se situent à environ deux points d’indice l’un de l’autre, le composite vous a dit qu’ils appartenaient à la même bande et ne vous a rien dit sur lequel choisir. À ce stade, les seules lignes qui valent la peine d’être lues sont celles qui correspondent à votre charge de travail — et si un fournisseur n’a pas publié une ligne dont vous avez besoin, cette absence est en soi une donnée, et non un vide à combler par une supposition.

La ligne du tokenizer que personne ne met dans le tableau comparatif.

La documentation d’Anthropic elle-même contient une phrase qui change toute comparaison de prix impliquant Claude Haiku 5.5, et il est facile de la lire sans s’y arrêter. Le modèle utilise le tokeniseur plus récent partagé avec Claude 4.7 et les versions ultérieures, qui compte environ 30 % de tokens en plus pour le même texte que le modèle qu’il remplace.

Comparez cela au tarif et l’arithmétique devient moins flatteuse que ne le laisse croire le prix affiché. Le tarif d’entrée de Claude Haiku 5.5 est de 0,10 $ par million de jetons, contre 0,15 $ pour GLM 5.3 Flash — un avantage de 1,5×. Si 30 % de jetons en plus sont nécessaires pour un même prompt, l’avantage effectif sur un texte identique se réduit considérablement, sans pour autant disparaître. Les tarifs de sortie sont identiques, à 0,50 $ dans le premier palier, de sorte que l’effet du tokenizer s’applique sans rien pour le compenser.

Le résultat mesuré est la version honnête de l'affirmation : selon les propres comptes d'Artificial Analysis, Claude Haiku 5.5 a généré 162 164 jetons de sortie par tâche de l'Index, contre 68 673 pour GLM 5.3 Flash — 2,4 fois plus — et il est malgré tout ressorti à 0,21 $ par tâche terminée, contre 0,25 $. L'avantage tarifaire survit à la verbosité, et ce qu'il en reste est plus petit que ne l'indique la grille tarifaire.

Un seul de ces deux affiche des tarifs forfaitaires. Le prix de Claude Haiku 5.5 passe à un palier supérieur au-delà de 100 000 tokens de prompt, à 0,50 $ en entrée et 2,50 $ en sortie ; GLM 5.3 Flash n’a pas de seuil équivalent publié. Pour la plupart du trafic de chat et d’assistance au code, ce palier n’entre jamais en jeu. Pour le travail d’agent sur des documents longs ou à grand contexte, il entre constamment en jeu, et à ce stade, la comparaison s’inverse bien au-delà de ce que suggèrent les chiffres du premier palier.

A capture of Anthropic's models-overview documentation table headed 'Lifecycle and reference', listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with context windows, maximum outputs, prices per million tokens, latency and default effort, and showing Claude Haiku 5.5 as 'This model' at 1M context, 128K maximum output and 'From $0.10/$0.50'.

La ligne qui tranche avant même que le moindre chiffre ne le fasse.

Tout ce qui précède suppose que vous pouvez choisir librement entre ces deux modèles. Une grande partie des équipes n’en a pas la possibilité, et la raison tient à une seule ligne de fiche technique que la discussion sur les benchmarks a tendance à occulter.

GLM 5.3 Flash est à poids ouverts, diffusé sous licence MIT, avec 320 milliards de paramètres au total, dont 18 milliards actifs. Il peut être téléchargé, auto-hébergé, affiné, quantifié, épinglé à une version et exécuté dans un tenant que vous contrôlez. Claude Haiku 5.5 est propriétaire et uniquement accessible via API, sans nombre de paramètres publié, sans licence ni dépôt.

Si votre cahier des charges indique que le modèle doit tourner sur votre propre matériel, ou qu’un checkpoint précis doit rester appelable pendant les trois prochaines années, cette comparaison est close avant même que la colonne des prix ne soit lue. Ce n’est pas un détail technique. C’est la raison la plus courante pour laquelle les équipes se retrouvent tout simplement sur un modèle de gamme intermédiaire à poids ouverts, et c’est la raison pour laquelle un avantage de 25 points sur AutomationBench n’est pas la seule chose qui pousse dans la direction de Z.ai.

Cela joue aussi dans l’autre sens, et la même honnêteté s’applique. Anthropic publie un engagement de retrait pour Claude Haiku 5.5, à une échéance pas avant octobre 2027, et propose le modèle sur une API first-party avec une fiche système et un ensemble d’évaluations documenté. Une publication en open-weights n’est pas automatiquement plus pérenne — vous héritez de la charge opérationnelle en même temps que des poids, et un fichier de licence n’est pas un contrat de support. Lequel de ces deux choix vous voulez est une question qui concerne votre équipe, pas les modèles.

Les deux côtés sur une seule touche, si vous voulez trancher empiriquement.

GLM 5.3 Flash figure au catalogue OrcaRouter au prix catalogue de Z.ai, avec 0 % de marge, répercuté directement plutôt que lissé, donc le tarif ci-dessus est celui de la facture et toute modification apportée par Z.ai nous est répercutée le jour même. Claude Haiku 5.5 ne figure pas dans notre catalogue — il est accessible via l'API d'Anthropic elle-même — et il vaut mieux le dire que de le laisser sous-entendu.

Ce que le catalogue facilite vraiment, c'est la forme de test que cette confrontation appelle réellement. Le désaccord entre l'indice composite et les lignes agentiques est une hypothèse sur votre charge de travail, et la seule façon de le trancher est de faire tourner les deux modèles sur la même trace. Avec GLM 5.3 Flash sur la route et une branche Anthropic de l'autre côté de la même passerelle, cela devient un changement de configuration plutôt que deux intégrations — une seule API pour plus de 200 modèles, une seule clé, basculement automatique en dessous, et le DSL de routage quand vous voulez répartir le trafic par classe de tâche et lire le coût sur une seule facture.

A capture of the OrcaRouter model page for GLM 5.3 Flash under z-ai/glm-5.3-flash, showing a 1M-token context window, 128K maximum output, text, image and video input, benchmarks published by Z.ai on 2026-08-26, the description of its 320B total and 18B active parameters, and a price strip of $0.15 input, $0.50 output and $0.030 cache read per million tokens.

Le verdict, énoncé comme les chiffres le soutiennent

Si votre travail consiste à faire du texte en entrée, du texte en sortie, que vos prompts restent dans le premier palier tarifaire et que vous payez au token pour un vrai volume, Claude Haiku 5.5 est ici le meilleur modèle : composite plus élevé, coût moindre par tâche terminée et plus de deux fois plus rapide par tâche. Le chiffre phare du benchmark terminal est du pareil au même et ne devrait servir à trancher quoi que ce soit.

Si votre travail est un agent qui doit accomplir un flux de travail à plusieurs étapes sans supervision, GLM 5.3 Flash est en tête sur le seul benchmark partagé qui mesure exactement cela, de 25 points, et c’est le moins cher des deux à modifier parce que vous pouvez détenir les poids.

Le score identique de 0,32828 correspond à la bonne image pour cette paire, mais pas parce que les modèles sont équivalents. C'est la seule ligne où deux modèles n'ayant presque rien d'autre en commun tombent par hasard sur le même chiffre — et c'est en prenant ce chiffre pour un résumé de la comparaison qu'une décision d'achat finit par se fonder sur le nombre le moins informatif du tableau.