
Claude Haiku 5.5 vs GLM-5.3-FlashX : payer 2,5 fois plus pour les mêmes poids, et est-ce que cela en vaut la peine
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
La chose la plus utile à savoir au sujet de GLM-5.3-FlashX avant de le comparer à Claude Haiku 5.5, c'est qu'il utilise les mêmes poids que GLM-5.3-Flash et que son coût d'appel est 2,5 fois plus élevé. Z.ai a lancé FlashX sur sa propre API le 18 septembre 2026, à 0,37 $ par million de tokens d'entrée et 1,25 $ par million de tokens de sortie, contre 0,15 $ et 0,50 $ pour le modèle de base dont il est dérivé. Rien n'a changé dans le modèle ; ce qui a changé, c'est l'endroit où il s'exécute et la vitesse à laquelle on promet qu'il y tournera. Comprendre ce couplage, c'est tout l'enjeu ici, car cela signifie qu'il ne s'agit pas d'une comparaison entre deux niveaux de capacité — mais d'une comparaison entre un palier tarifaire et un palier de service, et Haiku 5.5 se retrouve au milieu de ce débat en venant d'une direction complètement différente.
Deux modèles, quatre prix, un seuil
Mettez les quatre grilles tarifaires pertinentes côte à côte et la forme de la décision devient plus claire que ne le ferait n’importe quelle paire prise isolément :
• Claude Haiku 5.5, moins de 100 000 jetons — 0,10 $ en entrée, 0,50 $ en sortie par million (liste Anthropic)
• Claude Haiku 5.5, plus de 100 000 tokens — 0,50 $ en entrée, 2,50 $ en sortie par million (grille tarifaire Anthropic)
• GLM-5.3-Flash — 0,15 $ en entrée, 0,50 $ en sortie par million (liste Z.ai)
• GLM-5.3-FlashX — 0,37 $ en entrée, 1,25 $ en sortie par million (liste Z.ai)
• Contexte — 1 million de tokens sur les quatre (publié par le fournisseur)
• Poids ouverts — GLM-5.3-Flash et FlashX héritent des poids sous licence MIT du modèle de base ; Claude Haiku 5.5 est fermé (publié par le fournisseur)
• Score indépendant — GLM-5.3-Flash mesuré à un indice d’intelligence Artificial Analysis de 41,807 ; Claude Haiku 5.5 mesuré à 43,395 (Artificial Analysis)
La première chose à remarquer, c'est que le prix de FlashX se situe presque exactement au niveau du palier à contexte long de Claude Haiku 5.5 — 0,37 $ contre 0,50 $ en entrée, 1,25 $ contre 2,50 $ en sortie. Ce n'est pas une coïncidence du marché ; c'est ce que coûte un palier de service premium lorsque le modèle sous-jacent est de gabarit moyen et que le fournisseur facture le débit plutôt que la capacité. La deuxième chose, c'est que GLM-5.3-FlashX est la version chère d'un modèle face auquel le nouveau Haiku d'Anthropic est moins cher à contexte court et comparable à contexte long. La troisième, c'est que ces quatre chiffres tiennent tous dans un facteur cinq les uns par rapport aux autres, ce qui est une fourchette bien plus resserrée que ne le suggère le cadre « modèle bon marché contre modèle cher » de la plupart des comparaisons en tête-à-tête.

Ce qu'est réellement FlashX
GLM-5.3-FlashX n'est pas un nouveau modèle. C'est GLM-5.3-Flash servi sur l'infrastructure propre de Z.ai, annoncé jusqu'à 200 jetons de sortie par seconde en pointe par rapport au débit mesuré du modèle de base, et facturé 2,5 fois le tarif catalogue du modèle de base. L'argument de Z.ai est simple : les mêmes réponses, en plus grand nombre par seconde, et vous payez pour le service plutôt que pour les poids. Pour une charge de travail limitée par le débit — classification par lots, extraction à gros volume, tout ce où la latence est la contrainte plutôt que le coût — c'est une chose cohérente à vendre et une chose cohérente à acheter.
Ce n’est pas une amélioration de capacités, et la tarification le reflète honnêtement : si FlashX était un meilleur modèle, Z.ai ne pourrait pas facturer séparément les poids du modèle de base. Le 2,5x est une prime de service. Savoir si cela vaut la peine de payer dépend du goulot d’étranglement de votre charge de travail, et la réponse est différente pour un pipeline limité par la latence que pour un pipeline limité par le coût.
Artificial Analysis n’a pas de page distincte pour FlashX au moment de la rédaction, ce qu’il vaut mieux dire clairement plutôt que de le dissimuler : le chiffre indépendant que le tableau publie pour GLM-5.3-Flash — 41,807 sur l’Intelligence Index, 52,14 jetons de sortie par seconde mesurés, 0,328 sur Terminal-Bench Hard — est un chiffre pour le modèle de base, pas pour la version servie à 2,5x. L’affirmation de débit du fournisseur pour FlashX est un chiffre de pointe et émane du fournisseur. Aucun tiers indépendant n’a publié de débit pour FlashX lui-même, donc toute comparaison de la vitesse mesurée de Haiku 5.5 avec celle de FlashX est une comparaison avec un chiffre que Z.ai a fourni au sujet de son propre service.
Le multiplicateur de 2,5x de Z.ai n'est pas la seule chose qui rend FlashX coûteux par rapport à son tarif de base. Comme les poids de base sont sous licence MIT et hébergés par des tiers, une charge de travail qui a réellement besoin de plus de débit que n'en fournit le point de terminaison d'un seul fournisseur peut souvent l'obtenir en se répartissant entre plusieurs fournisseurs des mêmes poids, au tarif de base ou à un prix proche, plutôt qu'en payant l'offre premium d'un seul fournisseur. C'est une véritable alternative à laquelle la grille tarifaire de FlashX est confrontée, et Z.ai le sait — c'est sans doute pourquoi son argumentaire met l'accent sur le débit de pointe plutôt que sur l'unicité.

Là où Haiku 5.5 et FlashX se séparent
Mettez les deux en concurrence sur les dimensions qui déterminent une charge de travail réelle et la séparation est suffisamment nette pour choisir :
• Prix pour un contexte inférieur à 100K — Haiku 5.5 0,10 $ / 0,50 $ contre FlashX 0,37 $ / 1,25 $ ; Haiku l'emporte sur les deux tableaux
• Prix pour un contexte de plus de 100K — Haiku 5.5 $0.50 / $2.50 contre FlashX $0.37 / $1.25 ; FlashX l'emporte sur les deux tableaux
• Débit — pic annoncé par le fournisseur de 200 tok/s pour FlashX par rapport au service publié par Anthropic pour Haiku 5.5, qui n’annonce pas de pic de ce type
• Indice indépendant — Haiku 5.5 43,395 vs GLM-5.3-Flash 41,807 (Artificial Analysis ; aucun chiffre indépendant pour FlashX lui-même)
• Poids — FlashX hérite de poids ouverts sous licence MIT ; Haiku 5.5 est fermé et accessible uniquement via API
• Auto-hébergement — possible pour FlashX via les poids ouverts ; impossible pour Haiku 5.5
• Ensemble de fonctionnalités outil/agent — curseur d'effort ajustable sur Haiku 5.5, absent de la gamme GLM Flash
La cellule intéressante est la deuxième. Claude Haiku 5.5 est un modèle cinq fois moins cher que GLM-5.3-FlashX sur les requêtes courtes et légèrement plus cher que lui sur les longues, car la grille tarifaire de Haiku est multipliée par 5 à partir de 100 000 tokens, tandis que FlashX facture un tarif unique. Si votre trafic est majoritairement court, le Haiku est le choix évident sur le seul critère du prix. S'il est majoritairement long, FlashX n'est pas du tout en concurrence avec le prix de la tranche courte du Haiku — il est en concurrence avec la tranche longue du Haiku, et il remporte cette comparaison d'environ un tiers.
La comparaison des capacités est plus serrée qu’aucun des deux fournisseurs ne le souhaiterait. 41,807 contre 43,395 sur le même indice indépendant, c’est un écart inférieur à quatre pour cent, bien dans la marge de bruit de la plupart des évaluations au niveau applicatif, et bien trop faible pour justifier à lui seul un choix. Aucun des deux modèles ne domine l’autre en raisonnement général ; la décision se joue sur la grille tarifaire et sur le débit, pas sur celui qui est le plus intelligent.

La différence de licence est une vraie différence
Le fait que FlashX soit à l'origine un modèle à poids ouverts compte davantage que l'écart de prix sur un axe : il peut être auto-hébergé, et il peut être servi par n'importe qui. Claude Haiku 5.5 ne peut être ni l'un ni l'autre. Pour une équipe soumise à une exigence de conformité imposant que l'inférence se fasse sur son propre matériel, ou dont le volume régulier est suffisant pour qu'amortir un GPU revienne moins cher que de payer au token, la gamme GLM est la seule des deux qui réponde vraiment à la question. Pour tous les autres — la majorité, qui veulent un modèle derrière une API et préféreraient ne pas gérer la couche de service — la licence est une note de bas de page et le prix est l'argument.
Cela signifie aussi que les deux modèles ont des modes de défaillance différents lorsqu’un fournisseur connaît une mauvaise journée. Un modèle fermé servi uniquement par son fournisseur et les partenaires cloud de celui-ci tombe en panne lorsque ces derniers tombent en panne. Un modèle ouvert avec plusieurs hôtes indépendants peut être basculé de l’un à l’autre, à condition que quelque chose effectue ce basculement. C’est une véritable différence opérationnelle, et c’est le genre de chose qui ne se manifeste que le jour où cela compte.
Router les deux sans second contrat
Si la décision ci-dessus ne se réduit pas à un seul gagnant pour votre trafic — ce qui n'est généralement pas le cas, car les deux modèles se surpassent mutuellement sur des moitiés différentes de la grille tarifaire — la question pratique est de savoir comment exploiter les deux sans maintenir deux intégrations. OrcaRouter sert z-ai/glm-5.3-flash à 0,15 $ et 0,50 $ par million au tarif catalogue du fournisseur, aux côtés de qwen/qwen3.8-flash et du reste d'un catalogue de plus de 200 modèles, avec une seule clé et une seule facture. Un changement de tarif d'Anthropic sur Claude Haiku 5.5, ou de Z.ai sur la gamme Flash, est répercuté sans marge le jour même, plutôt que de rester en retard sur la grille tarifaire propre d'un revendeur, de sorte que les chiffres ci-dessus restent les chiffres que vous payez réellement.
Nous ne servons pas Claude Haiku 5.5, et nous ne servons pas GLM-5.3-FlashX — ni l'un ni l'autre ne figure dans notre catalogue ; pour ceux-là, adressez-vous directement à Anthropic et Z.ai. Ce que nous servons, c'est GLM-5.3-Flash, le modèle de base sous-jacent à FlashX, qui est le bon choix pour les nombreuses charges de travail où le supplément de service de 2,5x achète un débit dont personne n'a besoin. Lorsqu'un chemin de production dépend réellement de l'un des deux modèles que nous n'hébergeons pas, notre bascule est le mécanisme qui permet de l'essayer sans parier tout le chemin dessus : pointez la requête vers lui, gardez un modèle fonctionnel comme solution de repli, et laissez la couche de routage décider lequel répond.
Lequel choisir
En dessous de 100 000 tokens par requête, Claude Haiku 5.5 l'emporte sur le prix et est suffisamment proche de FlashX en termes de capacités pour que le choix soit évident. Au-dessus de 100 000 tokens, GLM-5.3-FlashX est moins cher que le palier long-contexte de Haiku 5.5 et c'est le modèle vers lequel se tourner si la taille de la requête est une propriété de la tâche plutôt qu'un choix — bien que le modèle de base GLM-5.3-Flash soit encore moins cher, et la seule raison de payer 2,5 fois plus est si vous avez spécifiquement besoin du débit annoncé de FlashX.
Le cadrage à écarter, c'est celui selon lequel l'un serait l'option économique et l'autre l'option performante. Ce sont tous deux des modèles à prix moyen, avec des grilles tarifaires fixes et bien documentées, et la variable intéressante n'est pas de savoir lequel est meilleur, mais pour quelle moitié de votre trafic chacun revient moins cher. Commencez par extraire votre distribution de tailles de requêtes ; la comparaison de prix à deux colonnes ci-dessus vous dira le reste.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
