
GLM-5.3-FlashX sort à 2,5 fois le prix du modèle sur lequel il tourne
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Le chiffre à retenir n’est pas 200. C’est 2,5. Le 18 septembre 2026, Z.ai a mis GLM-5.3-FlashX sur son API à un débit pouvant atteindre 200 jetons de sortie par seconde — et l’a facturé 2,5 fois ce qu’il facture pour GLM-5.3-Flash, le modèle à pondérations ouvertes dont il est issu. Rien n’a changé dans le modèle lui-même. Mêmes pondérations, même socle mixture-of-experts 320B-A18B, même contexte de 1 million de jetons, même prise en charge native du texte, des images, des vidéos et des fichiers. Ce qui a changé, c’est la pile de service en dessous, et ce que Z.ai facture désormais pour le privilège d’être plus près du début de la file d’attente.
Cela fait de FlashX un cas rare sur le marché des modèles : un lancement sans benchmark associé. Z.ai n’a publié aucune évaluation spécifique à FlashX, car il n’y a pas de nouveau modèle à évaluer. Tous les chiffres de capacités qui s’appliquent à GLM-5.3-Flash s’appliquent ici, y compris ceux qui sont moins flatteurs que ne le laissait entendre la couverture du lancement.
Tout le delta, en une seule passe
• Vitesse — GLM-5.3-FlashX jusqu'à 200 tok/s (pic rapporté par le fournisseur) contre GLM-5.3-Flash à 98 tok/s, selon les mesures d'Artificial Analysis sur l'API de Z.aibr> • Prix — 0,37 $ par 1M en entrée / 1,25 $ par 1M en sortie contre 0,15 $ / 0,50 $ au tarif cataloguebr> • Entrée mise en cache — 0,075 $ par 1M contre 0,03 $ par 1Mbr> • Intelligence — identique ; FlashX hérite des scores du modèle de basebr> • Contexte — 1M de tokens pour les deuxbr> • Poids — GLM-5.3-Flash est un modèle à poids ouverts sous licence MIT ; FlashX est une offre hébergée et ne dispose pas de ses propres poids
Le 200 et le 98 ne sont pas le même genre de nombre, et il vaut la peine d’être franc à ce sujet. L’un est un plafond que le fournisseur affirme que le service peut atteindre. L’autre est ce qu’un laboratoire indépendant a mesuré sur de vraies requêtes. Un utilisateur qui décide s’il doit payer 2,5× devrait considérer le 200 comme une publicité et aller mesurer sa propre charge de travail.

Ce que Z.ai dit fait le travail
L'accélération tient à l'infrastructure, non aux mathématiques. Z.ai décrit FlashX comme fonctionnant sur un cluster d'environ 100 000 accélérateurs chinois nationaux, doté d'une pile de service conçue sur mesure : un moteur d'inférence basé sur SGLang, une quantification W8A8, une quantification de cache mixte INT8/FP8/BF16, et une architecture désagrégée encode–prefill–decode qui sépare l'étape d'encodage multimodal des étapes de génération de tokens, de sorte qu'aucune ne bloque l'autre. L'entreprise rapporte un débit de service de bout en bout environ 3× supérieur à sa référence initiale sur le même matériel, et indique qu'un agent d'infrastructure propulsé par GLM-5.3 a contribué à optimiser la pile.
Tout cela est déclaré par le fournisseur et, jusqu'à présent, n'a été reproduit par personne en dehors de Z.ai. C'est aussi l'élément le plus plausible de l'histoire : les lancements de niveaux de service comme celui-ci sont généralement des victoires d'ingénierie, et les choix d'architecture décrits constituent la boîte à outils standard pour exactement ce type de gain. Ce qu'ils ne sont pas, en revanche, c'est une garantie. Un chiffre de 200 tok/s est un pic, et les pics sont atteints sur des sorties courtes, des caches chauds et un cluster non congestionné. Les requêtes multimodales à long contexte — la charge de travail pour laquelle FlashX est explicitement présenté — sont celles qui ont le moins de chances de l'atteindre.
Le prix est la véritable décision produit.
Au prix catalogue, GLM-5.3-FlashX coûte 0,37 $ par million de tokens d'entrée et 1,25 $ par million de tokens de sortie, l'entrée mise en cache étant à 0,075 $ et le stockage du cache gratuit pour une durée limitée. Dans la tarification domestique de Z.ai, cela représente 2 ¥ en entrée et 7 ¥ en sortie, contre 0,8 ¥ et 2,8 ¥ pour le Flash de base — le même ratio de 2,5×, exprimé dans la devise dans laquelle Z.ai vend sur son marché intérieur.

L’arithmétique devient vite inconfortable dans la direction que les gens vérifient rarement. Les jetons de sortie sont là où le multiplicateur mord le plus fort, car la sortie est le côté coûteux sur chaque modèle de cette famille : la sortie de FlashX est 2,5× celle de Flash, et la sortie coûte déjà ~3,4× le prix de l’entrée sur les deux. Une tâche par lots qui génère un million de jetons de sortie par jour passe de 0,50 $ à 1,25 $ — une différence de 274 $ par an pour une charge de travail sur laquelle, par définition, personne n’attend.
Là où cela rapporte, c’est sur la latence que l’on peut amortir. Une boucle d’agent qui effectue dix appels séquentiels économise dix fois la différence par appel, et si cette différence est de deux ou trois secondes, vous récupérez une demi-minute de temps d’horloge par tâche. Pour la complétion de code interactive, le dialogue en temps réel, ou tout pipeline où un humain ou un service en amont est bloqué en attente du prochain token, ce compromis est généralement judicieux. Z.ai précise également que le modèle ne fait actuellement pas partie de son GLM Coding Plan, de sorte que les utilisateurs abonnés ne disposent pas de FlashX inclus — ils le paient au token.
Si votre stack communique déjà avec plus d'un fournisseur, le changement se résume à modifier la chaîne de modèle, rien d'autre. C'est la raison pratique pour laquelle le routage existe en tant que couche : sur OrcaRouter le prix catalogue du fournisseur est répercuté avec 0 % de marge, donc un changement de prix de Z.ai ou une remise promotionnelle arrive le jour même où cela se produit en amont, et un point de terminaison unique devant plus de 200 modèles signifie qu'évaluer FlashX par rapport à Flash relève d'une simple modification de configuration plutôt que d'un projet d'intégration. Le basculement compte aussi ici — un tout nouveau palier de service sur un tout nouveau cluster est exactement le genre de dépendance pour laquelle il vaut la peine d'avoir un repli.
Ce qui n'a pas changé, et pourquoi cela compte davantage
FlashX hérite intégralement du profil de capacités de GLM-5.3-Flash, et ce profil est plus étroit que ne le laissait entendre la couverture du lancement. Les documents de Z.ai placent le modèle de base au niveau de Claude Opus 4.8 sur l'Artificial Analysis Intelligence Index. Artificial Analysis lui-même classe actuellement GLM-5.3-Flash à 42 sur cet indice, sur la base de mesures effectuées sur l'API propre de Z.ai — un score solide, bien au-dessus de la médiane des modèles à poids ouverts de sa catégorie, et très loin du niveau de pointe que suggère la comparaison du fournisseur. Les deux affirmations sont vraies ; elles ne disent simplement pas la même chose, et l'écart entre elles est la raison pour laquelle ce blog qualifie les chiffres des fournisseurs de chiffres de fournisseurs.
Le modèle de base est réellement capable et réellement ouvert. GLM-5.3-Flash est sorti le 26 août 2026 sous licence MIT, avec les poids sur Hugging Face, et sa conception d'attention hybride linéaire et éparse — compression IndexPool, hyper-connexions à contrainte de variété — réduit le calcul d'attention d'environ 3× et le cache KV d'environ 4,4× par rapport à GLM-5.3, ce qui rend un modèle de 320 B doté de 18 B de paramètres actifs suffisamment bon marché pour être servi tout court. La sortie est plafonnée à 131 072 tokens. Il est rapide pour son prix, pas rapide pour sa catégorie : Artificial Analysis a mesuré 98 tokens par seconde, contre une médiane de pairs supérieure à 70 mais inférieure à celle des modèles les plus rapides du classement.
FlashX ne change rien à tout cela. Il change seulement le temps que vous attendez.
La lecture honnête
Achetez FlashX si votre charge de travail est limitée par la latence et que vous avez déjà décidé que GLM-5.3-Flash est le bon modèle — un agent qui enchaîne les appels, un éditeur qui complète en ligne, une interface vocale ou de chat où la pause fait partie du produit. Restez sur GLM-5.3-Flash, ou sur les poids ouverts que vous pouvez héberger vous-même, si votre travail est traité par lots, hors ligne, ou limité par le débit plutôt que par la latence. L'intelligence que vous payez 2,5× plus cher est l'intelligence que vous aviez déjà.
La question ouverte est de savoir ce que dit une mesure indépendante à propos du 200. Personne en dehors de Z.ai n’a encore publié de chiffres de débit de FlashX, et tant que personne ne l’aura fait, la position honnête est que FlashX est un palier de service prometteur vendu sur un chiffre de pointe. C’est aussi, notamment, un test commercial : un laboratoire qui a passé un an à proposer un modèle quasi-frontière à un dixième du prix de son modèle phare demande maintenant si les développeurs paieront pour la vitesse en tant que telle. La réponse déterminera comment le prochain palier sera tarifé.

Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
