
GLM-5.3-FlashX vs GLM-5.3-Flash : mêmes poids, 2,5× le prix, un chiffre différent
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Vous ne pouvez pas acheter GLM-5.3-FlashX et obtenir un meilleur modèle. Ce n'est pas une critique — c'est toute la prémisse. GLM-5.3-FlashX, lancé sur l'API de Z.ai le 18 septembre 2026, utilise exactement les mêmes poids que GLM-5.3-Flash : le même socle mixture-of-experts de 320B au total et 18B actifs, la même fenêtre de contexte de 1M de jetons, les mêmes entrées natives texte, image, vidéo et fichier, le même plafond de sortie de 131 072 jetons. Z.ai n'a publié aucun benchmark pour FlashX, car il n'y a rien de nouveau à évaluer. Ce qui diffère, c'est la vitesse à laquelle les jetons sont produits et ce qu'ils coûtent, et ces deux chiffres sont les seules choses sur lesquelles un acheteur doit raisonner.
C’est une décision plus nette que la plupart des comparaisons de modèles, et plus difficile, car il n’y a pas d’argument de capacités derrière lequel se cacher. Soit la latence vaut 2,5× pour vous, soit elle ne le vaut pas.
Un modèle, deux prix
• Ce qu'est FlashX — un palier de service, et non la sortie d'un modèle ; mêmes poids, mêmes scores, mêmes limitesbr> • Prix des entrées — 0,37 $ par million de tokens sur FlashX contre 0,15 $ par million sur Flash au tarif cataloguebr> • Prix des sorties — 1,25 $ par million contre 0,50 $ par million, le multiplicateur qui fait réellement bouger une facturebr> • Entrées mises en cache — 0,075 $ par million contre 0,03 $ par millionbr> • Vitesse — jusqu'à 200 tokens de sortie par seconde (pic annoncé par le fournisseur) contre 98 tok/s mesurés indépendamment par Artificial Analysisbr> • Accès par abonnement — GLM-5.3-Flash est inclus dans le GLM Coding Plan de Z.ai avec un quota 3× ; FlashX ne l'est pasbr> • Auto-hébergement — GLM-5.3-Flash est un modèle à poids ouverts sous licence MIT sur Hugging Face ; FlashX n'a aucun poids à télécharger

Sur le marché domestique de Z.ai, le même ratio est énoncé clairement : 2 ¥ en entrée et 7 ¥ en sortie pour FlashX, contre 0,8 ¥ et 2,8 ¥ pour Flash. Plusieurs médias chinois décrivent le lancement de la même manière — 5 fois plus rapide, à 2,5 fois le prix — et chacun d’eux note que l’intelligence reste inchangée.
La latence est un poste à part, et elle n’est pas facturée au token.
Si le facteur 2,5× n’est pas automatiquement une mauvaise affaire, c’est parce que le prix des tokens et le coût d’une tâche sont deux grandeurs différentes. Un traitement par lots qui génère un million de tokens de sortie pendant la nuit paie 0,50 $ sur Flash et 1,25 $ sur FlashX pour la sortie seule, et ne récupère rien des 0,75 $ supplémentaires parce que personne n’attend. Une boucle d’agent qui effectue dix appels séquentiels paie la même prime par token, mais chaque appel revient plus vite, et l’économie se retrouve dans le temps d’horloge plutôt que sur la facture. Si FlashX revient réellement en une fraction du temps, dix tours peuvent rendre des dizaines de secondes de latence par tâche — et si cette tâche bloque un humain ou un service en amont, ces secondes valent plus que les tokens.
Le positionnement propre de Z.ai suit exactement cette ligne. Il oriente FlashX vers le codage à forte concurrence, les appels d'agents à plusieurs étapes, le dialogue en temps réel, la complétion de code et le travail multimodal à long contexte, et renvoie vers le Flash de base les charges de travail sensibles au prix et insensibles à la latence — traitement par lots hors ligne, génération en masse, tout ce qui est planifié. C'est la bonne répartition, et il convient de noter que c'est le fournisseur qui l'établit.
Là où le raisonnement s'effondre, c'est du côté du débit. Les 200 jetons par seconde de FlashX sont un pic rapporté par le fournisseur ; les 98 du modèle de base sont une médiane mesurée par un laboratoire indépendant. Les pics sont atteints sur des sorties courtes, avec des caches chauds et un cluster inactif. Une requête multimodale à long contexte — précisément la charge de travail que FlashX cible — est la moins susceptible de s'en approcher, et personne en dehors de Z.ai n'a publié de chiffres pour trancher la question. Si votre charge de travail est limitée par le débit plutôt que par la latence, un chiffre de pic vous dit très peu de chose sur ce que vous obtiendrez réellement.
L'échappatoire que FlashX n'a pas
Il existe une troisième option dans cette comparaison, et elle n’existe que parce que le modèle de base est ouvert. GLM-5.3-Flash est sorti le 26 août 2026 sous licence MIT, avec des poids sur Hugging Face et ModelScope, et il est aujourd’hui servi par des stacks d’inférence telles que SGLang, vLLM, TokenSpeed et KTransformers. Si votre volume est suffisamment élevé pour justifier le matériel, la comparaison honnête n’est pas Flash contre FlashX — c’est le prix de 1,25 $ par million de tokens de sortie de FlashX face à votre propre coût amorti par token sur vos propres accélérateurs.

Cette option a un véritable coût d’entrée. La version FP8 nécessite de l’ordre de 328 Go de mémoire GPU pour être servie, ce qui représente un déploiement multi-nœuds pour la plupart des équipes et un obstacle rédhibitoire pour les autres. Mais cela vaut la peine d’être dit, car c’est cette asymétrie qui fait de la tarification de FlashX un test délibéré plutôt qu’une inévitabilité : Z.ai facture un supplément pour une configuration de service que, pour le modèle de base, les clients peuvent en principe construire eux-mêmes. Le supplément rémunère la commodité, non la capacité, et la commodité a un tarif du marché qui diminue avec le temps.
Ce que le changement de prix signifie vraiment
L'économie derrière ce lancement est d'une lisibilité inhabituelle. GLM-5.3-Flash a été lancé à un dixième du prix de GLM-5.3 — moitié moins pendant une promotion de lancement — et il a été massivement utilisé, y compris durant une période de tests anonymes avant sa sortie que Z.ai a depuis confirmée. FlashX marque la première fois que cette famille prend la direction opposée : le même modèle, à un prix plus élevé. Des analystes cités dans la presse financière chinoise y voient un test commercial délibéré visant à déterminer si les développeurs accepteront de payer pour la vitesse en tant que telle, après une année passée à acheter des parts de marché avec des capacités proches des modèles de pointe à des prix de commodité.
Deux détails étayent cette lecture. FlashX est exclu du GLM Coding Plan, tandis que le Flash de base y est inclus avec un quota triple ; les utilisateurs abonnés ne peuvent donc pas intégrer ce nouveau palier à un engagement existant — ils paient au token. Et le prix est fixe, sans remise en heures creuses, contrairement à la structure horaire que certains concurrents utilisent pour remplir leurs capacités inactives. Un 2,5× fixe sur un palier de vitesse est un prix destiné à ceux qui ne peuvent pas attendre, et Z.ai découvre combien ils sont.
Choisir entre eux
Prenez FlashX si un humain ou un service est bloqué en attente du prochain token et que le modèle lui-même est déjà le bon choix — complétion en ligne, agents interactifs, chat en temps réel, tout ce où la pause fait partie du produit. Prenez GLM-5.3-Flash pour le travail par lots, hors ligne et en masse, pour tout ce que vous pouvez planifier, et pour toute charge de travail où vous payez le volume de sortie plutôt que la latence de sortie. Si votre volume est important et que votre équipe peut faire tourner des accélérateurs, évaluez le coût des poids de base auto-hébergés avant celui de FlashX ; la comparaison est plus favorable que ne le suggèrent les tarifs par token.
Quelle que soit votre choix, considérez les deux comme interchangeables au niveau du site d'appel. Ils acceptent les mêmes prompts, renvoient le même format et produisent la même qualité — la seule chose qui change est une chaîne de modèle, ce qui en fait le type de test A/B le moins coûteux à réaliser. Sur OrcaRouter le tarif catalogue du fournisseur est répercuté avec 0 % de marge, de sorte qu'un changement de tarification ou une promotion de Z.ai s'applique le jour même de sa mise en ligne en amont, et les deux niveaux se trouvent derrière un seul point de terminaison, devant plus de 200 modèles. Pour une décision qui repose entièrement sur une latence mesurée, pouvoir basculer entre eux en cours d'expérimentation sans toucher à votre intégration représente l'essentiel du travail.
Le verdict est plus étroit qu'une comparaison de modèles habituelle, et c'est précisément là tout l'intérêt. FlashX n'est pas un meilleur modèle et ne prétend pas l'être. C'est le même modèle avec une file d'attente plus courte, vendu à un prix qui n'a de sens que si la file d'attente était votre problème. Mesurez vous-même votre temps jusqu'au premier token sur les deux avant de vous engager — le 200 du fournisseur est un plafond, votre charge de travail est le seul benchmark qui compte, et la différence entre les deux niveaux ne tient qu'à un changement de configuration.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
