Une carte de titre principale pour GLM 5.3 Prime vs GLM-5.3-Flash indiquant « GLM 5.3 Prime vs GLM-5.3-Flash : un écart de 18x », avec pour sous-titre « L'un est une voie de service texte uniquement, l'autre est un modèle multimodal », avec trois pastilles indiquant « Prix / 1M : $2.80 / $8.80 vs $0.15 / $0.50 », « Modalité : texte uniquement vs texte, image, vidéo » et « Licence : propriétaire vs MIT », et une ligne de pied de page « GLM-5.3 annoncé le 14 août 2026 ; GLM-5.3-Flash publié le 26 août 2026. »
Guides & Insights

GLM 5.3 Prime vs GLM-5.3-Flash : un écart de prix de 18x entre deux modèles différents

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Voici la comparaison en une ligne, pour quiconque est arrivé avec une décision d'achat déjà à moitié prise : GLM 5.3 Prime correspond à GLM-5.3, dont les poids phares sont vendus via un palier de service accéléré à 2,80 $ et 8,80 $ par million de tokens, et GLM-5.3-Flash est un modèle distinct, nativement multimodal, avec ses propres poids ouverts à 0,15 $ et 0,50 $. L'écart entre les deux est d'environ dix-huit fois en entrée comme en sortie. Ce n'est pas une différence de palier — c'est un modèle différent à une position différente dans la famille, et la seule raison pour laquelle les deux noms se retrouvent côte à côte dans une liste de modèles est que les deux sont apparus à six semaines d'intervalle.

Se tromper là-dessus coûte cher dans les deux sens. Considérez Flash comme une version bon marché de Prime et vous serez surpris par ce qu’il ne peut pas faire. Considérez Prime comme un Flash plus rapide et vous paierez dix-huit fois trop cher pour un modèle qui ne peut pas voir une image.

Commencez par ce que chacun est réellement.

GLM-5.3-Flash est un mélange d'experts multimodal de 320 milliards de paramètres, dont 18 milliards actifs, publié le 26 août 2026 sous licence MIT, avec des poids sur Hugging Face et ModelScope. Il accepte nativement le texte, les images, la vidéo et les fichiers dans la même requête, dispose d'une fenêtre de contexte de 1 000 000 de jetons et d'un plafond de sortie de 128 000 jetons, et a été préentraîné séparément plutôt que distillé à partir du modèle phare. Sa conception d'attention hybride linéaire et parcimonieuse réduit le calcul d'attention d'environ un facteur trois et réduit le cache KV de plus de quatre fois par rapport à GLM-5.3, ce qui explique que son avantage de coût provienne du niveau architectural, et non d'une remise.

GLM 5.3 Prime est GLM-5.3 — un mélange d'experts clairsemé à 40 milliards de paramètres actifs annoncé le 14 août 2026, dans l'API à partir du 18 août, avec l'ouverture des poids le 25 août — servi via une voie à haut débit. Même contexte de 1 000 000 de tokens, même plafond de sortie de 131 072 tokens, entrée texte et sortie texte, raisonnement obligatoire à un niveau d'effort faible, élevé ou max, avec max par défaut. La documentation propre de Z.ai ne répertorie aucun SKU Prime ; ce palier existe sur une plateforme tierce qui nomme un unique fournisseur en amont derrière lui.

Le tableau d'affichage

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3-Flash - the scoreboard'. The GLM 5.3 Prime column reads 'Price / 1M: $2.80 / $8.80', 'Cached input: $0.56', 'Modality: text only', 'Weights: none', 'Intelligence Index: 45, same as GLM-5.3', 'Speed: 1.5-2x, vendor-reported'; the GLM-5.3-Flash column reads 'Price / 1M: $0.15 / $0.50', 'Cached input: $0.03', 'Modality: text, image, video, file', 'Weights: open, MIT', 'Intelligence Index: 42', 'Speed: 46 tokens/sec, independently measured'; the footer reads 'Flash figures per Artificial Analysis v4.3.2; Prime speed is vendor-reported with no independent measurement.'

• Prix — GLM 5.3 Prime 2,80 $ / 8,80 $ par 1M vs GLM-5.3-Flash 0,15 $ / 0,50 $ par 1M
• Entrée mise en cache — 0,56 $ par 1M vs 0,03 $ par 1M
• Multiplicateur — environ 18× en entrée comme en sortie, avant toute mise en cache
• Modalité — texte uniquement vs texte, image, vidéo et fichiers en entrée
• Paramètres — 40B actifs sur un MoE phare vs 320B au total / 18B actifs
• Poids — ouverts, sous une licence sur mesure assortie d'un seuil de chiffre d'affaires vs MIT, téléchargeables dès aujourd'hui
• Sortie maximale — 131 072 tokens vs 128 000 tokens
• Contexte — 1 000 000 de tokens dans les deux cas
• Indice d'intelligence — GLM-5.3 obtient 45 sur l'indice v4.3.2 ; GLM-5.3-Flash obtient 42
• Coût par tâche de l'indice — 2,01 $ pour le modèle phare vs 0,25 $ pour Flash
• Vitesse — environ 61 tokens de sortie par seconde vs environ 46, des médianes mesurées indépendamment dans les deux cas
• Accès par abonnement — Prime n'est pas inclus dans le Coding Plan de Z.ai ; Flash l'est, avec un quota 3×

Deux lignes de cette liste méritent plus qu'une puce. La première est l'écart d'intelligence : trois points sur l'Artificial Analysis Intelligence Index, 45 contre 42, selon la révision v4.3.2. Une révision antérieure du même indice plaçait ces modèles à 60 et 57, et ce couple plus ancien circule encore largement dans la couverture du lancement — ne mélangez pas les deux, car les chiffres ne sont pas comparables d'une révision à l'autre. Trois points, c'est un écart étroit qui se traduit par une légère dérive supplémentaire sur les chaînes agentiques très longues et une sensibilité accrue aux instructions ambiguës, plutôt que par une classe de modèle différente.

La deuxième est la vitesse, et elle inverse l’intuition que les noms créent. Sur des mesures indépendantes, Flash est le plus lent des deux — environ 46 jetons de sortie par seconde contre 61 pour le modèle phare, dans une catégorie où la moyenne est de 67. Flash justifie son nom par son prix et sa multimodalité, pas par sa latence. Cela compte pour la comparaison, car la raison habituelle de se tourner vers un petit modèle est qu’il répond plus vite, et ici, ce n’est pas le cas.

La décision qu’il vous appartient réellement de prendre

Parce que les deux modèles diffèrent sur trois axes à la fois — modalité, licence et prix —, le choix se règle généralement sur le premier axe et n’arrive jamais à l’arithmétique. Flash lit les images et la vidéo ; Prime ne peut rien lire d’autre que du texte. Si votre charge de travail touche à une capture d’écran, à une page numérisée, à une capture d’interface utilisateur ou à une trame vidéo, la comparaison est terminée avant même que le prix n’entre en jeu, et vous achetez Flash.

Si votre charge de travail est purement textuelle et que la question porte véritablement sur la qualité, la réponse honnête est que l’écart de trois points sur l’indice représente tout ce que vous achetez pour 18×. Que cela en vaille la peine dépend entièrement de votre capacité à vérifier la sortie. Lorsque la réponse est vérifiable — du code qui compile, une requête qui renvoie des lignes, une extraction structurée qui se valide par rapport à un schéma —, il est peu coûteux de détecter les ratés occasionnels de Flash et de réessayer, et pour un dix-huitième du prix, vous pouvez réessayer un très grand nombre de fois. Lorsque la sortie est de la prose qu’une personne doit juger, ou un long plan en plusieurs étapes sans contrôle intermédiaire, il est plus difficile de compenser l’écart et le surcoût est plus facile à justifier.

Là où les poids ouverts changent les maths

Flash est sous licence MIT, et sa plus petite quantification utilisable nécessite de l'ordre de 93 Go de mémoire d'accélérateur — un seul nœud à grande mémoire pour beaucoup d'équipes, et une erreur d'arrondi sur la facture pour certaines. GLM-5.3 porte une licence sur mesure qui exige que les grands opérateurs de modèles en tant que service dépassant un seuil de chiffre d'affaires passent un examen de sécurité, et sa plus petite quantification pratique se situe aux alentours de 217 Go, ce qui représente un déploiement multi-nœuds pour la plupart.

Cette asymétrie signifie que la véritable comparaison pour une équipe à fort volume n’est pas les 8,80 $ de Prime contre les 0,50 $ de Flash. C’est les 8,80 $ de Prime contre votre propre coût amorti par million de tokens de sortie sur du matériel que vous possédez déjà, en exécutant des poids que vous pouvez télécharger aujourd’hui sans discussion de licence. Pour une équipe disposant du matériel et du volume, ce chiffre est souvent le plus faible des trois, et il n’est disponible que du côté Flash de cette comparaison.

Acheter les deux, et les acheter ensemble

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 24, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input with text output, a 2026-08-26 date beside 'Public benchmarks by Z.ai', a 320B total / 18B active parameter line, a p50 time to first token of 6.86 seconds, and a stat strip reading $0.07 input, $0.25 output, 6.86 s p50 TTFT, 10.00 s p95 TTFT and 22,120.9M tokens.

La plupart des systèmes de production n'ont pas besoin de choisir. Le schéma qui convient à ce duo est un routeur : Flash sur le chemin par défaut pour le travail textuel et multimodal, le modèle phare en escalade lorsqu'une tâche s'étend sur un long horizon ou que la première tentative a échoué à un contrôle. Cela représente deux ID de modèles et une fonction de décision, et le coût d'une répartition légèrement erronée se chiffre en quelques centimes pour mille requêtes plutôt qu'en un problème d'architecture.

Nous hébergeons GLM-5.3-Flash à 0,07 $ et 0,25 $ par million de tokens — en dessous des tarifs catalogue du fournisseur, fixés à 0,15 $ et 0,50 $ — et GLM-5.3 au tarif catalogue du fournisseur, soit 1,40 $ et 4,40 $, les deux sans aucune marge de notre part — le prix catalogue du fournisseur est répercuté tel quel plutôt que refacturé selon une nouvelle grille, de sorte qu'une modification tarifaire du fournisseur est répercutée de notre côté le jour même où elle l'est du sien. Les deux identifiants se trouvent derrière une seule clé, aux côtés de plus de 200 autres modèles, ce qui fait de la montée en gamme du Flash vers le modèle phare un simple changement de nom de modèle au sein d'un même chemin d'appel, plutôt qu'une seconde intégration. Le basculement automatique couvre le cas où l'unique fournisseur en amont derrière un palier rapide se dégrade, et pour un palier comme Prime, qui ne répertorie qu'un seul fournisseur, ce n'est pas une inquiétude hypothétique.

Nous devons être directs sur les limites de cela : OrcaRouter n’héberge pas GLM 5.3 Prime, et nous n’hébergeons pas non plus GLM-5.3-FlashX. Les deux pages de modèle renvoient ici une 404. Si c’est l’accélération de Prime dont vous avez besoin, vous l’achèterez auprès de la plateforme qui la vend.

Ce que nous vous dirions réellement

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 24, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, a 1M-token context window, $0.15 per 1M input and $0.50 per 1M output tokens with an 83% cache discount, and the comparison line 'At 46 tokens per second, GLM 5.3 Flash is notably slow (67).'

Si vous avez lu jusqu’ici en cherchant un vainqueur, la réponse est que ce duo n’a jamais été un combat. Flash l’emporte sur le coût, sur la modalité, sur la licence et sur la facilité de déploiement, et il l’emporte sur ces quatre points avec une large marge. Le seul argument du modèle phare est trois points d’indice et environ 15 jetons de sortie de plus par seconde, et il facture dix-huit fois le prix pour cela. Pour la grande majorité des charges de travail textuelles, Flash est le choix par défaut correct, et la charge de la preuve incombe à l’option coûteuse.

L'endroit où il faut faire attention, c'est le milieu. Une équipe qui a besoin de la qualité de raisonnement d'un modèle phare sur le texte et doit aussi lire des images finira par faire tourner les deux modèles, et la tentation est de tout router vers le modèle phare parce que c'est celui qui a la réputation. C'est là que le 18× devient discrètement un vrai poste budgétaire. Routez le travail multimodal vers Flash, escaladez en cas d'échec, et vérifiez votre taux d'escalade réel avant de supposer qu'il est élevé.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement