Une carte de titre principale pour GLM-5.3-FlashX vs DeepSeek V4.1 Flash, sous-titrée « Le palier de vitesse qui est plus lent que le modèle bon marché », avec des pastilles indiquant « 200 vs 214,7 tok/s », « 0,37 $ / 1,25 $ vs 0,15 $ / 0,60 $ » et « AA 42 vs 40 », et une ligne de pied de page « GLM-5.3-FlashX lancé le 18 septembre 2026 ».
Guides & Insights

GLM-5.3-FlashX vs DeepSeek V4.1 Flash : le palier de vitesse qui est plus lent que le modèle bon marché

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

L'offre de vitesse premium de Z.ai a un problème, et il s'appelle DeepSeek V4.1 Flash. Lorsque Z.ai a lancé GLM-5.3-FlashX le 18 septembre 2026, elle a vendu le nouveau niveau sur un seul chiffre : jusqu'à 200 jetons de sortie par seconde, environ cinq fois le débit du GLM-5.3-Flash dont il est dérivé, pour 2,5× le prix. Des mesures indépendantes placent déjà le modèle à bas coût de DeepSeek à 214,7 jetons par seconde avec un temps jusqu'au premier jeton de 1,15 seconde — plus rapide sur les deux plans que le plafond annoncé par Z.ai, et à un prix dont FlashX n'approche pas. Si vous achetez de la vitesse, le marché a évolué avant l'arrivée de FlashX.

Cette approche est injuste envers FlashX d’une manière précise, et juste pour tout le reste. Les deux modèles sont des dérivés ouverts à contexte de 1 M qui ont été conçus pour le coût, et tous deux sont vraiment bons dans ce pour quoi ils ont été conçus. Mais ils ont été conçus pour deux moitiés différentes du même problème, et l’écart de prix entre eux est désormais suffisamment large pour que « lequel est le meilleur » ait une réponse en une ligne pour la plupart des charges de travail.

Là où chacun a réellement l’avantage

• Prix, tarif catalogue — GLM-5.3-FlashX 0,37 $ / 1,25 $ par million de tokens en entrée/sortie, contre DeepSeek V4.1 Flash 0,15 $ / 0,60 $ hors pointe et 0,30 $ / 1,20 $ en pointebr> • Entrée mise en cache — FlashX 0,075 $ par million contre 0,003 $ pour DeepSeek hors pointe, un écart de 25× qui se cumule fortement dans les boucles d'agentsbr> • Débit mesuré — FlashX jusqu'à 200 tok/s (pic annoncé par le fournisseur, aucun chiffre indépendant publié) contre 214,7 tok/s pour DeepSeek (Artificial Analysis, sur l'API de DeepSeek)br> • Temps jusqu'au premier token — non publié pour FlashX, contre 1,15 s mesuré pour DeepSeek V4.1 Flashbr> • Intelligence indépendante — FlashX hérite du score de 42 de GLM-5.3-Flash sur l'Artificial Analysis Intelligence Index, contre 40 pour DeepSeek V4.1 Flashbr> • Architecture — MoE de 320B au total / 18B actifs contre 552B au total avec environ 8B actifs en prefill et 16B en decodebr> • Modalité d'entrée — texte, image, vidéo et fichiers contre texte et imagebr> • Plafond de sortie — 131 072 tokens contre environ 384 000br> • Poids ouverts — GLM-5.3-Flash est sous licence MIT ; FlashX est une offre hébergée sans poids propres, et DeepSeek V4.1 Flash est sous licence MIT

A two-column scoreboard titled 'GLM-5.3-FlashX vs DeepSeek V4.1 Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'AA Index: 42', 'Context: 1M tokens', 'Output cap: 131,072'; the DeepSeek V4.1 Flash column reads 'Price: $0.15 / $0.60 off-peak', 'Cached input: $0.003 per 1M', 'Speed: 214.7 tok/s (measured)', 'AA Index: 40', 'Context: 1M tokens', 'Output cap: 384,000'; the footer reads 'FlashX speed is vendor-reported; DeepSeek figures per Artificial Analysis.'

Relisez cette liste deux fois, car sa forme est tout l'intérêt. FlashX remporte exactement deux lignes, et toutes deux sont étroites : une avance de deux points sur un indice d'intelligence indépendant, et l'entrée vidéo. DeepSeek l'emporte sur le prix, le prix en cache, la vitesse mesurée, la longueur des sorties et l'étendue des modalités, dans le sens qui compte — il prend en entrée des images et produit de longues réponses. L'écart de deux points sur l'indice se situe dans le bruit d'une seule exécution de benchmark et ne devrait pas être ce qui décide de votre architecture.

Le niveau de vitesse qui est plus lent que le modèle économique

C'est la partie sur laquelle il vaut la peine de s'attarder. Z.ai a conçu FlashX pour résoudre un problème réel : GLM-5.3-Flash est lent. Artificial Analysis l'a mesuré à 98 jetons de sortie par seconde, ce qui se situe au-dessus de la médiane de ses pairs parmi les modèles à poids ouverts de sa taille, mais reste très loin d'être interactif. La solution de l'entreprise a consisté en une refonte de la pile de service — environ 100 000 accélérateurs nationaux, un moteur basé sur SGLang, une quantification W8A8, un cache KV en précision mixte et une architecture désagrégée encode–prefill–decode — et elle rapporte un débit de bout en bout environ 3× supérieur à sa base de référence sur le même matériel.

DeepSeek a résolu le même problème au niveau de l'architecture, et a été le premier à y parvenir. La séparation encodeur–décodeur causale de V4.1 Flash active environ 8 milliards de paramètres lors du préremplissage et 16 milliards lors du décodage plutôt qu'un chiffre unique, et Compressed Sparse Attention 2 avec cache KV FP4 réduit le cache global à 890 octets par token — soit environ un quart de la HBM et un huitième du stockage SSD dont son prédécesseur avait besoin. Le résultat est un modèle qui tourne à 214,7 tokens par seconde, d'après les mesures d'un laboratoire neutre, sur la même API first-party, sans qu'un palier premium soit requis.

Le 200 de Z.ai est un pic revendiqué par le fournisseur et le 214,7 de DeepSeek est une médiane indépendante, ce qui constitue la comparaison la moins favorable possible pour Z.ai et la raison de la prendre avec des pincettes. Il est tout à fait possible que FlashX batte DeepSeek sur une requête à chaud, avec une sortie courte et sans congestion. Il est impossible de le savoir, car personne en dehors de Z.ai n'a publié de chiffres de débit pour FlashX. Ce que l'on peut savoir aujourd'hui, c'est que les deux modèles se situent dans la même plage de vitesse, et que l'un des deux coûte trois fois moins cher.

A screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash at max effort (captured September 19, 2026), showing an Intelligence Index score of 40, a measured 215 output tokens per second, $0.30 per 1M input and $1.20 per 1M output tokens, a 1M-token context window, 552B total parameters with 16B active, an MIT licence and weights on Hugging Face.

Où l’avantage tarifaire de DeepSeek devient structurel

DeepSeek V4.1 Flash facture 0,15 $ par million de jetons d'entrée et 0,60 $ par million de jetons de sortie en heures creuses, puis le double, soit 0,30 $ et 1,20 $, pendant deux créneaux en semaine (01:00–04:00 et 06:00–10:00 UTC). FlashX est à 0,37 $ et 1,25 $ en tarif fixe. Mettez-les côte à côte : la tarification fixe qui ressemble à un avantage est en fait la structure la plus coûteuse pour quiconque peut planifier son travail.

La ligne des entrées mises en cache est celle qui détermine les charges de travail des agents. DeepSeek facture 0,003 $ par million de jetons d'entrée mis en cache hors pointe ; FlashX facture 0,075 $, soit vingt-cinq fois plus. Un agent qui renvoie un long prompt système et un schéma d'outil à chaque étape paie cette différence à chaque étape, et c'est le poste de facturation qui, à lui seul, est le plus susceptible de dominer une vraie facture. Z.ai indique que le stockage du cache est gratuit pour une durée limitée, ce qui est une remise sur le stockage plutôt que sur les lectures qui s'accumulent réellement.

Il y a un contrepoids, et c’est l’honnêteté quant à ce que coûtent les propres chiffres de DeepSeek. Les évaluations menées par le fournisseur qui sous-tendent les scores mis en avant de V4.1 Flash ont été produites avec un effort de raisonnement maximal, et DeepSeek documente que le passage d’un effort 25 à un effort 100 fait passer DeepSWE v1.1 de 66,0 à 74,2 tout en consommant environ 2,5× les tokens de sortie. À 2,5× les tokens, le coût effectif de la configuration à effort élevé est bien plus proche de FlashX que ne le laisse penser le prix affiché — et le modèle est documenté comme très verbeux, générant 250M de tokens de sortie sur l’Intelligence Index contre une médiane de 130M. Un tarif par token bon marché sur un modèle bavard n’équivaut pas à une tâche bon marché. Quiconque compare ces deux modèles en termes de prix doit comparer le coût par tâche accomplie, et non le coût par million de tokens, et doit s’attendre à mesurer plutôt qu’à estimer.

Comment décider, concrètement

Si votre charge de travail est un agent de longue durée avec un préfixe stable, DeepSeek V4.1 Flash est le choix, et le ratio d’entrées mises en cache décide à lui seul. Si vous avez besoin de compréhension vidéo ou d’entrée de fichier dans le même appel, FlashX est le seul des deux à les prendre en charge — c’est une véritable différence de capacités, et non une différence de fiche technique. Si vous avez besoin de longues sorties générées, la limite de sortie d’environ 384 K de DeepSeek contre 131 072 pour FlashX compte pour la génération de rapports, les longs fichiers de code et tout ce qui synthétise plutôt que répond. Si vous avez besoin du meilleur score indépendant sur un seul indice de benchmark, le 42 de FlashX contre 40 est réel mais trop faible pour s’y appuyer.

Les deux modèles sont accessibles depuis un seul point de terminaison si votre pile est déjà routée, ce qui est la façon la moins coûteuse de trancher cette question. Sur OrcaRouter le prix catalogue du fournisseur est répercuté avec 0 % de marge, de sorte que la remise hors pointe de DeepSeek et tout futur changement de tarif de Z.ai sont répercutés le jour même où ils surviennent, et passer de l'un à l'autre se fait via une chaîne de modèle plutôt qu'une intégration. Le basculement automatique en cas de défaillance mérite d'être prévu pour FlashX en particulier : c'est un palier de service vieux de trois semaines sur un nouveau cluster, et le mode de défaillance contre lequel vous vous prémunissez est un plafond de capacité, et non un modèle qui cesse de fonctionner.

Le résumé sans détour : DeepSeek V4.1 Flash est le meilleur choix par défaut pour la plupart des travaux en production — moins cher par token, moins cher par token mis en cache, mesuré comme plus rapide, et capable de sorties plus longues. GLM-5.3-FlashX est le bon choix dans un créneau plus étroit, là où vous avez besoin d'entrées vidéo ou de fichiers et souhaitez un indice indépendant légèrement supérieur derrière. Z.ai a facturé au prix fort un niveau de rapidité et l'a lancé sur un marché où le modèle rapide et bon marché existait déjà. Voilà toute la comparaison.

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash (deepseek/deepseek-v4.1-flash, captured September 19, 2026) showing the model header, a 384K max output, text and image input, an MIT licence by DeepSeek with a 2026-09-10 release date, and the billing row reading $0.15 per 1M input and $0.60 per 1M output tokens with a 1.33-second p50 time to first token.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement