
GLM-5.3-Flash vs DeepSeek V4 Flash : Quel modèle de pointe économique devriez-vous appeler ?
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0259Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0258Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0166Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
L'intelligence de niveau frontier coûtait autrefois cinq dollars par million de tokens d'entrée ; aujourd'hui, deux modèles la proposent pour une bouchée de pain, et ils se côtoient dans le même palier budgétaire. GLM-5.3-Flash, le modèle multimodal à 18B actifs de Zhipu AI, open-sourcé le 26 août, et DeepSeek V4 Flash, le codeur agentique à ~13B actifs que DeepSeek a mis en production fin juillet, sont les deux arguments les plus solides pour affirmer que « near-frontier for pennies » est désormais une véritable catégorie de produits. Ils diffèrent plus que ne le suggèrent leurs étiquettes de prix : l'un est un généraliste nativement multimodal avec des poids MIT, l'autre un spécialiste éprouvé du codage et des agents, avec des scores de benchmark indépendants derrière lui.
La réponse courte pour la plupart des équipes : si vous voulez un modèle multimodal ouvert et bon marché sur lequel construire, choisissez GLM-5.3-Flash ; si vous voulez un modèle de codage avec des chiffres agentiques mesurés indépendamment que vous pouvez défendre en réunion, DeepSeek V4 Flash. Le reste de cette page détaille le raisonnement, le tableau de bord par dimension et les mises en garde — en commençant par celle, honnête, qu'une grande partie des affirmations de GLM-5.3-Flash sont rapportées par le fournisseur, tandis que les scores phares de DeepSeek V4 Flash sont mesurés indépendamment.
Le duel en une seule passe.
Les deux modèles sont des architectures mixture-of-experts avec environ 300 milliards de paramètres au total et moins de 20 milliards actifs par jeton ; tous deux prennent en charge une fenêtre de contexte d'un million de jetons, et tous deux sont à poids ouverts. C'est là que s'arrête la similitude. GLM-5.3-Flash est le premier modèle natif multimodal de la gamme GLM-5 de Zhipu — acceptant texte, image et vidéo en entrée — et il a été lancé sous licence MIT, ce qui signifie que vous pouvez l'auto-héberger dès aujourd'hui. DeepSeek V4 Flash est la version de production du modèle que DeepSeek fait évoluer depuis avril ; sa version principale couvre le texte et le code, son architecture est optimisée pour l'utilisation d'outils agentiques, et la vision est fournie séparément dans une version expérimentale plutôt que nativement. Sur l'indice d'intelligence, Zhipu revendique 57 pour le Flash contre 50 mesurés indépendamment pour DeepSeek V4 Flash — un écart significatif s'il se confirme, et le chiffre à surveiller pour une confirmation par un tiers.

Intelligence et benchmarks
C'est la section où la rigueur de sourcing est primordiale, car les deux modèles reposent sur des bases factuelles très différentes.
• Indice d'intelligence AA — GLM-5.3-Flash 57, selon les documents de lancement de Zhipu (non reproduits), contre DeepSeek V4 Flash 50, mesuré indépendamment par Artificial Analysis. Pour donner une échelle, Claude Opus 4.8 se situe près de 57 et Kimi K3 à 57 sur le même indice.
• SWE-bench Verified — aucun chiffre publié pour GLM-5.3-Flash pour l'instant, vs DeepSeek V4 Flash 79.0% (indépendant).
• LiveCodeBench — pas encore de chiffre publié pour GLM-5.3-Flash, contre DeepSeek V4 Flash 91.6% (indépendant).
• Agents' Last Exam — aucune donnée GLM-5.3-Flash publiée pour l'instant, vs DeepSeek V4 Flash 25.2 (indépendant).
Affirmation de parité en codage — Zhipu rapporte que les performances de codage de GLM-5.3-Flash sur son benchmark interne Z.ai Code Bench sont comparables à celles de Claude Opus 4.8 (rapporté par le fournisseur, non reproduit).
• Contexte familial — GLM-5.3, le grand frère de Flash, obtient indépendamment un score de 60 sur l’indice AA ; sur Terminal-Bench 2.1, la propre gamme GLM-5.3 de Zhipu varie de 83,1 à 88,2 lors des exécutions communautaires. Le Terminal-Bench 2.1 de DeepSeek V4 Flash est de 82,7 (indépendant).
L'asymétrie est le point : les chiffres de codage et d'agentique de DeepSeek V4 Flash ont été reproduits par des tiers depuis sa sortie en juillet, tandis que ceux de GLM-5.3-Flash sont des affirmations du fournisseur dès le premier jour. Le score de 57 pour Flash est sept points plus élevé que le 50 de DeepSeek si Zhipu a raison, mais le modèle a été largement testé anonymement avant son lancement, donc des scores indépendants devraient arriver rapidement.
Codage et agents : la véritable différenciation
Si vous achetez un modèle économique pour une charge de travail de codage agentique, la base de preuves importe plus que le delta brut de l'indice. DeepSeek V4 Flash a été ré-entraîné après coup spécifiquement pour la capacité agentique dans sa version de production, et ses chiffres mesurés indépendamment — 79.0 SWE-bench Verified, 91.6 LiveCodeBench, 82.7 Terminal-Bench 2.1 — sont ceux par rapport auxquels les concurrents sont désormais mesurés dans la catégorie économique. L'affirmation de Zhipu concernant le codage de GLM-5.3-Flash est d'une puissance comparable à celle de Claude Opus 4.8 sur son propre benchmark interne, ce qui est une déclaration forte mais pas encore indépendante.
Il y a aussi une différence de comportement dont il vaut la peine d'être informé. Les rapports de la communauté sur DeepSeek V4 Flash décrivent une réflexion relativement mesurée — environ 25 à 45 % des jetons de sortie sont des jetons de réflexion, avec un facteur d'expansion de la sortie d'environ 1,3 à 1,5 fois — ce qui maintient son coût par tâche à un niveau bas. Zhipu n'a pas publié de données comparables sur la verbosité pour GLM-5.3-Flash, et la verbosité est la variable qui transforme une grille tarifaire avantageuse en une tâche coûteuse. Tant que l'expansion réelle des jetons du Flash n'aura pas été mesurée, l'écart de coût effectif par tâche entre ces deux modèles est plus large que l'écart par jeton.
Multimodal, ou pas encore
C'est le différenciateur le plus net. GLM-5.3-Flash accepte nativement les images et les vidéos en plus du texte — le premier modèle GLM-5 à le faire — et Zhipu affirme que son coût de service en contexte long représente environ un tiers de celui du GLM-5.3. La version de production de DeepSeek V4 Flash est limitée au texte et au code ; la capacité multimodale de DeepSeek réside dans une version expérimentale séparée pour la vision, ce qui signifie qu'une charge de travail de vision côté DeepSeek implique un point de terminaison de modèle différent et un historique d'évaluation différent. Si votre pipeline a besoin de comprendre des images ou des vidéos à partir d'un modèle à faible coût aujourd'hui, GLM-5.3-Flash est le seul des deux à l'offrir nativement.
Prix : les chiffres réels
Les deux modèles sous-cotent tout le reste dans leur gamme de capacités, mais selon des calendriers différents.
• GLM-5.3-Flash — Zhipu le propose à un dixième du prix de GLM-5.3, soit 1,40 $ / 4,40 $ par million de jetons, ce qui donne environ 0,14 $ / 0,44 $, ou 0,07 $ / 0,22 $ pendant l’offre de lancement à durée limitée. Zhipu revendique également environ 0,045 $ par tâche sur l’indice AA Intelligence. Les montants en dollars sont dérivés des ratios annoncés par Zhipu ; le ratio lui-même est un fait actuel.
• DeepSeek V4 Flash — 0,14 $ par million de tokens en entrée, 0,28 $ par million de tokens en sortie, le tarif officiel publié par DeepSeek, avec un prix bien inférieur pour les entrées avec cache. Les estimations indépendantes du coût par test l'évaluent à environ 0,03 $ par test de benchmark — le modèle majeur le moins cher du tableau.
• Contexte long — GLM-5.3-Flash à environ un tiers du coût du contexte long de GLM-5.3 (selon le fournisseur) vs DeepSeek V4 Flash avec un contexte de 1M à 0,14 $ / 0,28 $ et une sortie maximale de ~393K.
Sur le papier, les deux prix catalogue sont presque identiques, et la remise rend GLM-5.3-Flash moins cher par jeton pour l’instant. Le hic, c’est que le prix par jeton de DeepSeek V4 Flash est stable et que sa verbosité est maîtrisée, tandis que le prix du Flash est une remise temporaire et que sa verbosité ne l’est pas encore — donc la prédiction honnête est que l’écart de coût effectif est plus faible que l’écart affiché, et qu’il pourrait même s’inverser une fois que les deux seront mesurés sur le même ensemble de tâches.

Vitesse et coût de service
Zhipu affirme que GLM-5.3-Flash présente le calcul d'attention le plus faible parmi les modèles économiques comparés — GLM-5.3, DeepSeek V4 Flash et Kimi K3 — avec un coût de calcul d'attention réduit de 3,0x et un cache KV réduit de 4,4x par rapport à GLM-5.3, tout en admettant que son cache KV reste légèrement plus volumineux que celui de DeepSeek V4 Flash. Côté service, Zhipu fait état d'une amélioration de 3x de la performance de service de bout en bout sur les puces chinoises domestiques, pour un coût par jeton qu'il qualifie de comparable à celui des GPU NVIDIA courants. Tous ces chiffres proviennent du fournisseur. Les coûts de service de DeepSeek V4 Flash, en revanche, sont établis : il est en production depuis le 31 juillet, c'est l'un des modèles les moins chers à exécuter par test, et des hébergeurs tiers le servent à volume depuis un mois. Pour une mise en production, un service éprouvé l'emporte sur un service prometteur.
Laquelle devriez-vous appeler ?
Les directives de décision, en termes simples :
Vous voulez du multimodal ouvert maintenant — GLM-5.3-Flash est le seul des deux à prendre en charge nativement les entrées image/vidéo, et ses poids MIT sont sur Hugging Face dès aujourd'hui.
• Vous voulez un modèle de codage/agentique avec des chiffres indépendants — DeepSeek V4 Flash obtient des scores SWE-bench Verified de 79.0 et Terminal-Bench 2.1 de 82.7, vérifiés par des tiers ; les affirmations de codage de GLM-5.3-Flash ne le sont pas encore.
• Vous voulez le plancher absolu en termes de coût par jeton — la remise de lancement de Flash lui donne l'avantage pour l'instant, mais considérez cette remise comme temporaire.
• Vous tenez à un rythme de production stable — les tarifs de 0,14 $ / 0,28 $ de DeepSeek V4 Flash sont stables depuis juillet ; la grille tarifaire de Flash ne date que de quelques jours.
• Vous êtes incertain et voulez essayer les deux sans un second contrat — DeepSeek V4 Flash est disponible sur OrcaRouter aujourd'hui au prix catalogue de DeepSeek avec 0% de marge, et le côté GLM de cette famille (GLM-5.3, le grand frère du Flash) y est également disponible, donc une fois que le Flash lui-même rejoint la liste, les deux camps de cette confrontation se retrouvent derrière une seule clé. En attendant, les poids MIT du Flash sur Hugging Face sont le moyen le moins cher de le tester vous-même, et le basculement automatique vers un modèle éprouvé est la façon d'essayer le nouveau sans engager une voie de production.

En résumé
GLM-5.3-Flash est le modèle le plus intéressant — multimodal natif, sous licence MIT, un score d'indice annoncé qui rivalise avec des modèles bien plus chers — mais c'est aussi le moins éprouvé, et ses meilleurs chiffres sont ceux du fournisseur au jour du lancement. DeepSeek V4 Flash est le choix économique le plus sûr pour le codage et les tâches d'agent : score d'intelligence indépendant plus bas, mais mesuré, reproductible et stable à 0,14 $ / 0,28 $. Achetez le Flash pour ce qu'il offre d'unique — le multimodal ouvert à ce prix — et achetez DeepSeek V4 Flash pour tout ce qui exige des résultats de référence vérifiables. La question vraiment ouverte, à laquelle les deux prochaines semaines apporteront une réponse, est de savoir si le 57 du Flash survit à une mesure indépendante.
Comparés dans cet article4
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
