
Qwen 3.8 vs GLM-5.2 : Le premier benchmark où ils se chevauchent réellement
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Ces deux modèles sont l'expression la plus claire de paris opposés dans l'IA chinoise open-weight. Chez Zhipu, GLM-5.2 est léger et éprouvé : 753 milliards de paramètres au total, avec seulement 40B actifs, un indice Artificial Analysis Intelligence audité de 51, des poids téléchargeables depuis juin 2026, et un prix publié de 0,95 $ / 3,00 $. Chez Alibaba, Qwen3.8-Max est le pari maximaliste : ~2,4T de paramètres, un nombre de paramètres actifs non divulgué et — jusqu'à récemment — aucun chiffre du tout.
La disponibilité générale du 3 août 2026 a donné à cette confrontation quelque chose qu'aucun autre article de cette série n'a : un benchmark sur lequel les deux modèles ont un score. Alibaba rapporte Terminal-Bench 2.1 à 86,6 ; Artificial Analysis a audité GLM-5.2 à 82,7 sur ce même test. Pour la première fois, l'affirmation de Qwen peut être placée à côté d'un chiffre de concurrent mesuré indépendamment sur un terrain identique — avec la réserve importante que seul un des deux a été produit par un arbitre.
Une note pour les développeurs — le moyen le plus rapide de trancher est d'exécuter les deux sur vos propres invites. OrcaRouter place plus de 200 modèles derrière un point de terminaison compatible OpenAI, vous pouvez donc opposer Qwen 3.8 Max à GLM-5.2 sur la même tâche sans avoir à intégrer deux SDK.
Verdict TL;DR. Sur le seul benchmark partagé, Qwen revendique une avance de 3,9 points sur Terminal-Bench 2.1 (86,6 contre 82,7) — un résultat réel s’il se reproduit, même si le chiffre de Qwen est auto-déclaré et celui de GLM est audité. Partout ailleurs, GLM-5.2 détient les avantages pratiques : il est ~2× moins cher à 0,95 $ / 3,00 $ contre 2 $ / 6 $ pour Qwen, ses poids sont téléchargeables aujourd’hui, ses 40B paramètres actifs le rendent réellement déployable, et il porte un score d’indice indépendant de 51 là où Qwen n’en a aucun. Qwen répond avec un contexte forfaitaire de 1M tokens, une multimodalité native que GLM ne possède pas, et un plafond potentiel plus élevé. Le profil léger et éprouvé bat encore le profil grand et non vérifié pour la production — mais l’écart s’est resserré le 3 août.
Points clés
• Premier chevauchement direct de benchmark dans la série : Terminal-Bench 2.1 — Qwen3.8-Max 86,6 (rapporté par Alibaba) contre GLM-5.2 82,7 (Artificial Analysis, audité). Qwen mène par 3,9 points, mais les deux chiffres ne sont pas également fiables.
• GLM-5.2 coûte environ la moitié du prix : $0.95 / $3.00 par 1M (AA blended ~$0.90) par rapport à Qwen3.8-Max qui est à $2 / $6.
• Les paramètres actifs sont la véritable histoire architecturale : GLM-5.2 utilise 40B actifs sur 753B au total. Alibaba n'a toujours pas divulgué le nombre de paramètres actifs de Qwen, ce qui rend son coût de service impossible à modéliser.
• Les poids de GLM sont téléchargeables aujourd'hui ; Ceux de Qwen sont promis d'ici la fin de la semaine, sans licence ni dépôt pour l'instant.
• GLM-5.2 a un indice audité de 51. Qwen3.8-Max reste sans score — bien que son prédécesseur Qwen3.7-Max ait obtenu 46, en dessous de GLM.
• Les offres uniques de Qwen : une fenêtre de contexte de 1M de jetons facturée à prix fixe, sans surcoût pour les prompts longs, ainsi qu'une entrée native texte/image/vidéo et OmniDocBench 1.5 92.1. GLM-5.2 est axé sur le texte.
Note de précision : tous les chiffres de qualité de Qwen3.8-Max sont rapportés par Alibaba et non vérifiés par des tiers. Les chiffres de GLM-5.2 proviennent d'Artificial Analysis. Comparer un score auto-déclaré à un score audité sur le même benchmark est instructif, mais non concluant — les environnements de test du fournisseur et ceux de l'évaluateur diffèrent. La tarification de Qwen est celle de la grille tarifaire GA et remplace la remise d'aperçu de juillet.
Les spécifications et le prix, côte à côte
Voici les données concrètes, chaque chiffre étant attribué à sa source.
• Fabricant / statut — Qwen3.8-Max : Alibaba ; GA (3 août 2026) ; GLM-5.2 : Zhipu ; publié en juin 2026
• Architecture — Qwen3.8-Max : ~2,4T au total, MoE sparse ; GLM-5.2 : 753B au total, MoE sparse (Artificial Analysis)
• Paramètres actifs — Qwen3.8-Max : Toujours non divulgués par Alibaba ; GLM-5.2 : 40B actifs (Artificial Analysis)
• Fenêtre de contexte — Qwen3.8-Max : 1M de jetons, tarif forfaitaire (983 616 avec réflexion ; sortie max 131 072) ; GLM-5.2 : 1M de jetons (Artificial Analysis)
• Terminal-Bench 2.1 — Qwen3.8-Max : 86,6 (rapporté par Alibaba) ; GLM-5.2 : 82,7 (Artificial Analysis, audité)
• AA Intelligence Index — Qwen3.8-Max: Pas encore noté; GLM-5.2: 51 (Artificial Analysis)
• Autres scores rapportés par les fournisseurs — Qwen3.8-Max : GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (rapporté par Alibaba) ; GLM-5.2 : le classement est mesuré par un tiers
• Modalités — Qwen3.8-Max : Texte, image, vidéo en entrée → texte en sortie ; GLM-5.2 : axé sur le texte
• Tarifs (entrée / sortie) — Qwen3.8-Max : $2.00 / $6.00 par 1M, forfaitaire ; entrée en cache $0.25 ; GLM-5.2 : $0.95 / $3.00 par 1M (AA mélangé ~$0.90)
• Poids ouverts — Qwen3.8-Max : Promis dans la semaine (pas encore de licence) ; GLM-5.2 : Oui — téléchargeable aujourd'hui
Deux choses encadrent cette comparaison, et la première est le point de données le plus utile de toute la série.
Premièrement, le recoupement Terminal-Bench est véritablement instructif. Terminal-Bench 2.1 mesure si un modèle peut utiliser un véritable shell jusqu'au bout — exécuter des commandes, lire les sorties, se remettre des erreurs. C'est la meilleure approximation disponible pour « ce modèle peut-il fonctionner comme un agent de codage plutôt que comme un simple suggérateur de code », et c'est le benchmark que les deux fournisseurs ont choisi de rapporter. Le 86,6 de Qwen contre le 82,7 audité de GLM représente une avance de 3,9 points en faveur de Qwen.
La réserve a son importance, mais elle ne doit pas être surestimée. Les bancs d'essai des fournisseurs et ceux des évaluateurs diffèrent dans l'échafaudage, la politique de nouvelle tentative et la construction des prompts, et ces choix peuvent faire varier un score Terminal-Bench de plus de quatre points. Ce n'est donc pas une preuve que Qwen est le meilleur modèle agentique. Ce que cela établit, c'est que l'affirmation autodéclarée de Qwen se situe dans la même bande concurrentielle qu'un modèle frontal open-weight audité, plutôt que dans un territoire invraisemblable. C'est une position nettement plus solide que « non évalué ».
Deuxièmement, la comparaison des architectures est l'endroit où GLM l'emporte discrètement. GLM-5.2 active 40B paramètres sur 753B. Ce seul chiffre vous indique son coût de service, son profil de latence, et qu'une équipe bien équipée peut réellement l'exécuter. Alibaba n'a toujours pas publié le nombre de paramètres actifs de Qwen — ce qui signifie que pour tout ce que le titre 2.4T laisse entendre, personne en dehors d'Alibaba ne peut estimer ce qu'il en coûte de servir Qwen3.8-Max ou comment il se comporterait en auto-hébergement. Dans une comparaison de Mixture-of-Experts, ce n'est pas une note de bas de page; c'est le nombre manquant le plus important.

Léger et éprouvé vs gros et non vérifié
Le cas de GLM-5.2 repose sur une position d'ingénierie cohérente : faire plus avec moins, publier les chiffres, livrer les poids. Un modèle à 40B actifs est peu coûteux à servir, rapide par construction et déployable par une équipe disposant d'un budget GPU sérieux mais pas déraisonnable. Son indice audité de 51 et son Terminal-Bench audité de 82,7 signifient qu'un acheteur ne prend rien sur parole. Et à 0,95 $ / 3,00 $, cela représente environ la moitié du prix de Qwen.
Le cas de Qwen3.8-Max est le pari inverse : construire le plus grand modèle possible et laisser la capacité justifier le coût. GA a rendu cet argument bien plus solide qu'avant, car il y a enfin des chiffres associés — GPQA Diamond 92,6 en sciences de cycles supérieurs, OSWorld-Verified 86,1 sur l'opération d'interface graphique, FrontierSWE 73,5 contre le 40,7 de son prédécesseur, et le 86,6 sur Terminal-Bench mentionné ci-dessus. Ce sont des chiffres de niveau frontière, et le quasi-doublement sur FrontierSWE est le type de saut générationnel difficile à simuler entièrement.
Mais deux lacunes persistent, et ce sont les deux mêmes qui comptaient en juillet. Il n'y a aucun score indépendant — Artificial Analysis et LMArena restent sans score sur Qwen3.8-Max, donc toute affirmation de qualité émane d'Alibaba. Et il n'y a aucune licence, donc la promesse open-weight ne peut pas encore être évaluée sur le plan commercial.
L'ancrage historique joue ici plus contre Qwen que dans la plupart des confrontations : le prédécesseur Qwen3.7-Max a obtenu 46 sur l'indice AA, en dessous des 51 de GLM-5.2. Ainsi, la revendication implicite d'Alibaba n'est pas simplement que Qwen3.8-Max est bon, mais qu'il a bondi d'un niveau inférieur à celui de GLM à un niveau bien supérieur en une seule génération. L'amélioration FrontierSWE donne une certaine crédibilité à cette affirmation. Un score indépendant permettrait de trancher.

Coût en pratique : où se situe 2×
Prenez un pipeline de codage agentique : 180 000 tokens de contexte de dépôt, 10 000 tokens de sortie par exécution.
• GLM-5.2: 0.18M × $0.95 = $0.171, plus 0.01M × $3.00 = $0.03. ≈ $0.20 par exécution.
• Qwen3.8-Max : 0,18 M × 2 $ = 0,36 $, plus 0,01 M × 6 $ = 0,06 $. ≈ 0,42 $ par exécution.
• À 3 000 exécutions/jour : GLM ≈ $603/jour ; Qwen ≈ $1 260/jour — environ 20 000 $/mois d’écart.
• Avec l'entrée en cache de Qwen à $0.25/1M sur un dépôt stable, son exécution tombe à ≈ $0.11, ce qui en réalité sous-cote le coût non mis en cache de GLM.
Cette dernière ligne est l’élément le plus utile en pratique dans cette comparaison. Le prix affiché de Qwen est le double de celui de GLM, mais son tarif en cas de cache hit de 0,25 $ par million est suffisamment agressif pour qu’un pipeline bien mis en cache puisse inverser le classement. Si votre agent relit un contexte presque inchangé à chaque tour — ce qui décrit la plupart des agents de codage — Qwen peut s’avérer l’option la moins chère en pratique malgré une grille tarifaire moins avantageuse. Les équipes qui ne configurent pas la mise en cache paieront le double pour rien.
Les deux modèles facturent les jetons de réflexion en tant que sortie, donc les configurations à forte intensité de raisonnement coûtent plus cher que ces estimations des deux côtés.
Déployabilité : l'axe que GLM possède
Ce sont tous deux des modèles MoE chinois à poids ouverts revendiquant un contexte de 1M de tokens, ce qui fait de la déployabilité le fossé pratique le plus net.
Les poids de GLM-5.2 sont téléchargeables depuis juin, et avec 40B actifs, c'est une cible réaliste pour l'auto-hébergement — quantifiable, déployable sur un nombre raisonnable de GPU, et déjà éprouvé par la communauté.
Les poids de Qwen3.8-Max sont promis dans la semaine, mais le modèle phare n'est pas une cible réaliste pour qui que ce soit : environ 1.2TB en 4 bits contre environ 141GB par H200 signifie huit accélérateurs haut de gamme ou plus, et le nombre non divulgué de paramètres actifs rend le débit résultant impossible à prédire. Ajoutez la licence manquante et l'auto-hébergement du modèle phare n'est, pour l'instant, pas un plan.
Annoncé en parallèle, Qwen3.8-27B est la véritable réponse d'Alibaba sur cet axe. Également en open-weights et fonctionnant, selon les rapports, dans environ 17 Go de VRAM — une seule carte haut de gamme, bien en dessous de l'empreinte de GLM-5.2 — il concurrence directement sur la déployabilité. Si votre intérêt pour l'un ou l'autre modèle est de l'exécuter vous-même, la comparaison Qwen 27B contre GLM-5.2 est celle qui comptera véritablement, et c'est un combat bien plus serré que 2.4T contre 753B.
FAQ
Est-ce que Qwen 3.8 est meilleur que GLM-5.2 ?
Sur le seul benchmark qu'ils partagent, Qwen revendique une avance — Terminal-Bench 2.1 86,6 contre 82,7 audité pour GLM. Mais le chiffre de Qwen est autodéclaré, tandis que celui de GLM a été mesuré par Artificial Analysis, et les différences de harnais peuvent dépasser un écart de quatre points. GLM-5.2 détient également un indice audité de 51, là où Qwen n'a aucun score indépendant. GLM est le choix plus sûr ; Qwen a le plafond non vérifié le plus élevé.
Comment se comparent-ils sur Terminal-Bench 2.1 ?
Qwen3.8-Max annonce 86,6 ; Artificial Analysis a mesuré GLM-5.2 à 82,7. Cela représente une avance nominale de 3,9 points pour Qwen et le premier chevauchement sur un même benchmark entre eux. Interprétez-le comme la preuve que Qwen est concurrentiel dans cette tranche plutôt que comme la preuve qu'il est en tête, car seul le score de GLM a été produit de manière indépendante.
Lequel est moins cher ?
GLM-5.2 sur la grille tarifaire — 0,95 $ / 3,00 $ par 1M (AA combiné ~0,90 $) contre 2 $ / 6 $ pour Qwen, soit environ la moitié. Mais l'input en cache de Qwen à 0,25 $ par 1M est suffisamment agressif pour qu'un pipeline fortement mis en cache puisse revenir moins cher sur Qwen que sur GLM sans cache.
Combien de paramètres actifs Qwen 3.8 Max utilise-t-il ?
Alibaba n'a jamais publié ce chiffre, même lors de la disponibilité générale. C'est ce nombre qui détermine le coût de service et la latence dans un modèle Mixture-of-Experts, donc son absence constitue une véritable lacune. GLM-5.2, en revanche, est documenté avec 40B actifs sur 753B au total.
Lesquels puis-je réellement auto-héberger ?
GLM-5.2 aujourd'hui — les poids sont disponibles et 40B actifs le rendent exploitable. Les poids de Qwen3.8-Max sont promis d'ici la semaine, mais le modèle phare nécessite huit GPU ou plus de classe H200 avec ~1.2TB en 4 bits, sans licence publiée pour l'instant. Le Qwen3.8-27B annoncé en parallèle, qui nécessiterait environ 17GB de VRAM, est l'option Qwen déployable et correspond mieux à la niche de GLM.
Est-ce que Qwen 3.8 Max a quitté la version d’aperçu ?
Oui, le 3 août 2026, avec une grille tarifaire publiée et un endpoint compatible OpenAI et DashScope. La campagne de crédits Qoder à -90 % de juillet ne décrit plus comment il est vendu.
Qu'offre Qwen que GLM-5.2 n'offre pas ?
Multimodalité native — entrée d'images et de vidéos, avec un score auto-déclaré de 92,1 sur OmniDocBench pour l'analyse de documents — et un contexte de 1 million de jetons facturé à un tarif fixe, sans surcoût pour les longues instructions. GLM-5.2 est axé sur le texte, donc pour les pipelines de documents, de captures d'écran ou de vidéos, Qwen ne rivalise pas vraiment avec lui, mais fait plutôt autre chose.
En résumé
Qwen 3.8 contre GLM-5.2 est le duel où la disponibilité générale a apporté le plus d'informations réellement nouvelles. Pour la première fois, Qwen obtient un score sur un benchmark qu'un évaluateur indépendant a également exécuté, et il se place au-dessus de GLM : Terminal-Bench 2.1 86.6 contre 82.7. Cela fait passer Qwen de « non noté » à « plausiblement compétitif sur le terrain mesuré », ce qui est un réel progrès même compte tenu de la réserve auto-déclarée.
Mais GLM-5.2 conserve la couronne de la praticité, et il le fait grâce à des atouts sans éclat : la moitié du prix, un indice audité de 51, 40B de paramètres actifs qui rendent son économie prévisible et son déploiement réalisable, et des poids que vous pouvez télécharger dès maintenant. Les réponses de Qwen — un contexte d'un million de jetons à prix forfaitaire, une multimodalité native et un plafond plus élevé — sont significatives mais conditionnelles, et ses deux lacunes de juillet sont inchangées : pas de score indépendant ni de licence. Surveillez trois choses : le premier score indépendant de l'Intelligence Index pour Qwen3.8-Max, la question de savoir si un évaluateur reproduit ce score de 86,6 sur Terminal-Bench, et la sortie de Qwen3.8-27B, là où ces deux philosophies vont vraiment s'affronter. En attendant, GLM-5.2 est ce que vous déployez et Qwen3.8-Max est ce que vous évaluez — avec la mise en cache activée.

Comparés dans cet article3
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
