Carte principale pour l'explicatif GLM-5.2, présentant une carte indiquant 753B paramètres au total, un large ruban de contexte indiquant un contexte de 1M tokens, et un badge indiquant poids ouverts MIT, avec un pied de page indiquant GLM-5.2 - publié le 16 juin 2026 - Z.ai.
Guides & Insights

Qu'est-ce que GLM-5.2 ? Le fleuron open-weight à contexte de 1 M de Z.ai, deux versions plus tard

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

GLM-5.2 est un grand modèle de langage à poids ouverts, uniquement textuel, de Z.ai, le laboratoire de Pékin anciennement connu sous le nom de Zhipu AI, sorti le 16 juin 2026 sous licence MIT. C’est un modèle de mélange d’experts de 753 milliards de paramètres avec une fenêtre de contexte d’un million de tokens, et pendant environ deux mois, il a été le modèle de codage à poids ouverts le plus performant que l’on pouvait télécharger. Il n’occupe plus cette position, car Z.ai a depuis livré deux successeurs en plus de lui — ce que la plupart des pages consacrées à GLM-5.2 omettent, et ce qui détermine si vous devriez encore vous y intéresser.

Quarante-trois articles dans les archives de ce blog mentionnent GLM-5.2. Jusqu'à présent, aucun d'entre eux ne lui était consacré : le modèle apparaît comme l'adversaire dans comparaison après comparaison, le point de référence fixe auquel les modèles plus récents sont mesurés. C'est un rôle étrange pour un modèle que son propre créateur a déjà dépassé, et c'est la raison d'être de cette page — une description directe de ce qu'est réellement GLM-5.2, de ce qu'il coûte, de ce en quoi il est bon, et de qui devrait encore le choisir.

Où se situe GLM-5.2 dans la propre gamme de Z.ai

Z.ai publie un journal des versions daté, et c'est la source la plus claire pour cela. Lisez-le dans l'ordre et la forme de la famille est évidente :

Z.ai's public release-notes page, listing dated model entries in reverse chronological order: 2026-08-26 GLM-5.3-Flash, 2026-08-18 GLM-5.3, 2026-06-16 GLM-5.2 and 2026-04-07 GLM-5.1, each with its own summary bullet points.

GLM-5 — 12 février 2026. Le premier GLM-5, destiné à l’ingénierie de systèmes complexes et aux tâches d’agents à long terme.
GLM-5.1 — 7 avril 2026. Travail à long horizon, capable de fonctionner en solo jusqu’à huit heures en une seule exécution.
• GLM-5.2 — 16 juin 2026. Le modèle phare à contexte de 1 M pour les tâches à long horizon ; le journal de Z.ai le décrit comme « contexte sans perte de 1 M, améliorant considérablement les capacités de tâches à long horizon ».
GLM-5.3 — 18 août 2026. Même modèle de base que GLM-5.2, les gains provenant du post-entraînement. Z.ai rapporte un gain de 50 % par rapport à GLM-5.2 sur son Code Bench interne et un état de l’art open source sur Terminal Bench 3.0.
GLM-5.3-Flash — 26 août 2026. Un modèle différent et plus petit construit sur une base nouvellement entraînée (320 B au total, 18 B actifs), le premier GLM-5 nativement multimodal.

L’entrée importante est celle de GLM-5.3. GLM-5.3 n’est pas un GLM-5.2 plus grand — ce sont les mêmes poids de base, poussés plus loin par le post-entraînement. Cela fait de GLM-5.2 le dernier modèle de la gamme dont la capacité venait de l’architecture, et de GLM-5.3 le modèle phare actuel pour le texte. Si vous choisissez aujourd’hui un modèle Z.ai sur la seule qualité, la réponse est GLM-5.3, et non GLM-5.2.

GLM-5.3-Flash est une branche distincte plutôt qu'une version moins chère de GLM-5.3 : un modèle plus petit, nativement multimodal (texte, image et vidéo), dont le prix est d'un ordre de grandeur inférieur à celui des modèles phares textuels. Si vous avez besoin de vision, GLM-5.2 n'est pas le modèle qu'il vous faut, dans un cas comme dans l'autre.

La fiche technique

• Paramètres — 753 B au total, d'après la fiche du modèle à l'adresse zai-org/GLM-5.2-FP8. Z.ai n'indique pas le nombre de paramètres actifs sur cette fiche ; des listes tierces l'estiment à près de 40 B par token, et nous n'avons pas pu confirmer ce chiffre à partir d'une source primaire.
• Fenêtre de contexte — 1 M de tokens, décrite sur la fiche comme « un contexte solide de 1 M de tokens qui soutient durablement un travail sur un horizon long ».
• Sortie maximale — 128 K de tokens.
• Modalité — texte en entrée, texte en sortie. Pas d'entrée d'image, pas d'audio. Notre propre fiche catalogue pour le modèle indique qu'il « ne prend en charge que l'entrée texte ».
• Licence — MIT, sans limites régionales. Les poids sont publiés via l'organisation zai-org sur Hugging Face en variantes BF16 et FP8.
• Contrôle du raisonnement — un mode de réflexion hybride piloté par un paramètre reasoning_effort avec les réglages high et max, la valeur par défaut étant max. L'appel natif d'outils et la sortie structurée sont pris en charge.
• Architecture — IndexShare, qui réutilise un indexeur léger unique toutes les quatre couches d'attention éparse et, d'après la fiche du modèle, réduit d'un facteur 2,9× les FLOPs par token en contexte complet ; ainsi qu'une couche améliorée de prédiction multi-token qui augmente jusqu'à 20 % la longueur d'acceptation du décodage spéculatif.
• Matériel d'entraînement — la couverture médiatique du lancement indique que le modèle a été entraîné sur des accélérateurs Huawei Ascend sans matériel Nvidia. Il s'agit d'une affirmation issue d'articles de presse, et non de la fiche du modèle, et nous la rapportons comme telle.

A scoreboard card for GLM-5.2 with six rows: released 16 June 2026, 753B total parameters MoE, 1M-token context with 128K output, MIT licence text only, price $1.40 and $4.40 per million tokens, and an Artificial Analysis Intelligence Index of 34, 11th of 114. The footer reads that vendor benchmarks are from Z.ai and the index is per Artificial Analysis v4.3.2.

Ce en quoi GLM-5.2 excelle de manière mesurable

Presque tout ce dans quoi GLM-5.2 excelle relève de mesures de codage ou d'agentique, et les chiffres ci-dessous sont déclarés par le fournisseur — ils proviennent du tableau de benchmarks de la fiche modèle de Z.ai elle-même, et non d'une reproduction indépendante.

• Terminal Bench 2.1 (Terminus-2) — 81,0, contre 63,5 pour GLM-5.1. C'est le bond générationnel le plus important du tableau.
• SWE-bench Pro — 62,1, contre 58,4 pour GLM-5.1.
• FrontierSWE (Dominance) — 74,4, contre 30,5 pour GLM-5.1 et 72,6 pour GPT-5.5.
• AIME 2026 — 99,2. GPQA-Diamond — 91,2. Les deux soutiennent confortablement la comparaison avec la frontière fermée dans le propre tableau de Z.ai.
• MCP-Atlas (jeu public) — 76,8, essentiellement au niveau des 77,8 de Claude Opus 4.8 dans le même tableau.
• Rappel en contexte long — 78,3, le chiffre qui compte le plus pour la fenêtre de 1 M de tokens. La fenêtre n'est utile que si le rappel tient en profondeur, et le chiffre de Z.ai lui-même indique que c'est globalement le cas.

L’image indépendante est plus mince mais réelle. Artificial Analysis attribue à GLM-5.2 un score de 34 à son Intelligence Index v4.3.2, ce qui le place 11e sur 114 modèles de sa catégorie. Deux réserves accompagnent ce chiffre, et Artificial Analysis les formule elle-même toutes les deux : le modèle est marqué comme obsolète sur sa page, et elle « ne poursuit l’évaluation comparative des performances que pour la charge de travail par défaut de 10 000 jetons d’entrée » — les résultats pour d’autres charges de travail sont historiques et ne sont plus mis à jour. Notre propre fiche catalogue pour le modèle contient un instantané d’évaluation plus ancien du 25 juin 2026 avec un score d’Intelligence de 33,7, qui ne correspond pas à la même révision de l’indice que le chiffre actuel et ne doit pas être interprété comme un changement du modèle.

Ce en quoi il est mesurablement mauvais

Trois choses, et elles méritent qu’on soit direct.

• Il s'agit uniquement de texte. Pas d'entrée d'image, pas d'entrée audio. GLM-5.3-Flash est le modèle multimodal de cette famille, et si votre charge de travail touche à des captures d'écran, des PDF ou de la vidéo, GLM-5.2 n'est pas du tout la bonne branche.
• Il perd largement sur les mesures de génie logiciel les plus difficiles et à l'horizon le plus long. Sur SWE-Marathon, il obtient 13,0 contre 26,0 pour Claude Opus 4.8. Sur DeepSWE, il obtient 46,2 contre 58 pour Claude Opus 4.8 et 70 pour GPT-5.5. Sur NL2Repo, il obtient 48,9 contre 69,7 pour Opus 4.8. Ce sont tous des chiffres rapportés par l'éditeur, issus du même tableau qui montre GLM-5.2 gagnant ailleurs, et c'est précisément ce qui les rend crédibles : Z.ai les a publiés à côté de ses propres victoires.
• Il a été supplanté sur les mesures qui l'ont rendu célèbre. GLM-5.3 utilise la même base et le surpasse de 50 % sur le Code Bench de Z.ai, ainsi que sur Terminal Bench 3.0 et sur Agents' Last Exam. GLM-5.2 est également signalé comme obsolète chez Artificial Analysis.

Un chiffre que nous n’avons pas pu obtenir : nous n’avons pas pu confirmer une mesure indépendante actuelle du débit ou de la latence pour GLM-5.2 auprès d’une source que nous avons pu ouvrir, donc cette page n’en indique aucun plutôt que de répéter un chiffre que nous n’avons pas pu vérifier.

Prix et où l'exécuter

Le tarif officiel de Z.ai, consulté aujourd'hui, indique GLM-5.2 à :

• Entrée — 1,40 $ par million de jetons
• Entrée mise en cache — 0,26 $ par million de jetons
• Sortie — 4,40 $ par million de jetons

Le stockage des entrées mises en cache est indiqué comme gratuit pour une durée limitée. À noter que GLM-5.3 applique exactement les trois mêmes tarifs, donc le modèle plus récent n’est pas plus cher dans la liste de Z.ai — ce qui supprime la raison habituelle de rester sur l’ancien.

Concernant la disponibilité : le modèle est servi via le propre endpoint compatible OpenAI de Z.ai à l'adresse api.z.ai/api/paas/v4/chat/completions, avec des SDK officiels pour Python et Java, et les poids sont téléchargeables depuis Hugging Face pour un auto-hébergement sous licence MIT. Au-delà de cela, il est disponible via un certain nombre de plateformes d'inférence tierces. Nous le routons : OrcaRouter propose GLM-5.2 sur sa page de modèle au tarif du fournisseur Z.ai, sans aucune marge, donc les 1,40 $ / 4,40 $ ci-dessus correspondent à ce que vous payez via nous, plutôt qu'à une copie de ce tarif majorée. La même clé donne également accès au reste du catalogue, ce qui compte ici pour une raison précise — voir ci-dessous.

The OrcaRouter model page for z-ai/glm-5.2, showing a Featured badge, a 1M-token context, 128K maximum output, text-only input and output, and rate cards reading $1.40 per million input tokens and $4.40 per million output tokens, alongside measured latency and a seven-day traffic figure.

Qui devrait choisir GLM-5.2, et qui devrait choisir autre chose ?

Choisissez GLM-5.2 si vous hébergez vous-même et que la fenêtre de 1 M de tokens est l'exigence plutôt que les scores de benchmark. La licence MIT sans restrictions régionales, les poids FP8 publiés et la conception d'attention IndexShare en font une solution réellement pratique à exécuter en contexte long, et le chiffre de rappel en profondeur est le nombre qui justifie la fenêtre. C'est aussi un choix raisonnable si vous avez déjà un pipeline adapté à son comportement de reasoning_effort et que le coût de re-validation des prompts par rapport à GLM-5.3 dépasse le gain.

Choisissez plutôt GLM-5.3 si vous achetez des tokens plutôt que des poids et que la qualité est le seul critère. C'est le même modèle de base, mieux post-entraîné, à des prix catalogue identiques. Aucun argument tarifaire ne plaide en faveur du modèle plus ancien sur la grille tarifaire de Z.ai elle-même.

Choisissez plutôt GLM-5.3-Flash si vous avez besoin de la vision, ou si vous avez besoin de l'option performante la moins chère : il gère le texte, l'image et la vidéo et son prix est bien inférieur à celui des deux fleurons du texte.

Choisissez complètement autre chose si votre travail se situe dans la partie la plus difficile de l'ingénierie logicielle à long horizon. Dans le tableau publié par Z.ai lui-même, Claude Opus 4.8 surpasse GLM-5.2 sur SWE-Marathon, DeepSWE, NL2Repo, SWE-bench Pro, ProgramBench et Tool-Decathlon ; GPT-5.5 le surpasse sur DeepSWE et ProgramBench. Les victoires de GLM-5.2 sont bien réelles, mais elles se concentrent sur le codage agentique de style terminal et le raisonnement, et non sur les tâches de type marathon. Si votre évaluation ressemble à une exécution d'agent de deux heures sur un vaste dépôt inconnu, l'avantage de prix des modèles à poids ouverts ne comble pas cet écart, d'après ces chiffres.

Le résumé pratique

GLM-5.2 est un modèle MoE uniquement textuel de 753 milliards de paramètres, sous licence MIT, avec un contexte de 1 M, publié le 16 juin 2026 à 1,40 $ / 4,40 $ par million de tokens, avec des scores annoncés par le fournisseur de 81,0 à Terminal Bench 2.1 et de 62,1 à SWE-bench Pro, ainsi qu’un Artificial Analysis Intelligence Index indépendant de 34. C’est le dernier fleuron GLM dont les capacités provenaient de l’architecture plutôt que du post-entraînement ; il a été remplacé deux fois par son propre fabricant, et il est marqué comme déprécié sur l’index indépendant qui l’a noté.

Rien de tout cela n’en fait un mauvais modèle. Cela en fait un modèle dont la cause est entendue : la question intéressante à propos de GLM-5.2 en septembre 2026 n’est pas de savoir s’il est bon, mais si la chose précise dont vous avez besoin — un modèle de codage à long contexte, auto-hébergeable et sous licence MIT — vaut plus pour vous que les trois points que GLM-5.3 ajoute par-dessus les mêmes poids. Pour la plupart des acheteurs de tokens, la réponse est non. Pour quiconque télécharge des poids, la réponse reste oui.

Si vous voulez le tester vous-même sans y engager un chemin de production, la couche de routage est le moyen le moins coûteux de le faire : dirigez la même requête vers GLM-5.2 et GLM-5.3 via un seul point de terminaison, comparez sur vos propres invites, et laissez le basculement automatique gérer le cas où c'est le point de terminaison du modèle plus ancien qui tombe en panne.

Call GLM-5.2 through OrcaRouter at the Z.ai provider rate, zero markup. https://www.orcarouter.ai/models/z-ai/glm-5.2 One API key reaches GLM-5.2, GLM-5.3 and 200+ other models, with automatic failover if an endpoint goes down.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement