
Revue du GLM-5.2 : Codage quasi-frontière à des prix Open-Weight ?
- anthropicNOUVEAUAnthropic: Claude Opus 52026-07-2461Intelligence78Code
- googleNOUVEAUGoogle: Gemini 3.6 Flash2026-07-2150Intelligence69Code
- googleNOUVEAUGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaNOUVEAUMeta: Muse Spark 1.12026-07-1651Intelligence71Code
- kimiNOUVEAUMoonshotAI: Kimi K32026-07-1557Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligence77Code
- grokxAI: Grok 4.52026-07-0854Intelligence72Code
- tencentTencent: Hy32026-07-0641Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1651Intelligence69Code60Maths
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligence61Code61Maths
- anthropicAnthropic: Claude Fable 52026-06-0960Intelligence77Code
- qwenQwen: Qwen3.7 Plus2026-06-0139Intelligence56Code59Maths
- minimaxMiniMax: MiniMax M32026-05-3144Intelligence59Code59Maths
- AnthropicAnthropic: Claude Opus 4.82026-05-2856Intelligence74Code68Maths
Z.ai a publié GLM-5.2 le 16 juin 2026, et l'a présenté comme un modèle phare conçu pour les tâches à long terme. Pour une fois, l'étiquette tient la route. GLM-5.2 associe une fenêtre de contexte de 1 million de jetons, effectivement entraînée pour de longues sessions d'agent de codage, aux meilleurs scores de codage jamais obtenus par un modèle à poids ouverts à ce jour — et il est disponible partout à la fois : l'API de Z.ai, le Plan de Codage GLM, et les poids complets sous licence MIT sur Hugging Face, sans aucune restriction régionale.
Cette revue répond à la question que la plupart des équipes se posent réellement : un modèle open-weight est-il enfin assez bon pour être votre modèle de codage par défaut, et où les fleurons fermés de la frontière justifient-ils encore leur prime ? Nous couvrirons ce qui est vraiment nouveau, ce que coûte réellement GLM-5.2 (y compris une réduction pour entrée en cache que la plupart des articles omettent), comment il se compare à GLM-5.1 et à la frontière fermée, et qui devrait passer aujourd'hui.
Verdict rapide
Considérez GLM-5.2 si vous…
- Exécutez des charges de travail de codage ou d'agents à volume élevé et souhaitez une qualité proche de la frontière à 1,40 $ / 4,40 $ par million de tokens — une fraction du prix des modèles phares.
- Construisez des agents de codage de longue durée — selon les résultats publiés de FrontierSWE par Z.ai, GLM-5.2 se situe à un point près de Claude Opus 4.8 et devant GPT-5.5
- Besoin d'une fenêtre de contexte de 1 million de tokens avec jusqu'à 128K tokens de sortie, entraînée spécifiquement pour les longues trajectoires d'agent désordonnées plutôt que simplement revendiquée sur une fiche technique.
- Vous voulez des poids ouverts : licence MIT, auto-hébergement, réglage fin et zéro verrouillage fournisseur.
Attendez (ou restez sur un vaisseau amiral fermé) si vous…
- Besoin du plafond absolu pour le travail agentique le plus difficile — Claude Opus 4.8 reste clairement en tête pour l'orchestration d'outils et les tâches autonomes de longue durée.
- Nécessite une entrée d'image ou de fichier : GLM-5.2 est uniquement textuel ; la vision se trouve dans la ligne GLM-V distincte de Z.ai.
- Sont fortement contraints par la latence — GLM-5.2 est un modèle qui privilégie la réflexion en premier lieu, et les statistiques de la passerelle publique montrent un temps médian jusqu'au premier token de l'ordre de plusieurs secondes.
Qu'est-ce que GLM-5.2 ?
GLM-5.2 est le dernier fleuron de la famille GLM de Z.ai (anciennement Zhipu AI), l'un des rares laboratoires à publier des modèles à poids ouverts à l'échelle de la frontière. La documentation publique du modèle indique environ 750 milliards de paramètres au total dans une conception Mixture-of-Experts, avec environ 40 milliards d'actifs par jeton. L'ID du modèle est `glm-5.2`, et il est généralement disponible aujourd'hui : vous pouvez discuter avec lui sur Z.ai, l'appeler via l'API Z.ai, l'utiliser dans le cadre de l'abonnement GLM Coding Plan (où il est apparu quelques jours avant le lancement public), ou télécharger les poids depuis Hugging Face et l'exécuter vous-même.
Ce qui est notable dans cette génération, c'est le positionnement. Z.ai ne vend pas GLM-5.2 comme un simple concurrent moins cher ; il le présente comme le modèle open source de codage le plus performant, avec des chiffres publiés qui le placent à quelques points seulement de la frontière fermée sur exactement les charges de travail — codage à long horizon et agents — là où la plupart des dépenses des développeurs vont désormais.
Quoi de neuf dans GLM-5.2 ?

Un saut de codage à long horizon, pas une mise à jour mineure.Le changement principal. Sur le tableau de référence publié par Z.ai, GLM-5.2 obtient 81.0 sur Terminal-Bench 2.1 contre 63.5 pour GLM-5.1, et 62.1 contre 58.4 sur SWE-bench Pro. Le chiffre le plus frappant est FrontierSWE, qui mesure des projets d'ingénierie ouverts s'étendant sur des heures à des dizaines d'heures : 74.4 contre 30.5 pour GLM-5.1.
Un solide contexte de 1 million de tokens. GLM-5.2 est le premier modèle GLM à associer une fenêtre d'un million de tokens (cinq fois les 200K de GLM-5.1) à un entraînement qui cible cette fenêtre : Z.ai affirme avoir considérablement étendu l'entraînement sur un contexte d'1 million de tokens dans des scénarios d'agents de codage — implémentation à grande échelle, recherche automatisée, optimisation des performances, débogage complexe. La sortie maximale atteint 128K tokens par réponse.
Contrôle du niveau d'effort.Nouveauté de cette génération : vous pouvez explicitement échanger la capacité contre la vitesse d'exécution et le coût de calcul en définissant un niveau d'effort de réflexion, au lieu d'obtenir une profondeur de raisonnement fixe pour chaque requête.
Une architecture moins coûteuse sous le capot.La nouvelle technique IndexShare de Z.ai réutilise le même indexeur sur quatre couches d'attention sparse, réduisant le calcul par token de 2,9x sur la longueur totale de contexte de 1M, et une couche MTP améliorée accélère le décodage spéculatif en augmentant la longueur d'acceptation jusqu'à 20%.
Entièrement ouvert. Les poids sont fournis sous licence MIT avec, selon les mots de Z.ai, aucune limite régionale — l'utilisation commerciale, le fine-tuning et l'hébergement privé sont tous autorisés.

Tarifs : ce que ça coûte réellement

Première partie GLM 5.2 API le prix est de 1,40 $ par million de tokens d'entrée et de 4,40 $ par million de tokens de sortie — le même prix que pour GLM-5.1, donc l'amélioration des capacités est gratuite si vous utilisez déjà l'API GLM. Les entrées en cache tombent à 0,26 $ par million, et Z.ai supprime actuellement les frais de stockage en cache pour une durée limitée, ce qui est important pour les boucles d'agent qui relisent des centaines de fois le même contexte de projet.
Pour échelle : Claude Opus 4.8 est listé à 5 $ / 25 $ par million de tokens. Si le tableau de benchmark de Z.ai est même directionnellement correct, GLM-5.2 délivre la plupart des capacités de codage à long horizon de la frontière pour bien moins d'un cinquième du prix de sortie phare. Deux mises en garde : le niveau d'effort détermine les dépenses réelles (plus d'effort signifie plus de tokens de réflexion), et les hôtes tiers listent leurs propres tarifs — certains moins chers que les premiers — donc vérifiez les chiffres actuels avant de budgétiser.
Note des avis
Les scores ci-dessous sont notre évaluation éditoriale basée sur les benchmarks publiés par Z.ai et la documentation du modèle — le tableau des benchmarks est propre au fournisseur. Nous y reviendrons lorsque des résultats indépendants seront disponibles.

- Codage : 9/10
- Utilisation agentique / d'outils : 8/10 — proche de la frontière sur MCP-Atlas, mais Opus 4.8 reste clairement en tête en matière d'orchestration d'outils.
- Raisonnement : 8/10 — mathématiques d'élite (AIME 2026 : {{1}}99.2{{/1}}, le score le plus élevé dans le tableau de Z.ai), pourtant les tests de raisonnement les plus larges favorisent encore la frontière fermée
- Rapport qualité-prix : 10/10
Contexte et documents longs : 9/10
- Vitesse et latence : 7/10 — un modèle qui privilégie la réflexion ; utilisez des niveaux d'effort plus faibles pour les tâches rapides
Note globale : ~8.5/10 — le premier modèle à poids ouvert suffisamment proche de la frontière pour être un choix par défaut, pas un compromis.
Avantages
Codage de long terme proche de la frontière à 1,40 $ / 4,40 $ par million de tokens — même prix que GLM-5.1, bien en dessous des modèles phares fermés
- Contexte solide de 1M de tokens avec 128K de sortie, entraîné sur des trajectoires réelles d'agents de codage
- Contrôle du niveau d'effort pour ajuster le compromis coût/latence/qualité par requête
- Poids ouverts MIT : auto-hébergement, réglage fin ou conservation d'un repli privé — pas de verrouillage, pas de limites régionales
- Entrée mise en cache à 0,26 $ par million avec stockage en cache actuellement gratuit — important pour les boucles d'agents.
Inconvénients
- Claude Opus 4.8 mène toujours les benchmarks agentiques les plus difficiles — l'orchestration d'outils et les tâches de longueur marathon ne sont pas encore la couronne de GLM-5.2
- Texte uniquement : pas d'entrée d'image, donc les workflows basés sur des captures d'écran ou la vision de documents nécessitent un modèle différent.
Thinking-first design signifie un délai perceptible avant le premier token ; une expérience utilisateur sensible à la latence nécessite des paramètres d'effort réduit ou une solution de repli plus rapide.
- L'auto-hébergement est un projet de centre de données, pas un projet de week-end — le checkpoint complet nécessite apparemment une mémoire GPU à l'échelle d'un cluster.
- L'histoire du benchmark repose pour l'instant sur le propre tableau de Z.ai ; la réplication indépendante est encore en cours d'arrivée.
Comment GLM-5.2 se compare

contre GLM-5.1.Même étiquette de $1.40 / $4.40, une fenêtre de contexte cinq fois plus grande, et un saut à long horizon qui ressemble à un saut de génération : FrontierSWE 74.4 contre 30.5, Terminal-Bench 2.1 81.0 contre 63.5, SWE-Marathon 13.0 contre 1.0. Si vous utilisez GLM-5.1, c'est l'appel de mise à niveau le plus facile de l'année — Z.ai publie même un guide de migration dédié.
vs la frontière fermée (Claude Opus 4.8, GPT-5.5). Sur le tableau de Z.ai, GLM-5.2 se place à quatre points d'Opus 4.8 sur Terminal-Bench 2.1 (81.0 contre 85.0), à un point près sur FrontierSWE (74.4 contre 75.1), et bat même GPT-5.5 sur SWE-bench Pro (62.1 contre 58.6) et FrontierSWE (74.4 contre 72.6). La frontière garde son avantage là où les tâches deviennent les plus longues et les plus gourmandes en outils : Opus 4.8 double GLM-5.2 sur SWE-Marathon (26.0 contre 13.0) et mène Tool-Decathlon avec une large marge. La règle pratique : GLM-5.2 pour le volume, un vaisseau amiral pour le sommet.
contre d'autres modèles open-weight. Contre Qwen3.7-Max, MiniMax M3 et DeepSeek-V4-Pro, GLM-5.2 domine toutes les lignes de codage dans le tableau publié. À ce jour, la couronne du codage open-weight est détenue par Z.ai.
Qui devrait utiliser GLM-5.2 ?
- Des équipes exécutant des agents de codage à grande échelle — bots CI, refactoring autonome, revue de code — où le coût par tâche détermine ce qui est économiquement possible
- Les constructeurs d'outils pour développeurs qui veulent une qualité quasi de pointe sans les factures de pointe
- Charges de travail à long contexte : analyse de monorepo, spécifications d'ingénierie multi-documents, sessions d'agent de plusieurs heures qui remplissent effectivement 1 million de jetons
- Les organisations qui ont besoin de poids ouverts — pour la conformité, le déploiement en environnements isolés, le réglage fin, ou simplement pour obtenir un levier de négociation face aux fournisseurs d'API
Qui devrait s'en tenir à un flagship fermé ?
- Les équipes dont les tâches les plus difficiles sont des exécutions autonomes de longue durée (marathon) ou une orchestration d'outils lourds — les benchmarks indiquent que la prime de la frontière est toujours réelle là-bas.
- Workflows dépendants de la vision : GLM-5.2 ne prend pas d'images.
- Produits où chaque seconde de latence du premier token coûte aux utilisateurs
GLM-5.2 en vaut-il la peine ?
Pour la plupart des charges de travail de codage et d'agents, oui — catégoriquement. Le cadre honnête : GLM-5.2 vous offre environ 90-95 % de la capacité de codage à long horizon de la frontière pour moins d'un cinquième du prix, avec des poids ouverts comme assurance. Les vaisseaux amiraux fermés remportent encore les 5 % les plus difficiles des tâches. Ce n'est pas une raison pour sauter GLM-5.2 ; c'est une raison pour router : envoyez le volume à GLM-5.2 et escaladez les problèmes de niveau sommet à un vaisseau amiral.
Verdict final
GLM-5.2 est le modèle de codage open-weight le plus puissant que vous puissiez utiliser aujourd'hui, et le premier qui se présente comme un choix par défaut plutôt qu'un compromis budgétaire — notre note : ~8,5/10. Il ne détrône pas Claude Opus 4.8 au sommet de la gamme de difficulté, mais il fait du flagship un outil spécialisé plutôt que la réponse évidente du quotidien. Si vous êtes sur GLM-5.1, mettez à jour maintenant. Si vous payez des prix de flagship pour un travail d'agent de routine, c'est votre signal pour réévaluer.
Utilisation de GLM-5.2 via OrcaRouter
Parce que le jeu intelligent est "GLM-5.2 pour le volume, un produit phare pour les tâches les plus difficiles", vous voudrez probablement plus d'un modèle en production — venant de plus d'un fournisseur. C'est la friction qu'OrcaRouter élimine.

OrcaRouter sert déjà GLM-5.2 (ID du modèle `z-ai/glm-5.2`) via un point de terminaison compatible OpenAI, aux tarifs propres de Z.ai de 1,40 $ / 4,40 $ sans majoration des tokens. Acheminez le trafic de codage et d'agents à volume élevé vers GLM-5.2, faites remonter les raisonnements les plus difficiles vers Claude Opus 4.8 ou un autre modèle phare, et gardez un basculement automatique prêt pour les pics de capacité lors des fenêtres de lancement — le tout sans réécrire votre intégration à chaque changement de modèle.

FAQ
GLM-5.2 est-il disponible maintenant ?
Oui. Il a été lancé le 16 juin 2026 et est généralement disponible : sur le chat et l'API de Z.ai (ID de modèle glm-5.2), dans le cadre du GLM Coding Plan, via des passerelles comme OrcaRouter, et en tant que poids ouverts sous licence MIT sur Hugging Face.
Combien coûte GLM-5.2 ?
Le prix de l'API propriétaire est de 1,40 $ par million de tokens en entrée et de 4,40 $ par million de tokens en sortie — inchangé par rapport à GLM-5.1. L'entrée en cache est de 0,26 $ par million, et le stockage en cache est gratuit pour une durée limitée.
GLM-5.2 est-il meilleur que GLM-5.1 ?
Avec une large marge sur les travaux à long horizon : 81.0 contre 63.5 sur Terminal-Bench 2.1, 74.4 contre 30.5 sur FrontierSWE, et un contexte de 1M contre 200K — au même prix.
GLM-5.2 contre Claude Opus 4.8 — lequel devrais-je utiliser ?
Par défaut, utilisez GLM-5.2 pour le codage à grand volume et le travail d'agent ; escaladez les tâches autonomes de type marathon et l'orchestration lourde d'outils vers Opus 4.8, qui reste leader dans ce domaine. L'acheminement entre les deux bat le choix d'un seul.
Qu'est-ce que la fenêtre de contexte ?
1 million de tokens, avec jusqu'à 128K tokens de sortie par réponse — et Z.ai affirme que la longue fenêtre a été spécifiquement entraînée sur des scénarios d'agents de codage, pas seulement étendue.
GLM-5.2 est-il vraiment open source ?
Oui — les poids sont publiés sous licence MIT sans restrictions régionales, gratuits pour un usage commercial et le réglage fin. Prévoyez toutefois un budget réaliste pour l'auto-hébergement : un checkpoint MoE d'environ 750 milliards de paramètres nécessite une mémoire GPU à l'échelle d'un cluster.
GLM-5.2 prend-il en charge l'entrée d'images ?
Non. GLM-5.2 est text-in, text-out. Pour les tâches de vision, Z.ai maintient une ligne de modèle GLM-V séparée, ou vous pouvez router les demandes d'images vers un modèle multimodal.
Puis-je utiliser GLM-5.2 via OrcaRouter ?
Oui — GLM-5.2 est disponible sur OrcaRouter en tant que z-ai/glm-5.2 aux tarifs de première partie avec une marge nulle, aux côtés de Claude, GPT, Gemini et d'autres modèles derrière un point de terminaison compatible OpenAI.
Prêt à mettre GLM-5.2 en production ? Lancez-le en quelques minutes — créez votre compte OrcaRouter et appelez GLM-5.2, Claude Opus 4.8, et tous les autres modèles leaders via un seul point de terminaison compatible OpenAI. Le codage de classe Frontier vient de devenir beaucoup moins cher ; une couche de routage est la façon dont vous récupérez les économies.
