API GLM 5.2 : Tarifs, Accès et Comment l'utiliser

API GLM 5.2 : Tarifs, Accès et Comment l'utiliser

Auteur

Fengya Tian

Date de publication

Retour à tous les articles

GLM-5.2 est généralement disponible depuis le 16 juin 2026, et son API est rapidement devenue l'un des sujets de développement les plus recherchés de l'été — pour une raison simple : elle offre des performances de codage et d'agent proches de la frontière à 1,40 $ par million de tokens d'entrée et 4,40 $ par million de tokens de sortie, avec une fenêtre de contexte de 1 million de tokens. Pas de liste d'attente, pas de portail d'aperçu : vous pouvez obtenir une clé et lancer dès aujourd'hui.

Ce guide couvre tout ce que la barre de recherche demande vraiment : ce que le GLM 5.2 API coûte, les quatre façons d'obtenir un accès (dont une gratuite), comment fonctionnent les modes de réflexion et les niveaux d'effort, comment se déroule la décision API-versus-Coding-Plan, et comment exécuter GLM-5.2 aux côtés de vos autres modèles via un seul point de terminaison.

Réponses rapides

L'API GLM 5.2 est-elle disponible maintenant ?Oui — généralement disponible depuis le 16 juin 2026, ID du modèle `glm-5.2`.

Combien cela coûte-t-il ?$1,40 / $4,40 par million de jetons (entrée/sortie), avec l'entrée en cache à $0,26 et le stockage en cache gratuit pendant une durée limitée.

Fenêtre de contexte? 1M tokens en entrée, jusqu'à 128K tokens en sortie.

Y a-t-il une option gratuite ? Les poids sont sous licence MIT pour l'auto-hébergement, et les niveaux gratuits de la passerelle vous permettent de tester sans carte. Détails ci-dessous.

Est-il multimodal ? Non — texte en entrée, texte en sortie. La vision se trouve dans la ligne GLM-V distincte de Z.ai.

Pourquoi les développeurs veulent cette API

La version courte de l'histoire du benchmark : dans le tableau publié par Z.ai, GLM-5.2 est le modèle de codage open-weight le plus puissant disponible — 81.0 sur Terminal-Bench 2.1 (contre 63.5 pour GLM-5.1), 62.1 sur SWE-bench Pro, et à moins d'un point de Claude Opus 4.8 sur le benchmark FrontierSWE à long horizon — à une fraction des prix des modèles de pointe. Cette combinaison, associée à un contexte de 1M spécialement entraîné pour les charges de travail des agents de codage, explique pourquoi l'API vaut la peine d'être intégrée plutôt que simplement intéressante.

Ce que vous obtenez avec l'API GLM 5.2

La surface API est moderne et sans surprise — dans le bon sens. Vous appelez le modèle `glm-5.2` et vous obtenez : une fenêtre de contexte de 1M de tokens avec jusqu'à 128K tokens de sortie ; un mode de réflexion que vous pouvez activer ou désactiver par requête ; des niveaux d'effort de raisonnement configurables jusqu'à `max` pour les problèmes les plus difficiles ; le streaming en temps réel ; l'appel de fonctions pour l'utilisation d'outils et d'agents ; une sortie JSON structurée ; et un mécanisme intelligent de mise en cache du contexte qui réduit le coût des entrées répétées. L'intégration d'outils de style MCP est prise en charge pour les frameworks d'agents.

Une limite à connaître avant d'architecturer autour : GLM-5.2 est uniquement textuel. Les captures d'écran, les PDF en tant qu'images, et la lecture de graphiques relèvent d'un modèle multimodal — soit la gamme GLM-V de Z.ai, soit le modèle d'un autre fournisseur sur une voie séparée.

Tarification de l'API GLM 5.2

Le prix officiel de première partie est $1.40 par million de tokens d'entrée et $4.40 par million de tokens de sortie — identique à GLM-5.1, ce qui signifie que le bond de capacité de juin n'a entraîné aucune augmentation de prix. Les entrées mises en cache sont facturées à $0.26 par million, et Z.ai renonce aux frais de stockage en cache pour une durée limitée. Il n'y a pas de supplément pour long contexte : la fenêtre complète de 1M est facturée aux tarifs standard.

Pour contexte, cela se situe bien en dessous des modèles fermés avec lesquels il est comparé — Claude Sonnet 5 affiche 3 $ / 15 $ et Claude Opus 4.8, 5 $ / 25 $ — et cela fait de la gestion du cache le plus grand levier sur votre facture : les boucles d'agents qui relisent un contexte de projet stable paient 0,26 $ au lieu de 1,40 $ à chaque appel. Deux notes budgétaires : des niveaux d'effort plus élevés consomment plus de jetons de réflexion, et les hébergeurs tiers publient leurs propres tarifs (certains inférieurs à ceux des fournisseurs officiels), vérifiez donc les chiffres actuels là où vous déployez réellement.

Comment obtenir une clé API GLM 5.2

Route 1 — la plateforme Z.ai. Créez un compte sur la plateforme développeur de Z.ai, générez une clé et appelez `glm-5.2` avec paiement par jeton aux tarifs officiels ci-dessus. Il s'agit de la voie directe et de première partie.

Route 2 — le GLM Coding Plan. Un abonnement qui intègre GLM-5.2 dans les outils de codage (GLM-5.2 y est apparu avant le lancement de l’API publique). Si votre utilisation est celle d’un développeur qui utilise un assistant IDE toute la journée, un forfait fixe peut battre la facturation par jeton ; vérifiez les tarifs actuels sur Z.ai.

Route 3 — une passerelle AI. Appelez GLM-5.2 via une passerelle multi-modèle comme OrcaRouter : un point d'accès compatible OpenAI, l'ID de modèle `z-ai/glm-5.2`, au même $1.40 / $4.40 sans majoration de jetons — aux côtés de Claude, GPT, Gemini, DeepSeek et plus de 200 autres modèles. Une seule clé, pas de gestion de comptes par fournisseur, et basculement inclus.

Voie 4 — self-host.Les poids sont sur Hugging Face sous une licence MIT sans limites régionales. Soyez honnête dans le budget : il s'agit d'un MoE d'environ 750 milliards de paramètres, donc prévoyez une mémoire GPU à l'échelle d'un cluster — une voie pour les équipes de plateforme, pas pour les ordinateurs portables.

Appeler l'API : quoi définir et pourquoi

L'intégration est délibérément ennuyeuse — les complétions de chat de style OpenAI avec une chaîne de modèle `glm-5.2` (ou `z-ai/glm-5.2` via OrcaRouter, qui expose également un point de terminaison `/v1/responses`). Les paramètres qui changent réellement les résultats :

Pensée activée ou désactivée. Laissez la pensée activée pour le codage, les agents et l'analyse ; désactivez-la pour des traitements rapides et économiques comme la classification et les échanges de chat courts.

Niveau d'effort. Le curseur entre qualité, latence et coût. Réservez les réglages les plus élevés (`max`) pour les problèmes vraiment difficiles ; les statistiques des passerelles publiques placent le temps médian jusqu'au premier token dans la plage de plusieurs secondes lorsque le modèle réfléchit, donc une UX sensible à la latence demande un effort plus faible.

Structure de prompt adaptée au cache. Mettez le contenu stable (prompt système, contexte de projet, exemples few-shot) en premier et identique entre les appels, de sorte que le taux de cache de 0,26 $ fasse le gros du travail.

Appel de fonctions + sortie structurée.Les deux sont de première classe ; les agents construits sur des schémas d'outils de style OpenAI se portent avec des changements minimes.

API ou plan de codage ?

Une décision qui déroute de nombreuses équipes, voici donc la distinction claire. L' API est une infrastructure mesurée : adaptée aux produits, aux pipelines et à tout ce qui est programmatique, où le coût évolue avec l'utilisation et la mise en cache récompense une bonne ingénierie. Le Coding Plan est un siège à tarif fixe pour les humains : adapté aux développeurs individuels qui utilisent des outils de codage IA, où un mois chargé coûterait le multiple en tokens. De nombreuses équipes utilisent judicieusement les deux — des plans pour les humains, l'API pour le produit.

Existe-t-il un moyen gratuit d'utiliser GLM 5.2 ?

Trois réponses honnêtes. L'auto-hébergement est libre de licence (MIT) mais coûteux en matériel — gratuit comme dans liberté, pas comme dans repas gratuit. Niveaux gratuits de passerelle: Le plan Hacker gratuit d'OrcaRouter vous permet d'appeler des modèles — y compris GLM-5.2 — sans carte de crédit, ce qui est le moyen le plus rapide et sans frais de l'évaluer sur des prompts réels. Crédits d'essai sur la plateforme propre de Z.ai varient selon le temps et la région, alors vérifiez l'offre d'inscription actuelle plutôt que de vous fier à des articles de blog vieux d'un mois.

Utilisation de l'API GLM 5.2 via OrcaRouter

Si GLM-5.2 partage la production avec d’autres modèles — et compte tenu de sa limite textuelle et de son profil de latence de réflexion, c’est généralement le cas — une couche de routage vous évite le câblage multi-fournisseur. OrcaRouter sert déjà GLM-5.2 aux tarifs first‑party sans majoration, derrière le même endpoint compatible OpenAI que 200 autres modèles : acheminez le codage à gros volume et le trafic agent vers GLM-5.2, envoyez les tâches de vision à un modèle multimodal, escaladez le raisonnement le plus difficile vers un modèle flagship, et laissez le basculement automatique gérer les aléas des fournisseurs. L’observabilité par modèle montre ce que chaque voie coûte par tâche terminée — c’est ainsi que « bon marché par token » se vérifie comme « bon marché par résultat. »

En résumé

L'API GLM 5.2 est ce rare lancement où le battage médiatique survit au contact de la page de tarification : un codage quasi-frontière à 1,40 $ / 4,40 $, un vrai contexte de 1M, et quatre voies d'accès dont une véritablement gratuite. Obtenez une clé, structurez vos prompts pour le cache, et laissez un routeur décider quand GLM-5.2 est la bonne voie.

Prêt à appeler GLM 5.2 en quelques minutes ? Créez un compte OrcaRouter gratuit, obtenez une clé API, et accédez à GLM-5.2 sans marge — aux côtés de Claude, GPT, Gemini et plus de 200 autres modèles — via un point de terminaison compatible OpenAI.

FAQ

L'API GLM 5.2 fonctionne-t-elle avec Claude Code et les outils de codage existants ?

Remarquablement bien — le propre tableau de référence de Z.ai rapporte le meilleur score Terminal-Bench du GLM-5.2 (82,7) en utilisant Claude Code comme harnais, et le Plan de Codage GLM est présenté comme un remplacement direct pour les workflows de style Claude Code. La plupart des frameworks d'agents compatibles OpenAI se connectent avec un changement d'URL de base et de nom de modèle.

Où vont mes données si j'utilise l'API GLM 5.2 ?

L'API propriétaire est exploitée par Z.ai ; les équipes ayant des exigences strictes en matière de résidence des données ou de conformité doivent examiner ses conditions, choisir un hébergeur tiers dans leur région préférée, ou utiliser les poids sous licence MIT pour exécuter GLM-5.2 entièrement dans leur propre infrastructure — une option que les modèles fermés ne peuvent pas offrir.

L'API GLM 5.2 peut-elle traiter des images ou des fichiers ?

Non — c'est entrée de texte, sortie de texte. Z.ai propose des modèles de vision séparés (la gamme GLM-V) pour la compréhension d'images, donc les produits multimodaux acheminent généralement les requêtes d'images vers un modèle de vision et conservent GLM-5.2 sur la voie texte.

Quelle est la différence entre glm-5.2 et z-ai/glm-5.2 ?

Même modèle, portes différentes : `glm-5.2` est l'ID du modèle sur l'API propriétaire de Z.ai, tandis que `z-ai/glm-5.2` est l'ID avec espace de noms utilisé par des passerelles comme OrcaRouter. Le prix est le même 1,40 $ / 4,40 $ dans les deux cas sur OrcaRouter, qui ne facture aucune majoration de jetons.


© 2026 OrcaRouter