GLM-5.3 est le dernier modèle phare de Z.ai (Zhipu AI) pour l'ingénierie logicielle complexe et les tâches agentiques à long horizon. Il offre une amélioration d'environ 50 % de l'expérience de codage par rapport à GLM-5.2, égalant Mythos 5 sur certaines capacités de cybersécurité, et trouve un meilleur équilibre entre performance brute et efficacité des tokens. C'est un modèle à texte en entrée / texte en sortie conçu pour le codage à l'échelle d'un dépôt, l'ingénierie autonome en plusieurs étapes et les flux de travail d'agent qui doivent rester cohérents sur de longs horizons. GLM-5.3 utilise la même surface d'API que la gamme GLM-5, avec deux changements que les appelants doivent gérer : le mode thinking est toujours activé (thinking.type n'accepte que la valeur enabled ; passer disabled fait désormais échouer la requête), et la profondeur du raisonnement est contrôlée par reasoning_effort avec les valeurs low / high / max, par défaut max. Il prend en charge l'appel d'outils natif et la sortie JSON structurée, et utilise le format chat-completions compatible OpenAI.
GLM 5.3 est un grand modèle de langage répertorié sous le fournisseur z-ai et servi via OrcaRouter. L'entrée du catalogue le décrit comme étant uniquement textuel, avec un contexte d'entrée allant…
Avec un contexte de 1 000 000 de jetons, GLM 5.3 peut traiter des documents qui devraient autrement être divisés en de nombreux fragments. Vous pouvez placer un roman entier, un long manuel technique ou des centaines de pages d'historique de conversation dans le prompt. Le principal avantage pratique est que le modèle peut prendre en compte tout le contenu à la fois lorsqu'il répond. Cela rend possibles des tâches comme le résumé, l'extraction de faits et l'analyse comparative sans logique de récupération personnalisée. Cela signifie également que vous pouvez poser des questions sur un grand volume de texte dans des échanges ultérieurs, car l'intégralité de la conversation reste dans la fenêtre de contexte. Cependant, l'utilisation d'un prompt de 1 M de jetons n'est pas gratuite ; les jetons d'entrée sont facturés à 1,40 $ par million, donc un prompt complet coûterait environ 1,40 $, et ce montant exclut la sortie. Aucune fonctionnalité de récupération dédiée n'est décrite dans le catalogue ; le modèle utilise donc simplement ce qui se trouve dans le contexte.
La longueur maximale de sortie pour GLM 5.3 est de 128 000 jetons. C'est bien au-dessus des limites par défaut typiques de 4 000 à 8 000 jetons sur de nombreux modèles. Cela permet au modèle de produire de longs rapports, des fichiers de code, des traductions automatiques ou des brouillons multi-chapitres en un seul appel. Au prix de sortie de 4,40 $ par million de jetons, une réponse de 128 000 jetons coûterait environ 0,56 $ en jetons de sortie (128 000 / 1 000 000 * 4,40). Le nombre réel de jetons par mot varie, mais cela donne une idée du coût maximal. La facturation d'OrcaRouter est basée sur les jetons, donc des sorties plus courtes coûtent proportionnellement moins. Rien n'indique que la limite de sortie puisse être augmentée ; 128 000 est le plafond indiqué dans le catalogue. Lors de la conception d'une application, vous devrez peut-être gérer un flux de sortie très long ou utiliser la diffusion en continu pour présenter les résultats progressivement, car le modèle peut émettre beaucoup de texte.
Le catalogue indique que la modalité d'entrée de Z.ai GLM 5.3 est le texte. Cela signifie que le modèle accepte des messages en texte brut, y compris l'historique de conversation, les invites système et le contenu utilisateur. Il n'accepte pas les images, l'audio, la vidéo ou tout autre contenu binaire. Il s'agit d'une contrainte importante lors du choix d'un modèle pour une tâche spécifique. Si votre pipeline doit lire une capture d'écran, analyser un enregistrement ou classifier une vidéo, vous auriez besoin d'un modèle multimodal ou d'une étape distincte de transcription/vision avant d'appeler GLM 5.3. Bien que la fenêtre de contexte soit grande, le contenu reste du texte ; vous ne pouvez pas joindre directement un fichier PDF à moins d'en extraire le texte au préalable. Le modèle peut traiter de longs contenus textuels JSON, du code, des journaux ou des articles. Pour les charges de travail exclusivement textuelles, le grand contexte peut être utile ; pour toute autre modalité, recherchez un modèle différent sur OrcaRouter.
Le grand contexte et la sortie longue de GLM 5.3 ont un prix par token plus élevé que celui de certains modèles plus petits. Si votre tâche ne nécessite que quelques milliers de tokens de contexte et une réponse courte, un modèle moins cher peut produire de bons résultats à moindre coût. OrcaRouter propose de nombreux modèles à différents niveaux de prix, mais cette entrée de catalogue ne répertorie pas d'alternatives. En règle générale, utilisez GLM 5.3 lorsque vous avez besoin d'un grand contexte ou d'une sortie très longue en un seul appel, et lorsque ces capacités justifient le coût. Si vous pouvez diviser votre tâche en plusieurs parties ou si un contexte plus court suffit, un modèle plus petit utilisera moins de tokens en entrée et pourrait être plus rentable. Considérez également la latence : le traitement d'un prompt de 1M de tokens prendra plus de temps que le traitement d'un prompt court, quel que soit le modèle. Le choix dépend de vos exigences de production.
L'entrée de catalogue OrcaRouter pour Z.ai GLM 5.3 n'inclut aucun score de benchmark. Cela signifie qu'il n'y a aucun chiffre officiel dans cette fiche à citer pour MMLU, HumanEval ou d'autres évaluations standard. Il reste possible d'évaluer le modèle vous-même en exécutant vos propres invites de test et en comparant les sorties sur votre domaine. Comme aucune donnée de benchmark n'est fournie, toute affirmation sur la qualité relative sur des tâches spécifiques doit être traitée avec prudence. Les seuls chiffres concrets fournis sont la fenêtre de contexte, la sortie maximale et le prix. Pour une famille de modèles de langage comme GLM, les publications externes peuvent offrir des informations générales, mais l'absence de tableau de benchmarks ici signifie que l'approche la plus sûre est de mesurer sur des tâches représentatives. L'API d'OrcaRouter peut être utilisée pour exécuter des évaluations côte à côte contre d'autres modèles, mais tous les résultats que vous obtenez s'appliquent à votre cas d'utilisation, pas aux classements mondiaux.
Aucune donnée de latence n'est répertoriée dans le catalogue pour GLM 5.3, il n'y a donc pas de vitesse exacte à rapporter. En général, le temps de réponse dépend de plusieurs facteurs : la longueur du prompt d'entrée, le nombre de jetons (tokens) demandés en sortie, la charge actuelle du fournisseur en amont et les conditions du réseau. Une requête avec un prompt de 1 000 000 de jetons prendra beaucoup plus de temps à traiter qu'un prompt court, car le modèle doit lire tout ce texte avant de générer. Le temps de génération de la sortie augmente également avec le nombre de jetons de sortie ; une réponse de 128 000 jetons peut être très lente. Pour les applications interactives, vous pouvez utiliser le streaming pour commencer à recevoir le texte au fur et à mesure qu'il est généré. L'API compatible OpenAI d'OrcaRouter prend en charge les paramètres de streaming standard, mais le débit réel est déterminé par le fournisseur z-ai. Vous devez tester une requête représentative pour comprendre la latence de votre charge de travail.
Les principales limitations de GLM 5.3 sont liées à ses spécifications de catalogue. Il est exclusivement textuel, donc il ne peut pas traiter nativement les images, l'audio ou la vidéo ; le contenu sous ces formes doit d'abord être converti en texte. La fenêtre de contexte est de 1 000 000 de jetons, mais l'utiliser pleinement signifie que votre requête est volumineuse, ce qui a des implications en termes de coût et de latence. La sortie maximale est de 128 000 jetons, mais générer une telle sortie prend du temps et peut rencontrer des délais d'attente du fournisseur si vous n'utilisez pas la diffusion en continu. Le catalogue ne répertorie aucun score de référence, vous ne devez donc pas supposer qu'il surpasse d'autres modèles sur toutes les tâches. Enfin, comme pour tous les modèles de langage, les sorties peuvent être inexactes ou hallucinées ; vous devez vérifier les informations importantes. Le nombre de jetons est approximatif, donc une invite de 1 M de jetons est un plafond pratique, pas une garantie que le modèle gérera parfaitement chaque invite longue.
GLM 5.3 est facturé par token. Le prix d'entrée indiqué est de 1,40 $ pour 1 000 000 de tokens, et le prix de sortie est de 4,40 $ pour 1 000 000 de tokens. OrcaRouter n'ajoute aucune majoration ; le montant qui vous est facturé correspond exactement au tarif du fournisseur. Les tokens d'entrée incluent l'invite, les instructions système éventuelles et l'historique de conversation que vous envoyez. Les tokens de sortie sont ceux générés par le modèle. La plupart des API comptabilisent à la fois l'invite et le texte généré, et ce modèle suit la facturation standard par token. Cette annonce ne comporte aucun abonnement mensuel, et aucune mention de frais fixes distincts n'y figure. Le coût total d'une requête est calculé comme suit : (tokens d'entrée / 1 000 000) * 1,40 plus (tokens de sortie / 1 000 000) * 4,40. Pour une requête avec 10 000 tokens d'entrée et 1 000 tokens de sortie, le coût serait de 0,014 $ plus 0,0044 $, pour un total d'environ 0,0184 $.
Comme les jetons d'entrée et de sortie sont tarifés différemment pour GLM 5.3, la répartition des coûts dépend de la façon dont vous utilisez le modèle. Les jetons d'entrée coûtent 1,40 $ par million, et les jetons de sortie coûtent 4,40 $ par million, ce qui rend la sortie plus de trois fois plus chère par jeton. C'est une structure de tarification courante pour de nombreux modèles de langage. Une tâche qui lit un long document et renvoie un court résumé sera dominée par le coût d'entrée. Une tâche qui commence par une invite courte et génère une réponse très longue sera dominée par le coût de sortie. Le maximum de sortie de 128 000 jetons signifie qu'une seule génération de longueur maximale pourrait coûter environ 0,56 $ en jetons de sortie. Dans une conversation qui accumule de nombreux tours, les deux côtés augmentent ; l'entrée historique est renvoyée à chaque fois, à moins d'utiliser des fenêtres de contexte plus courtes ou de tronquer l'historique. Vous pouvez réduire les coûts en gardant des invites concises et en limitant la longueur de sortie lorsque c'est possible.
La fiche catalogue de GLM 5.3 ne mentionne pas la mise en cache des invites, les réductions ni les paliers de tarification spéciaux. Le prix indiqué est simple : 1,40 $ par million de jetons d'entrée et 4,40 $ par million de jetons de sortie. Si OrcaRouter ou le fournisseur en amont introduit la mise en cache à l'avenir, le coût effectif pour les invites répétées pourrait changer, mais aucun mécanisme de ce type n'est décrit ici. De même, aucune mention n'est faite du traitement par lots ni des remises sur volume. Pour maîtriser les coûts, vous pouvez gérer le nombre de jetons que vous envoyez. Par exemple, au lieu de renvoyer toute une conversation, conservez uniquement les tours de discussion récents pertinents. Vous pouvez également définir une valeur max_tokens plus basse pour plafonner la longueur de la sortie. Étant donné qu'OrcaRouter facture au tarif du fournisseur avec zéro marge, le coût affiché dans la liste des modèles correspond au tarif de base. Vérifiez toujours la documentation actuelle pour connaître les mises à jour des prix ou les nouvelles fonctionnalités.
Pour appeler Z.ai GLM 5.3, pointez votre client HTTP vers l'API compatible OpenAI d'OrcaRouter. L'URL de base est https://api.orcarouter.ai/v1. Utilisez l'identifiant de modèle z-ai/glm-5.3 dans le corps de la requête. Si vous utilisez le SDK OpenAI officiel, définissez base_url sur le point de terminaison d'OrcaRouter et utilisez votre clé API OrcaRouter. Le format de requête est la forme standard des complétions de chat : un objet JSON avec un champ model et un tableau messages. Chaque message contient un rôle et un contenu. Le modèle générera une réponse textuelle. OrcaRouter transmet la requête au fournisseur z-ai. Comme l'API est compatible OpenAI, les bibliothèques et outils qui prennent en charge les points de terminaison OpenAI peuvent être pointés vers OrcaRouter sans intégration personnalisée. Pour l'authentification, incluez un en-tête Authorization avec votre clé OrcaRouter. Le point de terminaison accepte les appels normaux de complétion de chat ; il n'existe aucune ressource RESTful distincte pour ce modèle.
L'API compatible OpenAI d'OrcaRouter pour GLM 5.3 accepte les mêmes paramètres de requête que ceux couramment utilisés dans le format de complétion de chat OpenAI. Vous pouvez définir le modèle sur z-ai/glm-5.3, fournir des messages et contrôler la génération avec des paramètres tels que max_tokens, temperature, top_p et stream. La liste exacte des paramètres pris en charge peut varier selon le fournisseur. Le catalogue ne répertorie pas un schéma complet des paramètres. Vous devez donc consulter la documentation API d'OrcaRouter pour connaître les champs actuellement pris en charge. Étant donné que la sortie maximale du modèle est de 128 000 jetons, vous pouvez définir max_tokens bien au-delà de la valeur par défaut de nombreux clients ; si votre client plafonne cette valeur, vous devrez peut-être l'ajuster. La fenêtre contextuelle de 1 000 000 de jetons signifie que le nombre total de jetons de vos messages peut être très élevé ; envoyer autant de texte au format JSON ne pose pas de problème, mais soyez attentif à la taille de la requête et à la latence. Le streaming est généralement disponible pour les API compatibles OpenAI, mais le format de réponse exact d'OrcaRouter suit la norme.
La migration d'une application d'OpenAI vers GLM 5.3 via OrcaRouter nécessite généralement deux modifications. Premièrement, changez le base_url en https://api.orcarouter.ai/v1. Deuxièmement, changez le nom du modèle en z-ai/glm-5.3. Le tableau messages, les rôles et la structure de réponse JSON restent les mêmes que le format de complétion de chat d'OpenAI. Si vous utilisez actuellement le SDK OpenAI, mettez à jour les variables d'environnement ou la configuration du client pour pointer vers OrcaRouter. Utilisez une clé API OrcaRouter à la place de la clé précédente. Aucune modification de code n'est nécessaire pour le corps de la requête lui-même, bien que vous souhaitiez peut-être examiner les paramètres. Comme GLM 5.3 est textuel uniquement, supprimez toute pièce jointe image_url ou multimodale de vos invites. De plus, la fenêtre de contexte du modèle est beaucoup plus grande que celle de nombreux modèles OpenAI, vous pouvez donc augmenter la quantité d'historique de conversation que vous envoyez. Testez d'abord avec une petite requête pour confirmer que le format de réponse correspond à ce que votre code attend.
Voici une requête minimale de complétion de chat pour GLM 5.3 via OrcaRouter. Envoyez un POST à https://api.orcarouter.ai/v1/chat/completions avec un en-tête Authorization contenant votre clé API OrcaRouter. Le corps doit inclure les champs : model défini sur z-ai/glm-5.3, et messages avec au moins un message, par exemple {"role":"user","content":"Quelle est la capitale de la France ?"}. La réponse contiendra la réponse du modèle au format standard de complétion de chat OpenAI. Vous pouvez ajouter des paramètres facultatifs comme temperature et max_tokens. Si max_tokens est omis, le fournisseur utilise sa valeur par défaut ; pour profiter de la limite de sortie de 128 000 jetons, définissez max_tokens sur la valeur souhaitée. Pour le streaming, définissez stream sur true et lisez les lignes de données à mesure qu'elles arrivent. Le formatage JSON exact suit la convention d'OpenAI, donc les fonctions d'assistance existantes pour analyser les choix et le contenu des messages devraient fonctionner.
La principale différence entre GLM 5.3 et les modèles avec des fenêtres de contexte plus petites réside dans la quantité de texte pouvant tenir dans une seule requête. GLM 5.3 prend en charge 1 000 000 de tokens, tandis que de nombreux modèles courants prennent en charge entre 4 000 et 200 000 tokens. Pour des tâches comme l'analyse d'un livre entier, une seule requête avec GLM 5.3 peut éviter la complexité du découpage et de la récupération. Cependant, une fenêtre de contexte plus grande ne signifie pas automatiquement de meilleures performances ; les modèles à contexte plus court sont parfois optimisés pour être très précis sur des tâches ciblées. Le coût est un autre facteur : les prix d'entrée et de sortie par token pour GLM 5.3 sont de 1,40 $ et 4,40 $ par million de tokens, et une requête très longue consommera beaucoup de tokens. Si vos données tiennent dans un contexte plus petit, un modèle moins cher peut être plus efficace. OrcaRouter vous permet de choisir le modèle adapté à votre charge de travail ; la fiche catalogue de GLM 5.3 ne comprend pas de tableau comparatif, vous devriez donc tester avec vos propres données.
GLM 5.3 est un modèle textuel uniquement, il n'accepte donc ni images, ni audio, ni vidéo en entrée. Les modèles multimodaux peuvent combiner ces modalités avec du texte, ce qui vous permet de poser des questions sur une photo, un enregistrement ou une image vidéo. Si votre application nécessite une compréhension visuelle, GLM 5.3 n'est pas le bon choix. Cependant, pour les charges de travail textuelles uniquement, le contexte de 1 000 000 de tokens et la sortie de 128 000 tokens de GLM 5.3 sont distinctifs. De nombreux modèles multimodaux ont une fenêtre de contexte beaucoup plus petite ou une longueur de sortie limitée. De plus, les modèles multimodaux facturent souvent des prix d'entrée plus élevés, car les tokens d'image peuvent être coûteux. Si vous n'avez que du texte, vous préférerez peut-être un modèle textuel uniquement pour éviter la surcharge liée à l'encodage des images. Le choix entre GLM 5.3 et un modèle multimodal doit être basé sur les types d'entrée que votre application doit gérer. Pour un corpus de texte, le grand contexte de GLM 5.3 est un avantage évident.
Z.ai, également connu sous le nom de Zhipu AI, développe une famille de modèles GLM. Cette entrée de catalogue concerne spécifiquement GLM 5.3 et ne décrit pas les versions GLM plus anciennes ou plus petites. La fenêtre de contexte indiquée de 1 000 000 de jetons et la sortie maximale de 128 000 jetons sont plus grandes que les limites par défaut typiques, mais aucune spécification comparative pour d'autres modèles GLM n'est fournie dans cette entrée. Les modèles Z.ai plus petits peuvent avoir des tarifs différents et une latence plus faible, mais aucun chiffre spécifique n'apparaît à côté de cette fiche catalogue. Comme OrcaRouter sert des modèles de plusieurs fournisseurs, vous pouvez comparer GLM 5.3 avec d'autres modèles de texte côte à côte en utilisant l'API compatible OpenAI. La meilleure façon de décider est d'exécuter une petite charge de travail représentative sur chaque modèle et de mesurer la qualité, la vitesse et le coût. Sans scores comparatifs officiels, tout classement direct des performances entre GLM 5.3 et d'autres versions serait spéculatif.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatstopstreamtemperaturetool_choicetoolstop_p| Entrée / 1M tokens | $1.40 |
| Sortie / 1M tokens | $4.40 |
| Lecture cache / 1M | $0.260 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
Ce dont parlent les développeurs cette semaine
GET /api/public/models/z-ai/glm-5.3Ouvrir @misc{orcarouter_glm_5_3,
title = {GLM 5.3 API},
author = {Z.ai},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/z-ai/glm-5.3}
}Z.ai. (2026). GLM 5.3 API. OrcaRouter. https://www.orcarouter.ai/models/z-ai/glm-5.3