Carte de titre principale pour la comparaison de GLM-5.3 et GLM-5.2, sous-titrée « Même cerveau, benchmarks doublés », avec deux cartes de modèle partageant un seul bloc de base MoE 743B connecté et une flèche de mise à niveau incurvée étiquetée « post-entraînement uniquement » pointant de GLM-5.2 vers GLM-5.3.
Guides & Insights

GLM-5.3 vs GLM-5.2 : Même cerveau, benchmarks doublés

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La présentation que Zhipu AI donne elle-même de la mise à niveau de GLM-5.2 vers G​LM-5.3 est la plus honnête : le manuel n'a pas changé, seule la formation de l'élève a changé. G​LM-5.3, publié le 14 août 2026, repose sur exactement la même base MoE de 743 milliards de paramètres que GLM-5.2, qui a dominé le domaine des modèles à poids ouverts sur l'Artificial Analysis Intelligence Index en juin. L'architecture est inchangée, l'empreinte est inchangée, le prix de 1,40 $ / 4,40 $ par million est inchangé — et pourtant Z.ai rapporte que le modèle réentraîné double ou surpasse son prédécesseur sur plusieurs des benchmarks de codage et de sécurité publiés par les deux versions. Que cela fasse de G​LM-5.3 une mise à niveau indispensable ou une affaire à suivre dépend de la confiance que vous accordez à un modèle qui s'est autant amélioré sans changer d'architecture, et de savoir si sa nouvelle capacité cyber est une fonctionnalité que vous souhaitez voir verrouillée derrière une fenêtre de sécurité de deux semaines.

Le même cerveau, réentraîné

Tout ce qui faisait de GLM-5.2 un serveur pratique est conservé : le MoE de 743B avec environ 40B de paramètres actifs, l’attention sparse IndexShare qui a réduit les FLOPs à 1M de contexte, la licence MIT, la fenêtre de contexte de 1M, et le débit de tokens efficace, mesuré à environ 145–168 tokens/sec en observation indépendante. GLM-5.3 ne diffère que sur une seule dimension — le post-entraînement. Z.ai a mis à l’échelle l’étape d’apprentissage par renforcement avec les frameworks IndexShare, SAO et Slime, a ajouté des dizaines de fois plus d’environnements de tâches à long horizon, et les a étendus du débogage de code à la découverte de vulnérabilités de sécurité et à l’ingénierie des systèmes. Le résultat est un modèle qui se comporte différemment sur le même matériel, ce qui explique précisément pourquoi la question de la mise à niveau n’est pas « ai-je besoin de nouveaux GPU ? » mais « ai-je besoin d’un nouveau comportement ? »

Le delta de référence, dans les deux sens

Lu comme un avant-après des chiffres publiés par Z.ai, ce bond est le plus important de l'histoire des poids ouverts. Terminal-Bench 3.0 — la révision la plus difficile, sur laquelle les deux ont été évalués — passe de 4,6 à 28,3, soit un bond multiplié par six. DeepSWE v1.1 passe de 46,2 à 66,9, ce qui fait la différence entre « bon modèle ouvert » et « compétitif avec les leaders fermés ». Le sous-ensemble CLI d'Agents' Last Exam passe de 23,8 à 28,5. La découverte de vulnérabilités CyberGym passe de 77,2 à 84,5. ExploitBench fait plus que doubler, passant de 24,4 à 54,4, et le débit d'ExploitGym passe de 29 et 39 tâches terminées (deux et six heures) à 105 et 130. Z.ai résume cela comme une amélioration d'environ 50 % en matière de codage, et la forme des gains — concentrés dans le codage à long horizon, l'automatisation de terminal et la sécurité — est cohérente avec un modèle n'ayant subi qu'un post-entraînement : les connaissances brutes sont les mêmes, mais c'est la capacité à effectuer réellement un travail multi-étapes qui s'est renforcée.

• Terminal-Bench 3.0 — GLM-5.2 4,6 contre GLM-5.3 28,3

• DeepSWE v1.1 — GLM-5.2 46.2 vs GLM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 vs G​LM-5.3 28.5

• Découverte de vulnérabilités CyberGym — GLM-5.2 77.2 vs G​LM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 vs GLM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

La capacité que personne n'a planifiée

Les gains en matière de sécurité méritent leur propre paragraphe, car Z.ai affirme qu'ils ne faisaient pas partie du plan. L'équipe de post-entraînement a ajouté des environnements de découverte de vulnérabilités en s'attendant à une amélioration modeste ; le modèle s'est plutôt mis à enchaîner des exploits complets, un comportement émergent qui a forcé Z.ai à retenir les poids pendant environ deux semaines pour un durcissement de la sécurité. Lors de tests en conditions réelles avec des équipes de sécurité, GLM-5.3 a contribué à la découverte de 2 436 vulnérabilités dans 269 projets, dont 1 097 à risque moyen ou élevé, y compris des failles qui étaient passées inaperçues pendant des décennies dans des logiciels largement déployés. GLM-5.2 possédait une capacité de sécurité au sens ordinaire — il pouvait lire le code pour y déceler des bogues. GLM-5.3 la possède dans un sens différent : il est l'objet même de la fenêtre de sécurité. C'est un changement de nature, pas de degré, et c'est la raison la plus forte de traiter les deux modèles comme des produits différents malgré la base commune.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

L'avertissement de cohérence

Le contrepoids à chaque chiffre ci-dessus est que les premiers tests indépendants décrivent G​LM-5.3 comme incohérent d'une manière que GLM-5.2 n'était pas. Des évaluateurs indépendants rapportent que le même modèle se comporte comme un ingénieur externalisé tout juste passable sur certaines tâches et fournit des résultats de niveau professionnel sur d'autres, la différence étant corrélée à la clarté des exigences spécifiées. C'est exactement le profil d'échec que l'on prédirait pour un modèle dont les gains proviennent entièrement d'un post-entraînement à forte composante environnementale : il généralise à partir des formes de tâches sur lesquelles il a été entraîné, et les invites mal spécifiées sortent de ce cadre. Aucun des résultats indépendants n'est aussi net que les tableaux publiés par Z.ai, et aucun des chiffres de Z.ai n'a encore été reproduit de manière indépendante. Pour la production, cela plaide en faveur d'une évaluation explicite sur votre propre charge de travail avant la migration — la même réserve que GLM-5.2 justifiait, mais avec un écart plus large entre le meilleur et le pire des cas.

Prix, accès et la question de l’attente.

Les prix sont identiques, ce qui élimine la friction habituelle liée à la mise à niveau : les deux modèles sont à 1,40 $ / 4,40 $ par million de jetons, G​LM-5.3 nécessitant l'activation du mode réflexion. La vraie différence réside dans l'accès. GLM-5.2 est téléchargeable dès aujourd'hui sous licence MIT, auto-hébergeable sur une empreinte FP8 de moins d'un téraoctet, et appelable via OrcaRouter au prix catalogue sans majoration — le modèle vers lequel vous pouvez router dès maintenant, stable et évalué de manière indépendante. G​LM-5.3 est utilisable dès maintenant via ZCode / AutoClaw de Z.ai et le G​LM Coding Plan, mais l'API publique et les poids sont tous deux verrouillés pendant la fenêtre de sécurité, et ses chiffres de référence sont tous fournis par le vendeur, en attendant des ré-exécutions par des tiers. La réponse honnête à « dois-je attendre ? » comporte donc deux volets : pour le trafic de production qui ne doit pas régresser, GLM-5.2 reste aujourd'hui le pari sûr en open-weights, et dès que l'API de G​LM-5.3 s'ouvre et que les exécutions indépendantes confirment les résultats, le passage est un changement de route, pas une réécriture — vous conservez la même configuration à une seule clé et changez de voie. Pour les travaux exploratoires et d'évaluation de sécurité, G​LM-5.3 vaut la peine d'être essayé dès maintenant via les outils de Z.ai, en sachant que son avance publiée n'est pas vérifiée et que son comportement est plus variable que celui du modèle qu'il remplace.

Le verdict honnête

G​LM-5.3 est le meilleur modèle selon les propres chiffres de Z.ai — nettement meilleur en codage à long horizon et catégoriquement différent en matière de sécurité — et il est gratuit pour votre flux de travail, car la base, l'empreinte et le prix sont inchangés. Mais « meilleur selon les évaluations du fournisseur » et « meilleur dans votre pipeline » sont séparés par deux choses que GLM-5.2 possède déjà et que G​LM-5.3 n'a pas encore : la reproduction indépendante et les poids de distribution. Si vous exécutez déjà GLM-5.2, le chemin de mise à niveau est le moins coûteux de l'histoire des poids ouverts — même matériel, même prix, même surface d'API, et une attente de deux semaines pour les poids. La décision porte moins sur le fait que G​LM-5.3 soit meilleur que GLM-5.2 que sur votre volonté de miser la production sur un modèle dont les améliorations, et dont la capacité de sécurité nouvellement apparue, n'ont pas encore été confirmées par quiconque en dehors de Z.ai.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube