
Nex-N2.5 Pro vs GLM-5.2 : le même 82.7 sur Terminal-Bench, deux provenances très différentes
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0455Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0247Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0247Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0157Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2646Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligence75Code
- obsidianQwen3.8 27B2026-08-1541Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1251Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0547Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligence49Code
Deux modèles agentiques à poids ouverts, une coïncidence suspecte : Nex-N2.5 Pro et GLM-5.2 affichent tous deux 82,7 sur Terminal-Bench 2.1. Nex-AGI indique 82,7 pour Nex-N2.5 Pro sur sa propre fiche modèle, mesuré avec le banc d’essai NexCUA de l’alliance, que le public n’a pas vu. Le meilleur chiffre rapporté par Z.ai pour GLM-5.2 sur la même suite est également de 82,7 — et lorsqu’un banc d’essai indépendant a relancé le modèle, il a obtenu 77,9, soit environ cinq points sous le chiffre du fournisseur. Une égalité parfaite entre un chiffre que personne ne peut vérifier et un chiffre qui a déjà diminué une fois vérifié n’a rien d’une égalité. C’est la démonstration la plus claire possible de la raison pour laquelle la différence entre « poids ouverts » et « poids qui n’existeront que plus tard » décide de ce face-à-face avant même qu’une seule ligne du benchmark ne soit lue.
Les deux modèles se situent dans le même créneau commercial et ne pourraient pas être plus différents dans leur nature. Nex-N2.5 Pro, annoncé le 8 septembre 2026, est un modèle multimodal d’utilisation d’ordinateur — 397 milliards de paramètres au total, dont environ 17 milliards actifs, issu de la lignée Qwen3.5, conçu pour lire un écran et piloter une session de navigateur ou de bureau avec une boucle de rétroaction visuelle. GLM-5.2 est le modèle phare de Z.ai (Zhipu AI), sous licence MIT, pour le raisonnement et le codage à long horizon — environ 743 milliards de paramètres au total, dont environ 40 milliards actifs, texte uniquement, disponible en version GA depuis le 16 juin 2026, et le modèle qui a servi de point d’ancrage aux scores indépendants du palier des poids ouverts depuis des mois. L’un regarde le monde à travers des pixels et agit sur lui. L’autre pense en texte et livre du code. La licence des deux modèles indique que vous pouvez bâtir une entreprise sur eux ; la différence est que, pour l’un d’eux, cette licence n’est actuellement qu’une promesse.
Le même numéro, deux provenances différentes
{{1}}Commençons par l'égalité, car elle résume tout l'affrontement.{{/1}} {{2}}La fiche de Nex-AGI indique Terminal-Bench 2.1 à 82,7 pour Nex-N2.5 Pro,{{/2}} {{3}}ainsi qu'OSWorld-2 à 56,4, SWE-Bench Pro à 61,2 et BrowseComp à 89,7{{/3}} {{4}}— chacun d'entre eux a été produit via le harnais NexCUA, et aucun n'a été reproduit de manière indépendante dans les premiers jours de la vie du modèle, pour la simple raison que les poids ne sont pas téléchargeables.{{/4}} {{5}}Le chiffre de Z.ai, 82,7 pour GLM-5.2 sur Terminal-Bench 2.1, est le meilleur résultat annoncé par le fournisseur lui-même,{{/5}} {{6}}mais il repose sur un modèle que n'importe qui peut récupérer sur Hugging Face et relancer cet après-midi ;{{/6}} {{7}}la mesure indépendante de 77,9 obtenue avec le harnais existe déjà, et elle est inférieure d'environ cinq points au chiffre de Z.ai.{{/7}} {{8}}Lorsqu'un chiffre de fournisseur diminue lors d'un test indépendant, ce n'est pas un scandale — c'est la taxe normale de l'auto-mesure.{{/8}} {{9}}Lorsque le chiffre d'un fournisseur concurrent ne peut même pas être testé, l'absence de cette taxe est le problème, et non un signe que le chiffre est immaculé.{{/9}}

Lisez les lignes environnantes de la même manière. GLM-5.2 détient l'indice indépendant le plus élevé jamais produit dans la catégorie open — le début des années 50 sur l'actuel Intelligence Index d'Artificial Analysis — c'est pourquoi il reste le modèle open de référence depuis des mois, même s'il n'est pas la nouveauté la plus clinquante. Nex-N2.5 Pro ne dispose d'aucune entrée d'indice indépendant. Sur les lignes où les deux fournisseurs revendiquent des chiffres, celui qui est vérifiable appartient au titulaire ; sur les lignes où seul Nex-AGI a publié, les chiffres ne sont pas reproduits. Ce n'est pas un jugement sur quel modèle est plus intelligent. C'est un jugement sur quel modèle vous êtes autorisé à vérifier.
Les fiches techniques concordent plus qu'on ne le croirait.
Ôtez les benchmarks et les deux modèles s'alignent étroitement sur les fondamentaux :
• Publié — Nex-N2.5 Pro : 8 septembre 2026 (endpoints hébergés actifs, poids en attente). GLM-5.2 : GA le 16 juin 2026, poids en ligne.
• Licence — Nex-N2.5 Pro : Apache-2.0, poids bientôt disponibles. GLM-5.2 : MIT, téléchargeable maintenant.
• Échelle — Nex-N2.5 Pro : 397B au total / ~17B actifs. GLM-5.2 : ~743B au total / ~40B actifs.
• Modalité — Nex-N2.5 Pro : texte et image en entrée, texte en sortie, boucle de vision pour utilisation d’ordinateur. GLM-5.2 : modèle de raisonnement exclusivement textuel.
• Contexte / sortie — Nex-N2.5 Pro : 262 144 jetons de contexte. GLM-5.2 : 1M de jetons de contexte, sortie plafonnée à 128K.
• Contrôle du raisonnement — Nex-N2.5 Pro : aucun / moyen (adaptatif, par défaut) / élevé. GLM-5.2 : contrôles de l’effort de raisonnement sur la même chaîne de modèle.
• Prix par 1M de tokens — Nex-N2.5 Pro : offre gratuite hébergée, sans prix catalogue. GLM-5.2 : 1,40 $ pour l’entrée / 4,40 $ pour la sortie, 0,26 $ pour l’entrée en cache.
Les enveloppes diffèrent dans la manière dont les tâches des deux modèles diffèrent : GLM-5.2 apporte un million complet de jetons de contexte textuel et un plafond de sortie de 128K aux longues sessions d'ingénierie, tandis que Nex-N2.5 Pro échange la taille du contexte contre un canal de vision et une fenêtre réduite de 262K, destinée aux charges de travail à taille d'écran. Aucune spécification n'est fausse ; elles sont conçues pour des tâches différentes.
Poids ouverts, deux sens différents

C'est ici que la comparaison cesse d'être une affaire de chiffres. GLM-5.2 est ouvert comme on livre un produit sur lequel on peut bâtir une entreprise : licence MIT, poids sur Hugging Face, aucune restriction d'usage commercial, aucune clause de partage de données, aucun fournisseur qui vous surveille par-dessus l'épaule. Vous pouvez le télécharger, l'affiner, le servir derrière votre propre périmètre de conformité ou l'installer chez l'hébergeur de votre choix — et, puisque les poids sont publiés, son prix a un plancher qu'aucun fournisseur ne peut relever à lui seul. Nex-N2.5 Pro est promis sous licence Apache-2.0, une licence tout aussi permissive, mais le bandeau de sa fiche Hugging Face indique que les poids arrivent bientôt, sans qu'aucune date ne soit fixée. Pour une équipe régie par des règles de gouvernance des données, ou qui veut, à grande échelle, échapper entièrement à la tarification par token, cette différence est à elle seule toute la décision : GLM-5.2 est un modèle que vous pouvez posséder aujourd'hui, et Nex-N2.5 Pro est un modèle qu'on vous a promis. Le calcul de l'auto-hébergement favorise aussi le nouveau venu lorsque les poids arriveront enfin — 17B de paramètres actifs sur un nœud de huit H100 représente une empreinte bien plus accessible que la machine à ~40B actifs de GLM-5.2 — mais « lorsque les poids arriveront » pèse lourd dans cette phrase.
Les familles se déplacent dans des directions opposées.
Les deux modèles appartiennent à des familles en évolution rapide, et leurs trajectoires divergent. {{1}}La lignée de GLM-5.2 est transparente et itérative : Z.ai a livré GLM-5.3 en août comme rafraîchissement post-entraînement de la même base 5.2, et GLM-5.3 Flash début septembre ; les poids 5.2 sur lesquels vous construisez aujourd'hui sont donc le fondement que la famille continue d'améliorer — vos connaissances de l'architecture et vos fine-tunings restent pertinents.{{/1}} {{2}}La famille Nex-AGI est un pari sur une toute nouvelle génération : Nex-N2.5 Mini à 35B, Nex-N2.5 Pro à 397B, et un Nex-N2.5 Max uniquement texte à 1,6T dont la base propre est DeepSeek-V4-Pro-Base, les poids Pro qui permettraient à quiconque de valider les affirmations de la famille restant non publiés.{{/2}} Une équipe qui choisit une plateforme sur laquelle bâtir choisit entre une lignée dotée d'une feuille de route publiée de rafraîchissements et une première version dont le deuxième acte n'est pas encore arrivé.
Lequel mérite sa place dans votre build
Si votre exigence est que « le modèle doit être le nôtre » — pour la gouvernance des données, pour l’audit, pour un produit que vous ne voulez pas voir contrôlé par un seul fournisseur — alors GLM-5.2 n’est pas le meilleur choix dans ce face-à-face ; c’est le seul choix, car c’est le seul modèle en lice que vous pouvez télécharger. C’est aussi le seul à avoir un score indépendant, et il est proposé au prix catalogue de Z.ai, soit 1,40 $ par million de jetons en entrée et 4,40 $ par million de jetons en sortie. Si votre exigence est un agent multimodal d’utilisation d’ordinateur qui pourrait à terme casser les prix des leaders fermés, Nex-N2.5 Pro est la thèse à long terme la plus intéressante — un opérateur visuel à 17 milliards de paramètres actifs issu d’une alliance qui sait clairement ce qu’elle veut construire — mais une thèse n’est pas une dépendance, et un point de terminaison hébergé gratuitement n’est pas une fondation.

La manière concrète d’agir sur tout cela est de s’appuyer sur ce qui existe et de mesurer la promesse une fois qu’elle se concrétise. GLM-5.2 est sur OrcaRouter au prix catalogue de Z.ai — les mêmes 1,40 $ / 4,40 $, répercutés sans marge — et, comme ses poids sont ouverts, il est aussi auto-hébergeable si vous voulez que la mesure inclue votre propre pile de service. C’est le point de référence contre lequel exécuter votre charge de travail agentique réelle dès aujourd’hui, le DSL de routage tenant lieu du jour où Nex-N2.5 Pro apparaîtra chez un fournisseur au prix catalogue : quand cela arrivera, basculer la comparaison sera une règle de routage, pas une migration. Jusqu’à ce que les shards soient publiés et qu’un banc d’essai indépendant confirme — ou corrige — ce 82,7, Nex-N2.5 Pro contre GLM-5.2 est un affrontement entre un modèle que vous pouvez vérifier et un chiffre que vous ne pouvez pas.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
