Une carte hero générée intitulée « NV-Reason-CT vs GLM-5.2 » avec le sous-titre « L'un de ces deux est déprécié, et ce n'est pas celui que vous croyez ». Deux cartes face à face sont séparées par une paire de flèches bleues : la carte de gauche est étiquetée « NV-Reason-CT » avec une icône de scan corporel et « sorti en septembre 2026 - actuel - CT thoracique et abdominal uniquement » ; la carte de droite est étiquetée « GLM-5.2 » avec une icône de puce et « sorti en juin 2026 - remplacé par GLM-5.3 - déprécié chez Artificial Analysis ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

NV-Reason-CT vs GLM-5.2 : L'un des deux est obsolète, et ce n'est pas celui que vous croyez

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le modèle le plus ancien de cette comparaison est celui qui est retiré. GLM-5.2 est sorti le 16 juin 2026 ; NV-Reason-CT présente une activité de dépôt datée entre le 2 et le 25 septembre 2026. On s'attendrait à ce que celui de septembre soit la quantité incertaine et celui de juin le choix établi. C'est l'inverse sur l'axe qui compte pour un pipeline de texte : GLM-5.2 a été remplacé par GLM-5.3, sorti le 18 août 2026, et il porte désormais un marqueur de dépréciation sur le classement indépendant où ses chiffres sont publiés. NV-Reason-CT, quoi que d'autre reste en suspens à son sujet, est la version actuelle de la seule chose qu'il fait.

La première phrase utile de cet article est celle qu’un lecteur a le moins de chances d’avoir : si vous démarrez une build de texte aujourd’hui et que vous vous tournez vers GLM-5.2 par habitude, arrêtez-vous et regardez d’abord GLM-5.3. Il coûte 1,26 $ par million de tokens d’entrée et 3,96 $ par million de tokens de sortie, contre 1,40 $ et 4,40 $ pour GLM-5.2 — il est à la fois plus récent et moins cher — et son indice d’intelligence indépendant est de 44,8 contre 33,7, ce qui représente un cran de plus sur la même échelle plutôt qu’un pas de côté. C’est une décision distincte de tout ce qui concerne CT, et elle mérite d’être prise séparément.

Les deux modèles, et les deux types différents de rassis

Il existe une véritable distinction entre un modèle ancien et un modèle dépassé, et ce rapprochement la rend concrète.

• Ce qu'il fait — NV-Reason-CT lit un volume de TDM thoracique ou abdominal et produit des observations structurées par région anatomique ; GLM-5.2 est un modèle de langage exclusivement textuel destiné au raisonnement, au code et au traitement de documents longs

• Publié — les artefacts de NV-Reason-CT datent du 2 au 25 septembre 2026 ; GLM-5.2 le 16 juin 2026, GLM-5.3 suivant le 18 août 2026

• Statut de génération — NV-Reason-CT est la version 0.1, une version initiale, non annoncée ; GLM-5.2 est la génération précédente d'une gamme de produits commercialisée

• Positionnement indépendant — aucune mesure indépendante de NV-Reason-CT n'existe ; GLM-5.2 obtient 33,7 sur l'Artificial Analysis Intelligence Index, avec une marque de dépréciation, contre 44,8 pour GLM-5.3

• Licence et accès — Des poids OpenMDW-1.1 que vous téléchargez ; par rapport à un modèle à poids ouverts servi à 1,40 $ et 4,40 $ par million de jetons, avec des lectures en cache à 0,26 $

• Contexte — 13 824 jetons visuels par volume sans fenêtre de chat ; contre 1 000 000 de jetons en entrée et 128 000 en sortie

• Usage déclaré — recherche et éducation uniquement, pas un dispositif médical ; contre le déploiement à usage général

Le mot « déprécié » fait ici un travail précis, et il ne faut pas le surinterpréter. Un marqueur de dépréciation sur un classement signifie que l'évaluateur a cessé de considérer le modèle comme actuel, généralement parce qu'un successeur a pris sa place. Cela ne signifie pas que les poids ont été retirés, que l'API a été désactivée ou que le modèle a cessé de fonctionner. Les équipes dont les pipelines sont réglés sur GLM-5.2 ne sont pas en difficulté. Ce que cela signifie, en revanche, c'est que ses chiffres sont un instantané d'avant l'existence de GLM-5.3, et que les mélanger avec les chiffres actuels d'autres modèles revient à comparer une mesure de juin à un paysage de septembre.

Les nombres dont chaque camp dispose, et ce qu’ils valent.

Le bilan de GLM-5.2 est inhabituellement bien rempli, et il provient de deux sources qui divergent de manière instructive.

D'après les propres rapports de Z.ai, le modèle obtient 99,12 sur τ²-Bench, 62,1 sur SWE-bench Pro, 54,7 sur Humanity's Last Exam avec outils, et un meilleur score rapporté de 82,7 sur Terminal-Bench 2.1. Du côté indépendant, Artificial Analysis évalue le même modèle à 77,9 sur Terminal-Bench 2.1, 33,7 sur son Intelligence Index, 89,5 sur GPQA Diamond et 41,1 sur Humanity's Last Exam. Il existe d'autres chiffres du fournisseur — 99,2 sur AIME 2026, 92,5 sur HMMT February 2026, 91 sur IMOAnswerBench, 74,4 sur FrontierSWE, 63,7 sur ProgramBench, 76,8 sur MCP-Atlas — et ils proviennent tous de Z.ai.

Deux choses, dans cette liste, méritent d’être nommées. Premièrement, l’écart de 4,8 points sur Terminal-Bench 2.1 entre le meilleur score rapporté par le fournisseur, 82,7, et le score indépendant de 77,9 n’est pas une contradiction. Les chiffres les meilleurs rapportés par les fournisseurs correspondent généralement au meilleur résultat de plusieurs harnais, et le score Terminus-2 de Z.ai pour le même benchmark est de 81 — la mesure indépendante se situe dans la fourchette propre du fournisseur. Deuxièmement, l’écart sur Humanity's Last Exam est plus grand : 41,1 en indépendant contre un chiffre fournisseur de 40,5 sans outils et de 54,7 avec, ce qui signifie que le 54,7 mis en avant est un chiffre assisté par outils et que le 41,1 est le chiffre brut. Citer 54,7 à côté du score brut d’un autre modèle serait une véritable erreur.

Le bilan de NV-Reason-CT ne présente pas une telle structure à deux sources, et c'est précisément là qu'il est plus faible. Ses résultats sur CT-RATE — 0,614 de F1 et 0,871 d'AUROC sur dix-huit étiquettes, avec un seuil uniforme fixe et une invite directe oui/non, sans tête de classification ni adaptation spécifique à la tâche — sont ceux de NVIDIA. Les modèles auxquels il est comparé dans cet article (VoxelFM 0,581, Pillar-0 0,544, ClinFusion-8B 0,442, CT-CLIP 0,398, Merlin 0,358, MedGemma 1.5 0,303) sont tous des modèles d'imagerie. Rien n'a été reproduit indépendamment, et le modèle est téléchargeable depuis des semaines. Il rapporte également un macro-F1 dérivé de comptes rendus de 0,592 et une étude préliminaire menée par un radiologue expert reliant la relecture assistée à une réduction de 50 % du temps d'interprétation moyen rapporté, que les auteurs eux-mêmes signalent comme gravement limitée par la taille de l'échantillon.

Ainsi, la comparaison de provenance n’avantage pas le modèle plus récent, et c’est un point qui mérite qu’on s’y attarde. GLM-5.2 est le modèle plus ancien, supplanté, et ses chiffres sont plus dignes de confiance que ceux de NV-Reason-CT, parce que quelqu’un de l’extérieur de l’entreprise a fait tourner le harnais. Être à jour ne revient pas à être vérifié.

A generated scoreboard titled 'Provenance, not recency, decides what to trust' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; independent checks, none; model status, version 0.1, unannounced, current; licence, OpenMDW-1.1, research and education only. The right column, headed 'GLM-5.2', lists five rows: AA Intelligence 33.7, GPQA Diamond 89.5; provenance, vendor and Artificial Analysis; independent checks, yes, with a 4.8-point vendor-versus-independent gap on Terminal-Bench 2.1; model status, superseded by GLM-5.3 and deprecated by the evaluator; licence, open weights at $1.40 and $4.40 per million. A footer reads 'The superseded model is the better-verified one. Recency is not the same as evidence.'

Pourquoi la dépréciation compte plus qu’il n’y paraît

Il y a une défaillance spécifique que cette comparaison est conçue pour prévenir, et il ne s’agit pas du tout de CT.

Une équipe qui construit un pipeline de textes cliniques cherche un modèle à poids ouverts à exécuter sur son propre matériel, car les données sont sensibles. Elle trouve GLM-5.2, sous licence MIT, avec 743 milliards de paramètres dont environ 40 milliards actifs, qui répond au besoin et dispose d'un historique de benchmarks bien documenté. Elle s'en sert comme base d'ajustement. Six mois plus tard, elle découvre que la génération actuelle est GLM-5.3, qu'elle a un contexte de 1 M avec un plafond de sortie de 128 K, qu'elle est moins chère, à 1,26 $ et 3,96 $, et que la décision qu'elle croyait prendre — quel modèle à poids ouverts adopter comme standard — était en réalité une décision sur la génération, et qu'elle l'a prise par accident.

C’est un accident coûteux à découvrir tardivement, et il est évitable avec une seule recherche. Les conseils concrets :

• Vérifiez si le modèle sur lequel vous allez vous standardiser est bien celui de la génération actuelle — un marqueur de dépréciation sur un classement est le signal le plus rapide, et la liste de modèles du fournisseur lui-même est celle qui fait autorité

• Ne mélangez pas un instantané de juin avec des chiffres de septembre — l'indice de 33,7 de GLM-5.2 a été mesuré avant l'existence de GLM-5.3, et le placer à côté de l'indice d'un modèle actuel revient à comparer deux moments différents d'un domaine en mouvement

• Attention au nom — une offre « GLM-5.3 Prime » correspond à un palier de service qui utilise les mêmes poids à environ le double du prix catalogue, et non à un modèle distinct. Vérifiez les poids derrière toute référence avant de payer un supplément pour celle-ci

• Considérez un tarif affiché plus bas comme une question, et non comme une réponse — que GLM-5.3 soit moins cher que son prédécesseur est inhabituel et mérite d'être vérifié sur votre propre charge de travail plutôt que présumé

Rien de tout cela ne fait de GLM-5.2 un mauvais choix. Un modèle de 743B sous licence MIT, à 1,40 $ et 4,40 $, qu'une équipe a déjà calibré, est une chose parfaitement raisonnable à continuer d'exploiter, et un modèle de milieu de génération doté d'antécédents bien établis est parfois exactement ce que veut un flux de travail réglementé. Le point est qu'il devrait s'agir d'un choix, fait délibérément, plutôt que d'un défaut hérité d'une liste qui était à jour en juillet.

Le piège de la comparaison d'un modèle de texte à un modèle CT

La seule raison pour laquelle ce rapprochement peut paraître tant soit peu plausible, c’est que tous deux sont des modèles à poids ouverts publiés en 2026, et qu’un lecteur parcourant un catalogue y voit deux entrées comparables. Ils ne sont pas comparables, et le décalage a une forme bien précise.

GLM-5.2 dispose de 1 000 000 de tokens. Un seul volume CT de NV-Reason-CT coûte 13 824 tokens visuels. D’après ce calcul, GLM-5.2 pourrait contenir soixante-dix études CT et avoir encore de la place, ce qui invite à conclure qu’un modèle textuel à contexte suffisamment long rend le modèle d’imagerie redondant. Cette conclusion ne s’ensuit pas, et la raison réside dans l’interface plutôt que dans le budget.

Ces 13 824 tokens ne sont pas un résumé. C'est un cube de 384 millimètres rééchantillonné à 2 mm isotrope, découpé en patchs 8 x 8 x 8 sur une grille de 24 x 24 x 24, confié à un backbone linguistique sans sous-échantillonnage spatial ni couche de fusion — c'est pourquoi le chemin actif compte 4,35 B de paramètres sur 4,69 B au total, et pourquoi le calcul sert à préserver la résolution plutôt qu'à la faire disparaître par compression. GLM-5.2 est purement textuel. Il n'a aucun chemin de vision, donc la question de savoir comment il traiterait un scan ne se pose pas ; la réponse est qu'on ne peut lui en fournir un sous aucune forme. Les deux fiches de modèle décrivent une différence d'un facteur six cents dans le budget de tokens qui n'a rien à voir avec la comparaison, parce que l'un d'eux n'a aucun moyen de recevoir l'entrée.

L’erreur inverse est tout aussi possible. NV-Reason-CT prend en charge le thorax et l’abdomen, accepte un fichier NIfTI plutôt qu’une invite, ne permet pas l’utilisation d’outils, et sa fiche de modèle le réserve à la recherche et à l’éducation et précise qu’il ne s’agit pas d’un dispositif médical et que les sorties peuvent être incorrectes. Il ne peut pas normaliser un corpus de comptes rendus, écrire un harnais d’évaluation, ni raisonner sur un document de recommandations. Un modèle d’imagerie de 4,7 B ne remplace pas un modèle textuel de 743 B, pas plus que l’inverse.

A generated scoreboard titled 'Two open-weight models, two different jobs' listing six paired rows. Row one: what it reads, one-channel NIfTI volumes in Hounsfield units against text only. Row two: context, 13,824 visual tokens per volume against 1,000,000 tokens in and 128,000 out. Row three: parameters, 4.69B total and 4.35B active against 743B total and about 40B active. Row four: generation status, version 0.1 current, unannounced against superseded by GLM-5.3. Row five: price, self-hosted with no rate card against $1.40 and $4.40 per million, or $1.26 and $3.96 for the successor. Row six: stated use, research and education, not a medical device against general purpose. A footer reads 'GLM-5.2 figures per the provider and Artificial Analysis; NV-Reason-CT figures per the authors paper.'

Mettre la moitié du texte sur une seule touche

Si la question est de savoir sur quel modèle de texte exécuter le travail de pipeline, la réponse aujourd'hui est probablement GLM-5.3 plutôt que GLM-5.2 — et les deux figurent dans notre catalogue sous une seule clé. z-ai/glm-5.2 est servi au tarif de la liste du fournisseur Z.ai, sans marge, et GLM-5.3 à ses côtés, au sein d'une seule API couvrant plus de 200 modèles. Maintenir les deux disponibles importe plus que d'habitude lors d'un changement de génération : vous pouvez mesurer le successeur sur votre propre corpus avant de vous engager, conserver le titulaire comme solution de repli pendant ce temps, et basculer sans second contrat ni modification du code.

Le taux de répercussion mérite une phrase pour la même raison qu’il importe sur tout modèle dont le fournisseur révise les tarifs. Sans couche de marge intermédiaire, une modification des tarifs du fournisseur se répercute chez nous le jour même. Le basculement automatique couvre la dégradation d’un fournisseur en cours de lot, ce qui, pour une longue tâche d’extraction, est la défaillance qui coûte réellement une nuit, et le DSL de routage vous permet d’envoyer les requêtes individuelles au modèle qui devrait les traiter plutôt que de tout diriger vers un seul point de terminaison.

NV-Reason-CT n'est pas sur notre plateforme, et aucun modèle NVIDIA ne l'est. Cela mérite d'être dit clairement plutôt que d'être laissé à l'interprétation : le volet CT de cette architecture correspond à des poids téléchargés sur votre propre matériel, sous une licence qui l'autorise et une fiche de modèle qui interdit toute utilisation clinique. Nous ne l'hébergeons pas et nous n'allons pas écrire une phrase qui suggère le contraire.

L’ordre dans lequel prendre ces décisions

La bonne séquence pour un build clinique n'est pas celle que la comparaison implique.

Commencez par la question de la génération de texte, et commencez-la en vérifiant quelle génération est actuelle — GLM-5.3 plutôt que GLM-5.2, sur le prix et sur la capacité mesurée, à moins que vous n'ayez une raison de rester en place. Mesurez ensuite la latence par étude du modèle CT sur votre propre matériel, car ce chiffre n'est pas publié et il régit le reste du budget. Concevez ensuite le pipeline de sorte que les deux moitiés soient remplaçables indépendamment, puisque l'une est sur un cycle de vie proche de celui d'une préversion et l'autre est en version 0.1.

La seule chose à ne pas faire est de traiter les deux comme un choix. Un modèle textuel 743B remplacé et un modèle CT 4.69B actuel n’ont aucune tâche en commun. La comparaison ne vaut la peine d’être faite que pour ce qu’elle révèle : que l’artefact le plus récent a les preuves les plus faibles derrière lui, que l’ancien est discrètement hors génération, et que ces deux faits sont invisibles pour quiconque lit une ligne de catalogue qui les liste côte à côte comme s’il s’agissait d’alternatives.

A screenshot of the OrcaRouter model page for GLM 5.2, showing the identifier z-ai/glm-5.2 with a Featured badge and tags for Tools, JSON and Reasoning, the description of it as Z.ai's flagship model for long-horizon tasks with a 1M-token context window and up to 128K output tokens, a side panel listing a 1M-token context window and 128K maximum output with text input and text output, and a stat strip reading $1.40 per million input tokens, $4.40 per million output tokens, and a p50 time to first token under five seconds.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement