Een gegenereerde hero-kaart met de titel 'NV-Reason-CT vs GLM-5.2' en de ondertitel 'Een van deze is verouderd, en het is niet degene die je denkt'. Twee tegenover elkaar staande kaarten worden gescheiden door een paar blauwe pijlen: de linkerkaart is gelabeld 'NV-Reason-CT' met een lichaamsscanpictogram en 'uitgebracht september 2026 - huidig - alleen CT van borst en buik'; de rechterkaart is gelabeld 'GLM-5.2' met een chippictogram en 'uitgebracht juni 2026 - vervangen door GLM-5.3 - verouderd bij Artificial Analysis'. Het OrcaRouter-logo is in de rechteronderhoek samengesteld.
Guides & Insights

NV-Reason-CT vs GLM-5.2: Een van deze is verouderd, en het is niet degene die je denkt

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het oudere model in deze vergelijking is degene die wordt uitgefaseerd. **GLM-5.2** werd uitgebracht op 16 juni 2026; **NV-Reason-CT** heeft repository-activiteit met datums tussen 2 en 25 september 2026. Je zou verwachten dat de septemberversie de onzekere factor is en de juni-versie de gevestigde keuze. Het tegenovergestelde is waar op de as die ertoe doet voor een tekstpipeline: GLM-5.2 is opgevolgd door GLM-5.3, die op 18 augustus 2026 verscheen, en het draagt nu een deprecatiemarkering op de onafhankelijke leaderboard waarop zijn cijfers worden gepubliceerd. NV-Reason-CT, wat er verder ook onopgelost aan is, is de huidige release van het enige dat het doet.

Dus de eerste nuttige zin in dit artikel is degene die een lezer het minst waarschijnlijk heeft: als je vandaag een tekstbuild start en uit gewoonte naar GLM-5.2 grijpt, stop dan en kijk eerst naar GLM-5.3. Het kost $1,26 per miljoen inputtokens en $3,96 per miljoen outputtokens, tegenover de $1,40 en $4,40 van GLM-5.2 — het is zowel nieuwer als goedkoper — en de onafhankelijke intelligentie-index is 44,8 tegen 33,7, wat een stap omhoog op dezelfde schaal is in plaats van een stap opzij. Dat is een beslissing die losstaat van alles wat met CT te maken heeft, en die verdient het apart te worden genomen.

De twee modellen, en de twee verschillende soorten stale

Er is een echt onderscheid tussen een model dat oud is en een model dat achterhaald is, en deze combinatie maakt het concreet.

• Wat het doet — NV-Reason-CT leest een CT-volume van de borstkas of buik en levert gestructureerde bevindingen per anatomische regio; GLM-5.2 is een taalmodel dat alleen tekst verwerkt, voor redeneren, code en werk met lange documenten

• Uitgebracht — de artefacten van NV-Reason-CT dateren van 2 tot 25 september 2026; GLM-5.2 op 16 juni 2026, met GLM-5.3 die volgt op 18 augustus 2026

• Generatiestatus — NV-Reason-CT is versie 0.1, een eerste release, niet aangekondigd; GLM-5.2 is de vorige generatie van een productlijn die al wordt geleverd

• Onafhankelijke positie — er bestaan geen onafhankelijke metingen van NV-Reason-CT; GLM-5.2 wordt gemeten op 33,7 op de Artificial Analysis Intelligence Index, met een deprecatiemarkering, tegenover GLM-5.3 op 44,8

• Licentie en toegang — OpenMDW-1.1-gewichten die je downloadt; tegen een open-weightmodel dat wordt aangeboden voor $1,40 en $4,40 per miljoen tokens, met gecachte reads tegen $0,26

• Context — 13.824 visuele tokens per volume zonder chatvenster; tegenover 1.000.000 tokens in en 128.000 tokens uit

• Vermeld gebruik — alleen voor onderzoek en onderwijs, geen medisch hulpmiddel; tegen algemene inzet

Het woord "deprecated" verricht hier precies werk en het is de moeite waard er niet te veel in te lezen. Een deprecatiemarkering op een leaderboard betekent dat de evaluator het model niet meer als actueel beschouwt, meestal omdat een opvolger zijn plaats heeft ingenomen. Het betekent niet dat de weights zijn ingetrokken, de API is uitgeschakeld, of dat het model niet meer werkt. Teams met pipelines die zijn afgestemd op GLM-5.2 zitten niet in de problemen. Wat het wel betekent, is dat de cijfers een momentopname zijn van voordat GLM-5.3 bestond, en dat het vermengen ervan met actuele cijfers voor andere modellen neerkomt op het vergelijken van een junimeting met een septemberveld.

De aantallen die elke kant heeft, en wat ze waard zijn.

Het dossier van GLM-5.2 is ongewoon goed gevuld en het is afkomstig van twee bronnen die op leerzame wijze met elkaar in tegenspraak zijn.

Volgens de eigen rapportage van Z.ai scoort het model 99,12 op τ²-Bench, 62,1 op SWE-bench Pro, 54,7 op Humanity's Last Exam met tools, en een beste gerapporteerde score van 82,7 op Terminal-Bench 2.1. Aan de onafhankelijke kant meet Artificial Analysis hetzelfde model op 77,9 op Terminal-Bench 2.1, 33,7 op zijn Intelligence Index, 89,5 op GPQA Diamond en 41,1 op Humanity's Last Exam. Er zijn nog andere leverancierscijfers — 99,2 op AIME 2026, 92,5 op HMMT februari 2026, 91 op IMOAnswerBench, 74,4 op FrontierSWE, 63,7 op ProgramBench, 76,8 op MCP-Atlas — en ze zijn allemaal van Z.ai.

Twee dingen aan die lijst zijn het benoemen waard. Ten eerste is het verschil van 4,8 punt op Terminal-Bench 2.1 tussen de best gerapporteerde 82,7 van de leverancier en de onafhankelijke 77,9 geen tegenstrijdigheid. Best gerapporteerde cijfers van leveranciers zijn doorgaans de beste van meerdere testopstellingen, en Z.ai's eigen Terminus-2-cijfer voor dezelfde benchmark is 81 — de onafhankelijke meting valt binnen het bereik van de leverancier zelf. Ten tweede is de splitsing bij Humanity's Last Exam groter: 41,1 onafhankelijk tegenover een leverancierscijfer van 40,5 zonder tools en 54,7 met tools, wat betekent dat het kopcijfer 54,7 een tool-ondersteund getal is en 41,1 het kale getal. Het citeren van 54,7 naast de kale score van een ander model zou een echte fout zijn.

Het trackrecord van NV-Reason-CT heeft geen dergelijke tweebronstructuur, en dat is precies waar het zwakker is. De CT-RATE-resultaten — 0,614 F1 en 0,871 AUROC over achttien labels, met een vaste uniforme drempel en een directe ja/nee-prompt, zonder classificatiehoofd of taakspecifieke aanpassing — zijn van NVIDIA zelf. De modellen waarmee het in dat artikel wordt vergeleken (VoxelFM 0,581, Pillar-0 0,544, ClinFusion-8B 0,442, CT-CLIP 0,398, Merlin 0,358, MedGemma 1.5 0,303) zijn allemaal beeldvormingsmodellen. Niets is onafhankelijk gereproduceerd, en het model is al weken downloadbaar. Het rapporteert ook een uit rapporten afgeleide macro-F1 van 0,592 en een voorlopige studie met expertradiologen die geassisteerde beoordeling in verband brengt met een vermindering van 50% in de gemiddelde gerapporteerde interpretatietijd, wat de auteurs zelf bestempelen als een ernstige beperking door de kleine steekproef.

Dus de herkomstvergelijking pleit niet voor het nieuwere model, en dit is het punt dat het waard is om bij stil te staan. GLM-5.2 is het oudere, achterhaalde model, en zijn cijfers zijn betrouwbaarder dan die van NV-Reason-CT, omdat iemand buiten het bedrijf de harness heeft gedraaid. Actueel zijn is niet hetzelfde als geverifieerd zijn.

A generated scoreboard titled 'Provenance, not recency, decides what to trust' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; independent checks, none; model status, version 0.1, unannounced, current; licence, OpenMDW-1.1, research and education only. The right column, headed 'GLM-5.2', lists five rows: AA Intelligence 33.7, GPQA Diamond 89.5; provenance, vendor and Artificial Analysis; independent checks, yes, with a 4.8-point vendor-versus-independent gap on Terminal-Bench 2.1; model status, superseded by GLM-5.3 and deprecated by the evaluator; licence, open weights at $1.40 and $4.40 per million. A footer reads 'The superseded model is the better-verified one. Recency is not the same as evidence.'

Waarom de deprecatie meer uitmaakt dan het klinkt

Er is een specifieke fout die deze vergelijking moet voorkomen, en die heeft helemaal niets met CT te maken.

Een team dat een klinische tekstpijplijn bouwt, gaat op zoek naar een open-weightmodel om op hun eigen hardware te draaien, omdat de data gevoelig zijn. Ze vinden GLM-5.2, dat onder MIT-licentie valt, 743 miljard parameters heeft waarvan ongeveer 40 miljard actief, aan de eisen voldoet en een goed gedocumenteerd benchmarkrecord heeft. Ze tunen ertegen. Zes maanden later ontdekken ze dat de huidige generatie GLM-5.3 is, dat die 1M-context heeft met een uitvoerplafond van 128K, dat die met $1,26 en $3,96 goedkoper is, en dat de beslissing waarvan ze dachten dat ze die namen — welk open-weightmodel ze als standaard zouden nemen — eigenlijk een beslissing was over welke generatie, en ze hebben die per ongeluk genomen.

Dat is een dure fout om pas laat te ontdekken, en dat is met één opzoeking te voorkomen. De concrete richtlijn:

• Controleer of het model waarop je je gaat standaardiseren van de huidige generatie is — een deprecatiemarkering op een leaderboard is het snelste signaal, en de modellenlijst van de leverancier zelf is de gezaghebbende bron

• Meng geen momentopname uit juni met septembercijfers — de index van 33,7 van GLM-5.2 werd gemeten voordat GLM-5.3 bestond, en als je die naast de index van een actueel model zet, vergelijk je twee verschillende momenten in een vakgebied in beweging

• Wees voorzichtig met de naam — een vermelding als "GLM-5.3 Prime" is een serveerniveau met dezelfde gewichten tegen ongeveer het dubbele van de lijstprijs, geen apart model. Controleer de gewichten achter elke SKU voordat je er een premie voor betaalt

• Behandel een lager aangekondigd tarief als een vraag, niet als een antwoord — dat GLM-5.3 goedkoper is dan zijn voorganger is ongebruikelijk en het is de moeite waard om dit tegen je eigen workload te verifiëren in plaats van aan te nemen

Niets daarvan maakt GLM-5.2 een slechte keuze. Een MIT-gelicentieerd 743B-model voor $1,40 en $4,40 waartegen een team al heeft getuned, is een volkomen redelijk iets om te blijven draaien, en een model uit het midden van een generatie met een gevestigde staat van dienst is soms precies wat een gereguleerde workflow wil. Het punt is dat het een keuze zou moeten zijn, bewust gemaakt, in plaats van een standaardkeuze die is overgenomen uit een lijst die in juli actueel was.

De valkuil bij het vergelijken van een tekstmodel met een CT-model

De reden dat deze combinatie überhaupt aannemelijk lijkt, is dat beide open-weight modellen zijn die in 2026 zijn uitgebracht, en een lezer die een catalogus scant, twee vergelijkbare regelitems ziet. Ze zijn niet vergelijkbaar, en de mismatch heeft een specifieke vorm.

GLM-5.2 kan 1.000.000 tokens bevatten. Eén enkel CT-volume van NV-Reason-CT kost 13.824 visuele tokens. Volgens die rekensom zou GLM-5.2 zeventig CT-onderzoeken kunnen bevatten en nog ruimte overhouden, wat de conclusie oproept dat een tekstmodel met een voldoende lange context het beeldvormingsmodel overbodig maakt. Die conclusie volgt daar niet uit, en de reden is de interface, niet het budget.

Die 13.824 tokens zijn geen samenvatting. Het is een kubus van 384 millimeter die opnieuw is gesampled naar 2 mm isotroop, opgedeeld in 8 x 8 x 8 patches op een raster van 24 x 24 x 24, en doorgegeven aan een taalbackbone zonder ruimtelijke downsampling en zonder samenvoeglaag — daarom bestaat het actieve pad uit 4,35 miljard van de in totaal 4,69 miljard parameters, en daarom wordt de rekentijd besteed aan het behouden van resolutie in plaats van die weg te comprimeren. GLM-5.2 is alleen tekst. Het heeft helemaal geen vision-pad, dus de vraag hoe het een scan zou verwerken komt niet aan de orde; het antwoord is dat het er in geen enkele vorm een kan krijgen. De twee modelkaarten beschrijven een zeshonderdvoudig verschil in tokenbudget dat niets met de vergelijking te maken heeft, omdat een van beide geen enkele manier heeft om de invoer te ontvangen.

De omgekeerde fout is net zo goed mogelijk. NV-Reason-CT ondersteunt borst en buik, neemt een NIfTI-bestand in plaats van een prompt, maakt geen gebruik van tools, en de modelkaart beperkt het tot onderzoek en onderwijs en stelt dat het geen medisch hulpmiddel is en dat de uitvoer onjuist kan zijn. Het kan geen rapportcorpus normaliseren, geen evaluatieraamwerk schrijven of redeneren over een richtlijndocument. Een 4.7B-beeldvormingsmodel is evenmin een substituut voor een 743B-tekstmodel als het omgekeerde.

A generated scoreboard titled 'Two open-weight models, two different jobs' listing six paired rows. Row one: what it reads, one-channel NIfTI volumes in Hounsfield units against text only. Row two: context, 13,824 visual tokens per volume against 1,000,000 tokens in and 128,000 out. Row three: parameters, 4.69B total and 4.35B active against 743B total and about 40B active. Row four: generation status, version 0.1 current, unannounced against superseded by GLM-5.3. Row five: price, self-hosted with no rate card against $1.40 and $4.40 per million, or $1.26 and $3.96 for the successor. Row six: stated use, research and education, not a medical device against general purpose. A footer reads 'GLM-5.2 figures per the provider and Artificial Analysis; NV-Reason-CT figures per the authors paper.'

De tekst half op één toets zetten

Als de vraag is op welk tekstmodel het pipelinewerk moet draaien, is het antwoord vandaag waarschijnlijk GLM-5.3 in plaats van GLM-5.2 — en beide staan in onze catalogus onder één sleutel. z-ai/glm-5.2 wordt geleverd tegen het tarief van de providerlijst van Z.ai, zonder opslag, en GLM-5.3 daarnaast, binnen één enkele API die meer dan 200 modellen dekt. Beide beschikbaar houden is tijdens een generatiewissel belangrijker dan anders: je kunt de opvolger op je eigen corpus meten voordat je je vastlegt, de huidige als fallback aanhouden terwijl je dat doet, en overstappen zonder een tweede contract of een codewijziging.

Het pass-through-tarief is een zin waard om dezelfde reden waarom het ertoe doet bij elk model waarvan de leverancier de prijs aanpast. Zonder tussenliggende opslaglaag komt een tariefwijziging van een leverancier dezelfde dag bij ons terecht. Automatische failover vangt op dat een provider halverwege een batch verslechtert, wat voor een lange extractietaak nu juist de storing is die je een nacht kost, en met de routing-DSL kun je afzonderlijke verzoeken naar het model sturen dat ze zou moeten verwerken in plaats van alles op één endpoint te richten.

NV-Reason-CT staat niet op ons platform, en geen enkel NVIDIA-model staat erop. Dat kun je maar beter ronduit zeggen in plaats van het aan de lezer over te laten om het af te leiden: de CT-kant van deze architectuur bestaat uit gedownloade gewichten op je eigen hardware, onder een licentie die dat toestaat en een modelkaart die klinisch gebruik verbiedt. Wij hosten het niet en wij gaan geen zin schrijven die het tegendeel suggereert.

De volgorde waarin deze beslissingen moeten worden genomen

De juiste volgorde voor een klinische build is niet degene die de vergelijking impliceert.

Begin met de vraag over tekstgeneratie, en begin daarmee door eerst te bepalen wat de huidige is — GLM-5.3 in plaats van GLM-5, qua prijs en gemeten capaciteit, tenzij je een reden hebt om bij het huidige te blijven. Meet vervolgens de latentie per studie van het CT-model op je eigen hardware, want dat cijfer is niet gepubliceerd en het komt niet in benchmarks voor. Ontwerp daarna de pijplijn zo dat de twee helften onafhankelijk vervangbaar zijn, aangezien de ene een preview-achtige levenscyclus heeft en de andere op versie 0 staat.

Het enige wat je niet moet doen, is de twee als een keuze behandelen. Een achterhaald 743B-tekstmodel en een actueel 4,69B-CT-model hebben geen enkele taak gemeen. De vergelijking is alleen de moeite waard vanwege wat ze blootlegt: dat het nieuwere artefact op zwakkere evidentie berust, dat het oudere stilletjes niet meer tot de huidige generatie behoort, en dat beide feiten onzichtbaar zijn voor iedereen die een catalogusrij leest die ze naast elkaar vermeldt alsof het alternatieven waren.

A screenshot of the OrcaRouter model page for GLM 5.2, showing the identifier z-ai/glm-5.2 with a Featured badge and tags for Tools, JSON and Reasoning, the description of it as Z.ai's flagship model for long-horizon tasks with a 1M-token context window and up to 128K output tokens, a side panel listing a 1M-token context window and 128K maximum output with text input and text output, and a stat strip reading $1.40 per million input tokens, $4.40 per million output tokens, and a p50 time to first token under five seconds.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt