Eine generierte Hero-Karte mit dem Titel „NV-Reason-CT vs GLM-5.2" und dem Untertitel „Eines davon ist veraltet – und es ist nicht das, das du denkst". Zwei einander gegenüberliegende Karten werden durch ein Paar blauer Pfeile getrennt: Die linke Karte trägt die Beschriftung „NV-Reason-CT" mit einem Körper-Scan-Symbol und „veröffentlicht im September 2026 – aktuell – nur CT von Thorax und Abdomen"; die rechte Karte trägt die Beschriftung „GLM-5.2" mit einem Chip-Symbol und „veröffentlicht im Juni 2026 – abgelöst durch GLM-5.3 – veraltet bei Artificial Analysis". Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

NV-Reason-CT vs. GLM-5.2: Eines davon ist veraltet, und es ist nicht das, das Sie vermuten.

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das ältere Modell in diesem Vergleich ist dasjenige, das ausgemustert wird. GLM-5.2 wurde am 16. Juni 2026 veröffentlicht; NV-Reason-CT weist Repository-Aktivität mit Datumsangaben zwischen dem 2. und 25. September 2026 auf. Man würde erwarten, dass das September-Modell die unsichere Größe und das Juni-Modell die etablierte Wahl ist. Auf der Achse, die für eine Text-Pipeline zählt, ist das Gegenteil der Fall: GLM-5.2 wurde durch GLM-5.3 abgelöst, das am 18. August 2026 veröffentlicht wurde, und es trägt jetzt eine Deprecation-Kennzeichnung auf dem unabhängigen Leaderboard, auf dem seine Zahlen veröffentlicht werden. NV-Reason-CT ist, was auch immer sonst daran ungeklärt sein mag, die aktuelle Version der einzigen Sache, die es tut.

Die erste nützliche Aussage in diesem Artikel ist also die, die ein Leser am wenigsten wahrscheinlich schon hat: Wenn Sie heute ein Text-Build beginnen und aus Gewohnheit zu GLM-5.2 greifen, halten Sie inne und sehen Sie sich zuerst GLM-5.3 an. Es kostet 1,26 $ pro Million Input-Tokens und 3,96 $ pro Million Output-Tokens gegenüber 1,40 $ und 4,40 $ bei GLM-5.2 — es ist sowohl neuer als auch günstiger — und sein unabhängiger Intelligenzindex liegt bei 44,8 gegenüber 33,7, was ein Schritt nach oben auf derselben Skala ist und nicht ein Schritt zur Seite. Das ist eine Entscheidung, die von allem, was mit CT zu tun hat, getrennt ist, und sie sollte auch getrennt getroffen werden.

Die beiden Modelle und die zwei verschiedenen Arten von Veraltetem

Es gibt einen echten Unterschied zwischen einem Modell, das alt ist, und einem Modell, das abgelöst wurde, und diese Gegenüberstellung macht ihn konkret.

• Was es tut — NV-Reason-CT liest ein CT-Volumen des Thorax oder Abdomens ein und gibt strukturierte Befunde nach anatomischen Regionen aus; GLM-5.2 ist ein rein textbasiertes Sprachmodell für Reasoning, Code und die Arbeit mit langen Dokumenten

• Veröffentlicht — NV-Reason-CTs Artefakte stammen aus der Zeit vom 2. bis 25. September 2026; GLM-5.2 am 16. Juni 2026, gefolgt von GLM-5.3 am 18. August 2026

• Generationsstatus — NV-Reason-CT ist Version 0.1, eine Erstveröffentlichung, noch nicht angekündigt; GLM-5.2 ist die vorherige Generation einer bereits ausgelieferten Produktlinie

• Unabhängige Einordnung — es existieren keine unabhängigen Messungen von NV-Reason-CT; GLM-5.2 wird im Artificial Analysis Intelligence Index mit 33,7 gemessen, mit einem Deprecation-Marker, gegenüber GLM-5.3 mit 44,8

• Lizenz und Zugang — OpenMDW-1.1-Gewichte, die Sie herunterladen; gegenüber einem Open-Weight-Modell, das für 1,40 $ und 4,40 $ pro Million Tokens bereitgestellt wird, mit zwischengespeicherten Lesezugriffen zu 0,26 $

• Kontext — 13.824 visuelle Tokens pro Band ohne Chat-Fenster; gegen 1.000.000 Tokens Eingabe und 128.000 Ausgabe

• Angegebener Verwendungszweck — nur für Forschung und Lehre, kein Medizinprodukt; gegen einen Einsatz für allgemeine Zwecke

Das Wort „deprecated“ leistet hier präzise Arbeit, und es lohnt sich, nicht zu viel hineinzulesen. Ein Deprecation-Marker auf einem Leaderboard bedeutet, dass der Evaluator das Modell nicht mehr als aktuell behandelt, normalerweise weil ein Nachfolger seinen Platz eingenommen hat. Es bedeutet nicht, dass die Gewichte zurückgezogen wurden, die API abgeschaltet wurde oder das Modell nicht mehr funktioniert. Teams mit Pipelines, die auf GLM-4.0 abgestimmt sind, sind nicht in Schwierigkeiten. Was es bedeutet, ist, dass seine Zahlen eine Momentaufnahme aus der Zeit vor GLM-5.3 sind, und dass das Mischen mit aktuellen Zahlen für andere Modelle dem Vergleich einer Juni-Messung mit einem September-Feld gleichkommt.

Die Zahlen, die jede Seite hat, und was sie wert sind

GLM-5.2s Bilanz ist ungewöhnlich gut gefüllt, und sie stammt aus zwei Quellen, die in lehrreicher Weise voneinander abweichen.

Nach eigenen Angaben von Z.ai erzielt das Modell 99,12 auf τ²-Bench, 62,1 auf SWE-bench Pro, 54,7 auf Humanity's Last Exam mit Tools und einen besten gemeldeten Wert von 82,7 auf Terminal-Bench 2.1. Auf der unabhängigen Seite misst Artificial Analysis dasselbe Modell bei 77,9 auf Terminal-Bench 2.1, 33,7 auf seinem Intelligence Index, 89,5 auf GPQA Diamond und 41,1 auf Humanity's Last Exam. Es gibt weitere Herstellerangaben – 99,2 auf AIME 2026, 92,5 auf HMMT February 2026, 91 auf IMOAnswerBench, 74,4 auf FrontierSWE, 63,7 auf ProgramBench, 76,8 auf MCP-Atlas – und sie stammen alle von Z.ai.

Zwei Dinge an dieser Liste verdienen es, benannt zu werden. Erstens ist die 4,8-Punkte-Spanne bei Terminal-Bench 2.1 zwischen dem vom Anbieter am besten gemeldeten Wert von 82,7 und dem unabhängigen Wert von 77,9 kein Widerspruch. Vom Anbieter am besten gemeldete Zahlen sind typischerweise der beste Wert aus mehreren Testumgebungen, und der eigene Terminus-2-Wert von Z.ai für denselben Benchmark liegt bei 81 – die unabhängige Messung liegt innerhalb der eigenen Spanne des Anbieters. Zweitens ist die Abweichung bei Humanity's Last Exam größer: 41,1 unabhängig gegenüber einem Anbieterwert von 40,5 ohne Werkzeuge und 54,7 mit ihnen, was bedeutet, dass die Schlagzeilen-Zahl 54,7 werkzeuggestützt ist und die 41,1 ohne Werkzeuge ermittelt wurde. 54,7 neben dem Wert eines anderen Modells ohne Werkzeuge zu zitieren, wäre ein echter Fehler.

Die Bilanz von NV-Reason-CT weist keine solche Zwei-Quellen-Struktur auf, und genau darin ist sie schwächer. Seine CT-RATE-Ergebnisse — 0,614 F1 und 0,871 AUROC über achtzehn Labels, mit einem festen einheitlichen Schwellenwert und einem direkten Ja/Nein-Prompt und ohne Klassifikationskopf oder aufgabenspezifische Anpassung — sind NVIDIAs eigene. Die Modelle, mit denen es in diesem Artikel verglichen wird (VoxelFM 0,581, Pillar-0 0,544, ClinFusion-8B 0,442, CT-CLIP 0,398, Merlin 0,358, MedGemma 1.5 0,303), sind alle Bildgebungsmodelle. Nichts wurde unabhängig reproduziert, und das Modell ist seit Wochen herunterladbar. Es berichtet außerdem über einen aus Berichten abgeleiteten Macro-F1 von 0,592 und eine vorläufige Studie mit erfahrenen Radiologen, die die assistierte Überprüfung mit einer 50%igen Reduzierung der durchschnittlich angegebenen Interpretationszeit in Verbindung bringt, was die Autoren selbst als gravierende Kleinstichprobe kennzeichnen.

Der Herkunftsvergleich begünstigt also nicht das neuere Modell, und das ist der Punkt, bei dem es sich lohnt, innezuhalten. GLM-5.2 ist das ältere, abgelöste Modell, und seine Zahlen sind vertrauenswürdiger als die von NV-Reason-CT, weil jemand außerhalb des Unternehmens den Test-Harness ausgeführt hat. Auf dem neuesten Stand zu sein ist nicht dasselbe wie verifiziert zu sein.

A generated scoreboard titled 'Provenance, not recency, decides what to trust' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; independent checks, none; model status, version 0.1, unannounced, current; licence, OpenMDW-1.1, research and education only. The right column, headed 'GLM-5.2', lists five rows: AA Intelligence 33.7, GPQA Diamond 89.5; provenance, vendor and Artificial Analysis; independent checks, yes, with a 4.8-point vendor-versus-independent gap on Terminal-Bench 2.1; model status, superseded by GLM-5.3 and deprecated by the evaluator; licence, open weights at $1.40 and $4.40 per million. A footer reads 'The superseded model is the better-verified one. Recency is not the same as evidence.'

Warum die Deprecation wichtiger ist, als sie klingt

Es gibt einen Fehler, den dieser Vergleich verhindern soll, und er hat überhaupt nichts mit CT zu tun.

Ein Team, das eine klinische Text-Pipeline aufbaut, macht sich auf die Suche nach einem Open-Weight-Modell, das auf ihrer eigenen Hardware läuft, weil die Daten sensibel sind. Sie finden GLM-5.2, das unter MIT-Lizenz steht, 743 Milliarden Parameter hat, von denen rund 40 Milliarden aktiv sind, die Anforderungen erfüllt und eine gut dokumentierte Benchmark-Historie hat. Sie tunen darauf. Sechs Monate später entdecken sie, dass die aktuelle Generation GLM-5.3 ist, dass sie 1M-Kontext mit einer 128K-Ausgabegrenze bietet, dass sie mit 1,26 $ und 3,96 $ günstiger ist und dass die Entscheidung, die sie zu treffen glaubten – auf welches Open-Weight-Modell sie sich als Standard festlegen sollten –, tatsächlich eine Entscheidung darüber war, welche Generation, und dass sie diese aus Versehen trafen.

Das ist ein kostspieliger Fehler, der erst spät entdeckt wird, und er lässt sich mit einer einzigen Abfrage vermeiden. Die konkrete Anleitung:

• Prüfe, ob das Modell, das du als Standard festlegen willst, die aktuelle Generation ist — ein Deprecation-Marker in einem Leaderboard ist das schnellste Signal, und die eigene Modellliste eines Anbieters ist die maßgebliche

• Vermischen Sie keine Juni-Momentaufnahme mit September-Zahlen — Der Index von GLM-5.2 mit 33,7 wurde gemessen, bevor GLM-5.3 existierte, und ihn neben den Index eines aktuellen Modells zu setzen, vergleicht zwei verschiedene Zeitpunkte in einem sich bewegenden Feld

• Vorsicht beim Namen — ein Angebot namens „GLM-5.3 Prime" ist eine Serving-Stufe, die dieselben Gewichte zum etwa doppelten Listenpreis anbietet, kein separates Modell. Prüfe die Gewichte hinter jeder SKU, bevor du dafür einen Aufpreis zahlst

• Betrachten Sie einen niedrigeren Listenpreis als Frage, nicht als Antwort — dass GLM-5.3 günstiger ist als sein Vorgänger, ist ungewöhnlich und sollte anhand Ihrer eigenen Workload überprüft werden, statt es einfach anzunehmen

Nichts davon macht GLM-5.2 zu einer schlechten Wahl. Ein MIT-lizenziertes 743B-Modell für 1,40 $ und 4,40 $, auf das ein Team bereits abgestimmt hat, ist eine vollkommen vernünftige Sache, die man weiterlaufen lassen kann, und ein Modell der mittleren Generation mit einer gefestigten Erfolgsbilanz ist manchmal genau das, was ein regulierter Workflow will. Der Punkt ist, dass es eine Wahl sein sollte, bewusst getroffen, statt ein Standard, der von einer Liste geerbt wurde, die im Juli aktuell war.

Die Falle beim Vergleich eines Textmodells mit einem CT-Modell

Der Grund, warum diese Paarung überhaupt plausibel erscheint, ist, dass beide Open-Weight-Modelle sind, die 2026 veröffentlicht wurden, und wer einen Katalog durchsieht, zwei vergleichbare Posten sieht. Sie sind nicht vergleichbar, und die Diskrepanz hat eine bestimmte Gestalt.

GLM-5.2 fasst 1.000.000 Tokens. Ein einzelnes CT-Volumen von NV-Reason-CT kostet 13.824 visuelle Tokens. Nach dieser Rechnung könnte GLM-5.2 siebzig CT-Studien fassen und hätte noch Platz, was zu dem Schluss verleitet, dass ein Textmodell mit ausreichend langem Kontext das Bildgebungsmodell überflüssig macht. Dieser Schluss ist nicht zwingend, und der Grund dafür ist die Schnittstelle, nicht das Budget.

Diese 13.824 Token sind keine Zusammenfassung. Sie sind ein 384-Millimeter-Würfel, auf 2 mm isotrop neu abgetastet, in 8 × 8 × 8 Patches auf einem 24 × 24 × 24-Raster zerlegt und einem Sprach-Backbone übergeben, ohne räumliches Downsampling und ohne Merging-Schicht – weshalb der aktive Pfad 4,35 Mrd. Parameter der insgesamt 4,69 Mrd. ausmacht und weshalb die Rechenleistung darauf verwendet wird, die Auflösung zu erhalten, statt sie wegzukomprimieren. GLM-5.2 ist ausschließlich textbasiert. Es verfügt über keinerlei Vision-Pfad, daher stellt sich die Frage, wie es mit einem Scan umgehen würde, gar nicht; die Antwort ist, dass ihm in keiner Form ein Scan übergeben werden kann. Die beiden Modellkarten beschreiben einen sechshundertfachen Unterschied beim Token-Budget, der nichts mit dem Vergleich zu tun hat, weil eines von ihnen keine Möglichkeit hat, die Eingabe zu empfangen.

Der umgekehrte Fehler liegt genauso nahe. NV-Reason-CT unterstützt Thorax und Abdomen, nimmt eine NIfTI-Datei statt eines Prompts entgegen, unterstützt keine Tool-Nutzung, und seine Modellkarte beschränkt es auf Forschung und Bildung und gibt an, dass es kein Medizinprodukt ist und dass Ausgaben falsch sein können. Es kann keinen Berichtskorpus normalisieren, kein Evaluierungs-Harness schreiben oder über ein Leitliniendokument Schlussfolgerungen ziehen. Ein 4,7B-Bildgebungsmodell ist kein Ersatz für ein 743B-Textmodell – ebenso wenig wie umgekehrt.

A generated scoreboard titled 'Two open-weight models, two different jobs' listing six paired rows. Row one: what it reads, one-channel NIfTI volumes in Hounsfield units against text only. Row two: context, 13,824 visual tokens per volume against 1,000,000 tokens in and 128,000 out. Row three: parameters, 4.69B total and 4.35B active against 743B total and about 40B active. Row four: generation status, version 0.1 current, unannounced against superseded by GLM-5.3. Row five: price, self-hosted with no rate card against $1.40 and $4.40 per million, or $1.26 and $3.96 for the successor. Row six: stated use, research and education, not a medical device against general purpose. A footer reads 'GLM-5.2 figures per the provider and Artificial Analysis; NV-Reason-CT figures per the authors paper.'

Die Texthälfte auf eine Taste legen

Wenn die Frage lautet, auf welchem Textmodell die Pipeline-Arbeit ausgeführt werden soll, ist die Antwort heute wahrscheinlich GLM-5.3 statt GLM-5.2 — und beide sind in unserem Katalog unter einem Schlüssel verfügbar. z-ai/glm-5.2 wird zum Listenpreis des Anbieters Z.ai ohne Aufschlag angeboten, und GLM-5.3 daneben, innerhalb einer einzigen API, die mehr als 200 Modelle abdeckt. Beide verfügbar zu halten, ist bei einem Generationswechsel wichtiger als sonst: Du kannst den Nachfolger auf deinem eigenen Korpus messen, bevor du dich darauf festlegst, das bisherige Modell währenddessen als Fallback behalten und ohne einen zweiten Vertrag oder eine Codeänderung wechseln.

Die Durchlaufrate ist einen Satz wert – aus demselben Grund, aus dem sie bei jedem Modell zählt, dessen Anbieter die Preise neu festlegt. Ohne dazwischenliegende Margenstufe schlägt eine Preisänderung des Anbieters noch am selben Tag bei uns durch. Automatisches Failover fängt ab, wenn die Leistung eines Anbieters mitten im Batch nachlässt, was bei einem langen Extraktionsjob der Fehler ist, der tatsächlich eine Nacht kostet, und mit der Routing-DSL lassen sich einzelne Anfragen an das Modell schicken, das sie bearbeiten sollte, statt alles auf einen einzigen Endpunkt auszurichten.

NV-Reason-CT ist nicht auf unserer Plattform, und kein NVIDIA-Modell ist es. Das sollte man klar sagen, statt es der Schlussfolgerung zu überlassen: Die CT-Seite dieser Architektur besteht aus heruntergeladenen Gewichten auf Ihrer eigenen Hardware, unter einer Lizenz, die dies erlaubt, und einer Modellkarte, die die klinische Nutzung untersagt. Wir hosten es nicht, und wir werden keinen Satz schreiben, der etwas anderes nahelegt.

Die Reihenfolge, in der diese Entscheidungen getroffen werden

Die richtige Reihenfolge für einen klinischen Build ist nicht die, die der Vergleich impliziert.

Beginne mit der Frage der Textgenerierung und beginne damit, zu prüfen, welche Generation aktuell ist – GLM-5.3 statt GLM-5.2, beim Preis und bei der gemessenen Leistungsfähigkeit, es sei denn, du hast einen Grund, beim derzeitigen Stand zu bleiben. Miss dann die Latenz des CT-Modells pro Studie auf deiner eigenen Hardware, denn diese Zahl ist unveröffentlicht und sie bestimmt den Rest des Budgets. Entwirf dann die Pipeline so, dass die beiden Hälften unabhängig austauschbar sind, da sich eine in einem an eine Vorschau angrenzenden Lebenszyklus befindet und die andere bei Version 0.1 steht.

Das Einzige, was man nicht tun sollte, ist, die beiden als Wahlmöglichkeit zu behandeln. Ein abgelöstes 743B-Textmodell und ein aktuelles 4.69B-CT-Modell haben keine gemeinsame Aufgabe. Der Vergleich lohnt sich nur wegen dessen, was er offenlegt: dass hinter dem neueren Artefakt die schwächere Beleglage steht, dass das ältere still und leise nicht mehr zur aktuellen Generation gehört und dass beide Tatsachen für jeden unsichtbar sind, der eine Katalogzeile liest, die sie nebeneinander aufführt, als wären sie Alternativen.

A screenshot of the OrcaRouter model page for GLM 5.2, showing the identifier z-ai/glm-5.2 with a Featured badge and tags for Tools, JSON and Reasoning, the description of it as Z.ai's flagship model for long-horizon tasks with a 1M-token context window and up to 128K output tokens, a side panel listing a 1M-token context window and 128K maximum output with text input and text output, and a stat strip reading $1.40 per million input tokens, $4.40 per million output tokens, and a p50 time to first token under five seconds.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert