
NV-Reason-CT vs. GLM-5.2: Eines davon ist veraltet, und es ist nicht das, das Sie vermuten.
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 97 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 182 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Das ältere Modell in diesem Vergleich ist dasjenige, das ausgemustert wird. GLM-5.2 wurde am 16. Juni 2026 veröffentlicht; NV-Reason-CT weist Repository-Aktivität mit Datumsangaben zwischen dem 2. und 25. September 2026 auf. Man würde erwarten, dass das September-Modell die unsichere Größe und das Juni-Modell die etablierte Wahl ist. Auf der Achse, die für eine Text-Pipeline zählt, ist das Gegenteil der Fall: GLM-5.2 wurde durch GLM-5.3 abgelöst, das am 18. August 2026 veröffentlicht wurde, und es trägt jetzt eine Deprecation-Kennzeichnung auf dem unabhängigen Leaderboard, auf dem seine Zahlen veröffentlicht werden. NV-Reason-CT ist, was auch immer sonst daran ungeklärt sein mag, die aktuelle Version der einzigen Sache, die es tut.
Die erste nützliche Aussage in diesem Artikel ist also die, die ein Leser am wenigsten wahrscheinlich schon hat: Wenn Sie heute ein Text-Build beginnen und aus Gewohnheit zu GLM-5.2 greifen, halten Sie inne und sehen Sie sich zuerst GLM-5.3 an. Es kostet 1,26 $ pro Million Input-Tokens und 3,96 $ pro Million Output-Tokens gegenüber 1,40 $ und 4,40 $ bei GLM-5.2 — es ist sowohl neuer als auch günstiger — und sein unabhängiger Intelligenzindex liegt bei 44,8 gegenüber 33,7, was ein Schritt nach oben auf derselben Skala ist und nicht ein Schritt zur Seite. Das ist eine Entscheidung, die von allem, was mit CT zu tun hat, getrennt ist, und sie sollte auch getrennt getroffen werden.
Die beiden Modelle und die zwei verschiedenen Arten von Veraltetem
Es gibt einen echten Unterschied zwischen einem Modell, das alt ist, und einem Modell, das abgelöst wurde, und diese Gegenüberstellung macht ihn konkret.
• Was es tut — NV-Reason-CT liest ein CT-Volumen des Thorax oder Abdomens ein und gibt strukturierte Befunde nach anatomischen Regionen aus; GLM-5.2 ist ein rein textbasiertes Sprachmodell für Reasoning, Code und die Arbeit mit langen Dokumenten
• Veröffentlicht — NV-Reason-CTs Artefakte stammen aus der Zeit vom 2. bis 25. September 2026; GLM-5.2 am 16. Juni 2026, gefolgt von GLM-5.3 am 18. August 2026
• Generationsstatus — NV-Reason-CT ist Version 0.1, eine Erstveröffentlichung, noch nicht angekündigt; GLM-5.2 ist die vorherige Generation einer bereits ausgelieferten Produktlinie
• Unabhängige Einordnung — es existieren keine unabhängigen Messungen von NV-Reason-CT; GLM-5.2 wird im Artificial Analysis Intelligence Index mit 33,7 gemessen, mit einem Deprecation-Marker, gegenüber GLM-5.3 mit 44,8
• Lizenz und Zugang — OpenMDW-1.1-Gewichte, die Sie herunterladen; gegenüber einem Open-Weight-Modell, das für 1,40 $ und 4,40 $ pro Million Tokens bereitgestellt wird, mit zwischengespeicherten Lesezugriffen zu 0,26 $
• Kontext — 13.824 visuelle Tokens pro Band ohne Chat-Fenster; gegen 1.000.000 Tokens Eingabe und 128.000 Ausgabe
• Angegebener Verwendungszweck — nur für Forschung und Lehre, kein Medizinprodukt; gegen einen Einsatz für allgemeine Zwecke
Das Wort „deprecated“ leistet hier präzise Arbeit, und es lohnt sich, nicht zu viel hineinzulesen. Ein Deprecation-Marker auf einem Leaderboard bedeutet, dass der Evaluator das Modell nicht mehr als aktuell behandelt, normalerweise weil ein Nachfolger seinen Platz eingenommen hat. Es bedeutet nicht, dass die Gewichte zurückgezogen wurden, die API abgeschaltet wurde oder das Modell nicht mehr funktioniert. Teams mit Pipelines, die auf GLM-4.0 abgestimmt sind, sind nicht in Schwierigkeiten. Was es bedeutet, ist, dass seine Zahlen eine Momentaufnahme aus der Zeit vor GLM-5.3 sind, und dass das Mischen mit aktuellen Zahlen für andere Modelle dem Vergleich einer Juni-Messung mit einem September-Feld gleichkommt.
Die Zahlen, die jede Seite hat, und was sie wert sind
GLM-5.2s Bilanz ist ungewöhnlich gut gefüllt, und sie stammt aus zwei Quellen, die in lehrreicher Weise voneinander abweichen.
Nach eigenen Angaben von Z.ai erzielt das Modell 99,12 auf τ²-Bench, 62,1 auf SWE-bench Pro, 54,7 auf Humanity's Last Exam mit Tools und einen besten gemeldeten Wert von 82,7 auf Terminal-Bench 2.1. Auf der unabhängigen Seite misst Artificial Analysis dasselbe Modell bei 77,9 auf Terminal-Bench 2.1, 33,7 auf seinem Intelligence Index, 89,5 auf GPQA Diamond und 41,1 auf Humanity's Last Exam. Es gibt weitere Herstellerangaben – 99,2 auf AIME 2026, 92,5 auf HMMT February 2026, 91 auf IMOAnswerBench, 74,4 auf FrontierSWE, 63,7 auf ProgramBench, 76,8 auf MCP-Atlas – und sie stammen alle von Z.ai.
Zwei Dinge an dieser Liste verdienen es, benannt zu werden. Erstens ist die 4,8-Punkte-Spanne bei Terminal-Bench 2.1 zwischen dem vom Anbieter am besten gemeldeten Wert von 82,7 und dem unabhängigen Wert von 77,9 kein Widerspruch. Vom Anbieter am besten gemeldete Zahlen sind typischerweise der beste Wert aus mehreren Testumgebungen, und der eigene Terminus-2-Wert von Z.ai für denselben Benchmark liegt bei 81 – die unabhängige Messung liegt innerhalb der eigenen Spanne des Anbieters. Zweitens ist die Abweichung bei Humanity's Last Exam größer: 41,1 unabhängig gegenüber einem Anbieterwert von 40,5 ohne Werkzeuge und 54,7 mit ihnen, was bedeutet, dass die Schlagzeilen-Zahl 54,7 werkzeuggestützt ist und die 41,1 ohne Werkzeuge ermittelt wurde. 54,7 neben dem Wert eines anderen Modells ohne Werkzeuge zu zitieren, wäre ein echter Fehler.
Die Bilanz von NV-Reason-CT weist keine solche Zwei-Quellen-Struktur auf, und genau darin ist sie schwächer. Seine CT-RATE-Ergebnisse — 0,614 F1 und 0,871 AUROC über achtzehn Labels, mit einem festen einheitlichen Schwellenwert und einem direkten Ja/Nein-Prompt und ohne Klassifikationskopf oder aufgabenspezifische Anpassung — sind NVIDIAs eigene. Die Modelle, mit denen es in diesem Artikel verglichen wird (VoxelFM 0,581, Pillar-0 0,544, ClinFusion-8B 0,442, CT-CLIP 0,398, Merlin 0,358, MedGemma 1.5 0,303), sind alle Bildgebungsmodelle. Nichts wurde unabhängig reproduziert, und das Modell ist seit Wochen herunterladbar. Es berichtet außerdem über einen aus Berichten abgeleiteten Macro-F1 von 0,592 und eine vorläufige Studie mit erfahrenen Radiologen, die die assistierte Überprüfung mit einer 50%igen Reduzierung der durchschnittlich angegebenen Interpretationszeit in Verbindung bringt, was die Autoren selbst als gravierende Kleinstichprobe kennzeichnen.
Der Herkunftsvergleich begünstigt also nicht das neuere Modell, und das ist der Punkt, bei dem es sich lohnt, innezuhalten. GLM-5.2 ist das ältere, abgelöste Modell, und seine Zahlen sind vertrauenswürdiger als die von NV-Reason-CT, weil jemand außerhalb des Unternehmens den Test-Harness ausgeführt hat. Auf dem neuesten Stand zu sein ist nicht dasselbe wie verifiziert zu sein.

Warum die Deprecation wichtiger ist, als sie klingt
Es gibt einen Fehler, den dieser Vergleich verhindern soll, und er hat überhaupt nichts mit CT zu tun.
Ein Team, das eine klinische Text-Pipeline aufbaut, macht sich auf die Suche nach einem Open-Weight-Modell, das auf ihrer eigenen Hardware läuft, weil die Daten sensibel sind. Sie finden GLM-5.2, das unter MIT-Lizenz steht, 743 Milliarden Parameter hat, von denen rund 40 Milliarden aktiv sind, die Anforderungen erfüllt und eine gut dokumentierte Benchmark-Historie hat. Sie tunen darauf. Sechs Monate später entdecken sie, dass die aktuelle Generation GLM-5.3 ist, dass sie 1M-Kontext mit einer 128K-Ausgabegrenze bietet, dass sie mit 1,26 $ und 3,96 $ günstiger ist und dass die Entscheidung, die sie zu treffen glaubten – auf welches Open-Weight-Modell sie sich als Standard festlegen sollten –, tatsächlich eine Entscheidung darüber war, welche Generation, und dass sie diese aus Versehen trafen.
Das ist ein kostspieliger Fehler, der erst spät entdeckt wird, und er lässt sich mit einer einzigen Abfrage vermeiden. Die konkrete Anleitung:
• Prüfe, ob das Modell, das du als Standard festlegen willst, die aktuelle Generation ist — ein Deprecation-Marker in einem Leaderboard ist das schnellste Signal, und die eigene Modellliste eines Anbieters ist die maßgebliche
• Vermischen Sie keine Juni-Momentaufnahme mit September-Zahlen — Der Index von GLM-5.2 mit 33,7 wurde gemessen, bevor GLM-5.3 existierte, und ihn neben den Index eines aktuellen Modells zu setzen, vergleicht zwei verschiedene Zeitpunkte in einem sich bewegenden Feld
• Vorsicht beim Namen — ein Angebot namens „GLM-5.3 Prime" ist eine Serving-Stufe, die dieselben Gewichte zum etwa doppelten Listenpreis anbietet, kein separates Modell. Prüfe die Gewichte hinter jeder SKU, bevor du dafür einen Aufpreis zahlst
• Betrachten Sie einen niedrigeren Listenpreis als Frage, nicht als Antwort — dass GLM-5.3 günstiger ist als sein Vorgänger, ist ungewöhnlich und sollte anhand Ihrer eigenen Workload überprüft werden, statt es einfach anzunehmen
Nichts davon macht GLM-5.2 zu einer schlechten Wahl. Ein MIT-lizenziertes 743B-Modell für 1,40 $ und 4,40 $, auf das ein Team bereits abgestimmt hat, ist eine vollkommen vernünftige Sache, die man weiterlaufen lassen kann, und ein Modell der mittleren Generation mit einer gefestigten Erfolgsbilanz ist manchmal genau das, was ein regulierter Workflow will. Der Punkt ist, dass es eine Wahl sein sollte, bewusst getroffen, statt ein Standard, der von einer Liste geerbt wurde, die im Juli aktuell war.
Die Falle beim Vergleich eines Textmodells mit einem CT-Modell
Der Grund, warum diese Paarung überhaupt plausibel erscheint, ist, dass beide Open-Weight-Modelle sind, die 2026 veröffentlicht wurden, und wer einen Katalog durchsieht, zwei vergleichbare Posten sieht. Sie sind nicht vergleichbar, und die Diskrepanz hat eine bestimmte Gestalt.
GLM-5.2 fasst 1.000.000 Tokens. Ein einzelnes CT-Volumen von NV-Reason-CT kostet 13.824 visuelle Tokens. Nach dieser Rechnung könnte GLM-5.2 siebzig CT-Studien fassen und hätte noch Platz, was zu dem Schluss verleitet, dass ein Textmodell mit ausreichend langem Kontext das Bildgebungsmodell überflüssig macht. Dieser Schluss ist nicht zwingend, und der Grund dafür ist die Schnittstelle, nicht das Budget.
Diese 13.824 Token sind keine Zusammenfassung. Sie sind ein 384-Millimeter-Würfel, auf 2 mm isotrop neu abgetastet, in 8 × 8 × 8 Patches auf einem 24 × 24 × 24-Raster zerlegt und einem Sprach-Backbone übergeben, ohne räumliches Downsampling und ohne Merging-Schicht – weshalb der aktive Pfad 4,35 Mrd. Parameter der insgesamt 4,69 Mrd. ausmacht und weshalb die Rechenleistung darauf verwendet wird, die Auflösung zu erhalten, statt sie wegzukomprimieren. GLM-5.2 ist ausschließlich textbasiert. Es verfügt über keinerlei Vision-Pfad, daher stellt sich die Frage, wie es mit einem Scan umgehen würde, gar nicht; die Antwort ist, dass ihm in keiner Form ein Scan übergeben werden kann. Die beiden Modellkarten beschreiben einen sechshundertfachen Unterschied beim Token-Budget, der nichts mit dem Vergleich zu tun hat, weil eines von ihnen keine Möglichkeit hat, die Eingabe zu empfangen.
Der umgekehrte Fehler liegt genauso nahe. NV-Reason-CT unterstützt Thorax und Abdomen, nimmt eine NIfTI-Datei statt eines Prompts entgegen, unterstützt keine Tool-Nutzung, und seine Modellkarte beschränkt es auf Forschung und Bildung und gibt an, dass es kein Medizinprodukt ist und dass Ausgaben falsch sein können. Es kann keinen Berichtskorpus normalisieren, kein Evaluierungs-Harness schreiben oder über ein Leitliniendokument Schlussfolgerungen ziehen. Ein 4,7B-Bildgebungsmodell ist kein Ersatz für ein 743B-Textmodell – ebenso wenig wie umgekehrt.

Die Texthälfte auf eine Taste legen
Wenn die Frage lautet, auf welchem Textmodell die Pipeline-Arbeit ausgeführt werden soll, ist die Antwort heute wahrscheinlich GLM-5.3 statt GLM-5.2 — und beide sind in unserem Katalog unter einem Schlüssel verfügbar. z-ai/glm-5.2 wird zum Listenpreis des Anbieters Z.ai ohne Aufschlag angeboten, und GLM-5.3 daneben, innerhalb einer einzigen API, die mehr als 200 Modelle abdeckt. Beide verfügbar zu halten, ist bei einem Generationswechsel wichtiger als sonst: Du kannst den Nachfolger auf deinem eigenen Korpus messen, bevor du dich darauf festlegst, das bisherige Modell währenddessen als Fallback behalten und ohne einen zweiten Vertrag oder eine Codeänderung wechseln.
Die Durchlaufrate ist einen Satz wert – aus demselben Grund, aus dem sie bei jedem Modell zählt, dessen Anbieter die Preise neu festlegt. Ohne dazwischenliegende Margenstufe schlägt eine Preisänderung des Anbieters noch am selben Tag bei uns durch. Automatisches Failover fängt ab, wenn die Leistung eines Anbieters mitten im Batch nachlässt, was bei einem langen Extraktionsjob der Fehler ist, der tatsächlich eine Nacht kostet, und mit der Routing-DSL lassen sich einzelne Anfragen an das Modell schicken, das sie bearbeiten sollte, statt alles auf einen einzigen Endpunkt auszurichten.
NV-Reason-CT ist nicht auf unserer Plattform, und kein NVIDIA-Modell ist es. Das sollte man klar sagen, statt es der Schlussfolgerung zu überlassen: Die CT-Seite dieser Architektur besteht aus heruntergeladenen Gewichten auf Ihrer eigenen Hardware, unter einer Lizenz, die dies erlaubt, und einer Modellkarte, die die klinische Nutzung untersagt. Wir hosten es nicht, und wir werden keinen Satz schreiben, der etwas anderes nahelegt.
Die Reihenfolge, in der diese Entscheidungen getroffen werden
Die richtige Reihenfolge für einen klinischen Build ist nicht die, die der Vergleich impliziert.
Beginne mit der Frage der Textgenerierung und beginne damit, zu prüfen, welche Generation aktuell ist – GLM-5.3 statt GLM-5.2, beim Preis und bei der gemessenen Leistungsfähigkeit, es sei denn, du hast einen Grund, beim derzeitigen Stand zu bleiben. Miss dann die Latenz des CT-Modells pro Studie auf deiner eigenen Hardware, denn diese Zahl ist unveröffentlicht und sie bestimmt den Rest des Budgets. Entwirf dann die Pipeline so, dass die beiden Hälften unabhängig austauschbar sind, da sich eine in einem an eine Vorschau angrenzenden Lebenszyklus befindet und die andere bei Version 0.1 steht.
Das Einzige, was man nicht tun sollte, ist, die beiden als Wahlmöglichkeit zu behandeln. Ein abgelöstes 743B-Textmodell und ein aktuelles 4.69B-CT-Modell haben keine gemeinsame Aufgabe. Der Vergleich lohnt sich nur wegen dessen, was er offenlegt: dass hinter dem neueren Artefakt die schwächere Beleglage steht, dass das ältere still und leise nicht mehr zur aktuellen Generation gehört und dass beide Tatsachen für jeden unsichtbar sind, der eine Katalogzeile liest, die sie nebeneinander aufführt, als wären sie Alternativen.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
