
NV-Reason-CT vs. Grok 4.6: Wer liest den Scan und wer liest den Bericht
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 45 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 182 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Es gibt zwei Möglichkeiten, eine KI in eine CT-Pipeline einzubinden, und nur bei einer davon geht es um das Bild. NV-Reason-CT ist die erste: ein 3D-Vision-Language-Modell mit 4,69 Mrd. Parametern, das NIfTI-Volumes direkt liest und am 8. September 2026 auf Hugging Face veröffentlicht wurde – ohne einen Launch-Post von NVIDIA. Grok 4.6 ist die zweite: ein Text-und-Bild-Modell mit 500.000 Token, das am 12. August 2026 erschien, 2,00 US-Dollar pro Million Eingabe-Token kostet und sehr gut bei dem Teil der Aufgabe ist, der erst danach kommt, wenn jemand den Befund bereits aufgeschrieben hat. Setzt man sie in einen Vergleich, erweist sich die übliche Frage – welche ist besser – als falsch gestellt. Sie konkurrieren nicht um denselben Platz in der Pipeline. Sie konkurrieren um denselben Budgetposten.
Was tatsächlich auf jeder Seite ausgeliefert wurde
NV-Reason-CT erschien als Repository, als Paper und als Demo-Space, nicht als Produkt. Das GitHub-Repository unter NVIDIA-Medtech wurde am 2. September 2026 erstellt; die Gewichte auf Hugging Face folgten am 8. September; der arXiv-Preprint, NV-Reason-CT: 3D-Visual-Language-Modell für die CT-Analyse, erschien am 23. September mit sechzehn Autorinnen und Autoren von NVIDIA, den NIH und der Universität Zürich. NVIDIAs Newsroom enthält nichts darüber. Die Modellkarte beschreibt Version 0.1 und beschränkt die Nutzung auf Forschung und Bildung.
Grok 4.6 ist die entgegengesetzte Art von Release. Es ist ein erstklassiger kommerzieller Endpunkt, in der Entwicklerdokumentation des Anbieters als „Latest“ aufgeführt, mit einem veröffentlichten Preisblatt bepreist und als OpenAI-kompatibles Modell verfügbar, das bestehende Integrationen durch Ändern einer Basis-URL übernehmen. Es trat die Nachfolge von Grok 4.5 an, mit demselben Kontextfenster, derselben Eingabeoberfläche und derselben Grundpreisgestaltung.
Diese Asymmetrie ist die ganze Geschichte dieses Vergleichs. Das eine ist ein Forschungsartefakt, das zufällig herunterladbar ist. Das andere ist Infrastruktur. Liest man sie gegeneinander, zeigt sich, wo die Grenze zwischen „Forschungsartefakt“ und „Infrastruktur“ in der medizinischen Bildgebung derzeit verläuft – und sie verläuft nicht dort, wo man vermuten würde.
Die Arbeitsteilung, bei Inputs und Outputs
• Volumetrische Eingabe — NV-Reason-CT liest .nii/.nii.gz-NIfTI-Volumen in Hounsfield-Einheiten, nur Thorax oder Abdomen vs. Grok 4.6 liest Text, Bilder und Dateien, kein volumetrischer Pfad • Räumliche Verarbeitung — NV-Reason-CT konvertiert ein 384×384×384-mm-Volumen in ein 24×24×24-Raster mit 13.824 Token und 3D-MRoPE, ohne Downsampling vs. Grok 4.6 behandelt ein Bild als 2D-Bild • Kontext — NV-Reason-CT: ein Volumen ist ein fester Präfix, kein Kontextfenster im üblichen Sinne vs. Grok 4.6: 500.000 Token • Ausgabe — NV-Reason-CT: strukturierter Bericht, Antwort oder Reasoning-Trace, wobei das Denken deaktivierbar ist vs. Grok 4.6: Text mit strukturierten Ausgaben und Tool-Aufrufen • Lizenz — NV-Reason-CT: OpenMDW-1.1, 10,6 GB BF16-Gewichte vs. Grok 4.6: proprietär, nur API • Preis — NV-Reason-CT: GPU-Capex, keine Kosten pro Token vs. Grok 4.6: 2,00 $ / 6,00 $ pro Million Token, verdoppelt sich oberhalb von 200K Eingabe

Das Paar liest sich wie eine natürliche Übergabe. NV-Reason-CT erzeugt den Befund aus dem Volumen; Grok 4.6 ist das Modell, dem man tausend dieser Befunde in einem einzigen Kontextfenster übergeben würde, um über eine Kohorte hinweg nach Mustern zu suchen. Niemand hat diese Pipeline veröffentlicht. Sie ist die naheliegende Architektur, und es lohnt sich, klar zu sagen, dass sie ungetestet ist.
Die Zahlen von Grok 4.6 – und wem sie gehören
Zwei Werte für Grok 4.6 werden gemeinsam genannt, und sie sind nicht von derselben Art. Der GPQA-Diamond-Wert von 94,9 wird von Artificial Analysis gemessen, nicht vom Anbieter gemeldet – was genau deshalb die vertrauenswürdigere der beiden Kategorien ist, weil ein Dritter ihn erhoben hat. Der Wert von 44 im Artificial Analysis Intelligence Index, auf Index-Revision v4.3.2, platziert Grok 4.6 auf Rang 28 von 211 in seiner Klasse. Artificial Analysis führt das Modell außerdem als proprietär: Die Gewichte sind nicht öffentlich verfügbar.
Auf demselben Board misst AA Terminal-Bench 2.1 mit 88,4, SciCode mit 56,5, Humanity's Last Exam mit 42,9, 𝜏²-banking mit 50,7 und Long-Context-Recall mit 80,3. Das sind Instrumente für allgemeines Reasoning. Keines davon lässt sich auf einem 3D-CT-Volumen ausführen, und das ist kein Seitenhieb gegen Grok 4.6 – es ist eine Aussage darüber, was die Benchmark-Suite misst.
Die CT-Seite hat genau eine Tabelle, und sie gehört den Autoren.
Die gesamte öffentliche Evidenzbasis von NV-Reason-CT ist eine einzige Klassifikationstabelle zu den 18 Labels von CT-RATE, bei einem festen, einheitlichen Schwellenwert, unter Verwendung eines direkten Ja/Nein-Prompts ohne Klassifikationskopf. Sie berichtet Macro-F1 von 0,614 und Macro-AUROC von 0,871 – gegenüber VoxelFM mit 0,581/0,870, Pillar-0 mit 0,544/0,861, ClinFusion-8B mit 0,442, CT-CLIP mit 0,398/0,733, Merlin mit 0,358/0,662 und MedGemma 1.5 mit 0,303.
Diese Angaben wurden vom Anbieter gemacht, stammen aus der Modellkarte, und ich kennzeichne sie als solche, weil noch keine unabhängige Partei sie reproduziert hat. Zwei Dinge fallen in der Tabelle auf. Der F1-Vorsprung gegenüber VoxelFM beträgt 0,033, was bei 18 Labels mit einem festen Schwellenwert eine echte Lücke ist. Der AUROC-Vorsprung gegenüber demselben Modell beträgt 0,001, was ein Gleichstand ist. Beide Zahlen erscheinen in derselben Zeile derselben Tabelle, und nur eine von ihnen trägt eine Aussage.
Das andere, was die Tabelle aussagt, betrifft die eigene Rahmung der Arbeit. Die Vergleichsmodelle sind 3D-kontrastive Pretraining-Systeme, ein fusioniertes generatives 2D/3D-MLLM und ein slice-basiertes Frontier-Modell. Die Autoren haben sich dafür entschieden, gegen Systeme zu benchmarken, die Volumina verarbeiten, weil die einzige sinnvolle Behauptung hier ist, dass ein generatives 3D-Modell diskriminative 3D-Modelle bei der Klassifikation ohne Head schlagen kann. Es sagt nichts darüber aus, wie NV-Reason-CT bei irgendetwas im Vergleich zu einem allgemeinen Frontier-Modell abschneidet, weil dieser Vergleich auf dieser Achse nicht existiert.

Wohin das Geld fließt – und warum die Stufengrenze wichtig ist
Die Preisliste von Grok 4.6 enthält ein Detail, das im Stillen viel Architektur entscheidet: Prompts mit mehr als 200K Eingabe-Tokens werden zum doppelten Grundtarif abgerechnet — $4,00 Eingabe, $12,00 Ausgabe, wobei der Cache-Lese-Tarif von $0,50 auf $1,00 steigt. Ein Kohorten-Review-Job, der Befunde in einem einzigen langen Kontext ansammelt, ist genau die Arbeitslast, die diese Grenze überschreitet. Darunter beträgt der Cache-Lese-Tarif von $0,50 pro Million ein Viertel des Eingabepreises, was das Loopen eines großen festen Präfixes über Tausende von Berichten hinweg bezahlbar statt nur möglich macht.
Über OrcaRouter wird Grok 4.6 zum Listenpreis des Anbieters ohne jeden Aufschlag bereitgestellt, sodass die oben beschriebene Tarifarithmetik genau die ist, die Sie tatsächlich zahlen, und jede künftige Anpassung daran schon am selben Tag auf Ihrer Rechnung landet statt erst bei der nächsten Verlängerung. Der Grund, einen solchen Job über einen Router laufen zu lassen, statt einen einzelnen Endpunkt fest zu verdrahten, ist, dass Sie bei der Kohortenprüfung drei verschiedene Endpunkte ausprobieren wollen – und mit einem OpenAI-kompatiblen Schlüssel mit automatischem Failover über Anbieter hinweg kostet dieses Experiment nur einen Wechsel des Modellnamens.
Die CT-Hälfte der Pipeline hat keine solche Option. NV-Reason-CT wird nicht auf OrcaRouter gehostet – es ist ein 10,6 GB großer Checkpoint mit benutzerdefiniertem Modellcode, den Sie selbst ausführen, auf Ampere-, Hopper- oder Lovelace-Silizium, mit trust_remote_code=True. Wir werden nichts anderes suggerieren. Wenn Sie diese Pipeline aufbauen, kaufen Sie GPUs für die eine Hälfte und Tokens für die andere, und die Tatsache, dass beide Hälften zumindest von einer Konsole aus verwaltet werden können, ist die einzige Integrationsaussage, die es wert ist, gemacht zu werden.

Was ein zweiter Leser wirklich wert ist
Das NV-Reason-CT-Papier enthält eine vorläufige Studie mit erfahrenen Radiologen, die „günstige Konfidenzbewertungen für KI-unterstützte Überprüfung“ und eine 50%ige Reduktion der durchschnittlich angegebenen Interpretations- und Berichtszeit berichtet. Das sind starke Zahlen, und sie haben einen Vorbehalt, den das Papier selbst nennt: vorläufig, und das eigene Studiendesign der Autoren. Es gibt keine veröffentlichte unabhängige Replikation, und eine 50%ige Zeitreduktion in einer kontrollierten Lesestudie ist genau die Art von Ergebnis, die bei einer Replikation schrumpft. Es ist es wert, verfolgt zu werden. Es ist nicht wert, als gesichert zitiert zu werden.
Vor diesem Hintergrund ist der Beitrag von Grok 4.6 zu einem Radiologie-Workflow überhaupt keine Diagnose. Er ist vielmehr die Ebene, die die Berichte liest – die Triage-Warteschlange, den Nachsorgebrief, die Kodierung, das Paket zur Vorabgenehmigung. Diese Arbeit ist Text, sie hat ein hohes Volumen, sie ist pro Einheit günstig, und der Fehlermodus, wenn man sie falsch macht, ist administrativ statt klinisch. Es ist auch der Punkt, an dem ein 500K-Kontextfenster und ein Cache-Read für 0,50 $ ihren Platz wirklich verdienen.
Die Trennung, auf die dieser Vergleich hinausläuft, ist unverblümt: NV-Reason-CT hat einen echten 3D-Pfad und keine Distribution, keinen Preis und keine unabhängige Verifizierung. Grok 4.6 hat Distribution, einen Preis, unabhängige Benchmark-Abdeckung und überhaupt keinen volumetrischen Pfad. Wenn der Scan gelesen werden muss, kann das nur einer von beiden. Wenn der Papierkram rund um den Scan erledigt werden muss, ist nur der andere ein Produkt.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
