
NV-Reason-CT vs. GPT-5.6 Sol: 13.824 visuelle Tokens, bevor du ein Wort tippst
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 45 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 182 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Jede einzelne Thorax-CT, die Sie an NV-Reason-CT senden, kostet 13.824 visuelle Token, bevor der Prompt beginnt. Das ist weder eine Eigenheit noch eine Tuning-Entscheidung – es ist das gesamte Design. Der native 3D-Vision-Encoder des Modells nimmt ein Volumen von 384×384×384 mm und verwandelt es in ein 24×24×24-Raster, und auf der Modellkarte steht ausdrücklich, dass alle 13.824 Token und ihre dreidimensionalen Koordinaten das Sprachmodell „ohne räumliches Downsampling“ erreichen. Vergleichen Sie das mit dem, wofür Sie wahrscheinlich bereits bezahlen. GPT-5.6 Sol akzeptiert Text, Bilder und Dateien, und ein an es gesendetes Bild ist ein 2D-Bild – eine Schicht, ein Screenshot eines DICOM-Viewers, eine aus einem PDF herausgelöste radiologische Abbildung. Eines dieser Modelle hat einen volumetrischen Pfad. Das andere hat ein Kontextfenster. Die meisten Vergleiche zwischen ihnen brechen an dieser Unterscheidung zusammen, und dieser Zusammenbruch ist der interessante Teil.
Die Veröffentlichung, die niemand angekündigt hat
NVIDIA hat in seinem Newsroom kein Wort über NV-Reason-CT veröffentlicht. Es gibt keinen Launch-Beitrag, keine Keynote-Folie, keine Pressemitteilung. Was existiert, ist ein am 8. September 2026 erstelltes Hugging-Face-Repository, ein am 2. September erstelltes GitHub-Repository unter der NVIDIA-Medtech-Organisation, ein Gradio-Demo-Space und ein arXiv-Preprint — NV-Reason-CT: 3D-Visual-Language-Modell für die CT-Analyse — eingereicht am 23. September 2026 von einem Team aus sechzehn Autoren von NVIDIA mit Mitautoren am NIH und an der Universität Zürich.
Das ist ein echtes Muster, und es lohnt sich, es präzise zu benennen, statt es als Mysterium zu behandeln. NVIDIAs Gruppe für medizinische Bildgebung veröffentlicht Modellgewichte ohne großes Aufsehen und überlässt die Ankündigung dem Paper und dem Repository. Der Vorgänger NV-Reason-CXR-3B erschien im Oktober 2025 auf dieselbe Weise. Der Unterschied liegt hier im Maßstab: Dies ist das erste Mal, dass diese Gruppe das Rezept von 2D-Röntgenbildern auf native 3D-Volumen erweitert hat, und das Paper ist zwei Tage alt.
Was sich aus dem Repository wissen lässt: Architektur, Lizenz, Trainingsdaten, die Benchmark-Tabelle. Was noch nicht bestätigt ist: ob NVIDIA dies als unterstützte Produktlinie führen will, ob weitere Checkpoints folgen und wie es sich bei einer Bewertung durch irgendjemanden außer den Autoren schlägt. Das Repository hat Version 0.1 und bezeichnet sich selbst als ausschließlich für Forschung und Lehre.
Was jedes Modell tatsächlich akzeptiert
Hier wird ein direkter Vergleich schnell ehrlich. Die beiden Modelle haben keine gemeinsame Eingabeoberfläche.
NV-Reason-CT liest NIfTI-Volumen — .nii oder .nii.gz — mit Voxelintensitäten in Hounsfield-Einheiten. Es schneidet automatisch auf den Thorax oder das Abdomen zu, indem es Lungen-Hounsfield-Einheiten und eine 3D-Morphologie-Heuristik nutzt, resampelt auf eine isotrope Auflösung von 2 mm und akzeptiert nur "chest" oder "abdomen" als Anatomiewerte. Es gibt Text aus: einen strukturierten Bericht, eine Antwort oder eine schrittweise Reasoning-Trace, mit einem Schalter, um das Reasoning für kurze Antworten abzuschalten.
GPT-5.6 Sol liest Text, Bilder und Dateien, mit einem Kontextfenster von 1.050.000 Tokens und bis zu 128.000 Ausgabe-Tokens in einer einzigen Antwort. Es hat keinen volumetrischen Encoder. Gib ihm ein CT, und du musst zuerst entscheiden, wie du rund dreihundert Schichten zu etwas verflachst, das ein 2D-Bildencoder akzeptieren wird – eine Montage, eine Handvoll Schlüsselschichten, eine gerenderte Maximum-Intensity-Projektion. Jede einzelne dieser Entscheidungen verwirft die räumlichen Beziehungen, für deren Bewahrung der 3D-Pfad gebaut wurde.
Die ehrliche Formulierung lautet also nicht: „Welches Modell ist klüger?“ Sondern: Sols Bildpfad und der 3D-Pfad von NV-Reason-CT beantworten unterschiedliche Fragen. Sol kann über die Beschreibung eines Scans durch einen Radiologen schlussfolgern. NV-Reason-CT kann über den Scan schlussfolgern.
Ein Benchmark existiert, und nur einer von ihnen hat eine Nummer darauf
NV-Reason-CT berichtet Macro-F1 0,614 und Macro-AUROC 0,871 auf CT-RATEs 18-Label-Klassifikationsaufgabe, unter Verwendung eines direkten Ja/Nein-Prompts ohne Klassifikationskopf und ohne aufgabenspezifische Anpassung. Das sind die eigenen Zahlen der Autoren aus der Modellkarte, und die Vergleichszeile ist der nützliche Teil: VoxelFM mit 0,581 Macro-F1, Pillar-0 mit 0,544, ClinFusion-8B mit 0,442, CT-CLIP mit 0,398, Merlin mit 0,358, MedGemma 1.5 mit 0,303. Beim selben festen einheitlichen Schwellenwert übertrifft ein generatives 3D-Modell die 3D-kontrastiven Pretraining-Baselines und das schichtbasierte Frontier-Modell.
Eine Zahl in dieser Tabelle verdient Skepsis statt Wiederholung: die AUROC-Lücke. NV-Reason-CT meldet 0,871 gegenüber 0,870 von VoxelFM. Ein Tausendstel eines Punktes ist bei einer vom Anbieter durchgeführten Bewertung kein Sieg – es ist ein Gleichstand innerhalb der Unschärfe, die die Bewertung mit sich bringt. Die Macro-F1-Lücke von 0,033 ist die belegte Behauptung.
GPT-5.6 Sol hat keine CT-RATE-Zahl, weil CT-RATE kein Benchmark ist, auf dem es ausgeführt werden kann. Es hat einen Artificial Analysis Intelligence Index von 47, einen von AA gemessenen GPQA-Diamond-Wert von 94,1 und einen Humanity's Last Exam-Wert von 49,5 — alles Instrumente für allgemeines Schlussfolgern. 0,614 Macro-F1 neben 47 auf dem AA-Index zu stellen, wäre Arithmetik mit zwei verschiedenen Maßstäben. Ich werde es nicht tun, und du solltest jedem misstrauen, der es tut.
Reasoning-Traces, zwei verschiedene Produkte
Beide Modelle geben Reasoning aus. Das ist die eine echte philosophische Überschneidung, und der Unterschied ist aufschlussreich.
GPT-5.6 Sol bietet einen konfigurierbaren Reasoning-Aufwand, sodass du pro Anfrage Latenz und Kosten gegen die Tiefe abwägst, und du kannst das Reasoning über include_reasoning zurückerhalten. Es ist eine allgemeine Fähigkeit, die auf alles angewendet wird, was du ihm sendest.
Die Argumentation von NV-Reason-CT ist absichtlich eng gefasst. Der Trainingskorpus umfasst ungefähr 550.000 strukturierte QA-Beispiele aus 70.111 einzigartigen CT-Volumen, und ein Teil davon sind von Radiologen verfasste Begründungen, die aus aufgezeichneten und transkribierten Experteninterpretationen gesammelt wurden. Die GRPO-Phase, die auf das SFT folgt, verwendet verifizierbare Belohnungen über Brust- und Bauchanomalie-Sets – das heißt, das Belohnungssignal basiert darauf, ob ein angegebener Befund tatsächlich im Volumen vorhanden ist, und nicht darauf, ob sich die Prosa gut liest. Die Modellkarte beschreibt die Ausgabe als „überprüfbare Beobachtungen, Differenzialdiagnosen und Unsicherheit“ und enthält eine ausdrückliche Warnung, dass die generierte Argumentation „nicht garantiert die interne Berechnung des Modells repräsentiert“. Diese Warnung leistet echte Arbeit. Sie ist der Unterschied zwischen einer Spur, die man gegen die Daten prüfen kann, und einer Spur, die man nur bewundern kann.
Die Größe und die Lizenz, in einem Durchgang
• Parameter — NV-Reason-CT 4,69B insgesamt / 4,35B aktiv im CT-Pfad, aus einem Qwen3.5-4B-Backbone plus einem Primus-3D-ViT vs. GPT-5.6 Sol nicht offengelegt • Checkpoint-Größe — NV-Reason-CT ~10,6 GB BF16-Safetensors, läuft auf Ampere/Hopper/Lovelace vs. GPT-5.6 Sol nur per API • Eingabe — 3D-NIfTI-CT-Volumen in Hounsfield-Einheiten vs. Text, Bild, Datei • Kontext — NV-Reason-CT nicht zutreffend, ein Volumen ist ein festes Präfix von 13.824 Tokens vs. Sol 1.050.000 Tokens Eingabe, 128.000 Ausgabe • Lizenz — OpenMDW-1.1, Gewichte herunterladbar vs. proprietär, nur API-Zugang • Verfügbarkeit — Hersteller-Repository und eigene Gewichte vs. über OrcaRouter geroutet zu $4.00 / $20.00 pro Million, wobei sich Sols Tarif oberhalb von 272K Eingabe-Tokens auf $8.00 / $30.00 verdoppelt

Was der Split dich tatsächlich kostet
Der Kostenvergleich ergibt erst dann Sinn, wenn man akzeptiert, dass die Workloads unterschiedlich sind, daher hier die Version, die tatsächlich Sinn ergibt.
Sol wird pro Token abgerechnet, und sein Preis hat eine Klippe: 4,00 $ pro Million Input-Token und 20,00 $ pro Million Output-Token bis zu 272K Prompt-Token, danach 8,00 $ und 30,00 $. Auf OrcaRouter wird es zu OpenAIs eigenem Listenpreis ohne Aufschlag angeboten, was wichtiger ist, als es klingt — der Tarif, den Sie sehen, ist der Tarif, den OpenAI veröffentlicht, sodass jede Preisänderung noch am selben Tag auf Ihrer Rechnung ankommt und nicht erst bei der nächsten Vertragsverlängerung. Sein Cache-Lese-Tarif beträgt 0,40 $ pro Million, ein Zehntel des Inputs, und genau das macht lange agentische Schleifen mit einem großen festen Präfix rechnerisch überlebensfähig.
NV-Reason-CT hat überhaupt keinen Preis pro Token. Du lädst 10,6 GB herunter und bezahlst die GPU. Das ist eine Capex-versus-Opex-Frage, und sie hat nur eine Antwort: Bei ausreichend hohem Volumen gewinnt das Selbsthosting eines Modells mit 4,35 Mrd. aktiven Parametern bei den Kosten. Unterhalb dieses Volumens nicht, und der Break-even-Punkt hängt vollständig von deiner GPU-Auslastung ab. Niemand außerhalb von NVIDIA hat bisher eine Durchsatzangabe für diesen Checkpoint veröffentlicht, also rät jeder, der dir einen Break-even-Punkt nennt.

Womit ein Router hier hilft, ist der Teil des Workflows, der nicht der Scan ist. Eine Produktions-Pipeline für klinische Forschung ist selten ein einziges Modell – sie besteht aus Extraktion, einem Reasoning-Schritt, einem Zusammenfassungsschritt, manchmal einer zweiten Meinung. OrcaRouter stellt 200+ Modelle hinter einem OpenAI-kompatiblen Endpoint mit automatischem Failover über Anbieter hinweg bereit, sodass die universell einsetzbare Hälfte dieser Pipeline ausgetauscht oder umgeleitet werden kann, ohne einen zweiten Vertrag. NV-Reason-CT ist keines der Modelle, die wir routen; es ist ein Checkpoint, den Sie selbst ausführen. Die beiden Hälften der Pipeline können trotzdem hinter einem einzigen Schlüssel liegen.

Die offene Frage
NV-Reason-CT ist als Paper zwei Tage alt und als Repository siebzehn Tage, und das Feld, zu dem es gehört, ist klein genug, dass der nächste Datenpunkt informativ sein wird. Achte auf drei Dinge: eine unabhängige CT-RATE-Reproduktion, einen zweiten Checkpoint in der Familie und jedes Anzeichen dafür, dass NVIDIAs Medizingruppe dies als Produktlinie statt als Paper behandelt. Bis dahin ist die vertretbare Position eng und klar – dies ist der derzeit stärkste herunterladbare Checkpoint für natives 3D-CT-Reasoning, gemessen an der Tabelle der Autoren selbst, und er ist kein Ersatz für ein allgemeines Frontier-Modell, außer beim Lesen eines CTs.
