
NV-Reason-CT vs. Qwen3.8 Max: Das Fine-Tuning und die Familie, aus der es stammt
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 45 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 182 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Die erste Zeile der NV-Reason-CT-Modellkarte verrät Ihnen etwas, das die meisten überfliegen. Das Basismodell ist Qwen/Qwen3.5-4B, in den Repository-Metadaten als Fine-Tune-Beziehung aufgeführt. Als NVIDIA also ein Sprachmodell brauchte, um einen Primus-3D-Vision-Transformer daranzuschrauben, nahm es ein Qwen. Vergleichen Sie diesen Checkpoint mit Qwen3.8 Max — Alibabas eigenes 1.000.000-Token-Flaggschiff, ausgeliefert am 3. August 2026 — und Sie sehen ein Fine-Tune und das Familienunternehmen. Das eine ist ein 4,69B-Spezialist, der CT-Volumina von Thorax und Abdomen liest und am 8. September 2026 ohne Ankündigung auf Hugging Face veröffentlicht wurde. Das andere ist ein allgemeines Flaggschiff mit Text-, Bild- und Videoeingabe, einer veröffentlichten Preisliste und 37,2 Millionen Tokens gemessenen Datenverkehrs in unserem Netzwerk in der letzten Woche. Die interessante Frage ist nicht, welches gewinnt. Sie lautet, was ein 4B-Fine-Tune leisten kann, was das Flaggschiff seiner Familie nicht kann, und warum die Antwort spezifischer ist, als Sie erwarten würden.
Was das Fine-Tuning konkret gebracht hat
NVIDIAs eigene Formulierung dieser Lücke ist ungewöhnlich präzise, und sie ist der nützlichste Satz im Repository: Die meisten Vision-Language-Systeme „arbeiten entweder mit 2D-Bildern oder komprimieren volumetrische Merkmale vor der Sprachdekodierung". Das ist eine Beschreibung einer ganzen Modellklasse, und sie umfasst jedes allgemeine multimodale Flaggschiff auf dem Markt.
Die Lösung ist architektonisch und keine Frage des Maßstabs. Ein 384×384×384-mm-Eingabevolumen wird zu einem 24×24×24-Raster aus 13.824 visuellen Tokens. Diese Tokens und ihre dreidimensionalen Koordinaten gelangen ohne räumliches Downsampling in das Sprachmodell, und 3D MRoPE bewahrt die räumlichen Beziehungen im Decoder. Eingabevolumina werden anhand von Lungen-Hounsfield-Einheiten anatomiegerecht auf Thorax oder Abdomen zugeschnitten und anschließend auf eine isotrope 2-mm-Auflösung neu abgetastet.
Lies das im Vergleich zu dem, was Qwen3.8 Max akzeptiert. Text, Bild und Video — und Video kommt in dieser Reihe einer volumetrischen Eingabe am nächsten, was es zum ehrlichen statt zum rhetorischen Vergleichspunkt macht. Ein Video ist ein Stapel von 2D-Frames, die nach der Zeit geordnet sind. Ein CT-Volumen ist ein Stapel von 2D-Schichten, die nach ihrer physischen Position entlang der z-Achse geordnet sind, in Hounsfield-Einheiten, mit einem bekannten Millimeterabstand. Beide sind dreidimensionale Arrays. Nur eines von beiden besitzt ein physikalisches Koordinatensystem, auf das sich der Befund eines Radiologen lokalisieren lässt, und nur eines von beiden wird in einer Einheit gemessen, die außerhalb eines Bildsensors etwas bedeutet. Ein auf Video trainiertes Modell lernt zeitliche Kontinuität. Ein auf CT-Volumina trainiertes Modell lernt, dass eine Raumforderung in einer Schicht dieselbe Raumforderung in der nächsten Schicht acht Millimeter tiefer ist.
Der Trainingskorpus ist der eigentliche Unterschied.
Hier sind die beiden Modelle überhaupt nicht mehr vergleichbar, und genau das ist der Teil, den ein Datenblatt verschweigt.
NV-Reason-CT wurde Ende-zu-Ende mit überwachtem Feintuning und anschließender Group Relative Policy Optimization auf etwa 550.000 strukturierten QA-Beispielen trainiert, die aus 70.111 einzigartigen CT-Volumina stammen. Die Quellen sind CT-RATE – 47.149 Fälle vom Istanbul Medipol University Mega Hospital mit gepaarten Radiologieberichten – sowie ein internes NIH-Set mit 15.991 Fällen und die 22.720 Fälle von CancerVerse über vier Kontrastphasen und dreizehn maligne Tumortypen. Der Korpus umfasst standardisierte Berichte, auf Anomalien ausgerichtete QA, mehrstufige Dialoge und von Radiologen verfasste Begründungen, die aus aufgezeichneten Experteninterpretationen transkribiert wurden. Die GRPO-Phase verwendet verifizierbare Belohnungen über Thorax- und abdominale Anomalie-Sets, was bedeutet, dass das Belohnungssignal prüft, ob ein angegebener Befund im Volumen vorhanden ist, und nicht, ob die Prosa klinisch klingt.
Der Trainingskorpus von Qwen3.8 Max ist nicht in annähernd so detaillierter Form veröffentlicht, und es würde auch nicht helfen, wenn er es wäre, weil die angestrebte Fähigkeit allgemein ist. Stattdessen sind die Artificial-Analysis-Werte der relevante Beleg: ein Intelligence Index von 45,4, was ihn in der Momentaufnahme unserer API auf Platz 15 von 145 Modellen setzt, AA Coding 76,2 auf Rang 9, Terminal-Bench 2.1 bei 88,8, GPQA Diamond 92,8, Humanity's Last Exam 43,1, SciCode 52,1 und Long-Context-Recall 80,3. Das sind Messungen von Drittanbietern, keine Herstellerangaben, was sie zu den vertrauenswürdigsten Zahlen auf beiden Seiten dieser Seite macht.
Reasoning-Ausgabe, zwei verschiedene Verträge
Beide Modelle geben Reasoning-Traces aus, und bei beiden lassen sich diese abschalten. Die Ähnlichkeit endet an der Schnittstelle.
Qwen3.8 Max bietet enable_thinking und reasoning_effort sowie die vollständige Sampling-Oberfläche – Temperatur, top_p, Seed, Penalties, strukturierte Ausgaben, Tool-Aufrufe. Es ist eine allgemeine Reasoning-Fähigkeit, die man auf das richtet, was man gerade zur Verfügung hat. Ihr Denken ist nur so gut wie das Problem, das man ihr vorlegt, und sie kann eine Behauptung gegen nichts anderes verifizieren als gegen den Text, der ihr übergeben wurde.
Das Reasoning von NV-Reason-CT hat einen engeren Vertrag mit dem Leser, und die Modellkarte benennt die Grenze ausdrücklich: Generiertes Reasoning ist „überprüfbare Modellausgabe und es wird nicht garantiert, dass es die interne Berechnung des Modells repräsentiert.“ Dieser Vorbehalt leistet echte Arbeit, und er ist die Art von Satz, die nur auftaucht, wenn sich ein Team Gedanken darüber gemacht hat, was eine Klinikerin oder ein Kliniker mit einer plausibel klingenden Spur anfangen wird. Die Karte beschreibt die Ausgabe als überprüfbare Beobachtungen, Differenzialdiagnosen und Unsicherheit. Mit anderen Worten: eine Spur, die man gegen das Volumen prüfen kann, statt einer, die man nur lesen kann.
Durchsatz, von der einzigen Stelle aus, an der wir ihn messen können
Qwen3.8 Max bewegte in den letzten sieben Tagen 37,2 Millionen Tokens durch OrcaRouters eigenen Playground. Seine mediane Zeit bis zum ersten Token betrug 1,96 Sekunden – mit 53,3 Ausgabe-Tokens pro Sekunde mit Abstand die schnellste unter den Modellen dieser Serie. Seine Fehlerrate in diesem Zeitraum lag bei 3,5 %.
Diese beiden Zahlen ziehen in entgegengesetzte Richtungen und beide sind wichtig. Die Latenz ist ausgezeichnet und macht es angenehm, mit dem Modell zu iterieren. Die Fehlerquote ist im selben Zeitraum etwa siebzehnmal höher als die 0,21 % von Kimi K3, und diese Zahl entscheidet darüber, ob Sie es hinter einen synchronen, nutzerseitigen Aufruf oder einen Batch-Job mit Wiederholungen setzen. Dies ist gemessenes Verhalten in unserem Netzwerk, kein Benchmark, und es ist die Art von Sache, die Ihnen eine Preisliste nie verrät.
NV-Reason-CT hat nirgends eine vergleichbare Messung. Es ist ein 10,6 GB großer BF16-Checkpoint mit benutzerdefiniertem Modellcode, geladen mit trust_remote_code=True auf Ampere-, Hopper- oder Lovelace-Hardware, getestet von NVIDIA auf H100 und L40S. Es gibt keinen veröffentlichten p50-Wert, keine Fehlerrate und keine Durchsatzangabe. Wer Ihnen sagt, ab welcher Auslastung sich das Selbsthosting dieses Modells gegenüber der Bezahlung pro Token lohnt, rät nur.
Preis und Form, Seite an Seite
• Preis — NV-Reason-CT GPU-Capex, kein Preis pro Token im Vergleich zu Qwen3.8 Max: $2,00 / $6,00 pro Million Tokens, $0,25 pro Cache-Lesevorgang, $2,50 pro Cache-Schreibvorgang
• Eingabe — NV-Reason-CT 3D-NIfTI-CT-Volumina in Hounsfield-Einheiten, nur Thorax oder Abdomen vs. Qwen3.8 Max Text, Bild und Video
• Kontext — NV-Reason-CT ein Volumen, ein festes 13.824-Token-Präfix vs. Qwen3.8 Max 1.000.000 Token
• Parameter — NV-Reason-CT 4,69B insgesamt / 4,35B aktiv im CT-Pfad gegenüber Qwen3.8 Max nicht offengelegt
• Lizenz — NV-Reason-CT OpenMDW-1.1, Gewichte veröffentlicht vs. Qwen3.8 Max proprietär, nur API-Zugang
• Unabhängige Bewertungen — NV-Reason-CT: keine vs. Qwen3.8 Max: AA Intelligence Index 45,4, GPQA Diamond 92,8

Die Cache-Ökonomie von Qwen3.8 Max belohnt eine bestimmte Form: Ein gecachter Lesevorgang für 0,25 $ gegenüber 2,00 $ für frischen Input ist ein achtfacher Rabatt, und der Cache-Schreibvorgang für 2,50 $ bedeutet, dass sich ein langes wiederverwendbares Präfix schnell amortisiert. Das ist die Arbeitslast aus einem System-Prompt plus einem Protokolldokument, das über Tausende von Anfragen hinweg wiederverwendet wird. NV-Reason-CT hat das entgegengesetzte Kostenprofil – nahezu null Grenzkosten pro Scan, sobald die GPU gekauft ist, und eine harte Untergrenze von einer GPU, die auf unbestimmte Zeit vorgehalten wird.

Die Familie gemeinsam führen
Die natürliche Architektur hier – und es ist erwähnenswert, dass sie niemand veröffentlicht hat – ist das Fine-Tuning für das Volumen und das Flaggschiff für alles darum herum. NV-Reason-CT erzeugt den strukturierten Befund; Qwen3.8 Max übernimmt den Überweisungstext, den Protokollabgleich, die Codierung, den Nachsorgebrief – die Textarbeit mit hohem Volumen, bei der ein Million-Token-Fenster und ein achtfacher Cache-Rabatt tatsächlich ihren Platz verdienen.
Wenn das Ihre Pipeline ist, dann ist die eine Hälfte ein Checkpoint, den Sie selbst hosten, und die andere Hälfte sind Tokens, die Sie kaufen, und in der zweiten Hälfte tut ein Router etwas, das ein einzelner Anbieter-Endpunkt nicht kann. Qwen3.8 Max wird über OrcaRouter zum Listenpreis von Alibaba ohne Aufschlag bereitgestellt, sodass die oben genannten 2,00 $ / 6,00 $ genau das sind, was Sie zahlen, und jede künftige Preisänderung noch am selben Tag auf Ihrer Rechnung landet statt erst bei der Vertragsverlängerung. Automatisches Failover über Anbieter hinweg ist wichtiger als sonst, wenn die gemessene Fehlerrate des Modells selbst bei 3,5 % liegt – ein Retry, der an einen anderen gesunden Endpunkt geht, ist der Unterschied zwischen einem vorübergehenden Aussetzer und einem fehlgeschlagenen Batch. Und weil die allgemeine Hälfte der Pipeline ein einziger Modellname hinter einem OpenAI-kompatiblen Endpunkt ist, der über 200 Modelle abdeckt, kostet das Auswechseln gegen etwas anderes für ein einwöchiges Experiment nur eine String-Änderung, keine Integration.
NV-Reason-CT ist, um es klarzustellen, nicht auf OrcaRouter und wird es auch nicht sein – es ist eine Custom-Code-3D-Inferenz, die Sie selbst ausführen. Die ehrliche Version der Integrationsgeschichte ist, dass der selbstgehostete Spezialist und der geroutete Generalist unter einem Schlüssel laufen können, und mehr wird auch nicht behauptet.

Das Urteil, das tatsächlich Bestand hat
Diese Gegenüberstellung wird unter „Welche ist besser?“ abgelegt, und das sollte sie nicht. Qwen3.8 Max wird von Dritten anhand allgemeiner Schlussfolgerungsfähigkeit gemessen und schlägt den Großteil des Feldes; NV-Reason-CT hat eine einzige Tabelle mit eigenen Zahlen auf einem einzigen CT-Benchmark und eine Parameteranzahl von 4,69B, die in jedem allgemeinen Vergleich unauffällig wäre. Bei jedem allgemeinen Benchmark gewinnt das Flaggschiff, und der Grund dafür ist, dass der allgemeine Benchmark genau das ist, wofür es gebaut wurde.
Bei der einen Aufgabe, für die NV-Reason-CT entwickelt wurde – ein Thorax- oder Abdomen-CT-Volumen zu lesen und zu sagen, was darin enthalten ist, mit einer Spur, die jemand nachprüfen kann –, ist Qwen3.8 Max kein schwächerer Konkurrent. Es besitzt keinen volumetrischen Encoder, kann also gar nicht auf die Eingabe angewendet werden, ohne dass zuerst jemand entscheidet, wie ein Scan zu Bildern verflacht wird. Bei dieser Entscheidung geht die räumliche Information verloren. Das ist der ganze Sinn eines 4B-Fine-Tunings mit einem nativen 3D-Pfad und einem festen Präfix von 13.824 Token, und deshalb ist das Interessante an diesem Modell die Kleinheit seines Backbones und nicht seine Größe.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
