
NV-Reason-CT vs. DeepSeek V4 Pro: Die Kosten des Lesens eines Scans und wann der Batch ausgeführt werden sollte
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 506 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 183 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Hier ist eine operative Tatsache, die mehr Budgets für klinische Pipelines prägt als jeder Benchmark: DeepSeek V4 Prokostet $0,66 pro Million Input-Tokens und $1,98 pro Million Output-Tokens, und diese Sätze verdoppeln sich täglich in zwei Zeitfenstern, 01:00 bis 04:00 und 06:00 bis 10:00 UTC. Batch-Arbeit, die außerhalb dieser Fenster läuft, kostet die Hälfte dessen, was sie innerhalb kostet. Währenddessen hat NV-Reason-CT, NVIDIAs 3D-CT-Reasoner mit 4,69 Milliarden Parametern, überhaupt keine Preisliste – es ist ein Satz Gewichte, den man herunterlädt und ausführt, ohne veröffentlichte Durchsatzangabe für eine einzelne Studie mit 13.824 Tokens. Das eine dieser Modelle plant man ein. Das andere muss man messen, bevor man es budgetieren kann.
Diese Asymmetrie ist der nützliche Einstieg in diesen Vergleich, denn die beiden Modelle besetzen entgegengesetzte Enden der Pipeline und scheitern finanziell auf entgegengesetzte Weise. NV-Reason-CT ist ein Instrument mit festen Kosten: Die marginale Studie ist nahezu kostenlos, sobald die Hardware gekauft ist, doch die Hardware-Entscheidung ist groß, und die Latenz pro Studie ist undokumentiert. DeepSeek V4 Pro ist eine Maschine mit variablen Kosten: nichts zu kaufen, alles wird abgerechnet, und der Abrechnungszähler hat einen Zeitplan, den man vom Kalender ablesen kann.
Was jedes einzelne ist, jeweils in einer Zeile
• Aufgabe — NV-Reason-CT liest ein CT-Volumen des Thorax oder Abdomens und gibt strukturierte Befunde aus; DeepSeek V4 Pro liest und schreibt Text
• Architektur — ein 3D-Vision-Transformer namens Primus, initialisiert aus COLIPRI, mit einem Qwen3.5-4B-Sprachbackbone und 3D-Multi-Achsen-Rotationspositions-Embedding, mit 4,69 Mrd. Parametern, von denen 4,35 Mrd. aktiv sind; gegenüber einem Mixture-of-Experts-Modell mit 1,6 Billionen Parametern, von denen 49 Milliarden pro Token aktiv sind
• Eingabe — einkanalige NIfTI-Volumen (.nii, .nii.gz) in Hounsfield-Einheiten, LPS-orientiert, auf 2 mm isotrop neu abgetastet und auf die Anatomie zugeschnitten; gegen Text
• Kontext — ein einzelnes Volumen wird zu 13.824 visuellen Tokens in einem 24 x 24 x 24-Raster, ohne räumliches Downsampling und ohne Merging-Schicht; gegenüber 1.048.576 Eingabe-Tokens und 384.000 Ausgabe-Tokens
• Unterstützte Anatomien — Thorax und Abdomen, und nichts anderes; gegen alles, was Text beschreiben kann
• Preis — kein Listenpreis, selbst gehostet, kein veröffentlichter Durchsatz pro Studie; gegenüber $0,66 / $1,98 pro Million Tokens, Verdopplung in den beiden oben genannten UTC-Zeitfenstern, mit Cache-Lesevorgängen bei $0,022
• Gemessene Latenz — nicht veröffentlicht; gemessen an einem Median von 3.483 Millisekunden bis zum ersten Token bei 96,01 Ausgabe-Token pro Sekunde, mit einer Fehlerrate von 0,75 %
Zwei Zeilen darin sind jeweils mehr als eine Zeile wert. Die Kontextzeile ist die offensichtliche – eine Million Token gegenüber 13.824 –, aber die Einheiten sind nicht vergleichbar, und es ist ein Fehler, sie in die eine oder andere Richtung als Leistungsgefälle zu deuten. 13.824 Token sind das, was eine CT-Studie kostet, um sie getreu darzustellen. Eine Million Token ist die Menge an umgebendem Text, die du halten kannst. Die erste Zahl ist eine Aussage über Auflösung; die zweite ist eine Aussage über Gedächtnis.
Die Latenzzeile ist diejenige, die übersprungen wird. Der Median von 3,48 Sekunden bis zum ersten Token und 96 Token pro Sekunde bei DeepSeek V4 Pro sind gemessene, veröffentlichte Werte, und sie ermöglichen es, einen Textjob auf dem Papier zu dimensionieren. Das Fehlen einer vergleichbaren Angabe bei NV-Reason-CT ist keine Kritik am Modell; es ist der Grund, warum sich eine CT-Pipeline nicht kalkulieren lässt, bevor sie jemand ausführt. Ein 4,69B-Modell über 13.824 visuelle Token ist keine kleine Berechnung, und solange Sie es nicht auf Ihrer eigenen Hardware gemessen haben, raten Sie nur.
Die beiden Benchmark-Datensätze lesen, ohne sich selbst etwas vorzumachen
Die Bilanz von DeepSeek V4 Pro ist eine Mischung aus unabhängiger Messung und Herstellerangaben, und diese Mischung ist aufschlussreich, weil sie eine Zahl enthält, die alarmierend aussieht und es nicht ist.
• Artificial Analysis Intelligence Index — 36, was dem 72,4. Perzentil der gemessenen Modelle entspricht
• GPQA Diamond — 92,8, was nahe an der Spitze des Feldes liegt
• Humanity's Last Exam — 41 und 41 bei MMLU-Pro, 62,51 im Mathe-Index
• τ²-Bench — 96,20, mit IFBench bei 76,46 und tau_banking bei 39,59
• Langkontext-Abruf — 80.33
• SciCode und Terminal-Bench — 51 und 78,65 in der zweiten Version von Terminal-Bench
Ein zusammengesetzter Index von 36 neben einem GPQA Diamond von 92,8 liest sich wie ein Widerspruch, bis einem auffällt, was ein Index ist. Er ist ein Aggregat über viele Evaluierungen, und ein Modell, das bei einer Handvoll von ihnen hervorragend und bei anderen nur ausreichend ist, landet in der Summe im Mittelfeld, während es einzelne Bestenlisten anführt. Wer nur die 36 zitiert, um zu argumentieren, DeepSeek V4 Pro sei Mittelklasse, der zitiert einen Durchschnitt, als wäre er ein Maximum. Wer nur die 92,8 zitiert, um zu argumentieren, es führe das Feld an, der zitiert ein Maximum, als wäre es ein Durchschnitt. Beide Zahlen stammen von Artificial Analysis, und beide stimmen.
Die Bilanz von NV-Reason-CT enthält keine solche Mischung, und genau darin liegt das eigentliche Problem. Seine CT-RATE-Werte – 0,614 F1 und 0,871 AUROC über achtzehn Labels, mit einem festen einheitlichen Schwellenwert und einem direkten Ja/Nein-Prompt, ohne Klassifizierungs-Head und ohne aufgabenspezifische Anpassung – stammen aus NVIDIAs eigenem Paper und aus keiner anderen Quelle. Der Vergleichssatz in diesem Paper (VoxelFM mit 0,581, Pillar-0 mit 0,544, ClinFusion-8B mit 0,442, CT-CLIP mit 0,398, Merlin mit 0,358, MedGemma 1.5 mit 0,303) besteht ausschließlich aus anderen Bildgebungsmodellen. Kein einziges allgemeines Textmodell taucht darin auf, und kein Dritter hat auch nur eine dieser Zahlen reproduziert.

Die Planungsfrage, durchgearbeitet
Die zeitabhängige Preisgestaltung für DeepSeek V4 Pro ist das operativ am besten umsetzbare Merkmal beider Modelle, daher verdient sie eine konkrete Schritt-für-Schritt-Erklärung.
Eine realistische textseitige Arbeitslast für ein CT-Programm ist nicht glamourös. Es bedeutet, strukturierte Felder aus einem Korpus historischer Berichte zu extrahieren, damit man Labels zum Trainieren hat, DICOM-Verzeichnisbäume im großen Maßstab in NIfTI umzuwandeln, die Evaluierungsharness zu schreiben und immer wieder zu überarbeiten, Einheiten und Terminologie über vier Datensätze hinweg zu normalisieren und Kohorten zusammenzufassen. Nennen wir es hundert Millionen Eingabe-Tokens und zehn Millionen Ausgabe-Tokens für ein mittelgroßes Programm, eine bewusst runde Zahl, die für „viel Textarbeit“ steht.
• In einem verdoppelten Fenster — 1,32 $ und 3,96 $ pro Million, also 132 $ plus 39,60 $ bei diesen Volumina
• Außerhalb dieser Fenster — 0,66 $ und 1,98 $ pro Million, also 66 $ plus 19,80 $
• Der Unterschied — etwa 86 $ oder 49 % der Off-Peak-Rechnung dafür, einen Job zu verschieben, der sich von Natur aus für die Stapelverarbeitung eignet
• Cached-Lesevorgänge — 0,022 $ pro Million, also ein Sechzigstel des Eingabetarifs, sodass jeder Prompt-Präfix, den Sie im Korpus wiederverwenden, nahezu kostenlos ist
Das ist kein Rundungsfehler, und es ist verfügbar, weil die Arbeit asynchron ist. Die Berichtsextraktion muss nicht um 14:00 Uhr stattfinden. Einem DICOM-Konvertierungsjob ist es völlig egal, wie spät es ist. Die Preisstruktur ist eine direkte Einladung zur zeitlichen Planung, und eine Pipeline, die sie ignoriert, zahlt einen 49%-Aufschlag für das Privileg, dann zu laufen, wann es ihr gerade passt. Cache-Lesevorgänge sind aus demselben Grund wichtig: Ein gemeinsam genutzter System-Prompt oder ein festes Extraktionsschema, das über Tausende von Berichten hinweg wiederverwendet wird, liegt bei einem Sechzigstel des Eingabe-Tarifs.
NV-Reason-CT hat keinen gleichwertigen Hebel, weil es kein Messgerät hat. Die Kosten für das Lesen eines Scans sind die Kosten, die Ihre GPU pro Stunde verursacht, geteilt durch die Anzahl der Scans pro Stunde, die Sie durch sie hindurchbekommen, und die zweite Zahl ist diejenige, die niemand veröffentlicht hat. Wenn eine einzelne Studie zwei Sekunden dauert, bewältigt eine einzelne L40S ein großes Programm problemlos. Wenn sie zwanzig dauert, ändert sich die Hardware-Arithmetik völlig. NVIDIA hat auf H100 und L40S getestet, was Ihnen die Klasse der Karte verrät, nicht die Rate.
Die Falle, anzunehmen, sie könnten ersetzt werden
Der Fehler, zu dem diese Gegenüberstellung verleitet, ist subtiler als der übliche Kategorienfehler, denn es gibt eine Variante davon, die auf einer Folie vernünftig aussieht.
DeepSeek V4 Pro fasst 1.048.576 Tokens und gibt bis zu 384.000 aus. Ein CT-Volumen umfasst, nach der Berechnung des Modells, das es richtig liest, nur 13.824 Tokens. Ein Textmodell mit einem Fenster von einer Million Tokens hat bei dieser Tokenzahl also Platz für gut siebzig CT-Studien. Die Arithmetik ist korrekt, und die Schlussfolgerung – dass man CT-Daten in ein Textmodell einspeisen und sich die Bildgebungsinfrastruktur sparen könnte – ist falsch, und zwar aus genau dem Grund, aus dem die Zahl 13.824 überhaupt existiert.
Diese Zahl ist keine komprimierte Zusammenfassung eines Scans. Sie ist der Scan selbst – mit 2 mm isotroper Auflösung über einen 384-Millimeter-Würfel, in 8 x 8 x 8 Patches zerschnitten, dem Sprachmodell übergeben, ohne räumliches Downsampling und ohne Zusammenführungsschicht. Die Token-Anzahl ist gerade deshalb hoch, weil nichts weggeworfen wurde: der Abstand zwischen den Schichten, der ein Knötchen messbar macht, die Dichtewerte, die aus einer Textur einen Schwellenwert statt eines Adjektivs machen. Ein Textmodell kann diese Tokens genauso wenig als Volumina aufnehmen wie ein Dokument. Es hat das Budget. Es hat die Schnittstelle nicht.
Der interne Vergleich der Arbeit selbst beziffert den Unterschied. MedGemma 1.5 erhält bis zu 85 axiale Schichten – das Beste, was ein zweidimensionales oder schichtgestapeltes Frontend vernünftigerweise leisten kann – und erzielt 0,303 F1 gegenüber 0,614 für das native volumetrische Modell. Diese Lücke ist der Wert des dreidimensionalen Encoders, und keine noch so große Kontextfensterlänge schließt sie.
Die umgekehrte Ersetzung schlägt aus einfacheren Gründen fehl. NV-Reason-CT unterstützt Brustkorb und Abdomen, nimmt eine NIfTI-Datei statt eines Prompts entgegen, bietet keine Tool-Nutzung, und seine Modellkarte beschränkt es auf Forschung und Bildung und gibt an, dass es kein Medizinprodukt ist und dass Ausgaben falsch sein können. Es kann keine Felder aus einem Bericht extrahieren, und es kann nicht das Skript schreiben, das deinen Korpus aufbaut.

Wo wir passen – und wo bewusst nicht
DeepSeek V4 Pro wird über OrcaRouter bereitgestellt als deepseek/deepseek-v4-pro, zum Listenpreis des Anbieters ohne Aufschlag, innerhalb einer einzigen API, die mehr als 200 Modelle abdeckt. Die reine Weitergabe ohne Aufschlag ist bei einem Modell mit tageszeitabhängigem Preis wichtiger als sonst: Wenn ein Anbieter einen Tarif oder ein Zeitfenster ändert, ändert sich der Preis auf unserer Seite noch am selben Tag, weil dazwischen keine Aufschlagsebene liegt, die an einer alten Zahl festhält. Automatisches Failover deckt den Fall ab, dass ein Anbieter mitten im Batch an Leistung verliert, was bei einem langen, unbeaufsichtigten Extraktionsjob genau der Fehlermodus ist, der Sie tatsächlich eine Nacht kostet, und mit der Routing-DSL können Sie einzelne Anfragen an das Modell schicken, das sie bearbeiten sollte, statt alles über einen einzigen Endpunkt laufen zu lassen.
NV-Reason-CT ist nicht auf unserer Plattform. Kein NVIDIA-Modell ist dort. Die CT-Seite dieser Architektur ist Ihre eigene Hardware mit Ihren eigenen heruntergeladenen Gewichten, und wir werden keinen Satz schreiben, der einen Leser etwas anderes glauben lässt. Da es sich bei der Eingabe um aus Patientendaten abgeleitete volumetrische Daten handelt und die Lizenz OpenMDW-1.1 ist, ohne dass ein gehosteter Dienst damit verbunden ist, ist lokale Ausführung ohnehin genau das, wohin dieses Modell gehört.
Was das Pairing dir tatsächlich verrät
Die beiden Modelle konkurrieren nicht miteinander, und der Sinn des Vergleichs besteht darin, dass sie auf unterschiedliche Weise scheitern. NV-Reason-CT verleiht Ihnen eine Fähigkeit, die sonst nichts im Open-Source-Bereich bietet – natives dreidimensionales CT-Reasoning bei der vollen Auflösung der Studie – und verlangt von Ihnen, nicht budgetierte Kosten pro Studie, einen nicht veröffentlichten Durchsatz und eine Lizenz zu akzeptieren, die den klinischen Einsatz verbietet. DeepSeek V4 Pro bietet Ihnen eine verbrauchsbasierte Engine mit einer veröffentlichten Latenz, einer veröffentlichten Fehlerrate, unabhängigen Messungen und einem Preis, den Sie halbieren können, indem Sie auf die Uhr schauen, und sie kann einen Scan überhaupt nicht sehen.
Wenn du das Ding baust, statt es zu kaufen, ist die Form, die den Kontakt übersteht, die langweilige. Lass den CT-Read lokal laufen, kalkuliere ihn durch Messen statt durch das Nennen von Zahlen, und setze alles Textliche drumherum auf ein Rendezvous mit dem Off-Peak-Fenster. Der eine Zeitplan, den niemand kopieren sollte, ist der, der um 02:00 UTC eine Extraktion von hundert Millionen Token laufen lässt, weil der Batch zufällig genau dann bereit war.

