Eine generierte Hero-Karte mit dem Titel „NV-Reason-CT vs Claude Opus 5" und dem Untertitel „Ein Kategorienfehler, der ernst genommen werden sollte". Zwei einander gegenüberliegende Karten werden durch ein Paar blauer Pfeile getrennt: Die linke Karte trägt die Beschriftung „NV-Reason-CT" mit einem Body-Scan-Symbol und „4,69 Mrd. Parameter – 13.824 Token pro CT-Volumen – kein Medizinprodukt"; die rechte Karte trägt die Beschriftung „Claude Opus 5" mit einem Chip-Symbol und „1 Mio. Kontext – 128K Ausgabe – $5 / $25 pro Mio. Token". Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

NV-Reason-CT vs. Claude Opus 5: Ein Kategorienfehler, der ernst genommen werden sollte

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Wenn man NV-Reason-CT und Claude Opus 5 im selben Satz nennt, ist das ein Kategorienfehler, und es lohnt sich trotzdem, weil der Fehler lehrreich ist. NV-Reason-CT ist ein natives 3D-Vision-Language-Modell mit 4,69 Milliarden Parametern von NVIDIA, das ein Thorax- oder Abdomen-CT-Volumen in Hounsfield-Einheiten entgegennimmt und einen strukturierten Befund-für-Befund-Bericht erzeugt. Es ist kein Medizinprodukt, und die eigene Modellkarte sagt das auch. Claude Opus 5 ist das allgemeine Frontier-Modell für Text und Vision des Anbieters, veröffentlicht am 24. Juli 2026, mit einem Kontextfenster von einer Million Token, einer Ausgabeobergrenze von 128.000 Token und einem veröffentlichten Preis von fünf Dollar pro Million Eingabe-Token und fünfundzwanzig pro Million Ausgabe-Token. Eines davon liest ein CT. Das andere liest alles andere.

Der Grund, warum der Vergleich immer wieder angestellt wird – und er wird angestellt werden, jedes Mal, wenn jemand ein neues medizinisches VLM sieht und zu einem vertrauten Maßstab greift – ist, dass beide Prosa über ein Bild erzeugen. Diese oberflächliche Ähnlichkeit richtet echten Schaden in der Art und Weise an, wie Menschen über die beiden nachdenken, deshalb lohnt es sich, das im Detail auseinanderzunehmen.

Die tatsächliche Achse, die sie teilen, und die, die sie nicht teilen

Sie überschneiden sich an genau einer Stelle, und diese ist schmaler, als es aussieht.

• Modalität in — NV-Reason-CT nimmt einkanalige NIfTI-Volumina in Hounsfield-Einheiten über einen dedizierten dreidimensionalen Prozessor entgegen; Claude Opus 5 nimmt Text, Bilder und Dateien entgegen, eine Schnittstelle der zweiten Generation für Bilder, und kann eine volumetrische CT-Studie nicht nativ verarbeiten

• Was zurückkommt — eine nach anatomischen Regionen gegliederte Befundliste von NV-Reason-CT, verglichen mit allgemeinem Fließtext, strukturiertem JSON oder Tool-Aufrufen von Claude Opus 5

• Arbeitseinheiten — ein CT-Volumen, auf 2 mm isotrop neu abgetastet, auf die Anatomie zugeschnitten, in 8 x 8 x 8 Patches zerlegt; gegenüber dem, was Sie in ein Token-Budget stecken

• Kontext — NV-Reason-CT hat überhaupt kein Chat-Fenster; ein einzelnes Volumen wird ohne Downsampling zu 13.824 visuellen Tokens. Claude Opus 5 nimmt 1.000.000 Tokens auf und gibt bis zu 128.000 aus

• Lizenz — OpenMDW-1.1, ein herunterladbares Modell, das Sie auf Ihrer eigenen Hardware ausführen; gegenüber einer gehosteten API

• Angegebener Verwendungszweck — ausschließlich für Forschung und Bildung, ausdrücklich kein Medizinprodukt, für NV-Reason-CT; gegen universelle Allzweck-Unterstützung für Claude Opus 5

• Preis — kein Listenpreis, weil es nichts zu kaufen gibt, nur Gewichte zum Ausführen; im Vergleich zu $5 und $25 pro Million Token, mit Cache-Lesevorgängen zu $0.50

Die Zeile „Modality in“ ist die Stelle, an der der Kategorienfehler entsteht. Beide akzeptieren ein Bild, also wirken beide wie Bildmodelle, und man fragt sich vernünftigerweise, welches bei Bildern besser ist. Aber eine CT-Untersuchung ist kein Bild. Sie ist ein volumetrisches Array mit einer physikalischen Skala in Millimetern, einer kalibrierten Dichteeinheit und einer Anatomie, die nur in drei Dimensionen etwas bedeutet. Die Vision von Claude Opus 5 ist wirklich leistungsfähig, und es wird ein Röntgenbild oder einen Röntgenobjektträger vernünftig besprechen. Das ist eine andere Aufgabe als die Integration eines 400-Millimeter-Würfels aus Hounsfield-Werten bei 2 mm Auflösung und die Berichterstattung über die Lobulierung eines Knötchens.

Was die Zahlen auf jeder Seite tatsächlich messen

Die beiden Modelle haben Benchmark-Ergebnisse, die sich nie überschneiden, und sie nebeneinander zu lesen, ohne das zu bemerken, ist genau die Art und Weise, wie schlechte Beschaffungsentscheidungen getroffen werden.

NV-Reason-CT berichtet seine Ergebnisse auf dem öffentlichen CT-RATE-Benchmark für Thorax-CT über achtzehn Labels hinweg, unter Verwendung eines festen, einheitlichen Schwellenwerts und eines direkten Ja/Nein-Prompts, ohne Klassifikationskopf und ohne aufgabenspezifische Anpassung. Es erzielt 0,614 F1 und 0,871 AUROC und liegt damit vor VoxelFM mit 0,581 und 0,870, Pillar-0 mit 0,544 und 0,861, ClinFusion-8B mit 0,442 F1, CT-CLIP mit 0,398 und 0,733, Merlin mit 0,358 und 0,662 sowie MedGemma 1.5 mit 0,303 F1, wenn ihm bis zu 85 axiale Schnitte gegeben werden. Es gibt außerdem einen aus Berichten abgeleiteten Macro-F1 von 0,592. Jede einzelne dieser Zahlen stammt aus NVIDIAs eigenem Paper. Keine dieser Zahlen wurde von jemand anderem reproduziert, und das Modell ist seit einigen Wochen herunterladbar.

Die Bilanz von Claude Opus 5 ist allgemeiner Natur und weitgehend unabhängig. Artificial Analysis misst sie mit 50,8 auf seinem Intelligence Index, 78 auf seinem Coding Index, 93,2 bei GPQA Diamond und 54,9 bei Humanity's Last Exam, mit einem Long-Context-Recall-Score von 79,33. Das sind Zahlen von Drittanbietern zu allgemeinen Reasoning-, Code- und Wissensaufgaben. In diesem Set gibt es keinen Benchmark für klinische Bildgebung, und in der veröffentlichten Bilanz von Claude Opus 5 gibt es nirgends eine CT-RATE-Zeile.

Die ehrliche Aussage ist also nicht, dass eines vorne liegt. Sie lautet, dass die beiden Modelle noch nie von irgendjemandem an derselben Aufgabe gemessen worden sind. Jeder Satz der Form „NV-Reason-CT ist bei medizinischer Bildgebung besser als Claude Opus 5“ ist so, wie er geschrieben steht, nicht falsifizierbar, weil niemand das Experiment durchgeführt hat. NVIDIAs eigene Vergleichstabelle enthält kein allgemeines Frontier-Modell.

A generated scoreboard titled 'NV-Reason-CT vs Claude Opus 5 - what each number measures' with two columns. The left column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI volumes in Hounsfield units; output, structured findings by anatomical region; benchmark, CT-RATE 0.614 F1 and 0.871 AUROC over 18 labels; provenance, authors' own paper, unreproduced; licence, OpenMDW-1.1, self-hosted; use, research and education, not a medical device. The right column, headed 'Claude Opus 5', lists six rows: input, text, images, files; output, general prose, JSON, tool calls; benchmark, AA Intelligence 50.8, GPQA Diamond 93.2, HLE 54.9; provenance, independent, Artificial Analysis; licence, hosted API; use, general purpose. A footer reads 'The two benchmark sets share no task, so neither column can be subtracted from the other.'

Wo Menschen bei der Interface-Frage falsch liegen

Die einzige wirklich interessante technische Überschneidung ist diejenige, über die niemand streitet: wie eine Schnittstelle zwischen einem CT-Modell und einem Textmodell aussehen sollte.

Ein naheliegender Instinkt ist es, Claude Opus 5 einen Satz CT-Bilder oder ein herunterskaliertes Volumen zu geben und es daraus schlussfolgern zu lassen. Bei 1.000.000 Token Kontext klingt das großzügig, und gemessen an einer Studie mit nur 13.824 visuellen Token klingt es nach reichlich Platz. Der Platz ist nicht das Problem. Die Vision-Pipeline von Claude Opus 5 behandelt ein Bild als zweidimensionale Abbildung mit einer Pixel-Skala. Ein so dargebotenes Thorax-CT verliert den Schichtabstand, der eine Läsion messbar macht, und die Dichtekalibrierung, die aus „ground-glass“ einen Schwellenwert statt einer Beschreibung macht. Man kann ihm eine Montage axialer Schichten reichen und bekommt einen kohärent klingenden Absatz. Was man nicht bekommt, ist eine Messung.

Genau dafür wendet das Design von NV-Reason-CT seine Rechenleistung auf. Das 24 x 24 x 24-Raster aus einem 384-Millimeter-Volumen wird dem Sprachmodell in voller Auflösung übergeben, ohne räumliches Downsampling und ohne Zusammenführungsschicht, weshalb der aktive Pfad 4,35B Parameter umfasst statt etwas viel Kleinerem. Die Architektur ist eine Wette darauf, dass das Beibehalten räumlicher Details die Token-Kosten wert ist. Es ist eine Wette über die Repräsentation, nicht über Sprachfähigkeit, und Claude Opus 5 ist daran nicht beteiligt.

Das produktive Muster ist das langweilige: Verwenden Sie das CT-Modell für die volumetrische Befundung und ein Textmodell für alles drumherum. Berichtserstellung und Normalisierung, Kohortenzusammenfassungen, Evaluierungs-Harnesse, die Konvertierung von DICOM-Archiven in NIfTI im großen Maßstab, die Triage, welche Untersuchungen ein Mensch zuerst ansehen sollte. Das ist Arbeit mit langen Dokumenten und mit Code, und hier verdient ein 1M-Kontext-Modell seinen Preis.

Kosten, in zwei Einheiten, die sich nicht umrechnen lassen

Claude Opus 5 wird nach Verbrauch abgerechnet. Fünf Dollar pro Million Input-Tokens und fünfundzwanzig pro Million Output-Tokens, Cache-Lesevorgänge zu fünfzig Cent, Cache-Schreibvorgänge zu zehn Dollar. Für eine Pipeline, die einen Korpus von Berichten normalisiert oder Evaluierungscode schreibt und immer wieder neu schreibt, ergibt das eine Prognose, auf die man bauen kann: Tokens rein, Tokens raus, gecachte Lesevorgänge – und eine deutlich günstigere Rechnung, wenn man das Caching richtig hinbekommt.

NV-Reason-CT hat keinen Preis. Sie laden 4,69 Milliarden Parameter herunter und bezahlen mit Strom, GPU-Stunden und Entwicklungszeit. Für eine vollständige Studie mit 13.824 Token gibt es keinen veröffentlichten Durchsatzwert, und es wird keine quantisierte Variante angeboten, sodass die Kosten pro Studie für den Betrieb eine Zahl sind, die Sie selbst messen müssten. Das ist normal für Forschungsgewichte, und es ist zugleich der größte praktische Unterschied zwischen den beiden: Das eine hat eine Preisliste, das andere eine Rechnung, die Sie erst sehen, wenn Sie sie bereits bezahlt haben.

Der Vergleich, der wirklich zählt, erfolgt pro Studie, nicht pro Token. Das Lesen einer CT ist eine Arbeitseinheit. Ein Durchlauf zur Berichtnormalisierung für denselben Fall ist eine Textaufgabe, die in Tausenden von Token gemessen wird. Ersteres mit einem Dollarbetrag zu beziffern, bedeutet, seine Hardware zu kennen; Letzteres zu beziffern ist reine Arithmetik.

Die Falle in der Mitte des Vergleichs

Es gibt einen konkreten Fehler, den es sich lohnt zu benennen, denn er ist genau der, zu dem diese Gegenüberstellung einlädt. Er besteht darin, NV-Reason-CT als spezialisiertes Fine-Tuning eines allgemeinen Modells zu behandeln und deshalb anzunehmen, dass das allgemeine Modell in den meisten Fällen nah genug herankommt und deutlich flexibler ist.

Es handelt sich nicht um eine Feinabstimmung. Es ist ein 3D-Vision-Transformer namens Primus, initialisiert aus COLIPRI, angekoppelt an ein Qwen3.5-4B-Sprach-Backbone mit 3D-Multi-Axis-Rotary-Position-Embedding, trainiert mit ungefähr 550.000 strukturierten Frage-Antwort-Beispielen, die aus 70.111 CT-Volumina aus CT-RATE, CancerVerse und einer internen NIH-Sammlung stammen, und anschließend mit GRPO anhand einer Belohnung optimiert, die den F1-Score für das Abnormalitäten-Set mit 2,0, einen regionenspezifischen Berichtsstruktur-Score mit 0,5 und eine weiche Längenstrafe mit 1,0 gewichtet. Der dreidimensionale Encoder ist das Entscheidende am Modell. Ein zweidimensionales oder schichtbasiertes Frontend ist ein anderes Instrument, und der Vergleich der Arbeit selbst zeigt, was dieser Unterschied wert ist: MedGemma 1.5 bei 0,303 F1, wenn man ihm bis zu 85 axiale Schichten zuführt, gegenüber 0,614 für das native volumetrische Modell.

Der umgekehrte Fehler ist genauso häufig und ebenso teuer: anzunehmen, dass man NV-Reason-CT, weil es spezialisiert ist, für alles Klinische einsetzen sollte. Es unterstützt Thorax und Abdomen und sonst nichts, sein Aufruf ist eine NIfTI-Datei statt einer Chat-Nachricht, und seine Lizenzbedingungen besagen, dass es nur für Forschung und Lehre bestimmt ist. Es wird keinen Pathologie-Objektträger lesen, keine Frage zu einer Leitlinie beantworten oder den Code schreiben, der Ihre DICOM-Konvertierung stapelweise verarbeitet. Zu einem CT-Modell zu greifen, um Textarbeit zu erledigen, ist derselbe Kategorienfehler wie zu einem Textmodell zu greifen, um Volumetrie zu betreiben – nur in die andere Richtung.

A generated scoreboard titled 'The two models, at a glance' listing six paired rows. Row one: parameters, 4.69B total and 4.35B active, against undisclosed. Row two: context, 13,824 visual tokens per volume against 1,000,000 input and 128,000 output tokens. Row three: input, one-channel NIfTI in Hounsfield units against text, images and files. Row four: availability, weights downloadable on Hugging Face against hosted API. Row five: price, self-hosted with no rate card against $5 and $25 per million tokens. Row six: status, unannounced research release against generally available. A footer reads 'NV-Reason-CT figures per the authors paper and model card; Claude Opus 5 figures per the provider rate card and Artificial Analysis.'

Wie die beiden Hälften in ein System passen

Keines der Modelle ersetzt das andere, und die sinnvolle Architektur enthält beide – was die praktische Frage aufwirft, wie man sie aufruft.

Claude Opus 5 wird über OrcaRouter als anthropic/claude-opus-5 zum Listenpreis des Anbieters Anthropic ohne Aufschlag bereitgestellt, innerhalb einer einzigen API, die mehr als 200 Modelle abdeckt. Das ist bei einem einzelnen Aufruf weniger von Bedeutung als für die umgebende Pipeline: Wenn die Text-Hälfte eines klinischen Builds ein Modell unter mehreren Kandidaten ist, bedeutet es, alle hinter einem einzigen Schlüssel zu haben, dass Sie sie in Ihrem eigenen Korpus vergleichen können, ohne einen zweiten Vertrag oder eine Codeänderung, und die Routing-DSL ermöglicht es Ihnen, einzelne Anfragen an das Modell zu senden, das sie bearbeiten sollte, während automatisches Failover Sie absichert, wenn ein Anbieter beeinträchtigt ist.

NV-Reason-CT ist nicht auf unserer Plattform, und kein NVIDIA-Modell ist dort. Es sind Gewichte, die Sie herunterladen und auf Ihrer eigenen Hardware ausführen – genau das erlaubt Ihnen die Lizenz, und da es sich bei den Eingabedaten um patientenabgeleitete volumetrische Daten handelt, ist es wahrscheinlich ohnehin das, was Sie wollen. Wir werden nicht suggerieren, dass wir ein Modell routen, das wir nicht haben. Die Textseite des Builds ist der Bereich, in dem wir nützlich sind; die volumetrische Seite ist der Bereich, in dem Sie mit einem 4,69-Milliarden-Modell und einer GPU auf sich allein gestellt sind.

A screenshot of the OrcaRouter model page for Claude Opus 5, showing the identifier anthropic/claude-opus-5, the description of it as Anthropic's most capable model for complex reasoning and long-horizon agentic work, a side panel listing a 1,000,000-token context window and 128,000 maximum output tokens with text, image and file input and text output, and a stat strip reading $5.00 per million input tokens, $25.00 per million output tokens, and a p50 time to first token under four seconds.

Das Urteil, das der Überprüfung standhält

Wenn Sie ein CT-Volumen in strukturierte Befunde eingelesen haben möchten, gibt es dafür ein Modell; es stammt aus NVIDIAs Forschungsgruppe und ist ein Download statt eines API-Aufrufs. Wenn Sie ein Korpus von Berichten normalisiert, eine Evaluierungsumgebung geschrieben, einen DICOM-Konvertierungsjob skriptiert oder eine Kohorte zusammengefasst haben möchten, gibt es auch dafür ein Modell, und es hat eine Preisliste.

An der Aussage ist festzuhalten: Für keinen von beiden ist nachgewiesen, dass er in irgendetwas besser ist als der andere, weil das Experiment nicht durchgeführt wurde. Nachgewiesen ist, dass eine native dreidimensionale Schnittstelle eine schichtbasierte bei einem öffentlichen Chest-CT-Benchmark mit einem Vorsprung schlägt, den die Autoren auf etwa drei F1-Punkte beziffern, und dass ein allgemeines Frontier-Modell unabhängig an der Spitze des Feldes bei Reasoning, Code und Long-Context-Arbeit gemessen wird. Das sind zwei Aussagen über zwei verschiedene Aufgaben. Sie als Ranking zu lesen, ist der Kategorienfehler, und er hält sich genau bis zu dem Punkt, an dem jemand den direkten Vergleich veröffentlicht, den noch niemand veröffentlicht hat.