Eine generierte Hero-Karte mit dem Titel „NV-Reason-CT vs Nemotron 3 Ultra“ und dem Untertitel „Ein Logo, zwei Release-Philosophien“. Am unteren Rand verlaufen drei Chips: „4,69B vs. 550B gesamt / 55B aktiv“, „~10,6 GB BF16 vs. Hunderte GB“ und „Veröffentlicht am 8. Sep. vs. 4. Juni 2026“. Das OrcaRouter-Logo ist unten rechts eingefügt.
Guides & Insights

NV-Reason-CT vs. Nemotron 3 Ultra: Ein Logo, zwei Veröffentlichungsphilosophien

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

NVIDIA hat in diesem Jahr zwei Open-Weights-Modelle ausgeliefert und niemandem von einem davon erzählt. Nemotron 3 Ultraerschien am 4. Juni 2026 auf Hugging Face als ein Flaggschiff mit insgesamt 550 Mrd. und 55 Mrd. aktiven Parametern, mit einem technischen Bericht, einem OpenMDW-1.1-Lizenzregime und einer vollständigen Veröffentlichung von Open-Pre-Training- und Post-Training-Datensätzen im Rücken. NV-Reason-CTerschien am 8. September 2026 als ein CT-Spezialist mit 4,69 Mrd. Parametern, mit einem Repository, einem Demo-Space und zwei Wochen später einem arXiv-Preprint, der die Veröffentlichung in einem Zitationsblock erwähnt. Für das zweite gab es keine Ankündigung. Vergleicht man sie, vergleicht man nicht wirklich Fähigkeiten – ein allgemeines Flaggschiff mit 550 Mrd. Parametern und ein medizinischer Spezialist mit 4,69 Mrd. Parametern überschneiden sich nicht. Man vergleicht zwei unterschiedliche Theorien, wie man ein Modell veröffentlicht, beide vom selben Unternehmen betrieben, drei Monate auseinander.

Was jedes Repository tatsächlich enthält

Die Veröffentlichung von Nemotron 3 Ultra ist eine vollständig offene Pipeline. Der NVFP4-Checkpoint auf Hugging Face hat 249.746 Downloads und 338 Likes angezogen; das BF16-Schwestermodell, der Basis-Checkpoint und die Post-Training-Datensätze wurden alle zusammen damit veröffentlicht. Es ist zwölfsprachig und rein textbasiert, basiert auf einem latenten Mixture-of-Experts-Mamba2-Transformer-Hybrid mit Multi-Token-Vorhersage und trägt die openmdw-1.1-Lizenz. Artificial Analysis verortet es mit einem Intelligence Index von 47,7 in der ausgelieferten NVFP4-Präzision und 48,2 in voller Präzision — der höchste Wert eines US-Open-Weights-Modells laut dieser Rangliste. Unsere eigene frühere Berichterstattung über die Nemotron-Lehrermodelle verzeichnet den medianen Anbieterpreis bei etwa 0,60 US-Dollar pro Million Eingabe-Tokens und 2,60 US-Dollar pro Million Ausgabe-Tokens sowie NVIDIAs Durchsatzwert von 183 Ausgabe-Tokens pro Sekunde in Messungen durch Dritte.

NV-Reason-CT ist ein viel kleineres und deutlich stärker abgeschlossenes Artefakt. Zehn Komma sechs Gigabyte BF16-Gewichte, eine 10-KB-große model.py, eine 26-KB-große processor.py, eine Chat-Vorlage und eine inference.py. Ein Demo-Space. Ein Paper. Zweihundertzehn Downloads Stand dieser Woche. Kein Datensatz-Release. Kein technischer Bericht. Keine Serving-Konfiguration über ein Beispiel mit einem einzelnen Volume hinaus.

Der Gegensatz dreht sich nicht um die Größe — er dreht sich darum, was ein Downstream-Engineer mit dem Artefakt anfangen kann. Das Release von Ultra ist so gestaltet, dass jemand anderes das Training reproduzieren kann. Das Release von NV-Reason-CT ist so gestaltet, dass jemand anderes die Inferenz ausführen kann. Das sind unterschiedliche Versprechen.

Nur eines von ihnen ist auf NVIDIAs eigenem Stack aufgebaut.

Hier ist das Detail, das die Leute überrascht, und es lässt sich aus dem Frontmatter der Modellkarte verifizieren: Das Basismodell von NV-Reason-CT ist Qwen/Qwen3.5-4B, mit einer Fine-Tune-Beziehung, nicht einem Nemotron-Checkpoint. NVIDIA montierte einen Primus-3D-Vision-Transformer – initialisiert mit COLIPRI-Gewichten – auf ein Qwen-Sprachmodell und trainierte das Paar Ende-zu-Ende mit überwachtem Fine-Tuning, gefolgt von Group Relative Policy Optimization.

Das ist keine Kritik und kein Skandal. Es ist die Branchennorm für Vision-Language-Arbeit, und NVIDIA gibt es offen in den Repository-Metadaten an. Aber es bedeutet, dass die naheliegendste Annahme über diese Gegenüberstellung – dass NV-Reason-CT ein Nemotron-Derivat ist – falsch ist. Die beiden Modelle auf dieser Seite teilen ein Logo und eine Lizenzfamilie und im Wesentlichen nichts sonst. Keine gemeinsame Architektur, keinen gemeinsamen Tokenizer, keine gemeinsamen Trainingsdaten, keinen gemeinsamen Serving-Pfad.

Größe, in den Zahlen, die entscheiden, wo es läuft

• Parameter — NV-Reason-CT 4,69B gesamt / 4,35B aktiv im CT-Pfad vs. Nemotron 3 Ultra 550B gesamt / 55B aktiv, sparses LatentMoE • Checkpoint auf der Festplatte — NV-Reason-CT ca. 10,6 GB BF16 vs. Nemotron 3 Ultra Hunderte Gigabyte in BF16, zusätzlich in NVFP4 veröffentlicht • Eingabe — NV-Reason-CT 3D-NIfTI-CT-Volumen in Hounsfield-Einheiten, nur Thorax oder Abdomen, ein Volumen-Präfix mit 13.824 Token vs. Nemotron 3 Ultra Text, bis zu 1 Mio. Token Kontext mit einer Ausgabegrenze von 65K • Kontext — NV-Reason-CT im üblichen Sinne nicht anwendbar vs. Nemotron 3 Ultra 1.000.000 Token • Lizenz — beide OpenMDW-1.1 • Hardware — NV-Reason-CT Ampere / Hopper / Lovelace, getestet auf H100 und L40S vs. Nemotron 3 Ultra Multi-GPU-Serving mit 55B aktiv • Unabhängiger Score — NV-Reason-CT keiner veröffentlicht vs. Nemotron 3 Ultra AA Intelligence Index 47,7 NVFP4 / 48,2 volle Präzision

A generated scoreboard titled 'NV-Reason-CT vs Nemotron 3 Ultra - the scoreboard'. Left column 'NV-Reason-CT': Parameters 4.69B total / 4.35B active CT pathway; Checkpoint on disk ~10.6 GB BF16; Input 3D NIfTI CT, chest or abdomen; Context one 13,824-token volume prefix; Licence OpenMDW-1.1; Independent score none published. Right column 'Nemotron 3 Ultra': Parameters 550B total / 55B active LatentMoE; Checkpoint on disk hundreds of GB BF16, also NVFP4; Input text, up to 1M tokens; Context 1,000,000 in / 65,000 out; Licence OpenMDW-1.1; Independent score AA Index 47.7 NVFP4 / 48.2 full. A footer reads 'NV-Reason-CT figures from NVIDIA's model card; Nemotron 3 Ultra Intelligence Index per Artificial Analysis.'

Die praktische Grenze ist die Speichergrenze. Ein 4,69-Mrd.-Modell mit einem 3D-Encoder passt auf eine einzige Karte, und eine Forschungsgruppe kann das rechtfertigen. Ein Modell mit insgesamt 550 Mrd. Parametern bei 55 Mrd. aktiven Parametern braucht selbst quantisiert echte Serving-Infrastruktur. Keines von beiden ist ein Wochenendexperiment, aber sie liegen bei diesem Problem in unterschiedlichen Größenordnungen.

Zwei Bewertungsregime, die nicht gemittelt werden können

Ultras Beleg ist die allgemeine Leistungsfähigkeit: ein Artificial Analysis Intelligence Index im oberen Vierzigbereich, Benchmark-Abdeckung für Reasoning-, Coding- und agentische Aufgaben sowie vom Anbieter gemeldete Zahlen für die Familie, darunter SWE-Bench Verified 71,9, MMLU-Pro 86,8 und LiveCodeBench v6 89,0 — wobei die letzten drei NVIDIAs eigene Zahlen sind und als solche gekennzeichnet wurden.

Der Beleg für NV-Reason-CT ist eine einzige Tabelle. Macro-F1 0,614 und Macro-AUROC 0,871 bei CT-RATEs 18-Label-Klassifikationsaufgabe, bei einem festen einheitlichen Schwellenwert, mithilfe eines direkten Ja/Nein-Prompts ohne Klassifikationskopf, gegenüber VoxelFM mit 0,581/0,870, Pillar-0 mit 0,544/0,861, ClinFusion-8B mit 0,442, CT-CLIP mit 0,398/0,733, Merlin mit 0,358/0,662 und MedGemma 1.5 mit 0,303. Wieder NVIDIAs Zahlen, auf der Modellkarte, bisher ohne unabhängige Reproduktion.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Ein AA Intelligence Index von 47,7 und ein CT-RATE Macro-F1 von 0,614 sind nicht zwei Messungen ein und derselben Sache. Sie sind Messungen von zwei Dingen. Es gibt keine vertretbare Weise zu sagen, Ultra sei „besser“ als NV-Reason-CT, und der Grund ist nicht eine Bewertungspräferenz – es ist, dass sich die Instrumente überhaupt nicht überschneiden. Der einzige ehrliche Vergleich in dieser Paarung ist der, für wen jedes Modell akkreditiert ist, im wörtlichen Sinne dessen, welche Belege dafür existieren, dass es seinen Job erfüllt.

Warum die stille Veröffentlichung die rationale ist

Versetz dich in das Team für medizinische Bildgebung. Du hast ein funktionierendes 3D-CT-Modell. Du möchtest, dass Radiologen, Medizinstudierende und Forschende es nutzen. Was bringt dir eine Keynote?

Ein Launch-Event weckt Erwartungen an Support, Roadmaps und Langlebigkeit, die ein Forschungsteam nicht erfüllen kann. Es lädt zu allgemeiner Evaluierung anhand von Benchmarks ein, bei denen ein modalitätsgebundenes 4,69B-Modell aus strukturell irrelevanten Gründen wenig beeindruckend aussieht. Und es stellt ein Modell, das ausdrücklich „nicht als Ersatz für professionelles klinisches Urteil verwendet werden darf“, einem Publikum vor, das keine Lizenzbedingungen liest. Ein Repository, ein Paper und ein Demo-Space erreichen genau das Publikum, das alle drei liest, und lassen das Artefakt in seinem eigenen Tempo sprechen. Der Versionsstring ist „0.1“. Die Modellkarte besagt: nur für Forschung und Bildung. Das ist ein Release, das darauf ausgelegt ist, zitiert und nicht gekauft zu werden.

Ultras Release ist das Gegenteil und gleichermaßen rational — ein Flaggschiff braucht Distribution, eine Preisliste und Ökosystem-Unterstützung, weshalb es mit Datensätzen und einem Bericht kam.

Wo ein Router passt – und wo nicht

Keines dieser Modelle ist auf OrcaRouter, und ich werde nichts anderes behaupten: NV-Reason-CT ist ein 10,6 GB großer Checkpoint mit benutzerdefiniertem Modellcode, den Sie selbst hosten, und Nemotron 3 Ultra mit 55B aktiven Parametern wird über NVIDIAs eigene API und mehrere Drittanbieter-Plattformen bereitgestellt.

A screenshot of the Hugging Face model card for NVIDIA Nemotron 3 Ultra, showing the Model Summary block listing 550B total and 55B active parameters, a LatentMoE architecture, 1M context, OpenMDW-1.1 licence and a release date of June 4, 2026, followed by the Model Overview and evaluation rows.

Was eine Routing-Schicht für ein Team leistet, das mit beiden arbeitet, ist enger gefasst und dennoch nützlich. Eine klinische Forschungspipeline, die NV-Reason-CT für das Volumen und ein allgemeines Modell für den umgebenden Text verwendet, braucht einen Ort, an dem sie dieses allgemeine Modell austauschen kann, ohne einen zweiten Vertrag, und ein OpenAI-kompatibler Endpunkt, der 200+ Modelle abdeckt mit automatischem Failover über Anbieter hinweg ist dieser Ort. Er hält den selbst gehosteten Spezialisten und den gehosteten Generalisten unter einem Schlüssel statt zwei Integrationen.

Was man aus dem Pairing mitnehmen kann

Als Wettbewerber gelesen, sind die beiden Modelle ein Kategorienfehler. Als Fallstudie gelesen, sind sie ungewöhnlich klar. Derselbe Anbieter, dieselbe Lizenzfamilie, dasselbe Jahr — und zwei Veröffentlichungsstrategien, gewählt, um zwei völlig unterschiedlichen nachgelagerten Absichten zu entsprechen. Das eine ist Infrastruktur mit einem angehängten Ökosystem. Das andere ist ein Paper mit angehängten Gewichten, veröffentlicht, damit ein bestimmtes kleines Publikum es ausführen und zitieren kann.

Wenn Sie ein allgemeines Open-Weights-Modell suchen, ist NV-Reason-CT kein Kandidat und war nie als solcher gedacht. Wenn Sie Thorax- und Abdomen-CT-Volumen programmatisch lesen, kann Nemotron 3 Ultra Ihnen nicht helfen und war nie dafür gedacht. Die einzige echte Überschneidung zwischen ihnen ist das Logo, und die einzige wirkliche Lektion ist, dass NVIDIA bereit ist, still zu veröffentlichen, wenn das Publikum klein und technisch genug ist, dass es das Repository ohne Hilfe finden wird.