
NV-Reason-CT vs. Nemotron 3 Ultra: Ein Logo, zwei Veröffentlichungsphilosophien
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 45 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 182 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
NVIDIA hat in diesem Jahr zwei Open-Weights-Modelle ausgeliefert und niemandem von einem davon erzählt. Nemotron 3 Ultraerschien am 4. Juni 2026 auf Hugging Face als ein Flaggschiff mit insgesamt 550 Mrd. und 55 Mrd. aktiven Parametern, mit einem technischen Bericht, einem OpenMDW-1.1-Lizenzregime und einer vollständigen Veröffentlichung von Open-Pre-Training- und Post-Training-Datensätzen im Rücken. NV-Reason-CTerschien am 8. September 2026 als ein CT-Spezialist mit 4,69 Mrd. Parametern, mit einem Repository, einem Demo-Space und zwei Wochen später einem arXiv-Preprint, der die Veröffentlichung in einem Zitationsblock erwähnt. Für das zweite gab es keine Ankündigung. Vergleicht man sie, vergleicht man nicht wirklich Fähigkeiten – ein allgemeines Flaggschiff mit 550 Mrd. Parametern und ein medizinischer Spezialist mit 4,69 Mrd. Parametern überschneiden sich nicht. Man vergleicht zwei unterschiedliche Theorien, wie man ein Modell veröffentlicht, beide vom selben Unternehmen betrieben, drei Monate auseinander.
Was jedes Repository tatsächlich enthält
Die Veröffentlichung von Nemotron 3 Ultra ist eine vollständig offene Pipeline. Der NVFP4-Checkpoint auf Hugging Face hat 249.746 Downloads und 338 Likes angezogen; das BF16-Schwestermodell, der Basis-Checkpoint und die Post-Training-Datensätze wurden alle zusammen damit veröffentlicht. Es ist zwölfsprachig und rein textbasiert, basiert auf einem latenten Mixture-of-Experts-Mamba2-Transformer-Hybrid mit Multi-Token-Vorhersage und trägt die openmdw-1.1-Lizenz. Artificial Analysis verortet es mit einem Intelligence Index von 47,7 in der ausgelieferten NVFP4-Präzision und 48,2 in voller Präzision — der höchste Wert eines US-Open-Weights-Modells laut dieser Rangliste. Unsere eigene frühere Berichterstattung über die Nemotron-Lehrermodelle verzeichnet den medianen Anbieterpreis bei etwa 0,60 US-Dollar pro Million Eingabe-Tokens und 2,60 US-Dollar pro Million Ausgabe-Tokens sowie NVIDIAs Durchsatzwert von 183 Ausgabe-Tokens pro Sekunde in Messungen durch Dritte.
NV-Reason-CT ist ein viel kleineres und deutlich stärker abgeschlossenes Artefakt. Zehn Komma sechs Gigabyte BF16-Gewichte, eine 10-KB-große model.py, eine 26-KB-große processor.py, eine Chat-Vorlage und eine inference.py. Ein Demo-Space. Ein Paper. Zweihundertzehn Downloads Stand dieser Woche. Kein Datensatz-Release. Kein technischer Bericht. Keine Serving-Konfiguration über ein Beispiel mit einem einzelnen Volume hinaus.
Der Gegensatz dreht sich nicht um die Größe — er dreht sich darum, was ein Downstream-Engineer mit dem Artefakt anfangen kann. Das Release von Ultra ist so gestaltet, dass jemand anderes das Training reproduzieren kann. Das Release von NV-Reason-CT ist so gestaltet, dass jemand anderes die Inferenz ausführen kann. Das sind unterschiedliche Versprechen.
Nur eines von ihnen ist auf NVIDIAs eigenem Stack aufgebaut.
Hier ist das Detail, das die Leute überrascht, und es lässt sich aus dem Frontmatter der Modellkarte verifizieren: Das Basismodell von NV-Reason-CT ist Qwen/Qwen3.5-4B, mit einer Fine-Tune-Beziehung, nicht einem Nemotron-Checkpoint. NVIDIA montierte einen Primus-3D-Vision-Transformer – initialisiert mit COLIPRI-Gewichten – auf ein Qwen-Sprachmodell und trainierte das Paar Ende-zu-Ende mit überwachtem Fine-Tuning, gefolgt von Group Relative Policy Optimization.
Das ist keine Kritik und kein Skandal. Es ist die Branchennorm für Vision-Language-Arbeit, und NVIDIA gibt es offen in den Repository-Metadaten an. Aber es bedeutet, dass die naheliegendste Annahme über diese Gegenüberstellung – dass NV-Reason-CT ein Nemotron-Derivat ist – falsch ist. Die beiden Modelle auf dieser Seite teilen ein Logo und eine Lizenzfamilie und im Wesentlichen nichts sonst. Keine gemeinsame Architektur, keinen gemeinsamen Tokenizer, keine gemeinsamen Trainingsdaten, keinen gemeinsamen Serving-Pfad.
Größe, in den Zahlen, die entscheiden, wo es läuft
• Parameter — NV-Reason-CT 4,69B gesamt / 4,35B aktiv im CT-Pfad vs. Nemotron 3 Ultra 550B gesamt / 55B aktiv, sparses LatentMoE • Checkpoint auf der Festplatte — NV-Reason-CT ca. 10,6 GB BF16 vs. Nemotron 3 Ultra Hunderte Gigabyte in BF16, zusätzlich in NVFP4 veröffentlicht • Eingabe — NV-Reason-CT 3D-NIfTI-CT-Volumen in Hounsfield-Einheiten, nur Thorax oder Abdomen, ein Volumen-Präfix mit 13.824 Token vs. Nemotron 3 Ultra Text, bis zu 1 Mio. Token Kontext mit einer Ausgabegrenze von 65K • Kontext — NV-Reason-CT im üblichen Sinne nicht anwendbar vs. Nemotron 3 Ultra 1.000.000 Token • Lizenz — beide OpenMDW-1.1 • Hardware — NV-Reason-CT Ampere / Hopper / Lovelace, getestet auf H100 und L40S vs. Nemotron 3 Ultra Multi-GPU-Serving mit 55B aktiv • Unabhängiger Score — NV-Reason-CT keiner veröffentlicht vs. Nemotron 3 Ultra AA Intelligence Index 47,7 NVFP4 / 48,2 volle Präzision

Die praktische Grenze ist die Speichergrenze. Ein 4,69-Mrd.-Modell mit einem 3D-Encoder passt auf eine einzige Karte, und eine Forschungsgruppe kann das rechtfertigen. Ein Modell mit insgesamt 550 Mrd. Parametern bei 55 Mrd. aktiven Parametern braucht selbst quantisiert echte Serving-Infrastruktur. Keines von beiden ist ein Wochenendexperiment, aber sie liegen bei diesem Problem in unterschiedlichen Größenordnungen.
Zwei Bewertungsregime, die nicht gemittelt werden können
Ultras Beleg ist die allgemeine Leistungsfähigkeit: ein Artificial Analysis Intelligence Index im oberen Vierzigbereich, Benchmark-Abdeckung für Reasoning-, Coding- und agentische Aufgaben sowie vom Anbieter gemeldete Zahlen für die Familie, darunter SWE-Bench Verified 71,9, MMLU-Pro 86,8 und LiveCodeBench v6 89,0 — wobei die letzten drei NVIDIAs eigene Zahlen sind und als solche gekennzeichnet wurden.
Der Beleg für NV-Reason-CT ist eine einzige Tabelle. Macro-F1 0,614 und Macro-AUROC 0,871 bei CT-RATEs 18-Label-Klassifikationsaufgabe, bei einem festen einheitlichen Schwellenwert, mithilfe eines direkten Ja/Nein-Prompts ohne Klassifikationskopf, gegenüber VoxelFM mit 0,581/0,870, Pillar-0 mit 0,544/0,861, ClinFusion-8B mit 0,442, CT-CLIP mit 0,398/0,733, Merlin mit 0,358/0,662 und MedGemma 1.5 mit 0,303. Wieder NVIDIAs Zahlen, auf der Modellkarte, bisher ohne unabhängige Reproduktion.

Ein AA Intelligence Index von 47,7 und ein CT-RATE Macro-F1 von 0,614 sind nicht zwei Messungen ein und derselben Sache. Sie sind Messungen von zwei Dingen. Es gibt keine vertretbare Weise zu sagen, Ultra sei „besser“ als NV-Reason-CT, und der Grund ist nicht eine Bewertungspräferenz – es ist, dass sich die Instrumente überhaupt nicht überschneiden. Der einzige ehrliche Vergleich in dieser Paarung ist der, für wen jedes Modell akkreditiert ist, im wörtlichen Sinne dessen, welche Belege dafür existieren, dass es seinen Job erfüllt.
Warum die stille Veröffentlichung die rationale ist
Versetz dich in das Team für medizinische Bildgebung. Du hast ein funktionierendes 3D-CT-Modell. Du möchtest, dass Radiologen, Medizinstudierende und Forschende es nutzen. Was bringt dir eine Keynote?
Ein Launch-Event weckt Erwartungen an Support, Roadmaps und Langlebigkeit, die ein Forschungsteam nicht erfüllen kann. Es lädt zu allgemeiner Evaluierung anhand von Benchmarks ein, bei denen ein modalitätsgebundenes 4,69B-Modell aus strukturell irrelevanten Gründen wenig beeindruckend aussieht. Und es stellt ein Modell, das ausdrücklich „nicht als Ersatz für professionelles klinisches Urteil verwendet werden darf“, einem Publikum vor, das keine Lizenzbedingungen liest. Ein Repository, ein Paper und ein Demo-Space erreichen genau das Publikum, das alle drei liest, und lassen das Artefakt in seinem eigenen Tempo sprechen. Der Versionsstring ist „0.1“. Die Modellkarte besagt: nur für Forschung und Bildung. Das ist ein Release, das darauf ausgelegt ist, zitiert und nicht gekauft zu werden.
Ultras Release ist das Gegenteil und gleichermaßen rational — ein Flaggschiff braucht Distribution, eine Preisliste und Ökosystem-Unterstützung, weshalb es mit Datensätzen und einem Bericht kam.
Wo ein Router passt – und wo nicht
Keines dieser Modelle ist auf OrcaRouter, und ich werde nichts anderes behaupten: NV-Reason-CT ist ein 10,6 GB großer Checkpoint mit benutzerdefiniertem Modellcode, den Sie selbst hosten, und Nemotron 3 Ultra mit 55B aktiven Parametern wird über NVIDIAs eigene API und mehrere Drittanbieter-Plattformen bereitgestellt.

Was eine Routing-Schicht für ein Team leistet, das mit beiden arbeitet, ist enger gefasst und dennoch nützlich. Eine klinische Forschungspipeline, die NV-Reason-CT für das Volumen und ein allgemeines Modell für den umgebenden Text verwendet, braucht einen Ort, an dem sie dieses allgemeine Modell austauschen kann, ohne einen zweiten Vertrag, und ein OpenAI-kompatibler Endpunkt, der 200+ Modelle abdeckt mit automatischem Failover über Anbieter hinweg ist dieser Ort. Er hält den selbst gehosteten Spezialisten und den gehosteten Generalisten unter einem Schlüssel statt zwei Integrationen.
Was man aus dem Pairing mitnehmen kann
Als Wettbewerber gelesen, sind die beiden Modelle ein Kategorienfehler. Als Fallstudie gelesen, sind sie ungewöhnlich klar. Derselbe Anbieter, dieselbe Lizenzfamilie, dasselbe Jahr — und zwei Veröffentlichungsstrategien, gewählt, um zwei völlig unterschiedlichen nachgelagerten Absichten zu entsprechen. Das eine ist Infrastruktur mit einem angehängten Ökosystem. Das andere ist ein Paper mit angehängten Gewichten, veröffentlicht, damit ein bestimmtes kleines Publikum es ausführen und zitieren kann.
Wenn Sie ein allgemeines Open-Weights-Modell suchen, ist NV-Reason-CT kein Kandidat und war nie als solcher gedacht. Wenn Sie Thorax- und Abdomen-CT-Volumen programmatisch lesen, kann Nemotron 3 Ultra Ihnen nicht helfen und war nie dafür gedacht. Die einzige echte Überschneidung zwischen ihnen ist das Logo, und die einzige wirkliche Lektion ist, dass NVIDIA bereit ist, still zu veröffentlichen, wenn das Publikum klein und technisch genug ist, dass es das Repository ohne Hilfe finden wird.
