Een gegenereerde hero-kaart met de titel 'NV-Reason-CT vs Nemotron 3 Ultra' en de ondertitel 'Eén logo, twee releasefilosofieën'. Onderaan staan drie chips: '4,69B vs 550B / 55B actief', '~10,6 GB BF16 vs honderden GB', en 'Uitgebracht 8 sep vs 4 jun 2026'. Het OrcaRouter-logo is rechtsonder samengesteld.
Guides & Insights

NV-Reason-CT vs Nemotron 3 Ultra: één logo, twee releasefilosofieën

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

NVIDIA heeft dit jaar twee open-weights modellen uitgebracht en over één ervan tegen niemand iets gezegd. Nemotron 3 Ultra verscheen op 4 juni 2026 op Hugging Face als een flagship met 550B totale en 55B actieve parameters, met een technisch rapport, een OpenMDW-1.1-licentieregime en een volledige release van een open pre-training- en post-trainingdataset erachter. NV-Reason-CT verscheen op 8 september 2026 als een CT-specialist met 4,69B parameters, met een repository, een demo-Space en twee weken later een arXiv-preprint die de release in een citatieblok vermeldt. Voor de tweede kwam geen enkele aankondiging. Vergelijk ze en je vergelijkt niet echt capaciteiten — een algemeen flagship van 550B en een medisch specialist van 4,69B overlappen elkaar niet. Je vergelijkt twee verschillende theorieën over hoe je een model uitbrengt, beide gehanteerd door hetzelfde bedrijf, drie maanden na elkaar.

Wat elke repository daadwerkelijk bevat

De release van Nemotron 3 Ultra is een volledig open pijplijn. De NVFP4-checkpoint op Hugging Face heeft 249.746 downloads en 338 likes gekregen; de BF16-tegenhanger, de basis-checkpoint en de post-trainingdatasets zijn allemaal samen ermee gepubliceerd. Het is twaalftalig, alleen tekst, gebouwd op een latente mixture-of-experts Mamba2-Transformer-hybride met multi-tokenvoorspelling, en het heeft de openmdw-1.1-licentie. Artificial Analysis plaatst het op een Intelligence Index van 47,7 in de geleverde NVFP4-precisie en 48,2 in volledige precisie — het hoogste van alle Amerikaanse open-weightmodellen, volgens die ranglijst. Onze eigen eerdere berichtgeving over de Nemotron-lerarenmodellen vermeldt de mediane aanbiedersprijs op ongeveer $0,60 per miljoen inputtokens en $2,60 per miljoen outputtokens, en het doorvoercijfer van NVIDIA van 183 outputtokens per seconde in een meting door derden.

NV-Reason-CT is een veel kleiner en veel meer gesloten artefact. Tien komma zes gigabyte BF16-gewichten, een 10 KB model.py, een 26 KB processor.py, een chat-template, en een inference.py. Eén demo-Space. Eén paper. Tweehonderdtien downloads per deze week. Geen datasetrelease. Geen technisch rapport. Geen serveerconfiguratie anders dan een voorbeeld met één volume.

Het contrast gaat niet over grootte — het gaat erom wat een downstream-engineer met het artefact kan doen. De release van Ultra is zo ontworpen dat iemand anders de training kan reproduceren. De release van NV-Reason-CT is zo ontworpen dat iemand anders de inferentie kan uitvoeren. Dat zijn verschillende beloften.

Slechts één ervan is gebouwd op NVIDIA's eigen stack.

Hier is het detail dat mensen verrast, en het is verifieerbaar uit de frontmatter van de modelkaart: het basismodel van NV-Reason-CT is Qwen/Qwen3.5-4B, met een fine-tune-relatie, geen Nemotron-checkpoint. NVIDIA schroefde een Primus 3D vision transformer — geïnitialiseerd vanuit COLIPRI-gewichten — op een Qwen-taalmodel en trainde het paar end-to-end met supervised fine-tuning, gevolgd door Group Relative Policy Optimization.

Dat is geen kritiek en het is geen schandaal. Het is de industriestandaard voor visie-taalmodellen, en NVIDIA vermeldt het duidelijk in de metadata van de repository. Maar het betekent wel dat de meest voor de hand liggende aanname over deze confrontatie — dat NV-Reason-CT een Nemotron-afgeleide is — onjuist is. De twee modellen op deze pagina delen een logo en een licentiefamilie en vrijwel niets anders. Geen gedeelde architectuur, geen gedeelde tokenizer, geen gedeelde trainingsdata, geen gedeeld servingpad.

Grootte, in de getallen die bepalen waar het draait

• Parameters — NV-Reason-CT 4,69B totaal / 4,35B actief in het CT-pad vs. Nemotron 3 Ultra 550B totaal / 55B actief sparse LatentMoE • Checkpoint op schijf — NV-Reason-CT ~10,6 GB BF16 vs. Nemotron 3 Ultra honderden gigabytes in BF16, daarnaast gepubliceerd in NVFP4 • Invoer — NV-Reason-CT 3D NIfTI-CT-volumes in Hounsfield-eenheden, alleen thorax of abdomen, één volumeprefix van 13.824 tokens vs. Nemotron 3 Ultra tekst, tot 1 miljoen tokens context met een uitvoerlimiet van 65K • Context — NV-Reason-CT niet van toepassing in de gebruikelijke zin vs. Nemotron 3 Ultra 1.000.000 tokens • Licentie — beide OpenMDW-1.1 • Hardware — NV-Reason-CT Ampere / Hopper / Lovelace, getest op H100 en L40S vs. Nemotron 3 Ultra multi-GPU-serving met 55B actief • Onafhankelijke score — NV-Reason-CT geen gepubliceerd cijfer vs. Nemotron 3 Ultra AA Intelligence Index 47,7 NVFP4 / 48,2 volledige precisie

A generated scoreboard titled 'NV-Reason-CT vs Nemotron 3 Ultra - the scoreboard'. Left column 'NV-Reason-CT': Parameters 4.69B total / 4.35B active CT pathway; Checkpoint on disk ~10.6 GB BF16; Input 3D NIfTI CT, chest or abdomen; Context one 13,824-token volume prefix; Licence OpenMDW-1.1; Independent score none published. Right column 'Nemotron 3 Ultra': Parameters 550B total / 55B active LatentMoE; Checkpoint on disk hundreds of GB BF16, also NVFP4; Input text, up to 1M tokens; Context 1,000,000 in / 65,000 out; Licence OpenMDW-1.1; Independent score AA Index 47.7 NVFP4 / 48.2 full. A footer reads 'NV-Reason-CT figures from NVIDIA's model card; Nemotron 3 Ultra Intelligence Index per Artificial Analysis.'

De praktische scheidslijn is het geheugen. Een model van 4,69 miljard parameters met een 3D-encoder past op één kaart, en een onderzoeksgroep kan dat verantwoorden. Een model met in totaal 550 miljard parameters, waarvan 55 miljard actief, heeft echte serving-infrastructuur nodig, zelfs gekwantiseerd. Geen van beide is een weekendexperiment, maar ze liggen ordes van grootte uit elkaar wat dat probleem betreft.

Twee evaluatieregimes die niet kunnen worden gemiddeld

Het bewijs van Ultra is algemene capaciteit: een Artificial Analysis Intelligence Index in de hoge veertigers, benchmarkdekking op het gebied van redeneren, coderen en agentische taken, en door de leverancier gerapporteerde cijfers voor de familie, waaronder SWE-Bench Verified 71,9, MMLU-Pro 86,8 en LiveCodeBench v6 89,0 — waarbij die laatste drie NVIDIA's eigen cijfers zijn en als zodanig aangeduid.

Het bewijs voor NV-Reason-CT bestaat uit één tabel. Macro-F1 0,614 en Macro-AUROC 0,871 op de 18-labelclassificatietaak van CT-RATE, bij een vaste uniforme drempel, met een directe ja/nee-prompt zonder classificatiehoofd, tegenover VoxelFM met 0,581/0,870, Pillar-0 met 0,544/0,861, ClinFusion-8B met 0,442, CT-CLIP met 0,398/0,733, Merlin met 0,358/0,662 en MedGemma 1.5 met 0,303. Opnieuw de cijfers van NVIDIA, op de modelkaart, en tot nu toe geen onafhankelijke reproductie.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Een AA Intelligence Index van 47,7 en een CT-RATE Macro-F1 van 0,614 zijn geen twee metingen van één ding. Het zijn metingen van twee dingen. Er is geen verdedigbare manier om te zeggen dat Ultra "beter" is dan NV-Reason-CT, en de reden is niet een voorkeur voor scores — het is dat de instrumenten helemaal niet overlappen. De enige eerlijke vergelijking in deze combinatie is die van voor wie elk model geaccrediteerd is, in de letterlijke zin van welk bewijs er bestaat dat het zijn werk doet.

Waarom de stille release de rationele keuze is

Plaats jezelf in het team voor medische beeldvorming. Je hebt een werkend 3D-CT-model. Je wilt dat radiologen, geneeskundestudenten en onderzoekers het gebruiken. Wat levert een keynote je op?

Een lanceerevenement wekt verwachtingen over ondersteuning, roadmaps en levensduur die een onderzoeksteam niet kan waarmaken. Het nodigt uit tot algemene evaluatie op benchmarks waarop een modaliteitsgebonden model van 4,69B om structureel irrelevante redenen weinig indrukwekkend zal lijken. En het plaatst een model dat expliciet "mag niet worden gebruikt als vervanging van professioneel klinisch oordeel" tegenover een publiek dat de licentievoorwaarden niet leest. Een repository, een paper en een demo Space bereiken precies het publiek dat alle drie leest, en ze laten het artefact in zijn eigen tempo spreken. De versiestring is "0.1". De kaart vermeldt: uitsluitend onderzoek en onderwijs. Dat is een release die bedoeld is om geciteerd te worden, niet om gekocht te worden.

De release van Ultra is het tegenovergestelde en even rationeel — een vlaggenschip heeft distributie, een tariefkaart en ecosysteemondersteuning nodig, en daarom kwam het met datasets en een rapport.

Waar een router past, en waar niet.

Geen van deze modellen staat op OrcaRouter, en ik ga niet het tegendeel suggereren: NV-Reason-CT is een checkpoint van 10,6 GB met aangepaste modelcode die je zelf host, en Nemotron 3 Ultra met 55B actieve parameters wordt aangeboden via NVIDIA's eigen API en verschillende platforms van derden.

A screenshot of the Hugging Face model card for NVIDIA Nemotron 3 Ultra, showing the Model Summary block listing 550B total and 55B active parameters, a LatentMoE architecture, 1M context, OpenMDW-1.1 licence and a release date of June 4, 2026, followed by the Model Overview and evaluation rows.

Wat een routeringslaag doet voor een team dat met beide werkt, is beperkter en nog steeds nuttig. Een klinische onderzoekspipeline die NV-Reason-CT gebruikt voor het volume en een algemeen model voor de omliggende tekst, heeft een plek nodig om dat algemene model te vervangen zonder een tweede contract, en één OpenAI-compatibel eindpunt dat 200+ modellen dekt met automatische failover tussen providers is die plek. Het houdt de zelfgehoste specialist en de gehoste generalist onder één sleutel in plaats van twee integraties.

Wat je uit de pairing kunt halen

Gelezen als concurrenten zijn de twee modellen een categoriefout. Gelezen als casestudy zijn ze ongewoon duidelijk. Dezelfde leverancier, dezelfde licentiefamilie, hetzelfde jaar — en twee releasestrategieën gekozen om twee volledig verschillende downstream-intenties te matchen. De ene is infrastructuur met een ecosysteem eraan vast. De andere is een paper met gewichten eraan vast, uitgebracht zodat een specifiek klein publiek het kan draaien en citeren.

Als je op zoek bent naar een algemeen open-weightsmodel, is NV-Reason-CT geen kandidaat en was dat ook nooit bedoeld. Als je thorax- en abdominale CT-volumes programmatisch leest, kan Nemotron 3 Ultra je niet helpen en was dat ook nooit de bedoeling. De enige echte overlap tussen beide is het logo, en de enige echte les is dat NVIDIA bereid is om stilletjes uit te brengen wanneer het publiek klein en technisch genoeg is om de repository zelfstandig te vinden.