Una hero card generata intitolata 'NV-Reason-CT vs Nemotron 3 Ultra' con il sottotitolo 'Un solo logo, due filosofie di rilascio'. Tre chip corrono lungo la parte inferiore: '4,69B vs 550B totali / 55B attivi', '~10,6 GB BF16 vs centinaia di GB' e 'Rilasciato l'8 set vs il 4 giu 2026'. Il logo OrcaRouter è composto in basso a destra.
Guides & Insights

NV-Reason-CT vs Nemotron 3 Ultra: un logo, due filosofie di rilascio

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

NVIDIA ha rilasciato due modelli a pesi aperti quest'anno e non ha detto niente a nessuno riguardo a uno dei due.Nemotron 3 Ultra è arrivato su Hugging Face il 4 giugno 2026 come flagship da 550B totali e 55B attivi, con un report tecnico, un regime di licenza OpenMDW-1.1 e un intero rilascio di dataset aperti di pre-training e post-training alle spalle.NV-Reason-CT è arrivato l'8 settembre 2026 come specialista CT da 4,69 miliardi di parametri, con un repository, uno Space demo e un preprint arXiv due settimane più tardi che menziona il rilascio in un blocco di citazione. Non c'è stato alcun annuncio per il secondo. Confrontali e non stai davvero confrontando le capacità — un flagship generalista da 550B e uno specialista medico da 4,69 miliardi di parametri non si sovrappongono. Stai confrontando due teorie diverse su come rilasciare un modello, entrambe messe in pratica dalla stessa azienda, a tre mesi di distanza.

Cosa contiene effettivamente ciascun repository

Il rilascio di Nemotron 3 Ultra è una pipeline aperta completa. Il checkpoint NVFP4 su Hugging Face ha attirato 249.746 download e 338 like; il gemello BF16, il checkpoint base e i dataset di post-training sono tutti pubblicati insieme ad esso. È in dodici lingue, solo testo, costruito su un ibrido Mamba2-Transformer con mixture-of-experts latente e previsione multi-token, e adotta la licenza openmdw-1.1. Artificial Analysis lo colloca a un Intelligence Index di 47,7 nella precisione NVFP4 distribuita e 48,2 a piena precisione — il più alto di qualsiasi modello statunitense a pesi aperti, secondo quella classifica. La nostra precedente copertura dei modelli teacher Nemotron registra il prezzo mediano dei fornitori a circa 0,60 $ per milione di token in input e 2,60 $ per milione in output, e il dato di throughput di NVIDIA di 183 token di output al secondo in misurazioni di terze parti.

NV-Reason-CT è un artefatto molto più piccolo e molto più chiuso. Dieci punto sei gigabyte di pesi BF16, 10 KB di model.py, 26 KB di processor.py, un template di chat e un inference.py. Uno Space demo. Un paper. Duecentodieci download a partire da questa settimana. Nessun rilascio di dataset. Nessun rapporto tecnico. Nessuna configurazione di serving oltre a un esempio a volume singolo.

Il contrasto non riguarda le dimensioni — riguarda ciò che un ingegnere a valle può fare con l'artefatto. Il rilascio di Ultra è progettato affinché qualcun altro possa riprodurre l'addestramento. Il rilascio di NV-Reason-CT è progettato affinché qualcun altro possa eseguire l'inferenza. Sono promesse diverse.

Solo uno di essi è costruito sullo stack proprietario di NVIDIA

Ecco il dettaglio che sorprende le persone, ed è verificabile dal frontmatter della model card: il modello base di NV-Reason-CT è Qwen/Qwen3.5-4B, con una relazione di fine-tuning, non un checkpoint Nemotron. NVIDIA ha collegato un vision transformer Primus 3D — inizializzato dai pesi COLIPRI — a un modello linguistico Qwen e ha addestrato la coppia end-to-end con fine-tuning supervisionato seguito da Group Relative Policy Optimization.

Non è una critica e non è uno scandalo. È la norma del settore per il lavoro su visione-linguaggio, e NVIDIA lo dichiara apertamente nei metadati del repository. Ma significa che l'assunzione più naturale in assoluto su questo confronto — che NV-Reason-CT sia un derivato di Nemotron — è falsa. I due modelli in questa pagina condividono un logo e una famiglia di licenze e praticamente nient'altro. Nessuna architettura condivisa, nessun tokenizer condiviso, nessun dato di addestramento condiviso, nessun percorso di serving condiviso.

Dimensioni, nei numeri che decidono dove gira

• Parametri — NV-Reason-CT 4,69B totali / 4,35B attivi nel percorso CT rispetto a Nemotron 3 Ultra 550B totali / 55B attivi LatentMoE sparso • Checkpoint su disco — NV-Reason-CT ~10,6 GB BF16 rispetto a Nemotron 3 Ultra centinaia di gigabyte in BF16, pubblicato inoltre in NVFP4 • Input — NV-Reason-CT volumi CT NIfTI 3D in unità Hounsfield, solo torace o addome, un prefisso di volume da 13.824 token rispetto a Nemotron 3 Ultra testo, fino a 1M token di contesto con un limite di output di 65K • Contesto — NV-Reason-CT non applicabile nel senso usuale rispetto a Nemotron 3 Ultra 1.000.000 di token • Licenza — OpenMDW-1.1 per entrambi • Hardware — NV-Reason-CT Ampere / Hopper / Lovelace, testato su H100 e L40S rispetto a Nemotron 3 Ultra serving multi-GPU a 55B attivi • Punteggio indipendente — NV-Reason-CT nessuno pubblicato rispetto a Nemotron 3 Ultra AA Intelligence Index 47,7 NVFP4 / 48,2 precisione piena

A generated scoreboard titled 'NV-Reason-CT vs Nemotron 3 Ultra - the scoreboard'. Left column 'NV-Reason-CT': Parameters 4.69B total / 4.35B active CT pathway; Checkpoint on disk ~10.6 GB BF16; Input 3D NIfTI CT, chest or abdomen; Context one 13,824-token volume prefix; Licence OpenMDW-1.1; Independent score none published. Right column 'Nemotron 3 Ultra': Parameters 550B total / 55B active LatentMoE; Checkpoint on disk hundreds of GB BF16, also NVFP4; Input text, up to 1M tokens; Context 1,000,000 in / 65,000 out; Licence OpenMDW-1.1; Independent score AA Index 47.7 NVFP4 / 48.2 full. A footer reads 'NV-Reason-CT figures from NVIDIA's model card; Nemotron 3 Ultra Intelligence Index per Artificial Analysis.'

La linea pratica è quella della memoria. Un modello da 4.69B con un encoder 3D entra su una singola scheda e un gruppo di ricerca può giustificarlo. Un modello da 550B totali con 55B attivi richiede una vera infrastruttura di serving anche quantizzato. Nessuno dei due è un esperimento da weekend, ma si collocano su ordini di grandezza diversi di quel problema.

Due regimi di valutazione di cui non si può fare la media

Le prove a sostegno di Ultra riguardano la capacità generale: un Artificial Analysis Intelligence Index nella parte alta della quarantina, una copertura di benchmark su ragionamento, coding e attività agentiche, e dati dichiarati dal fornitore per la famiglia, tra cui SWE-Bench Verified 71,9, MMLU-Pro 86,8 e LiveCodeBench v6 89,0 — questi ultimi tre sono numeri di NVIDIA stessa, etichettati come tali.

La prova di NV-Reason-CT è una tabella. Macro-F1 0,614 e Macro-AUROC 0,871 sul task di classificazione a 18 etichette di CT-RATE, a una soglia uniforme fissa, usando un prompt diretto Sì/No senza testa di classificazione, rispetto a VoxelFM a 0,581/0,870, Pillar-0 a 0,544/0,861, ClinFusion-8B a 0,442, CT-CLIP a 0,398/0,733, Merlin a 0,358/0,662 e MedGemma 1.5 a 0,303. Ancora i numeri di NVIDIA, sulla scheda del modello, senza ancora alcuna riproduzione indipendente.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Un AA Intelligence Index di 47,7 e un CT-RATE Macro-F1 di 0,614 non sono due misurazioni di una sola cosa. Sono misurazioni di due cose. Non esiste un modo difendibile per dire che Ultra sia "migliore" di NV-Reason-CT, e il motivo non è una preferenza di punteggio — è che gli strumenti non si sovrappongono affatto. L'unico confronto onesto in questo abbinamento riguarda per che cosa ciascun modello è accreditato, nel senso letterale di quali prove esistano che faccia il suo lavoro.

Perché il rilascio silenzioso è quello razionale

Mettiti nei panni del team di imaging medico. Hai un modello CT 3D funzionante. Vuoi che radiologi, studenti di medicina e ricercatori lo utilizzino. Che cosa ti offre un keynote?

Un evento di lancio crea aspettative su supporto, roadmap e longevità che un team di ricerca non può soddisfare. Invita a una valutazione generica su benchmark in cui un modello da 4,69B vincolato a una singola modalità apparirà poco impressionante per ragioni strutturalmente irrilevanti. E mette un modello che esplicitamente "non deve essere usato come sostituto del giudizio clinico professionale" davanti a un pubblico che non legge i termini di licenza. Un repository, un paper e uno Space dimostrativo raggiungono esattamente il pubblico che legge tutti e tre, e lasciano che l'artefatto parli al proprio ritmo. La stringa di versione è "0.1". La scheda dice solo ricerca e istruzione. Questa è una release progettata per essere citata, non comprata.

Il lancio di Ultra è l'opposto ed è altrettanto razionale — un flagship ha bisogno di distribuzione, di un listino prezzi e del supporto dell'ecosistema, ed è per questo che è arrivato con dataset e un report.

Dove un router è adatto, e dove non può esserlo

Nessuno di questi modelli è su OrcaRouter, e non ho intenzione di suggerire il contrario: NV-Reason-CT è un checkpoint da 10,6 GB con codice del modello personalizzato che ospiti tu stesso, e Nemotron 3 Ultra a 55B attivi è servito tramite l'API di NVIDIA stessa e diverse piattaforme di terze parti.

A screenshot of the Hugging Face model card for NVIDIA Nemotron 3 Ultra, showing the Model Summary block listing 550B total and 55B active parameters, a LatentMoE architecture, 1M context, OpenMDW-1.1 licence and a release date of June 4, 2026, followed by the Model Overview and evaluation rows.

Ciò che un livello di routing fa per un team che lavora con entrambi è più circoscritto, ma comunque utile. Una pipeline di ricerca clinica che usa NV-Reason-CT per il volume e un modello generale per il testo circostante ha bisogno di un punto in cui sostituire quel modello generale senza un secondo contratto, e un unico endpoint compatibile con OpenAI che copre oltre 200 modelli con failover automatico tra provider è quel punto. Mantiene lo specialista self-hosted e il generalista hosted sotto un'unica chiave anziché due integrazioni.

Cosa trarre dall'abbinamento

Letti come concorrenti, i due modelli sono un errore di categoria. Letti come caso di studio, sono insolitamente chiari. Stesso fornitore, stessa famiglia di licenze, stesso anno — e due strategie di rilascio scelte per corrispondere a due intenti a valle completamente diversi. Uno è infrastruttura con un ecosistema allegato. L'altro è un paper con pesi allegati, rilasciato affinché uno specifico pubblico ristretto possa eseguirlo e citarlo.

Se stai cercando un modello generalista a pesi aperti, NV-Reason-CT non è un candidato e non è mai stato pensato per esserlo. Se leggi volumi CT del torace e dell'addome in modo programmatico, Nemotron 3 Ultra non può aiutarti e non è mai stato pensato per farlo. L'unica vera sovrapposizione tra loro è il logo, e l'unica vera lezione è che NVIDIA è disposta a rilasciare in sordina quando il pubblico è abbastanza piccolo e tecnico da trovare il repository da solo.