Une carte hero générée intitulée « NV-Reason-CT vs Nemotron 3 Ultra » avec le sous-titre « Un logo, deux philosophies de publication ». Trois puces s'alignent en bas : « 4,69 B vs 550 B au total / 55 B actifs », « ~10,6 Go BF16 vs des centaines de Go », et « Publié le 8 sept. vs le 4 juin 2026 ». Le logo OrcaRouter est incrusté en bas à droite.
Guides & Insights

NV-Reason-CT vs Nemotron 3 Ultra : un seul logo, deux philosophies de publication

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

NVIDIA a publié deux modèles à poids ouverts cette année et n'a parlé à personne de l'un des deux. Nemotron 3 Ultraest arrivé sur Hugging Face le 4 juin 2026 en tant que fleuron de 550 B au total et 55 B actifs, avec à l'appui un rapport technique, un régime de licence OpenMDW-1.1 et la publication intégrale de jeux de données ouverts de pré-entraînement et de post-entraînement. NV-Reason-CTest arrivé le 8 septembre 2026 en tant que spécialiste CT de 4,69 milliards de paramètres, avec un dépôt, un Space de démonstration et une prépublication arXiv deux semaines plus tard qui mentionne la publication dans un bloc de citation. Il n'y a eu aucune annonce pour le second. Comparez-les et vous ne comparez pas vraiment des capacités — un fleuron généraliste de 550 B et un spécialiste médical de 4,69 B ne se chevauchent pas. Vous comparez deux théories différentes de la manière de publier un modèle, toutes deux mises en œuvre par la même entreprise, à trois mois d'intervalle.

Ce que contient réellement chaque dépôt

La sortie de Nemotron 3 Ultra est un pipeline ouvert complet. Le checkpoint NVFP4 sur Hugging Face a attiré 249 746 téléchargements et 338 likes ; son pendant BF16, le checkpoint de base et les jeux de données de post-entraînement sont tous publiés en parallèle. Il couvre douze langues, en texte uniquement, repose sur un hybride Mamba2-Transformer à mélange d'experts latent avec prédiction multi-token, et il est distribué sous licence openmdw-1.1. Artificial Analysis le place à 47,7 sur l'Intelligence Index dans la précision NVFP4 livrée et à 48,2 en pleine précision — le score le plus élevé de tous les modèles à poids ouverts américains, selon ce classement. Notre propre couverture antérieure des modèles enseignants Nemotron consigne un prix médian chez les fournisseurs d'environ 0,60 $ par million de tokens d'entrée et 2,60 $ par million de tokens de sortie, ainsi que le débit de 183 tokens de sortie par seconde relevé par des tiers pour NVIDIA.

NV-Reason-CT est un artefact beaucoup plus petit et beaucoup plus fermé. Dix virgule six gigaoctets de poids BF16, un model.py de 10 Ko, un processor.py de 26 Ko, un template de chat, et un inference.py. Un Space de démonstration. Un article. Deux cent dix téléchargements à ce jour cette semaine. Aucune publication de jeu de données. Aucun rapport technique. Aucune configuration de service au-delà d’un exemple à volume unique.

Le contraste ne porte pas sur la taille — il porte sur ce qu’un ingénieur en aval peut faire avec l’artefact. La publication d’Ultra est conçue pour que quelqu’un d’autre puisse reproduire l’entraînement. La publication de NV-Reason-CT est conçue pour que quelqu’un d’autre puisse exécuter l’inférence. Ce sont des promesses différentes.

Un seul d'entre eux repose sur la propre stack de NVIDIA

Voici le détail qui surprend les gens, et il est vérifiable à partir du frontmatter de la fiche du modèle : le modèle de base de NV-Reason-CT est Qwen/Qwen3.5-4B, avec une relation de fine-tuning, et non un checkpoint Nemotron. NVIDIA a greffé un transformer de vision 3D Primus — initialisé à partir des poids COLIPRI — sur un modèle de langage Qwen et a entraîné le couple de bout en bout avec un fine-tuning supervisé, suivi d'une optimisation de politique relative de groupe.

Ce n'est pas une critique et ce n'est pas un scandale. C'est la norme du secteur pour les travaux vision-langage, et NVIDIA le divulgue clairement dans les métadonnées du dépôt. Mais cela signifie que l'hypothèse la plus naturelle à propos de cette confrontation — que NV-Reason-CT est un dérivé de Nemotron — est fausse. Les deux modèles de cette page partagent un logo et une famille de licences, et pratiquement rien d'autre. Aucune architecture commune, aucun tokenizer commun, aucune donnée d'entraînement commune, aucun chemin de service commun.

Taille, dans les chiffres qui décident où il s'exécute

• Paramètres — NV-Reason-CT : 4,69 B au total / 4,35 B actifs dans la voie CT vs Nemotron 3 Ultra : 550 B au total / 55 B actifs, LatentMoE sparse • Checkpoint sur disque — NV-Reason-CT ~10,6 Go en BF16 vs Nemotron 3 Ultra : des centaines de gigaoctets en BF16, publié en plus en NVFP4 • Entrée — NV-Reason-CT : volumes CT NIfTI 3D en unités Hounsfield, thorax ou abdomen uniquement, un préfixe de volume de 13 824 tokens vs Nemotron 3 Ultra : texte, jusqu’à 1 M de tokens de contexte avec une limite de sortie de 65 K • Contexte — NV-Reason-CT : non applicable au sens habituel vs Nemotron 3 Ultra : 1 000 000 de tokens • Licence — les deux sous OpenMDW-1.1 • Matériel — NV-Reason-CT : Ampere / Hopper / Lovelace, testé sur H100 et L40S vs Nemotron 3 Ultra : service multi-GPU à 55 B actifs • Score indépendant — NV-Reason-CT : aucun publié vs Nemotron 3 Ultra : AA Intelligence Index 47,7 NVFP4 / 48,2 en précision complète

A generated scoreboard titled 'NV-Reason-CT vs Nemotron 3 Ultra - the scoreboard'. Left column 'NV-Reason-CT': Parameters 4.69B total / 4.35B active CT pathway; Checkpoint on disk ~10.6 GB BF16; Input 3D NIfTI CT, chest or abdomen; Context one 13,824-token volume prefix; Licence OpenMDW-1.1; Independent score none published. Right column 'Nemotron 3 Ultra': Parameters 550B total / 55B active LatentMoE; Checkpoint on disk hundreds of GB BF16, also NVFP4; Input text, up to 1M tokens; Context 1,000,000 in / 65,000 out; Licence OpenMDW-1.1; Independent score AA Index 47.7 NVFP4 / 48.2 full. A footer reads 'NV-Reason-CT figures from NVIDIA's model card; Nemotron 3 Ultra Intelligence Index per Artificial Analysis.'

La ligne de démarcation pratique est celle de la mémoire. Un modèle de 4,69 B avec un encodeur 3D tient sur une seule carte, et un groupe de recherche peut justifier cela. Un modèle de 550 B au total, avec 55 B actifs, nécessite une véritable infrastructure de service, même quantisé. Ni l’un ni l’autre n’est une expérience de week-end, mais ils se situent à des ordres de grandeur différents pour ce problème.

Deux régimes d’évaluation qui ne peuvent pas être moyennés

Les preuves d'Ultra relèvent de la capacité générale : un indice d'intelligence Artificial Analysis dans la fourchette haute de la quarantaine, une couverture de benchmarks sur le raisonnement, le codage et les tâches agentiques, et des chiffres rapportés par le fournisseur pour la famille, notamment SWE-Bench Verified 71,9, MMLU-Pro 86,8 et LiveCodeBench v6 89,0 — ces trois derniers étant les propres chiffres de NVIDIA et signalés comme tels.

La preuve de NV-Reason-CT tient en un seul tableau. Macro-F1 0,614 et Macro-AUROC 0,871 sur la tâche de classification à 18 labels de CT-RATE, à un seuil uniforme fixe, à l'aide d'une invite directe Oui/Non sans tête de classification, contre VoxelFM à 0,581/0,870, Pillar-0 à 0,544/0,861, ClinFusion-8B à 0,442, CT-CLIP à 0,398/0,733, Merlin à 0,358/0,662 et MedGemma 1.5 à 0,303. Là encore, les chiffres de NVIDIA, sur la fiche du modèle, sans reproduction indépendante à ce jour.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Un AA Intelligence Index de 47,7 et un CT-RATE Macro-F1 de 0,614 ne sont pas deux mesures d'une même chose. Ce sont des mesures de deux choses. Il n'existe aucune manière défendable de dire qu'Ultra est « meilleur » que NV-Reason-CT, et la raison n'est pas une préférence de notation — c'est que les instruments ne se recoupent pas du tout. La seule comparaison honnête dans ce duo est celle de ce pour quoi chaque modèle est accrédité, au sens littéral des preuves existantes qu'il fait son travail.

Pourquoi la sortie discrète est le choix rationnel

Mettez-vous à la place de l’équipe d’imagerie médicale. Vous disposez d’un modèle TDM 3D fonctionnel. Vous voulez que des radiologues, des étudiants en médecine et des chercheurs l’utilisent. Qu’est-ce qu’un keynote vous apporte ?

Un événement de lancement suscite des attentes en matière de support, de feuilles de route et de longévité qu’une équipe de recherche ne peut satisfaire. Il invite à une évaluation généraliste sur des benchmarks où un modèle verrouillé sur une modalité de 4,69 B paraîtra peu impressionnant pour des raisons structurellement non pertinentes. Et il place un modèle qui « ne doit pas être utilisé comme substitut au jugement clinique professionnel » devant un public qui ne lit pas les termes de la licence. Un dépôt, un article et un Space de démonstration atteignent exactement le public qui lit les trois, et ils laissent l’artefact parler à son propre rythme. La chaîne de version est « 0.1 ». La fiche indique : recherche et éducation uniquement. Voilà une sortie conçue pour être citée, pas achetée.

Le lancement d’Ultra est l’inverse et tout aussi rationnel — un produit phare a besoin de distribution, d’une grille tarifaire et du soutien de l’écosystème, c’est pourquoi il s’est accompagné de jeux de données et d’un rapport.

Là où un routeur a sa place, et là où il ne l'a pas

Aucun de ces deux modèles ne figure sur OrcaRouter, et je ne vais pas suggérer le contraire : NV-Reason-CT est un checkpoint de 10,6 Go avec du code de modèle personnalisé que vous hébergez vous-même, et Nemotron 3 Ultra, à 55 B de paramètres actifs, est servi via l’API propre à NVIDIA et plusieurs plateformes tierces.

A screenshot of the Hugging Face model card for NVIDIA Nemotron 3 Ultra, showing the Model Summary block listing 550B total and 55B active parameters, a LatentMoE architecture, 1M context, OpenMDW-1.1 licence and a release date of June 4, 2026, followed by the Model Overview and evaluation rows.

Ce qu'une couche de routage apporte à une équipe qui travaille avec les deux est plus restreint, mais tout de même utile. Un pipeline de recherche clinique qui utilise NV-Reason-CT pour le volume et un modèle généraliste pour le texte environnant a besoin d'un endroit où échanger ce modèle généraliste sans un second contrat, et un point de terminaison compatible OpenAI couvrant plus de 200 modèles avec un basculement automatique entre fournisseurs est cet endroit. Il maintient le spécialiste auto-hébergé et le généraliste hébergé sous une seule clé plutôt que deux intégrations.

Ce qu'il faut retenir de l'accord

Lus comme des concurrents, les deux modèles relèvent d’une erreur de catégorie. Lus comme une étude de cas, ils sont d’une clarté inhabituelle. Même fournisseur, même famille de licences, même année — et deux stratégies de publication choisies pour correspondre à deux intentions en aval complètement différentes. L’un est une infrastructure à laquelle est attaché un écosystème. L’autre est un article auquel sont attachés des poids, publié pour qu’un petit public spécifique puisse l’exécuter et le citer.

Si vous cherchez un modèle généraliste à poids ouverts, NV-Reason-CT n’est pas un candidat et n’a jamais été censé l’être. Si vous lisez des volumes TDM thoraciques et abdominaux par programmation, Nemotron 3 Ultra ne peut pas vous aider et n’a jamais été censé le faire. Le seul vrai point commun entre eux, c’est le logo, et la seule véritable leçon, c’est que NVIDIA est prêt à publier discrètement lorsque le public est assez restreint et technique pour trouver le dépôt sans aide.