Una tarjeta hero generada titulada 'NV-Reason-CT vs Nemotron 3 Ultra' con el subtítulo 'Un logo, dos filosofías de lanzamiento'. Tres chips se distribuyen a lo largo de la parte inferior: '4,69B vs 550B en total / 55B activos', '~10,6 GB BF16 vs cientos de GB' y 'Publicado el 8 de septiembre vs el 4 de junio de 2026'. El logotipo de OrcaRouter está compuesto en la parte inferior derecha.
Guides & Insights

NV-Reason-CT vs Nemotron 3 Ultra: un logotipo, dos filosofías de lanzamiento

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

NVIDIA lanzó dos modelos de pesos abiertos este año y no le dijo a nadie nada sobre uno de ellos. Nemotron 3 Ultra llegó a Hugging Face el 4 de junio de 2026 como un buque insignia de 550B en total y 55B activos, con un informe técnico, un régimen de licencia OpenMDW-1.1 y todo un lanzamiento de conjuntos de datos abiertos de preentrenamiento y postentrenamiento que lo respaldaba. NV-Reason-CT llegó el 8 de septiembre de 2026 como un especialista en CT de 4,69B parámetros con un repositorio, un Space de demostración y un preprint de arXiv dos semanas después que menciona el lanzamiento en un bloque de citas. No hubo ningún anuncio para el segundo. Compáralos y en realidad no estás comparando capacidades — un buque insignia general de 550B y un especialista médico de 4,69B no se solapan. Estás comparando dos teorías distintas de cómo lanzar un modelo, ambas puestas en práctica por la misma empresa, con tres meses de diferencia.

Lo que realmente contiene cada repositorio

El lanzamiento de Nemotron 3 Ultra es un pipeline abierto completo. El checkpoint NVFP4 en Hugging Face ha atraído 249,746 descargas y 338 me gusta; la variante BF16, el checkpoint base y los conjuntos de datos de post-entrenamiento se publican junto a él. Es de doce idiomas, solo texto, está construido sobre un híbrido Mamba2-Transformer con mezcla latente de expertos y predicción multi-token, y cuenta con la licencia openmdw-1.1. Artificial Analysis lo sitúa en un Intelligence Index de 47.7 en la precisión NVFP4 distribuida y 48.2 en precisión completa —el más alto de cualquier modelo estadounidense de pesos abiertos, según ese ranking. Nuestra cobertura anterior de los modelos profesor Nemotron registra el precio medio del proveedor en aproximadamente $0.60 por millón de tokens de entrada y $2.60 por millón de salida, y la cifra de rendimiento de NVIDIA de 183 tokens de salida por segundo en mediciones de terceros.

NV-Reason-CT es un artefacto mucho más pequeño y mucho más cerrado. Diez coma seis gigabytes de pesos BF16, un model.py de 10 KB, un processor.py de 26 KB, una plantilla de chat y un inference.py. Un Space de demostración. Un artículo. Doscientas diez descargas a fecha de esta semana. Sin publicación de conjunto de datos. Sin informe técnico. Sin configuración de servicio más allá de un ejemplo de un solo volumen.

El contraste no se trata del tamaño — se trata de lo que un ingeniero downstream puede hacer con el artefacto. El lanzamiento de Ultra está diseñado para que otra persona pueda reproducir el entrenamiento. El lanzamiento de NV-Reason-CT está diseñado para que otra persona pueda ejecutar la inferencia. Son promesas diferentes.

Solo uno de ellos está construido sobre el propio stack de NVIDIA

Aquí está el detalle que sorprende a la gente, y es verificable a partir del frontmatter de la tarjeta del modelo: el modelo base de NV-Reason-CT es Qwen/Qwen3.5-4B, con una relación de ajuste fino, no un checkpoint de Nemotron. NVIDIA acopló un transformador de visión 3D Primus —inicializado a partir de los pesos de COLIPRI— a un modelo de lenguaje Qwen y entrenó el par de extremo a extremo con ajuste fino supervisado seguido de optimización de política relativa de grupo.

Eso no es una crítica y no es un escándalo. Es la norma de la industria para el trabajo de visión y lenguaje, y NVIDIA lo divulga claramente en los metadatos del repositorio. Pero sí significa que la suposición más natural sobre esta comparación —que NV-Reason-CT es un derivado de Nemotron— es falsa. Los dos modelos de esta página comparten un logotipo y una familia de licencias, y esencialmente nada más. No comparten arquitectura, ni tokenizador, ni datos de entrenamiento, ni ruta de servicio.

Tamaño, en los números que deciden dónde se ejecuta

• Parámetros — NV-Reason-CT: 4,69 B en total / 4,35 B activos en la ruta de TC frente a Nemotron 3 Ultra: 550 B en total / 55 B activos con LatentMoE disperso • Checkpoint en disco — NV-Reason-CT ~10,6 GB en BF16 frente a Nemotron 3 Ultra: cientos de gigabytes en BF16, publicado además en NVFP4 • Entrada — NV-Reason-CT: volúmenes de TC NIfTI 3D en unidades Hounsfield, solo de tórax o abdomen, un prefijo de volumen de 13.824 tokens frente a Nemotron 3 Ultra: texto, hasta 1 M de tokens de contexto con un límite de salida de 65 K • Contexto — NV-Reason-CT: no aplicable en el sentido habitual frente a Nemotron 3 Ultra: 1.000.000 de tokens • Licencia — OpenMDW-1.1 para ambos • Hardware — NV-Reason-CT: Ampere / Hopper / Lovelace, probado en H100 y L40S frente a Nemotron 3 Ultra: servicio con múltiples GPU a 55 B activos • Puntuación independiente — NV-Reason-CT: ninguna publicada frente a Nemotron 3 Ultra: AA Intelligence Index 47,7 NVFP4 / 48,2 en precisión completa

A generated scoreboard titled 'NV-Reason-CT vs Nemotron 3 Ultra - the scoreboard'. Left column 'NV-Reason-CT': Parameters 4.69B total / 4.35B active CT pathway; Checkpoint on disk ~10.6 GB BF16; Input 3D NIfTI CT, chest or abdomen; Context one 13,824-token volume prefix; Licence OpenMDW-1.1; Independent score none published. Right column 'Nemotron 3 Ultra': Parameters 550B total / 55B active LatentMoE; Checkpoint on disk hundreds of GB BF16, also NVFP4; Input text, up to 1M tokens; Context 1,000,000 in / 65,000 out; Licence OpenMDW-1.1; Independent score AA Index 47.7 NVFP4 / 48.2 full. A footer reads 'NV-Reason-CT figures from NVIDIA's model card; Nemotron 3 Ultra Intelligence Index per Artificial Analysis.'

La línea práctica es la de la memoria. Un modelo de 4.69B con un codificador 3D cabe en una sola tarjeta y un grupo de investigación puede justificarlo. Un modelo de 550B en total con 55B activos necesita infraestructura de servicio real incluso cuantizado. Ninguno es un experimento de fin de semana, pero están en órdenes distintos de ese problema.

Dos regímenes de evaluación que no pueden promediarse

La evidencia de Ultra es su capacidad general: un Artificial Analysis Intelligence Index en la parte alta de los cuarenta, cobertura de benchmarks en tareas de razonamiento, programación y agentes, y cifras reportadas por el proveedor para la familia, incluidas SWE-Bench Verified 71.9, MMLU-Pro 86.8 y LiveCodeBench v6 89.0 —siendo esas tres últimas cifras propias de NVIDIA y etiquetadas como tales.

La evidencia de NV-Reason-CT es una tabla. Macro-F1 0.614 y Macro-AUROC 0.871 en la tarea de clasificación de 18 etiquetas de CT-RATE, con un umbral uniforme fijo, usando un prompt directo de Sí/No sin cabeza de clasificación, frente a VoxelFM con 0.581/0.870, Pillar-0 con 0.544/0.861, ClinFusion-8B con 0.442, CT-CLIP con 0.398/0.733, Merlin con 0.358/0.662 y MedGemma 1.5 con 0.303. Otra vez los números de NVIDIA, en la ficha del modelo, sin reproducción independiente todavía.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Un AA Intelligence Index de 47,7 y un CT-RATE Macro-F1 de 0,614 no son dos mediciones de una misma cosa. Son mediciones de dos cosas. No hay ninguna forma defendible de decir que Ultra es "mejor" que NV-Reason-CT, y la razón no es una preferencia de puntuación: es que los instrumentos no se superponen en absoluto. La única comparación honesta en este emparejamiento es la de para qué está acreditado cada modelo, en el sentido literal de qué evidencia existe de que hace su trabajo.

Por qué el lanzamiento discreto es la opción racional

Ponte en el lugar del equipo de imagen médica. Tienes un modelo 3D de TC que funciona. Quieres que radiólogos, estudiantes de medicina e investigadores lo utilicen. ¿Qué te aporta un keynote?

Un evento de lanzamiento genera expectativas sobre soporte, hojas de ruta y longevidad que un equipo de investigación no puede cumplir. Invita a una evaluación de propósito general en benchmarks donde un modelo de 4.69B bloqueado a una única modalidad parecerá poco impresionante por razones estructuralmente irrelevantes. Y pone un modelo que explícitamente «no debe usarse como sustituto del juicio clínico profesional» frente a un público que no lee los términos de la licencia. Un repositorio, un artículo y un Space de demostración llegan exactamente al público que lee los tres, y dejan que el artefacto hable a su propio ritmo. La cadena de versión es "0.1". La tarjeta dice únicamente investigación y educación. Eso es un lanzamiento diseñado para ser citado, no comprado.

El lanzamiento de Ultra es lo opuesto y es igualmente racional: un producto insignia necesita distribución, una tabla de tarifas y respaldo del ecosistema, y por eso vino con conjuntos de datos y un informe.

Dónde encaja un router, y dónde no

Ninguno de estos modelos está en OrcaRouter, y no voy a sugerir lo contrario: NV-Reason-CT es un checkpoint de 10.6 GB con código de modelo personalizado que alojas tú mismo, y Nemotron 3 Ultra, con 55B activos, se sirve a través de la propia API de NVIDIA y varias plataformas de terceros.

A screenshot of the Hugging Face model card for NVIDIA Nemotron 3 Ultra, showing the Model Summary block listing 550B total and 55B active parameters, a LatentMoE architecture, 1M context, OpenMDW-1.1 licence and a release date of June 4, 2026, followed by the Model Overview and evaluation rows.

Lo que una capa de enrutamiento hace por un equipo que trabaja con ambos es más acotado y aun así útil. Una canalización de investigación clínica que usa NV-Reason-CT para el volumen y un modelo general para el texto circundante necesita un lugar donde intercambiar ese modelo general sin un segundo contrato, y un único endpoint compatible con OpenAI que cubre más de 200 modelos con conmutación por error automática entre proveedores es ese lugar. Mantiene al especialista autoalojado y al generalista alojado bajo una sola clave en lugar de dos integraciones.

Qué sacar del emparejamiento

Leídos como competidores, los dos modelos son un error de categoría. Leídos como un caso de estudio, son inusualmente claros. Mismo proveedor, misma familia de licencias, mismo año — y dos estrategias de lanzamiento elegidas para coincidir con dos intenciones posteriores completamente diferentes. Uno es infraestructura con un ecosistema adjunto. El otro es un paper con pesos adjuntos, publicado para que un público pequeño y específico pueda ejecutarlo y citarlo.

Si buscas un modelo general de pesos abiertos, NV-Reason-CT no es un candidato y nunca pretendió serlo. Si lees volúmenes de TC de tórax y abdomen de forma programática, Nemotron 3 Ultra no puede ayudarte y nunca pretendió hacerlo. La única superposición real entre ellos es el logotipo, y la única lección real es que NVIDIA está dispuesta a lanzar discretamente cuando la audiencia es lo bastante pequeña y técnica como para encontrar el repositorio por su cuenta.