Se ha generado una tarjeta hero titulada 'NV-Reason-CT vs Claude Opus 5' con el subtítulo 'Un error de categoría que merece tomarse en serio'. Dos tarjetas enfrentadas están separadas por un par de flechas azules: la tarjeta izquierda lleva la etiqueta 'NV-Reason-CT' con un icono de escaneo corporal y '4,69 mil millones de parámetros - 13.824 tokens por volumen de TC - no es un producto sanitario'; la tarjeta derecha lleva la etiqueta 'Claude Opus 5' con un icono de chip y '1 M de contexto - 128 K de salida - 5 $ / 25 $ por millón de tokens'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

NV-Reason-CT vs Claude Opus 5: Un error de categoría que merece tomarse en serio

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Poner NV-Reason-CT y Claude Opus 5 en la misma frase es un error de categoría, y vale la pena hacerlo de todos modos, porque el error es instructivo. NV-Reason-CT es un modelo nativo de visión-lenguaje 3D de 4,69 mil millones de parámetros de NVIDIA que toma un volumen de TC de tórax o abdomen en unidades Hounsfield y produce un informe estructurado hallazgo por hallazgo. No es un dispositivo médico y su propia tarjeta de modelo lo dice. Claude Opus 5 es el modelo general de frontera de texto y visión del proveedor, lanzado el 24 de julio de 2026, con una ventana de contexto de un millón de tokens, un techo de salida de 128.000 tokens, y una tarifa publicada de cinco dólares por millón de tokens de entrada y veinticinco por millón de salida. Uno de estos lee una TC. El otro lee todo lo demás.

La razón por la que la comparación no deja de hacerse —y se seguirá haciendo cada vez que alguien vea un nuevo VLM médico y recurra a una vara de medir conocida— es que ambos producen prosa sobre una imagen. Esa similitud superficial está causando un daño real en la manera en que las personas razonan sobre los dos, así que vale la pena desentrañarla en detalle.

El eje real que comparten, y el que no.

Se superponen en exactamente un lugar, y es más estrecho de lo que parece.

• Modalidad de entrada — NV-Reason-CT acepta volúmenes NIfTI de un solo canal en unidades Hounsfield mediante un procesador tridimensional dedicado; Claude Opus 5 acepta texto, imágenes y archivos, lo que constituye una interfaz de segunda generación para imágenes y no puede procesar de forma nativa un estudio de TC volumétrico

• Qué devuelve — una lista de hallazgos organizada por región anatómica de NV-Reason-CT, frente a prosa general, JSON estructurado o llamadas a herramientas de Claude Opus 5

• Unidades de trabajo — un volumen de TC, remuestreado a 2 mm isotrópico, recortado a la anatomía, cortado en parches de 8 x 8 x 8; frente a lo que sea que pongas en un presupuesto de tokens

• Contexto — NV-Reason-CT no tiene ninguna ventana de chat; un solo volumen se convierte en 13.824 tokens visuales sin submuestreo. Claude Opus 5 admite 1.000.000 de tokens de entrada y emite hasta 128.000

• Licencia — OpenMDW-1.1, un modelo descargable que ejecutas en tu propio hardware; frente a una API alojada

• Uso declarado — únicamente para investigación y educación, explícitamente no es un dispositivo médico, para NV-Reason-CT; en contra de la asistencia de propósito general para Claude Opus 5

• Precio — sin precio de lista, porque no hay nada que comprar, solo pesos que ejecutar; frente a $5 y $25 por millón de tokens, con lecturas en caché a $0.50

La fila «modalidad en» es donde nace el error de categoría. Ambos aceptan una imagen, así que ambos parecen modelos de imagen, y un lector pregunta razonablemente cuál es mejor con imágenes. Pero un estudio de CT no es una imagen. Es una matriz volumétrica con una escala física en milímetros, una unidad de densidad calibrada y una anatomía que solo significa algo en tres dimensiones. La visión de Claude Opus 5 es genuinamente capaz y discutirá con sensatez una radiografía o un portaobjetos de patología. Esa es una tarea distinta de integrar un cubo de 384 milímetros de valores Hounsfield con una resolución de 2 mm e informar sobre la lobulación de un nódulo.

Qué miden realmente los números de cada lado

Los dos modelos tienen historiales de referencia que no se tocan, y leerlos uno al lado del otro sin darse cuenta de eso es como se toman malas decisiones de compra.

NV-Reason-CT reporta sus resultados en el benchmark público de TC de tórax CT-RATE, en dieciocho etiquetas, usando un umbral uniforme fijo y un prompt directo de sí/no sin cabeza de clasificación y sin adaptación específica a la tarea. Registra un F1 de 0.614 y un AUROC de 0.871, por delante de VoxelFM con 0.581 y 0.870, Pillar-0 con 0.544 y 0.861, ClinFusion-8B con un F1 de 0.442, CT-CLIP con 0.398 y 0.733, Merlin con 0.358 y 0.662, y MedGemma 1.5 con un F1 de 0.303 cuando se le dan hasta 85 cortes axiales. También hay un macro-F1 derivado del informe de 0.592. Cada una de esas cifras proviene del propio artículo de NVIDIA. Ninguna ha sido reproducida por nadie más, y el modelo lleva unas semanas disponible para descargar.

El historial de Claude Opus 5 es de propósito general y en gran medida independiente. Artificial Analysis lo sitúa en 50,8 en su Intelligence Index, 78 en su Coding Index, 93,2 en GPQA Diamond y 54,9 en Humanity's Last Exam, con una puntuación de recuerdo de contexto largo de 79,33. Esas son cifras de terceros sobre tareas generales de razonamiento, código y conocimiento. No hay ningún benchmark de imágenes clínicas en ese conjunto, y no hay ninguna fila de CT-RATE en ningún lugar del historial publicado de Claude Opus 5.

Así que la afirmación honesta no es que uno esté por delante. Es que nadie ha medido nunca los dos modelos en la misma tarea.Cualquier frase de la forma «NV-Reason-CT es mejor que Claude Opus 5 en imagen médica» es irrefutable tal como está escrita, porque nadie ha realizado el experimento. La propia tabla comparativa de NVIDIA no incluye ningún modelo frontera de propósito general.

A generated scoreboard titled 'NV-Reason-CT vs Claude Opus 5 - what each number measures' with two columns. The left column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI volumes in Hounsfield units; output, structured findings by anatomical region; benchmark, CT-RATE 0.614 F1 and 0.871 AUROC over 18 labels; provenance, authors' own paper, unreproduced; licence, OpenMDW-1.1, self-hosted; use, research and education, not a medical device. The right column, headed 'Claude Opus 5', lists six rows: input, text, images, files; output, general prose, JSON, tool calls; benchmark, AA Intelligence 50.8, GPQA Diamond 93.2, HLE 54.9; provenance, independent, Artificial Analysis; licence, hosted API; use, general purpose. A footer reads 'The two benchmark sets share no task, so neither column can be subtracted from the other.'

En qué se equivoca la gente con la pregunta de la interfaz

La única superposición técnica realmente interesante es la que nadie discute: cómo debería ser una interfaz entre un modelo de TC y un modelo de texto.

Un instinto razonable es alimentar a Claude Opus 5 con un conjunto de imágenes de TC o un volumen submuestreado y pedirle que razone. Con 1.000.000 de tokens de contexto, eso suena generoso, y frente a un estudio que solo tiene 13.824 tokens visuales, suena a espacio de sobra. El espacio no es el problema. El pipeline de visión de Claude Opus 5 trata una imagen como una imagen bidimensional con una escala de píxeles. Una TC de tórax presentada de esa manera pierde el espaciado entre cortes que hace medible una lesión y la calibración de densidad que hace que el "vidrio deslustrado" sea un umbral en lugar de una descripción. Puedes darle un montaje de cortes axiales y obtener un párrafo que suena coherente. Lo que no puedes obtener es una medición.

Eso es precisamente aquello a lo que el diseño de NV-Reason-CT dedica su cómputo. La cuadrícula de 24 x 24 x 24 procedente de un volumen de 384 milímetros se entrega al modelo de lenguaje a resolución completa, sin submuestreo espacial ni capa de fusión, y por eso la vía activa tiene 4,35 mil millones de parámetros en lugar de algo mucho más pequeño. La arquitectura es una apuesta a que conservar el detalle espacial compensa el coste en tokens. Es una apuesta sobre la representación, no sobre la capacidad lingüística, y Claude Opus 5 no participa en ella.

El patrón productivo es el aburrido: usa el modelo de CT para la lectura volumétrica y usa un modelo de texto para todo lo demás. Generación y normalización de informes, resúmenes de cohortes, arneses de evaluación, convertir archivos DICOM a NIfTI a escala, priorizar qué estudios debería revisar primero una persona. Eso es trabajo de documentos largos y de código, y es donde un modelo con contexto de 1M justifica su tarifa.

Costo, en dos unidades que no se convierten

Claude Opus 5 se factura por consumo. Cinco dólares por millón de tokens de entrada y veinticinco por millón de salida, las lecturas de caché a cincuenta centavos, las escrituras de caché a diez dólares. Para un pipeline que normaliza un corpus de informes o escribe y reescribe código de evaluación, eso produce una previsión que puedes construir: tokens de entrada, tokens de salida, lecturas en caché y una factura mucho más barata si aciertas con la caché.

NV-Reason-CT no tiene precio. Descargas 4.690 millones de parámetros y pagas en electricidad, horas de GPU y tiempo de ingeniería. No hay una cifra publicada de rendimiento para un estudio completo de 13.824 tokens, y no se ofrece ninguna variante cuantizada, así que el coste por estudio de ejecutarlo es un número que tendrías que medir tú mismo. Eso es normal para pesos de investigación y también es la mayor diferencia práctica entre los dos: uno tiene una tarifa publicada, el otro tiene una factura que no puedes ver hasta que ya la has pagado.

La comparación que realmente importa es por estudio, no por token. Una lectura de TC es una unidad de trabajo. Una pasada de normalización de informe sobre el mismo caso es una tarea de texto medida en miles de tokens. Poner una cifra en dólares a la primera implica conocer tu hardware; ponérsela a la segunda es aritmética.

La trampa en medio de la comparación

Hay un error específico que vale la pena nombrar, porque es el que propicia este emparejamiento. Consiste en tratar NV-Reason-CT como un ajuste fino especializado de un modelo general y, por tanto, asumir que el modelo general estará lo suficientemente cerca en la mayoría de los casos y será mucho más flexible.

No es un ajuste fino. Es un transformer de visión 3D llamado Primus, inicializado a partir de COLIPRI, acoplado a un backbone de lenguaje Qwen3.5-4B con embedding de posición rotatorio multieje 3D, entrenado con aproximadamente 550.000 ejemplos estructurados de preguntas y respuestas extraídos de 70.111 volúmenes de TC en CT-RATE, CancerVerse y una colección interna de los NIH, y luego ajustado con GRPO frente a una recompensa que pondera la F1 del conjunto de anomalías en 2,0, una puntuación de estructura de informe específica de región en 0,5 y una penalización suave por longitud en 1,0. El codificador tridimensional es lo esencial del modelo. Un front-end bidimensional o basado en cortes es un instrumento distinto, y la propia comparación del artículo muestra cuánto vale esa diferencia: MedGemma 1.5 con 0,303 de F1 cuando se le alimenta con hasta 85 cortes axiales, frente a 0,614 del modelo volumétrico nativo.

El error inverso es igual de común y cuesta lo mismo: suponer que, como NV-Reason-CT está especializado, deberías usarlo para todo lo clínico. Solo admite tórax y abdomen, y nada más; su invocación es un archivo NIfTI en lugar de un mensaje de chat, y los términos de su licencia indican que es únicamente para investigación y educación. No leerá un portaobjetos de patología, ni responderá una pregunta sobre una guía clínica, ni escribirá el código que procesa por lotes tu conversión de DICOM. Recurrir a un modelo de CT para hacer trabajo de texto es el mismo error de categoría que recurrir a un modelo de texto para hacer volumetría, solo que apuntando en la dirección opuesta.

A generated scoreboard titled 'The two models, at a glance' listing six paired rows. Row one: parameters, 4.69B total and 4.35B active, against undisclosed. Row two: context, 13,824 visual tokens per volume against 1,000,000 input and 128,000 output tokens. Row three: input, one-channel NIfTI in Hounsfield units against text, images and files. Row four: availability, weights downloadable on Hugging Face against hosted API. Row five: price, self-hosted with no rate card against $5 and $25 per million tokens. Row six: status, unannounced research release against generally available. A footer reads 'NV-Reason-CT figures per the authors paper and model card; Claude Opus 5 figures per the provider rate card and Artificial Analysis.'

Cómo encajan las dos mitades en un solo sistema

Ninguno de los dos modelos reemplaza al otro, y la arquitectura sensata contiene a ambos, lo que plantea la pregunta práctica de cómo llamarlos.

Claude Opus 5 se sirve a través de OrcaRouter como anthropic/claude-opus-5 a la tarifa de lista del proveedor de Anthropic sin ningún recargo, dentro de una única API que cubre más de 200 modelos. Eso importa menos para una sola llamada que para el pipeline que la rodea: cuando la mitad de texto de una implementación clínica es un modelo entre varios candidatos, tenerlos todos detrás de una sola clave significa que puedes compararlos en tu propio corpus sin un segundo contrato ni un cambio de código, y el DSL de enrutamiento te permite enviar solicitudes individuales al modelo que debería gestionarlas, mientras que la conmutación por error automática te cubre cuando un proveedor se degrada.

NV-Reason-CT no está en nuestra plataforma, y ningún modelo de NVIDIA lo está. Son pesos que descargas y ejecutas en tu propio hardware, que es exactamente lo que permite la licencia y, dado que la entrada son datos volumétricos derivados de pacientes, probablemente sea lo que quieras de todos modos. No vamos a dar a entender que enrutamos un modelo que no alojamos. La parte de texto de la compilación es donde somos útiles; la parte volumétrica es donde estás por tu cuenta con un modelo de 4.69B y una GPU.

A screenshot of the OrcaRouter model page for Claude Opus 5, showing the identifier anthropic/claude-opus-5, the description of it as Anthropic's most capable model for complex reasoning and long-horizon agentic work, a side panel listing a 1,000,000-token context window and 128,000 maximum output tokens with text, image and file input and text output, and a stat strip reading $5.00 per million input tokens, $25.00 per million output tokens, and a p50 time to first token under four seconds.

El veredicto que resiste el escrutinio

Si necesita que un volumen de CT se lea y se convierta en hallazgos estructurados, hay un modelo para eso: proviene del grupo de investigación de NVIDIA y es una descarga en lugar de una llamada a la API. Si necesita normalizar un corpus de informes, escribir un arnés de evaluación, programar una tarea de conversión de DICOM o resumir una cohorte, también hay un modelo para eso, y tiene una tabla de tarifas.

La línea que hay que sostener es que no se ha demostrado que ninguno sea mejor que el otro en nada, porque el experimento no se ha llevado a cabo. Lo que sí se ha demostrado es que una interfaz tridimensional nativa supera a una basada en cortes en un benchmark público de TC de tórax por un margen que los autores sitúan en unos tres puntos F1, y que un modelo general de frontera se mide de forma independiente a la cabeza del campo en razonamiento, código y trabajo de contexto largo. Son dos afirmaciones sobre dos trabajos diferentes. Leerlas como una clasificación es el error de categoría, y sigue en pie justo hasta que alguien publique la comparación directa que nadie ha publicado todavía.