Una tarjeta principal generada titulada 'NV-Reason-CT vs Gemini 3.1 Pro' con el subtítulo 'La superficie de entrada más amplia, y aun así no es un lector de CT'. Dos tarjetas enfrentadas están separadas por un par de flechas azules: la tarjeta izquierda está etiquetada como 'NV-Reason-CT' con un icono de escaneo corporal y 'solo tórax y abdomen - 13,824 tokens visuales por volumen - OpenMDW-1.1'; la tarjeta derecha está etiquetada como 'Gemini 3.1 Pro' con un icono de chip y 'entrada de audio, vídeo, imagen, archivo y texto - contexto de 1M - nivel de vista previa'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

NV-Reason-CT vs Gemini 3.1 Pro: la superficie de entrada más amplia, y sigue sin ser un lector de CT

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Noventa y cuatro por ciento. Esa es la tasa de error que nuestro propio catálogo registra actualmente para una ruta que sirve a Gemini 3.1 Pro — 93,93 %, junto con una mediana del tiempo hasta el primer token que se lee como un tope de diez segundos y una cifra de rendimiento de 978 tokens por segundo. Lee eso como una declaración sobre el modelo y sacarás exactamente la conclusión equivocada. Léelo como una declaración sobre un nivel de vista previa bajo carga y se convierte en lo más útil de la página, porque es lo que realmente experimenta un pipeline clínico cuando depende de una ruta que no se ha aprovisionado para el tráfico de producción.

El modelo del otro lado de esta comparación no tiene ese problema ni esa medición. NV-Reason-CT es el razonador nativo de TC 3D de NVIDIA, con 4.69 mil millones de parámetros, descargable bajo OpenMDW-1.1, sin ninguna cifra de rendimiento publicada y sin alojamiento en ninguna parte. Así que un lado de este enfrentamiento te ofrece la superficie de entrada más amplia del sector, con un perfil de disponibilidad en torno al cual tienes que diseñar; el otro te ofrece una única capacidad concreta, con una latencia que tienes que medir tú mismo. Ninguno cuenta con un panel de monitoreo en el que puedas confiar desde el primer día, y por razones opuestas.

Dos modelos, dos definiciones de «multimodal»

La palabra hace mucho trabajo en ambas descripciones de producto, y casi nada de ese trabajo se comparte.

• Entradas aceptadas — Gemini 3.1 Pro acepta texto, imágenes, audio, video y archivos; NV-Reason-CT acepta un volumen NIfTI de un solo canal en unidades Hounsfield, y nada más

• Qué significa "3D" — NV-Reason-CT remuestrea a 2 mm isotrópicos sobre un cubo de 384 milímetros y lo corta en parches de 8 x 8 x 8 para una cuadrícula de 24 x 24 x 24; la entrada de video de Gemini 3.1 Pro es una secuencia de fotogramas bidimensionales con una línea de tiempo

• Contexto — 1.048.576 tokens de entrada y 65.536 de salida para Gemini 3.1 Pro; un volumen es 13.824 tokens visuales para NV-Reason-CT, sin submuestreo ni capa de fusión, y no hay ninguna ventana de chat a su alrededor

• Lanzamiento — 19 de febrero de 2026 para Gemini 3.1 Pro, en un slug de vista previa; un lanzamiento de investigación no anunciado para NV-Reason-CT, con actividad en el repositorio fechada del 2 al 25 de septiembre de 2026

• Precio — $2 y $12 por millón de tokens hasta 200.000 tokens, luego $4 y $18, con lecturas de caché a $0,20 y escrituras de caché a $0,375; frente a pesos autoalojados sin tarifa

• Capacidades — visión, audio, uso de herramientas, salida JSON y razonamiento para Gemini 3.1 Pro; hallazgos estructurados por región anatómica para NV-Reason-CT, sin herramientas

• Licencia y estado — una API de vista previa alojada; frente a pesos OpenMDW-1.1 cuya ficha de modelo indica únicamente investigación y educación y declara claramente que no es un dispositivo médico

Una entrada de video y una entrada de TC volumétrica parecen adyacentes a distancia y no podrían estar más separadas de cerca. El video son fotogramas a lo largo del tiempo. Un estudio de TC es un único volumen estático con tres ejes espaciales, una escala física en milímetros y una unidad de densidad calibrada, donde lo que se mide es la densidad de una estructura cuyo tamaño importa. Gemini 3.1 Pro observará una grabación quirúrgica y describirá lo que sucedió. No medirá un nódulo. Eso no es una limitación que Google no haya abordado; es un problema diferente que nadie ha resuelto con un modelo general.

Qué cubren los dos registros de benchmark y qué dejan fuera

Gemini 3.1 Pro tiene un historial independiente y es bueno en los ejes que mide.

• GPQA Diamond — 94,1, la cifra más alta de todo este conjunto de artículos

• Humanity's Last Exam — 47, con una puntuación de recuperación de contexto largo de 82, de nuevo la más alta de esta comparación

• IFBench y SciCode — 77,14 y 58,7

• τ²-Bench — 95,61, con tau_banking en 21,44 y Terminal-Bench Hard en 53,79

• Inteligencia y programación de Artificial Analysis — 29,7 y 68,8

• Latencia medida — una mediana de diez segundos hasta el primer token, que parece ser un límite máximo más que una mediana real, a 978 tokens por segundo y una tasa de error del 93,93%

Observa la forma de eso: un perfil de conocimiento y contexto largo en la parte superior de la comparación, un índice de inteligencia en la parte media-baja, y una medición de disponibilidad que es inutilizable. Los tres describen el mismo modelo en la misma ruta. Un GPQA Diamond alto significa que sabe mucho. Una puntuación compuesta de 29.7 significa que no lidera en todo. Una tasa de error del 93.93% significa que, en esta ruta en particular, la mayoría de tus solicitudes no se completarán — y eso es casi con certeza un hecho de capacidad y aprovisionamiento sobre un endpoint de vista previa en lugar de una propiedad de los pesos. No podemos probar cuál desde fuera. Lo que sí podemos decir es que ninguno de esos tres números es un error tipográfico y cualquier arquitectura que lea solo el primero va a tener una mala semana.

El historial de NV-Reason-CT es más limitado y conlleva una salvedad distinta. Sus 0,614 de F1 y 0,871 de AUROC en CT-RATE, en dieciocho etiquetas con un umbral uniforme fijo y un prompt directo de sí/no, y sin cabeza de clasificación ni adaptación específica para la tarea, son cifras de la propia NVIDIA procedentes del artículo de la propia NVIDIA. El conjunto de comparación que las respalda —VoxelFM con 0,581, Pillar-0 con 0,544, ClinFusion-8B con 0,442, CT-CLIP con 0,398, Merlin con 0,358, MedGemma 1.5 con 0,303— contiene únicamente modelos de imagen. No aparece ningún modelo multimodal general, lo que significa que la pregunta «cómo le iría a Gemini 3.1 Pro en CT-RATE» no se ha planteado, y mucho menos respondido.

A generated scoreboard titled 'Breadth on one side, depth on the other' with two columns. The left column, headed 'Gemini 3.1 Pro', lists six rows: inputs, text, image, audio, video, file; context, 1,048,576 in and 65,536 out; GPQA Diamond 94.1; AA Intelligence 29.7; route reliability, 93.93% measured error rate; price, $2 and $12 per million tokens, doubling past 200k. The right column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI in Hounsfield units; context, 13,824 visual tokens per volume, no chat window; CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; route reliability, not applicable, self-hosted; price, no rate card, no published throughput. A footer reads 'The 93.93% error rate describes a preview route under load, not the quality of the weights.'

El problema del nivel de vista previa, planteado correctamente

Esta es la parte de la comparación que no tiene nada que ver con la TC y sí todo que ver con llevar a cabo cualquier cosa clínica.

Una tasa de error del 93,93% no es una degradación sutil. Es una ruta en la que falla la inmensa mayoría de las llamadas. La reacción natural es declarar el modelo inutilizable, y esa reacción es errónea por dos razones. Primero, una tasa de error medida en un endpoint de vista previa refleja capacidad, cuota y enrutamiento regional, no la capacidad del modelo. Los niveles de vista previa de Google son famosos por estar aprovisionados para evaluación en lugar de producción, y un slug con nombre de vista previa es un slug que puede ser limitado sin previo aviso. Segundo, la medición es una instantánea de una ruta en un momento. Cambiará. Lo que no cambiará es la lección: una dependencia de una ruta de vista previa es una dependencia de una decisión de capacidad que toma otra persona.

Las mitigaciones no tienen nada de glamorosas y son la razón misma de que el enrutamiento exista como disciplina en lugar de como una mera conveniencia.

• Nunca codifiques de forma rígida un slug de vista previa en una ruta de producción — pon la capacidad detrás de una interfaz para que el modelo que hay detrás se pueda intercambiar sin necesidad de un despliegue

• Reintentar y recurrir a otro proveedor o a otro modelo — para un trabajo de extracción por lotes, una tasa de fallos del 94 % es supervivible si los fallos se redirigen a otra parte y fatal si no lo hacen

• Mide tu propia tasa de error en lugar de heredar una — la cifra del 93,93 % es el número de nuestro catálogo para una ruta, y la tuya dependerá de tu región, tu volumen y la forma de tu carga de trabajo

• Mantén un segundo modelo preparado para cualquier cosa con un plazo clínico — el modo de fallo contra el que te proteges no es una mala respuesta, sino ninguna respuesta

La misma disciplina se aplica a la inversa en el lado CT, donde no hay ruta alguna. Un modelo autoalojado no tiene una tasa de error de proveedor; tiene una tasa de error de hardware, una carga de mantenimiento y un techo de capacidad fijado por cuántas GPU compraste. El modo de fallo es una cola, y la mitigación es la planificación en lugar de la conmutación por error. Problema distinto, misma regla: saber de qué número dependes en realidad.

Dónde un contexto largo ayuda de verdad, y dónde no

La ventana de 1.048.576 tokens de Gemini 3.1 Pro y su puntuación de 82 puntos en recuerdo de contexto largo son ventajas reales que merece la pena aprovechar de forma deliberada y no accidental.

El punto donde rinden frutos en un programa de TC no es la exploración. Es todo lo que la rodea. Una única pasada de extracción sobre una nota operatoria extensa y sus informes asociados, manteniendo todo el documento en contexto para que los campos sean coherentes entre sí. Un resumen de cohorte que tiene que sostener cientos de narrativas de pacientes a la vez para encontrar el patrón que las atraviesa. Un trabajo de conversión en el que el esquema, cien registros de ejemplo y el registro de errores deben estar visibles en la misma llamada. Esos son trabajos en los que una ventana larga cambia la respuesta, no solo la comodidad.

El punto en el que no ayuda es la propia exploración, y vale la pena enunciar la razón con precisión porque es el error que invita esta comparación. Una TC de tórax representada tal como la representa NV-Reason-CT cuesta 13.824 tokens. Gemini 3.1 Pro podría albergar setenta estudios así dentro de su ventana con espacio de sobra. La restricción no es el espacio. Es que la vía de visión de Gemini 3.1 Pro trata una imagen como una fotografía con una escala de píxeles, de modo que un estudio presentado así ha perdido el espaciado entre cortes y la calibración de densidad antes de que se emita el primer token. Se puede gastar un millón de tokens en un volumen y aun así no tener un volumen. La propia comparación del artículo hace concreto el costo de eso: MedGemma 1.5 con 0,303 de F1 cuando se le alimentan hasta 85 cortes axiales, frente a 0,614 del modelo volumétrico nativo, lo que supone una diferencia de aproximadamente el doble.

Dónde encajamos, y lo único que no diremos

Gemini 3.1 Pro se sirve a través de OrcaRouter como google/gemini-3.1-pro-preview a la tarifa de lista del proveedor sin margen adicional, dentro de una única API que cubre más de 200 modelos. Para un modelo que actualmente se encuentra en un nivel de vista previa, esa combinación es más útil de lo que parece. Sin margen adicional significa que un cambio de tarifa del proveedor llega a nuestro lado el mismo día en lugar de ser absorbido por una capa intermedia que mantiene un número antiguo. La conmutación automática por error significa que una ruta que empieza a fallar no arrastra consigo un lote — lo cual, dado un índice de error medido en los noventa en una ruta, no es algo hipotético. Y un DSL de enrutamiento para enviar solicitudes individuales al modelo que debería gestionarlas te permite asignar el trabajo de contexto largo a un modelo y el trabajo masivo y económico a otro sin mantener dos integraciones.

NV-Reason-CT no está en nuestra plataforma. Ningún modelo de NVIDIA lo está. Son pesos que descargas y ejecutas tú mismo, y el planteamiento honesto es que las dos mitades de esta arquitectura viven en lugares completamente distintos: una detrás de una API con una tarifa y un riesgo de versión preliminar, la otra en tu propio hardware con una licencia OpenMDW-1.1 y una cifra de rendimiento que tienes que producir tú mismo.

A generated scoreboard titled 'What each side gives you, and what it costs' listing five paired rows. Row one: widest input surface, audio, video, image and file against text only, one modality at a time. Row two: longest context, 1,048,576 tokens in against 13,824 tokens per volume. Row three: highest benchmark, GPQA Diamond 94.1 against CT-RATE F1 0.614. Row four: weakest measured figure, a 93.93% route error rate against no published throughput at all. Row five: dependency, a hosted preview tier against your own GPUs. A footer reads 'Both sides carry a number nobody should build on without measuring it themselves.'A screenshot of the OrcaRouter model page for Gemini 3.1 Pro, showing the identifier google/gemini-3.1-pro-preview with tags for Vision, Audio, Video, Tools, JSON and Reasoning, the description of it as a multimodal model accepting text, image, audio, video and file input, and a side panel listing a 1,048,576-token context window with up to 65,536 output tokens. A stat strip reads $2.00 per million input tokens, $12.00 per million output tokens, a median time to first token, and an error rate of 93.93 percent.

La decisión que sobrevive al contacto con la producción

Si tu problema es la comprensión de texto, audio, video o documentos en contexto largo, Gemini 3.1 Pro está medido de forma independiente a la cabeza del campo en conocimiento y recuperación, y lo único que se interpone entre él y una pipeline de producción es la fiabilidad de las rutas, que es un problema de ingeniería que se puede resolver, no un problema del modelo. Ponlo detrás de una conmutación por error, no fijes en el código el slug de vista previa y mide tu propia tasa de error en lugar de confiar en la de nadie, incluida la nuestra.

Si tu problema es un volumen de TC de tórax o abdomen, en esta comparación hay exactamente un modelo abierto que puede abordarlo; no es el que tiene la ventana de un millón de tokens, y el número que debería regir tu planificación no es su puntuación F1. Es la latencia por estudio que nadie ha publicado. Mídela antes de prometer a alguien una cifra de rendimiento.

Vale la pena hacer la comparación porque separa dos cosas que se confunden constantemente: la amplitud de la entrada y la profundidad de la representación. Gemini 3.1 Pro tiene la superficie de entrada más amplia que se haya lanzado y la mejor memoria de contexto largo de este conjunto, y aun así no puede leer un estudio de CT como un estudio de CT. NV-Reason-CT puede leer uno y nada más. Una pipeline necesita ambos, los necesita en infraestructuras diferentes y necesita saber cuál de los dos números de cada lado es el que te avisará a las tres de la mañana.