Una tarjeta hero generada titulada 'NV-Reason-CT vs GPT-5.6 Sol' con el subtítulo '13,824 tokens visuales antes de que escribas una palabra'. Tres chips recorren la parte inferior: 'especialista en CT de 4.69B vs no revelado', 'NIfTI 3D de entrada, hallazgos de salida', y 'Sol: 1,050,000 de entrada / 128,000 de salida'. El logotipo de OrcaRouter está compuesto en la parte inferior derecha.
Guides & Insights

NV-Reason-CT GPT-5.6 Sol: 13.824 tokens visuales antes de que escribas una palabra

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Cada TAC de tórax que envías a NV-Reason-CT cuesta 13.824 tokens visuales antes de que empiece el prompt. Eso no es una peculiaridad ni una decisión de ajuste: es todo el diseño. El codificador nativo de visión 3D del modelo toma un volumen de 384×384×384 mm y lo convierte en una cuadrícula de 24×24×24, y la ficha del modelo dice explícitamente que los 13.824 tokens y sus coordenadas tridimensionales llegan al modelo de lenguaje "sin submuestreo espacial". Compáralo con lo que probablemente ya estás pagando. GPT-5.6 Sol acepta texto, imágenes y archivos, y una imagen que se le envía es una imagen 2D: un corte, una captura de pantalla de un visor de DICOM, una figura radiológica pegada desde un PDF. Uno de estos modelos tiene una vía volumétrica. El otro tiene una ventana de contexto. La mayoría de las comparaciones entre ellos colapsan en esa distinción, y el colapso es la parte interesante.

El lanzamiento que nadie anunció

NVIDIA no ha publicado ni una palabra sobre NV-Reason-CT en su sala de prensa. No hay una publicación de lanzamiento, ni una diapositiva de la presentación principal, ni un comunicado de prensa. Lo que existe es un repositorio de Hugging Face creado el 8 de septiembre de 2026, un repositorio de GitHub bajo la organización NVIDIA-Medtech creado el 2 de septiembre, un Space de demostración de Gradio, y un preprint de arXiv — NV-Reason-CT: modelo de lenguaje visual 3D para análisis de CT — enviado el 23 de septiembre de 2026 por un equipo de dieciséis autores de NVIDIA con coautores en los NIH y la Universidad de Zúrich.

Ese es un patrón real, y vale la pena nombrarlo con precisión en lugar de tratarlo como un misterio. El grupo de imágenes médicas de NVIDIA publica los pesos de forma discreta y deja que el artículo y el repositorio hagan el anuncio. El predecesor, NV-Reason-CXR-3B, salió en octubre de 2025 de la misma manera. La diferencia aquí es la escala: es la primera vez que ese grupo extiende la receta de radiografías 2D a volúmenes 3D nativos, y el artículo tiene solo dos días.

Lo que se puede saber del repositorio: arquitectura, licencia, datos de entrenamiento, la tabla de benchmarks. Lo que aún no se ha confirmado: si NVIDIA pretende que esto sea una línea de producto con soporte, si vendrán más checkpoints y cómo se sostiene ante la evaluación de terceros que no sean los autores. El repositorio está en la versión 0.1 y se describe a sí mismo como solo para investigación y educación.

Lo que cada modelo acepta realmente

Aquí es donde un cara a cara se vuelve honesto enseguida. Los dos modelos no comparten una superficie de entrada.

NV-Reason-CT lee volúmenes NIfTI — .nii o .nii.gz — con intensidades de vóxel en unidades Hounsfield. Recorta automáticamente a la región torácica o abdominal usando unidades Hounsfield pulmonares y una heurística de morfología 3D, remuestrea a una resolución isotrópica de 2 mm y solo acepta "chest" o "abdomen" como valores de anatomía. Genera texto: un informe estructurado, una respuesta o un rastro de razonamiento paso a paso, con un interruptor para desactivar el razonamiento y obtener respuestas breves.

GPT-5.6 Sol lee texto, imágenes y archivos, con una ventana de contexto de 1.050.000 tokens y hasta 128.000 tokens de salida en una sola respuesta. No tiene codificador volumétrico. Dale un TC y primero tendrás que decidir cómo aplanar unos trescientos cortes en algo que un codificador de imágenes 2D acepte: un montaje, un puñado de cortes clave, una proyección de máxima intensidad renderizada. Cada una de esas decisiones descarta las relaciones espaciales que la vía 3D fue diseñada para preservar.

Así que el planteamiento honesto no es «qué modelo es más inteligente». Es que la vía de imágenes de Sol y la vía 3D de NV-Reason-CT responden a preguntas diferentes. Sol puede razonar sobre la descripción que hace un radiólogo de una exploración. NV-Reason-CT puede razonar sobre la exploración.

Existe un benchmark, y solo uno de ellos tiene un número.

NV-Reason-CT reporta Macro-F1 0.614 y Macro-AUROC 0.871 en la tarea de clasificación de 18 etiquetas de CT-RATE, usando un prompt directo de Sí/No sin cabeza de clasificación y sin adaptación específica a la tarea. Esos son los propios números de los autores de la tarjeta del modelo, y la fila de comparación es la parte útil: VoxelFM con 0.581 Macro-F1, Pillar-0 con 0.544, ClinFusion-8B con 0.442, CT-CLIP con 0.398, Merlin con 0.358, MedGemma 1.5 con 0.303. Con el mismo umbral uniforme fijo, un modelo generativo 3D supera a las líneas base de preentrenamiento contrastivo 3D y al modelo de frontera basado en cortes.

Un número en esa tabla merece escepticismo en lugar de repetición: la diferencia de AUROC. NV-Reason-CT reporta 0.871 frente al 0.870 de VoxelFM. Una milésima de punto, en una evaluación realizada por el proveedor, no es una victoria — es un empate dentro del ruido que pueda contener la evaluación. La diferencia de Macro-F1 de 0.033 es la afirmación fundamentada.

GPT-5.6 Sol no tiene un número CT-RATE porque CT-RATE no es un benchmark sobre el que se pueda ejecutar. Tiene un Artificial Analysis Intelligence Index de 47, una puntuación de 94.1 en GPQA Diamond medida por AA, y una puntuación de 49.5 en Humanity's Last Exam — todos instrumentos de razonamiento general. Poner 0.614 Macro-F1 junto a 47 en el AA Index sería aritmética con dos reglas diferentes. No voy a hacerlo, y deberías desconfiar de cualquiera que lo haga.

Trazas de razonamiento, dos productos diferentes

Ambos modelos emiten razonamiento. Ese es el único solapamiento filosófico genuino, y la diferencia es instructiva.

GPT-5.6 Sol expone un esfuerzo de razonamiento configurable, de modo que intercambias latencia y coste por profundidad en cada solicitud, y puedes solicitar que se devuelva el razonamiento mediante include_reasoning. Es una capacidad general que se aplica a lo que le envíes.

El razonamiento de NV-Reason-CT es deliberadamente acotado. El corpus de entrenamiento consta de aproximadamente 550.000 ejemplos estructurados de preguntas y respuestas (QA) extraídos de 70.111 volúmenes de TC únicos, y una parte de él es razonamiento redactado por radiólogos, recopilado a partir de interpretaciones expertas grabadas y transcritas. La etapa de GRPO que sigue al SFT utiliza recompensas verificables sobre conjuntos de anomalías torácicas y abdominales, lo que significa que la señal de recompensa se basa en si un hallazgo declarado está realmente presente en el volumen, no en si la prosa se lee bien. La ficha del modelo describe la salida como «observaciones revisables, diagnósticos diferenciales e incertidumbre», y lleva una advertencia explícita de que el razonamiento generado «no se garantiza que represente el cálculo interno del modelo». Esa advertencia cumple una función real. Es la diferencia entre una traza que puedes contrastar con los datos y una traza que solo puedes admirar.

El tamaño y la licencia, en una sola pasada.

• Parámetros — NV-Reason-CT 4.69B totales / 4.35B activos en la vía de TC, a partir de un modelo base Qwen3.5-4B más un Primus 3D ViT frente a GPT-5.6 Sol no divulgado • Tamaño del checkpoint — NV-Reason-CT ~10.6 GB safetensors BF16, se ejecuta en Ampere/Hopper/Lovelace frente a GPT-5.6 Sol solo por API • Entrada — volúmenes de TC NIfTI 3D en unidades Hounsfield frente a texto, imagen, archivo • Contexto — NV-Reason-CT no aplicable, un volumen es un prefijo fijo de 13,824 tokens frente a Sol 1,050,000 tokens de entrada, 128,000 de salida • Licencia — OpenMDW-1.1, pesos descargables frente a propietario, solo acceso por API • Disponibilidad — repositorio del proveedor y sus propios pesos frente a enrutado en OrcaRouter a $4.00 / $20.00 por millón, con la tarifa de Sol que, por encima de 272K tokens de entrada, se duplica a $8.00 / $30.00

A generated scoreboard titled 'NV-Reason-CT vs GPT-5.6 Sol - the scoreboard'. Left column 'NV-Reason-CT': Input 3D NIfTI CT, chest or abdomen; Volume prefix 13,824 tokens, fixed; Parameters 4.69B total / 4.35B active; CT-RATE Macro-F1 0.614 (vendor-reported); Licence OpenMDW-1.1, weights published; Price GPU capex, no per-token rate. Right column 'GPT-5.6 Sol': Input text, image, file; Context / output 1,050,000 in / 128,000 out; Parameters undisclosed; CT-RATE Macro-F1 not applicable; Licence proprietary, API only; Price $4.00 / $20.00 per M. A footer reads 'NV-Reason-CT figures are the authors' own and unreproduced; GPT-5.6 Sol pricing per OpenAI's rate card as routed by OrcaRouter.'

Lo que la separación realmente te cuesta

La comparación de costos solo tiene sentido una vez que aceptas que las cargas de trabajo son diferentes, así que aquí está la versión que sí tiene sentido.

Sol se factura por token y su precio tiene un escalón: $4.00 por millón de entrada y $20.00 por millón de salida hasta 272K tokens de prompt, luego $8.00 y $30.00. En OrcaRouter se sirve al precio de lista de OpenAI sin margen, lo cual importa más de lo que parece — la tarifa que ves es la que OpenAI publica, así que cualquier cambio de precio llega a tu factura el mismo día en lugar de en la próxima renovación del contrato. Su tarifa de lectura de caché es de $0.40 por millón, una décima parte de la entrada, que es lo que hace que los bucles agénticos largos con un gran prefijo fijo sean aritméticamente viables.

NV-Reason-CT no tiene ningún precio por token. Descargas 10,6 GB y pagas por la GPU. Eso es una cuestión de capex frente a opex, y solo tiene una respuesta: con un volumen suficientemente alto, el autoalojamiento de un modelo de 4,35B de parámetros activos gana en coste. Por debajo de ese volumen, no lo hace, y el punto de cruce depende enteramente de tu utilización de la GPU. Nadie fuera de NVIDIA ha publicado aún una cifra de rendimiento para este checkpoint, así que cualquiera que te dé un punto de cruce está adivinando.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

En lo que un router sí ayuda aquí es en la parte del flujo de trabajo que no es el escaneo. Un pipeline de investigación clínica en producción rara vez es un solo modelo: es extracción, un paso de razonamiento, un paso de resumen y, a veces, una segunda opinión. OrcaRouter expone más de 200 modelos detrás de un único endpoint compatible con OpenAI con conmutación automática por error entre proveedores, de modo que la mitad de propósito general de ese pipeline se puede sustituir o redirigir sin un segundo contrato. NV-Reason-CT no es uno de los modelos que enrutamos; es un checkpoint que ejecutas tú mismo. Las dos mitades del pipeline aún pueden estar detrás de una sola clave.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol, showing the identifier openai/gpt-5.6-sol, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 1,050,000-token context window with 128K maximum output, the description of it as the flagship of OpenAI's GPT-5.6 series, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $4.00 per million input tokens and $20.00 per million output tokens with a p50 time to first token of 10.00 s.

La pregunta abierta

NV-Reason-CT tiene dos días como artículo y diecisiete días como repositorio, y el campo al que pertenece es lo suficientemente pequeño como para que el próximo punto de datos sea informativo. Presta atención a tres cosas: una reproducción independiente de CT-RATE, un segundo checkpoint en la familia, y cualquier señal de que el grupo médico de NVIDIA esté tratando esto como una línea en lugar de un artículo. Hasta entonces, la posición defendible es estrecha y clara: este es el checkpoint de razonamiento de TC nativo en 3D más fuerte que se puede descargar actualmente, a juzgar por la propia tabla de los autores, y no es un reemplazo de un modelo de frontera general para nada excepto para leer una TC.