
NV-Reason-CT vs Grok 4.6: ¿Quién lee el escaneo y quién lee el informe?
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 45 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Hay dos maneras de poner una IA en un pipeline de CT, y solo una de ellas tiene que ver con la imagen. NV-Reason-CT es la primera: un modelo de visión y lenguaje 3D de 4,69 mil millones de parámetros que lee volúmenes NIfTI directamente y se publicó en Hugging Face el 8 de septiembre de 2026 sin una publicación de lanzamiento de NVIDIA. Grok 4.6 es el segundo: un modelo de texto e imagen de 500.000 tokens que se lanzó el 12 de agosto de 2026, cuesta $2,00 por millón de tokens de entrada y es muy bueno en la parte del trabajo que ocurre después de que alguien ya haya anotado el hallazgo. Si se los pone en una comparación, la pregunta habitual —cuál es mejor— resulta estar mal planteada. No compiten por el mismo lugar en el pipeline. Compiten por la misma partida presupuestaria.
Lo que realmente se envió en cada lado
NV-Reason-CT llegó como un repositorio, un artículo y un Space de demostración, no como un producto. El repositorio de GitHub bajo NVIDIA-Medtech se creó el 2 de septiembre de 2026; los pesos de Hugging Face llegaron después, el 8 de septiembre; el preprint de arXiv, NV-Reason-CT: modelo de lenguaje visual 3D para análisis de CT, se publicó el 23 de septiembre con dieciséis autores de NVIDIA, los NIH y la Universidad de Zúrich. La sala de prensa de NVIDIA no recoge nada al respecto. La tarjeta del modelo describe la versión 0.1 y restringe su uso a la investigación y la educación.
Grok 4.6 es el tipo opuesto de lanzamiento. Es un endpoint comercial de primer nivel, listado como "Latest" en la documentación para desarrolladores del proveedor, con precio en una tarifa publicada y disponible como un modelo compatible con OpenAI que las integraciones existentes adoptan cambiando una URL base. Sucedió a Grok 4.5 con la misma ventana de contexto, la misma superficie de entrada y el mismo precio base.
Esa asimetría lo es todo en esta comparación. Uno es un artefacto de investigación que da la casualidad de que se puede descargar. El otro es infraestructura. Leerlos el uno contra el otro te dice dónde cae actualmente la línea entre "artefacto de investigación" e "infraestructura" en las imágenes médicas — y no es donde lo supondrías.
La división del trabajo, en insumos y productos
• Entrada volumétrica — NV-Reason-CT lee volúmenes NIfTI .nii/.nii.gz en unidades Hounsfield, solo tórax o abdomen, frente a Grok 4.6, que lee texto, imágenes y archivos, sin vía volumétrica • Manejo espacial — NV-Reason-CT convierte un volumen de 384×384×384 mm en una cuadrícula de 24×24×24 de 13.824 tokens con MRoPE 3D, sin submuestreo, frente a Grok 4.6, que trata una imagen como una imagen 2D • Contexto — NV-Reason-CT: un volumen es un prefijo fijo, sin ventana de contexto en el sentido habitual, frente a Grok 4.6: 500.000 tokens • Salida — NV-Reason-CT: informe estructurado, respuesta o traza de razonamiento con pensamiento desactivable, frente a Grok 4.6: texto con salidas estructuradas y llamadas a herramientas • Licencia — NV-Reason-CT: OpenMDW-1.1, pesos BF16 de 10,6 GB, frente a Grok 4.6: propietario, solo API • Precio — NV-Reason-CT: CAPEX de GPU, sin tarifa por token, frente a Grok 4.6: $2.00 / $6.00 por millón, duplicado por encima de 200K de entrada

La pareja se lee como un relevo natural. NV-Reason-CT produce el hallazgo a partir del volumen; Grok 4.6 es el modelo al que le entregarías mil de esos hallazgos, en una sola ventana de contexto, para buscar patrones en una cohorte. Nadie ha publicado ese pipeline. Es la arquitectura obvia, y vale la pena decir sin rodeos que no está probada.
Las cifras de Grok 4.6, y de quién son
Dos cifras de Grok 4.6 circulan juntas y no son del mismo tipo. La puntuación de 94.9 en GPQA Diamond la mide Artificial Analysis, no la reporta el proveedor — lo cual es la más fiable de las dos categorías precisamente porque la ejecutó un tercero. La puntuación de 44 en el Artificial Analysis Intelligence Index, en la revisión v4.3.2 del índice, sitúa a Grok 4.6 en el puesto 28 de 211 en su clase. Artificial Analysis también registra el modelo como propietario: los pesos no están disponibles públicamente.
En el mismo tablero, AA mide Terminal-Bench 2.1 en 88.4, SciCode en 56.5, Humanity's Last Exam en 42.9, 𝜏²-banking en 50.7 y la recuperación de contexto largo en 80.3. Esos son instrumentos de razonamiento general. Ninguno de ellos puede ejecutarse sobre un volumen de TC 3D, y eso no es una crítica a Grok 4.6 — es una afirmación sobre lo que mide la suite de benchmarks.
El lado de CT tiene exactamente una tabla, y es la de los autores.
Toda la base de evidencia pública de NV-Reason-CT es una tabla de clasificación sobre las 18 etiquetas de CT-RATE, con un umbral uniforme fijo, usando un prompt directo de Sí/No sin cabeza de clasificación. Reporta un Macro-F1 de 0.614 y un Macro-AUROC de 0.871, frente a VoxelFM con 0.581/0.870, Pillar-0 con 0.544/0.861, ClinFusion-8B con 0.442, CT-CLIP con 0.398/0.733, Merlin con 0.358/0.662, y MedGemma 1.5 con 0.303.
Estos son datos reportados por el proveedor, de la ficha del modelo, y los etiqueto como tales porque ninguna parte independiente los ha reproducido aún. Hay dos cosas que vale la pena notar dentro de la tabla. El margen de F1 sobre VoxelFM es de 0,033, que es una diferencia real en 18 etiquetas con un umbral fijo. El margen de AUROC sobre el mismo modelo es de 0,001, que es un empate. Ambos números aparecen en la misma fila de la misma tabla, y solo uno de ellos conlleva una afirmación.
Lo otro que te dice la tabla es sobre el propio encuadre del artículo. Los modelos de comparación son sistemas de preentrenamiento contrastivo en 3D, un MLLM generativo fusionado 2D/3D y un modelo de frontera basado en cortes. Los autores eligieron comparar contra sistemas que ingieren volúmenes, porque la única afirmación significativa aquí es que un modelo generativo en 3D puede superar a modelos discriminativos en 3D en clasificación sin una cabeza. No dice nada sobre cómo se compara NV-Reason-CT con un modelo de frontera general en ningún aspecto, porque esa comparación no existe en este eje.

Adónde va el dinero y por qué importa el límite del nivel
La tarifa de Grok 4.6 incluye un detalle que decide silenciosamente gran parte de la arquitectura: los prompts que superan los 200K tokens de entrada se facturan al doble de la tarifa base — 4,00 $ de entrada y 12,00 $ de salida, con la tarifa de lectura de caché subiendo de 0,50 $ a 1,00 $. Un trabajo de revisión por cohortes que acumula hallazgos en un único contexto largo es exactamente la carga de trabajo que cruza esa línea. Por debajo de ella, la tarifa de lectura de caché de 0,50 $ por millón supone un cuarto del precio de entrada, y eso es lo que hace que repetir un prefijo fijo extenso sobre miles de informes resulte asequible, y no solo posible.
A través de OrcaRouter, Grok 4.6 se sirve al precio de lista de ese proveedor sin ningún margen añadido, así que la aritmética de niveles anterior es la aritmética que realmente pagas, y cualquier ajuste futuro en ella llega a tu factura el mismo día en lugar de en la próxima renovación. La razón para enrutar un trabajo como este en lugar de codificar de forma fija un único endpoint es que la mitad de revisión de cohortes de un flujo clínico es donde querrás probar tres modelos distintos antes de decidirte — y con una sola clave compatible con OpenAI y conmutación automática por error entre proveedores, ese experimento cuesta solo un cambio de nombre de modelo.
La mitad CT del pipeline no tiene esa opción. NV-Reason-CT no está alojado en OrcaRouter — es un checkpoint de 10,6 GB con código de modelo personalizado que ejecutas tú mismo, en silicio Ampere, Hopper o Lovelace, con trust_remote_code=True. No vamos a insinuar lo contrario. Si estás construyendo este pipeline, estás comprando GPUs para una mitad y tokens para la otra, y el hecho de que ambas mitades puedan al menos gestionarse desde una sola consola es la única afirmación de integración que merece la pena hacer.

Lo que realmente vale un segundo lector
El artículo NV-Reason-CT incluye un estudio preliminar con radiólogos expertos que informa «calificaciones de confianza favorables para la revisión asistida por IA» y una reducción del 50 % en el tiempo promedio reportado de interpretación y elaboración de informes. Son cifras contundentes y vienen con una advertencia que el propio artículo señala: son preliminares y corresponden al propio diseño de estudio de los autores. No existe una replicación independiente publicada, y una reducción del 50 % del tiempo en un estudio de lectura controlado es exactamente el tipo de resultado que se reduce al replicarse. Vale la pena seguirle la pista. No vale la pena citarlo como establecido.
Frente a eso, la contribución de Grok 4.6 a un flujo de trabajo de radiología no es el diagnóstico en absoluto. Es la capa que lee los informes: la cola de triaje, la carta de seguimiento, la codificación, el paquete de autorización previa. Ese trabajo es texto, es de alto volumen, es barato por unidad, y el modo de fallo de hacerlo mal es administrativo en lugar de clínico. También es donde una ventana de contexto de 500K y una lectura de caché de $0.50 se ganan genuinamente su lugar.
Así que la división a la que llega esta comparación es tajante: NV-Reason-CT tiene una vía 3D real y ninguna distribución, ningún precio y ninguna verificación independiente. Grok 4.6 tiene distribución, un precio, cobertura de benchmarks independientes y ninguna vía volumétrica en absoluto. Si necesitas que se lea el escaneo, solo uno de estos puede hacerlo. Si necesitas que se gestione el papeleo en torno al escaneo, solo el otro es un producto.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
