
NV-Reason-CT vs DeepSeek V4 Pro: El costo de leer un escaneo y cuándo ejecutar el lote
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 506 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 183 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
He aquí un hecho operativo que determina más presupuestos de pipelines clínicos que cualquier benchmark: DeepSeek V4 Pro cuesta $0,66 por millón de tokens de entrada y $1,98 por millón de tokens de salida, y esas tarifas se duplican durante dos franjas cada día, de 01:00 a 04:00 y de 06:00 a 10:00 UTC. El trabajo por lotes que se ejecuta fuera de esas franjas cuesta la mitad de lo que cuesta dentro de ellas. Mientras tanto,NV-Reason-CT, el razonador de TC 3D de 4,69 mil millones de parámetros de NVIDIA, no tiene ninguna tarifa publicada — es un conjunto de pesos que se descarga y se ejecuta, sin ninguna cifra de rendimiento publicada para un único estudio de 13.824 tokens. A uno de estos modelos lo programas. Al otro tienes que medirlo antes de poder presupuestarlo.
Esa asimetría es la vía útil para entrar en esta comparación, porque los dos modelos ocupan extremos opuestos del pipeline y fallan financieramente de maneras opuestas. NV-Reason-CT es un instrumento de costo fijo: el estudio marginal es casi gratuito una vez comprado el hardware, pero la decisión de hardware es grande y la latencia por estudio no está documentada. DeepSeek V4 Pro es un motor de costo variable: no hay nada que comprar, todo se mide, y el medidor tiene una programación que se puede leer directamente del calendario.
Qué es cada uno, en una línea cada uno
• Trabajo — NV-Reason-CT lee un volumen de TC de tórax o abdomen y emite hallazgos estructurados; DeepSeek V4 Pro lee y escribe texto
• Arquitectura — un transformer de visión 3D llamado Primus inicializado desde COLIPRI, con un backbone de lenguaje Qwen3.5-4B y embedding rotatorio de posición multieje 3D, con 4,69 mil millones de parámetros, de los cuales 4,35 mil millones están activos; frente a una mezcla de expertos de 1,6 billones de parámetros con 49 mil millones activos por token
• Entrada — volúmenes NIfTI de un solo canal (.nii, .nii.gz) en unidades Hounsfield, con orientación LPS, remuestreados a 2 mm isotrópicos y recortados a la anatomía; frente a texto
• Contexto — un solo volumen se convierte en 13.824 tokens visuales en una cuadrícula de 24 x 24 x 24, sin reducción espacial ni capa de fusión; frente a 1.048.576 tokens de entrada y 384.000 de salida
• Anatomías compatibles — tórax y abdomen, y nada más; frente a todo lo que el texto puede describir
• Precio — sin precio de lista, autoalojado, sin rendimiento publicado por estudio; frente a $0,66 / $1,98 por millón de tokens, que se duplica en las dos ventanas UTC mencionadas arriba, con lecturas de caché a $0,022
• Latencia medida — no publicada; frente a una mediana de 3.483 milisegundos hasta el primer token, a 96,01 tokens de salida por segundo y con una tasa de error del 0,75%
Hay dos filas ahí que valen más que una línea cada una. La fila de contexto es la obvia —un millón de tokens frente a 13.824—, pero las unidades no son comparables y es un error interpretarlas como una brecha de capacidad en cualquiera de las dos direcciones. 13.824 tokens es lo que cuesta representar fielmente un estudio de TC. Un millón de tokens es la cantidad de texto circundante que puedes retener. El primer número es una afirmación sobre la resolución; el segundo, sobre la memoria.
La fila de latencia es la que se omite. La mediana de 3,48 segundos hasta el primer token y los 96 tokens por segundo de DeepSeek V4 Pro son cifras medidas y publicadas, y permiten dimensionar un trabajo de texto sobre el papel. La ausencia de cualquier cifra equivalente en NV-Reason-CT no es una crítica al modelo; es la razón por la que no se puede calcular el costo de un pipeline de CT antes de que alguien lo ejecute. Un modelo de 4,69B sobre 13.824 tokens visuales no es un cálculo pequeño, y hasta que no lo hayas cronometrado en tu propio hardware, estarás adivinando.
Leyendo los dos registros de referencia sin engañarte a ti mismo
El historial de DeepSeek V4 Pro es una mezcla de medición independiente e informes del proveedor, y la mezcla es instructiva porque contiene un número que parece alarmante y no lo es.
• Artificial Analysis Intelligence Index — 36, lo que lo sitúa en el percentil 72,4 de los modelos medidos
• GPQA Diamond — 92.8, lo que lo sitúa muy cerca de la cima del sector
• Humanity's Last Exam — 41, y 41 en MMLU-Pro, 62,51 en el índice de matemáticas
τ²-Bench — 96,20, con IFBench en 76,46 y tau_banking en 39,59
• Recuperación de contexto largo — 80.33
• SciCode y Terminal-Bench — 51 y 78.65 en la segunda versión de Terminal-Bench
Un índice compuesto de 36 junto a un GPQA Diamond de 92.8 suena a contradicción hasta que uno se da cuenta de qué es un índice. Es un agregado de muchas evaluaciones, y un modelo que es excelente en unas pocas y apenas adecuado en otras quedará en la zona media de la suma, mientras que encabeza tablas individuales. Cualquiera que cite el 36 por sí solo para argumentar que DeepSeek V4 Pro es de gama media está citando un promedio como si fuera un máximo. Cualquiera que cite el 92.8 por sí solo para argumentar que lidera el campo está citando un máximo como si fuera un promedio. Ambos números son de Artificial Analysis, y ambos son verdaderos.
El historial de NV-Reason-CT no contiene esa mezcla, y ese es el problema honesto que presenta. Sus cifras en CT-RATE —0,614 de F1 y 0,871 de AUROC en dieciocho etiquetas, usando un umbral uniforme fijo y un prompt directo de sí/no, sin cabeza de clasificación y sin adaptación específica a la tarea— proceden del artículo de la propia NVIDIA y de ningún otro lugar. El conjunto de comparación de ese artículo (VoxelFM con 0,581, Pillar-0 con 0,544, ClinFusion-8B con 0,442, CT-CLIP con 0,398, Merlin con 0,358, MedGemma 1.5 con 0,303) está formado enteramente por otros modelos de imagen. No aparece ni un solo modelo de texto general, y ningún tercero ha reproducido ninguna de las cifras.

La cuestión de la programación, resuelta paso a paso
La tarificación por tiempo de DeepSeek V4 Pro es lo más accionable a nivel operativo de cualquiera de los dos modelos, así que merece un análisis detallado y concreto.
Una carga de trabajo realista del lado del texto para un programa de CT no es glamorosa. Consiste en extraer campos estructurados de un corpus de informes históricos para tener etiquetas con las que entrenar, convertir árboles de directorios DICOM a NIfTI a escala, escribir y reescribir el arnés de evaluación, normalizar unidades y terminología en cuatro conjuntos de datos, y resumir cohortes. Pongamos cien millones de tokens de entrada y diez millones de tokens de salida para un programa de tamaño medio, que es una cifra deliberadamente redonda que representa «mucho trabajo de texto».
• Dentro de una ventana duplicada — $1.32 y $3.96 por millón, así que $132 más $39.60 sobre esos volúmenes
• Fuera de esas ventanas — $0.66 y $1.98 por millón, así que $66 más $19.80
• La diferencia — aproximadamente $86, o el 49% de la factura fuera de horas pico, por mover un trabajo que por naturaleza puede procesarse por lotes
• Lecturas en caché — $0,022 por millón, lo que equivale a una sexagésima parte de la tarifa de entrada, así que cualquier prefijo de prompt que reutilices en todo el corpus es prácticamente gratis
Eso no es un error de redondeo, y está disponible porque el trabajo es asíncrono. La extracción de informes no tiene que ocurrir a las 14:00. A un trabajo de conversión DICOM no le importa qué hora sea. La estructura de precios es una invitación directa a programar, y un pipeline que la ignora está pagando una prima del 49 % por el privilegio de ejecutarse cuando le apetece. Las lecturas de caché importan por la misma razón: un prompt de sistema compartido o un esquema de extracción fijo, reutilizado en miles de informes, se sitúa en una sexagésima parte de la tarifa de entrada.
NV-Reason-CT no tiene una palanca equivalente, porque no tiene medidor. El coste de leer una exploración es lo que cueste tu GPU por hora dividido entre las exploraciones por hora que puedas procesar, y el segundo número es el que nadie ha publicado. Si un solo estudio tarda dos segundos, una sola L40S se encarga de un programa grande sin problemas. Si tarda veinte, la aritmética del hardware cambia por completo. NVIDIA probó con H100 y L40S, lo que te dice la clase de tarjeta, no la tasa.
La trampa de asumir que se pueden sustituir
El error al que invita este emparejamiento es más sutil que el habitual error de categoría, porque existe una versión de él que parece razonable en una diapositiva.
DeepSeek V4 Pro admite 1.048.576 tokens y emite hasta 384.000. Un volumen de TC, según el cálculo del modelo que lo lee correctamente, solo ocupa 13.824 tokens. Así que un modelo de texto con una ventana de un millón de tokens tiene espacio para setenta y tantos estudios de TC con esa cantidad de tokens. La aritmética es correcta y la conclusión —que se podrían introducir datos de TC en un modelo de texto y ahorrarse la infraestructura de imágenes— es errónea, por la misma razón por la que existe la cifra de 13.824 en primer lugar.
Ese número no es un resumen comprimido de una exploración. Es la exploración, con una resolución isotrópica de 2 mm en un cubo de 384 milímetros, cortada en parches de 8 x 8 x 8, entregada al modelo de lenguaje sin submuestreo espacial ni capa de fusión. El recuento de tokens es alto precisamente porque no se descartó nada: el espaciado entre cortes que hace que un nódulo sea medible, los valores de densidad que hacen de una textura un umbral en vez de un adjetivo. Un modelo de texto no puede ingerir esos tokens como volúmenes, como tampoco puede hacerlo un documento. Tiene el presupuesto. No tiene la interfaz.
La propia comparación interna del artículo cifra esa diferencia. MedGemma 1.5, al que se le proporcionan hasta 85 cortes axiales —lo máximo que puede hacer razonablemente un front end bidimensional o de cortes apilados—, obtiene 0.303 de F1 frente a 0.614 del modelo volumétrico nativo. Esa brecha es el valor del codificador tridimensional, y ninguna ventana de contexto, por amplia que sea, logra cerrarla.
La sustitución inversa falla por razones más simples. NV-Reason-CT and abdomen, toma un archivo NIfTI en lugar de un prompt, no tiene herramienta, y su modelo lo restringe a investigación y educación y declara que no es un dispositivo médico y que las salidas pueden ser incorrectas. No puede extraer campos de un informe, y no puede escribir el script que construye tu corpus.

Dónde encajamos y dónde deliberadamente no
DeepSeek V4 Pro se sirve a través de OrcaRouter como deepseek/deepseek-v4-pro, a la tarifa de lista del proveedor sin margen adicional, dentro de una sola API que cubre más de 200 modelos. El traspaso importa más de lo habitual en un modelo con precio según la hora del día: cuando un proveedor cambia una tarifa o una ventana, la tarifa de nuestro lado cambia el mismo día, porque no hay una capa de margen en medio que mantenga un número antiguo. La conmutación por error automática cubre el caso en que un proveedor se degrada a mitad de lote, que para un trabajo de extracción largo y desatendido es el modo de fallo que realmente te cuesta una noche, y el DSL de enrutamiento te permite enviar solicitudes individuales al modelo que debería gestionarlas en lugar de pasar todo por un único endpoint.
NV-Reason-CT no está en nuestra plataforma. Ningún modelo de NVIDIA lo está. El lado de CT de esta arquitectura es su propio hardware con sus propios pesos descargados, y no vamos a escribir una frase que deje a un lector pensar lo contrario. Dado que la entrada son datos volumétricos derivados de pacientes y la licencia es OpenMDW-1.1 sin ningún servicio alojado asociado, la ejecución local es donde ese modelo pertenece en cualquier caso.
Lo que el emparejamiento realmente te dice
Los dos modelos no compiten, y el punto de compararlos es que fallan de manera diferente. NV-Reason-CT te ofrece una capacidad que ninguna otra alternativa abierta tiene —razonamiento nativo sobre TC tridimensional a la resolución completa del estudio— y te pide que aceptes un coste por estudio no presupuestado, un rendimiento no publicado y una licencia que prohíbe el despliegue clínico. DeepSeek V4 Pro te ofrece un motor con tarificación por uso, con una latencia publicada, una tasa de error publicada, mediciones independientes y un precio que puedes reducir a la mitad con solo mirar el reloj, y no puede ver un escaneo en absoluto.
Si estás construyendo la cosa en lugar de comprarla, la forma que sobrevive al contacto es la aburrida. Ejecuta la lectura de CT localmente, presupuéstala midiendo en lugar de citar, y pon todo lo textual que la rodea en una cita con la ventana de horas valle. El único horario que nadie debería copiar es el que ejecuta cien millones de tokens de extracción a las 02:00 UTC porque fue cuando el lote dio la casualidad de estar listo.

