
NV-Reason-CT vs Qwen3.8 Max: El ajuste fino y la familia de la que proviene
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 45 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
La primera línea de la NV-Reason-CT tarjeta del modelo te dice algo que la mayoría de la gente pasa por alto. El modelo base es Qwen/Qwen3.5-4B, listado en los metadatos del repositorio como una relación de ajuste fino. Así que cuando NVIDIA necesitó un modelo de lenguaje al que acoplar un transformador de visión 3D Primus, tomó un Qwen. Compara ese checkpoint con Qwen3.8 Max — el buque insignia de 1.000.000 tokens de Alibaba, lanzado el 3 de agosto de 2026 — y estás viendo un ajuste fino y el negocio familiar. Uno es un especialista de 4,69B que lee volúmenes de TC de tórax y abdomen y se publicó en Hugging Face el 8 de septiembre de 2026 sin anuncio. El otro es un buque insignia general con entrada de texto, imagen y vídeo, una tarifa publicada y 37,2 millones de tokens de tráfico medido en nuestra red la semana pasada. La pregunta interesante no es cuál gana. Es qué puede hacer un ajuste fino de 4B que el buque insignia de su familia no puede, y por qué la respuesta es más específica de lo que esperarías.
Lo que compró el ajuste fino, concretamente
La propia caracterización que hace NVIDIA de esta brecha es inusualmente precisa, y es la frase más útil del repositorio: la mayoría de los sistemas de visión y lenguaje «o bien operan sobre imágenes 2D o bien comprimen las características volumétricas antes de la decodificación del lenguaje». Eso describe a toda una clase de modelos, e incluye a cada modelo insignia multimodal general que hay en el mercado.
La solución es arquitectónica, más que una cuestión de escala. Un volumen de entrada de 384×384×384 mm se convierte en una cuadrícula de 24×24×24 de 13.824 tokens visuales. Esos tokens y sus coordenadas tridimensionales entran en el modelo de lenguaje sin submuestreo espacial, y 3D MRoPE conserva las relaciones espaciales dentro del decodificador. Los volúmenes de entrada se recortan con conocimiento anatómico a tórax o abdomen usando unidades Hounsfield pulmonares, y luego se remuestrean a una resolución isotrópica de 2 mm.
Compara eso con lo que acepta Qwen3.8 Max. Texto, imagen y vídeo — y el vídeo es lo más parecido que hay en esta serie a una entrada volumétrica, lo que lo convierte en el punto de comparación honesto y no en uno retórico. Un vídeo es una pila de fotogramas 2D ordenados por el tiempo. Un volumen de TC es una pila de cortes 2D ordenados por su posición física a lo largo del eje z, en unidades Hounsfield, con un espaciado conocido en milímetros. Ambos son matrices tridimensionales. Solo uno de ellos tiene un sistema de coordenadas físicas al que se puede localizar el hallazgo de un radiólogo, y solo uno de ellos se mide en una unidad que significa algo fuera de un sensor de imagen. Un modelo entrenado con vídeo aprende continuidad temporal. Un modelo entrenado con volúmenes de TC aprende que una masa en un corte es la misma masa en el corte siguiente, ocho milímetros más abajo.
El corpus de entrenamiento es la verdadera diferencia
Aquí es donde los dos modelos dejan por completo de ser comparables, y es la parte que una ficha técnica oculta.
NV-Reason-CT se entrenó de extremo a extremo con ajuste fino supervisado seguido de Optimización de Políticas Relativas de Grupo sobre aproximadamente 550.000 ejemplos de QA estructurados extraídos de 70.111 volúmenes de TC únicos. Las fuentes son CT-RATE —47.149 casos del Hospital Mega de la Universidad Medipol de Estambul con informes de radiología emparejados—, un conjunto interno de los NIH de 15.991 casos, y los 22.720 casos de CancerVerse en cuatro fases de contraste y trece tipos de tumores malignos. El corpus incluye informes estandarizados, QA centrado en anomalías, diálogo multiturno y razonamiento escrito por radiólogos transcrito de interpretaciones expertas grabadas. La etapa de GRPO utiliza recompensas verificables sobre conjuntos de anomalías torácicas y abdominales, lo que significa que la señal de recompensa comprueba si un hallazgo declarado está presente en el volumen en lugar de si la prosa suena clínica.
El corpus de entrenamiento de Qwen3.8 Max no se publica con nada parecido a ese nivel de detalle, y no serviría de nada que así fuera, porque la capacidad objetivo es general. En su lugar, sus cifras de Artificial Analysis son la evidencia relevante: un Intelligence Index de 45,4 que lo sitúa en el puesto 15 de 145 modelos en la instantánea de nuestra API, AA Coding 76,2 en el puesto 9, Terminal-Bench 2.1 con 88,8, GPQA Diamond 92,8, Humanity's Last Exam 43,1, SciCode 52,1 y recuperación de contexto largo 80,3. Esas son mediciones de terceros, no afirmaciones del proveedor, lo que las convierte en las cifras más fiables de ambos lados de esta página.
Salida de razonamiento, dos contratos diferentes
Ambos modelos emiten trazas de razonamiento y ambos te permiten desactivarlas. La similitud termina en la interfaz.
Qwen3.8 Max expone enable_thinking y reasoning_effort, junto con toda la superficie de muestreo — temperatura, top_p, semilla, penalizaciones, salidas estructuradas y llamada a herramientas. Es una capacidad de razonamiento general que puedes dirigir a lo que tengas. Su pensamiento es tan bueno como el problema que le entregues, y no tiene forma de verificar una afirmación contra nada excepto el texto que se le dio.
El razonamiento de NV-Reason-CT tiene un contrato más limitado con el lector, y la ficha del modelo señala el límite de forma explícita: el razonamiento generado es «una salida del modelo revisable y no se garantiza que represente el cómputo interno del modelo». Esa salvedad cumple una función real, y es el tipo de frase que solo aparece cuando un equipo ha pensado en lo que hará un clínico con un rastro que suena plausible. La ficha describe la salida como observaciones revisables, diagnósticos diferenciales e incertidumbre. Un rastro que se puede contrastar con el volumen, en otras palabras, en lugar de uno que solo se puede leer.
Rendimiento, desde el único lugar donde podemos medirlo
Qwen3.8 Max movió 37,2 millones de tokens a través del propio playground de OrcaRouter en los últimos siete días. Su tiempo medio hasta el primer token fue de 1,96 segundos —cómodamente el más rápido de los modelos de esta serie—, con 53,3 tokens de salida por segundo. Su tasa de errores durante ese período fue del 3,5 %.
Esas dos cifras tiran en direcciones opuestas y ambas importan. La latencia es excelente y hace que el modelo sea agradable de iterar. La tasa de error es aproximadamente diecisiete veces mayor que el 0,21 % de Kimi K3 en la misma ventana, y ese es el número que decide si lo pones detrás de una llamada síncrona orientada al usuario o de un trabajo por lotes con reintentos. Esto es comportamiento medido en nuestra red, no un benchmark, y es el tipo de cosa que una lista de tarifas nunca te dice.
NV-Reason-CT no tiene ninguna medición equivalente en ningún sitio. Es un checkpoint BF16 de 10,6 GB con código de modelo personalizado, cargado con trust_remote_code=True en hardware Ampere, Hopper o Lovelace, probado por NVIDIA en H100 y L40S. No se ha publicado ningún p50, ninguna tasa de error ni ninguna cifra de rendimiento. Cualquiera que te diga el volumen de cruce a partir del cual autoalojar esto es mejor que pagar por token está adivinando.
Precio y forma, uno al lado del otro
• Precio — CAPEX de GPU de NV-Reason-CT, sin tarifa por token frente a Qwen3.8 Max $2.00 / $6.00 por millón de tokens, $0.25 por lectura en caché, $2.50 por escritura en caché
• Entrada — volúmenes de TC NIfTI 3D de NV-Reason-CT en unidades Hounsfield, solo tórax o abdomen vs texto, imagen y vídeo de Qwen3.8 Max
• Contexto — NV-Reason-CT: un solo volumen, un prefijo fijo de 13.824 tokens frente a los 1.000.000 tokens de Qwen3.8 Max
• Parámetros — NV-Reason-CT 4.69B en total / 4.35B activos en la ruta CT frente a Qwen3.8 Max no divulgado
• Licencia — NV-Reason-CT OpenMDW-1.1, pesos publicados frente a Qwen3.8 Max propietario, solo acceso mediante API
• Puntuaciones independientes — NV-Reason-CT ninguna vs Qwen3.8 Max AA Intelligence Index 45.4, GPQA Diamond 92.8

La economía de caché de Qwen3.8 Max recompensa un patrón específico: una lectura en caché de $0.25 frente a una entrada nueva de $2.00 representa un descuento de ocho a uno, y la escritura en caché de $2.50 significa que un prefijo largo reutilizable se amortiza rápidamente. Esa es la carga de trabajo de un prompt de sistema más un documento de protocolo reutilizado en miles de solicitudes. NV-Reason-CT tiene el perfil de costos opuesto: un costo marginal casi nulo por escaneo una vez comprada la GPU, y un mínimo fijo de una GPU mantenida indefinidamente.

Llevando la familia juntos
La arquitectura natural aquí —y vale la pena decir que nadie la ha publicado— es el modelo ajustado para el volumen y el modelo insignia para todo lo que lo rodea. NV-Reason-CT produce el hallazgo estructurado; Qwen3.8 Max se encarga del texto de derivación, la coincidencia de protocolos, la codificación y la carta de seguimiento: el trabajo de texto de gran volumen donde una ventana de un millón de tokens y un descuento de caché de ocho veces realmente se ganan su lugar.
Si ese es tu pipeline, la mitad es un checkpoint que alojas tú y la otra mitad son tokens que compras, y esa segunda mitad es donde un router hace algo que un endpoint de un solo proveedor no puede. Qwen3.8 Max se sirve a través de OrcaRouter al precio de lista de Alibaba sin margen, así que los $2.00 / $6.00 de arriba son lo que pagas y cualquier cambio de precio futuro llega a tu factura el mismo día en lugar de en la renovación. La conmutación por error automática entre proveedores importa más de lo habitual cuando la tasa de error medida del propio modelo es del 3,5 %: un reintento que va a un endpoint distinto y saludable es la diferencia entre un fallo pasajero y un lote fallido. Y como la mitad general del pipeline es un solo nombre de modelo detrás de un endpoint compatible con OpenAI que cubre más de 200 modelos, cambiar a otra cosa para un experimento de una semana cuesta un cambio de cadena, no una integración.
NV-Reason-CT, para que quede claro, no está en OrcaRouter ni va a estarlo: es inferencia 3D de código personalizado que ejecutas por tu cuenta. La versión honesta del relato de la integración es que el especialista autoalojado y el generalista enrutado pueden quedar bajo una misma clave, y eso es todo lo que se afirma.

El veredicto que realmente se sostiene
Este emparejamiento se archiva bajo «cuál es mejor», y no debería. A Qwen3.8 Max lo miden terceros en razonamiento general y supera a la mayor parte del campo; NV-Reason-CT tiene una única tabla con sus propios números en un único benchmark de CT, y una cantidad de parámetros de 4,69B que pasaría desapercibida en cualquier comparación general. En cualquier benchmark general, gana el modelo insignia, y la razón es que el benchmark general es aquello para lo que fue construido.
En la única tarea para la que se construyó NV-Reason-CT —leer un volumen de TC torácico o abdominal y decir qué contiene, con una traza que alguien pueda comprobar—, Qwen3.8 Max no es un competidor más débil. No tiene codificador volumétrico, así que no se puede ejecutar sobre la entrada en absoluto sin que alguien decida primero cómo aplanar una exploración en imágenes. Ahí es donde se pierde la información espacial. Ese es exactamente el sentido de un modelo de 4B ajustado con una ruta 3D nativa y un prefijo fijo de 13.824 tokens, y es la razón por la que lo interesante de este modelo es la pequeñez de su backbone en lugar de su tamaño.
