
NV-Reason-CT vs Kimi K3: 210 descargas y 588 millones de tokens
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 45 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Uno de estos modelos se ha descargado 210 veces desde Hugging Face. El otro movió 588 millones de tokens a través de nuestro propio playground en los últimos siete días. Ambos son de pesos abiertos, ambos se pueden descargar ahora mismo, y la diferencia entre esos dos números es lo más útil de esta comparación. NV-Reason-CT es el modelo de visión-lenguaje 3D de 4,69 mil millones de parámetros de NVIDIA para TC de tórax y abdomen, publicado en Hugging Face el 8 de septiembre de 2026 sin ningún anuncio. Kimi K3 es el buque insignia de MoonshotAI con 1.048.576 tokens, lanzado el 15 de julio de 2026 y ahora uno de los modelos más concurridos de nuestra red. Ambos son "abiertos" en el sentido que importa en un formulario de adquisición. Pero no son abiertos de la misma manera en absoluto.
Dos significados de «puedes descargarlo»
Empieza por lo que cada descarga deposita realmente en tu disco, porque aquí es donde la mayoría de las comparaciones de pesos abiertos pierden rigor.
NV-Reason-CT te ofrece model.safetensors de aproximadamente 10,6 GB en BF16, además de un model.py y un considerable processor.py — 26 KB de código de procesamiento personalizado que implementa el recorte con reconocimiento anatómico, el remuestreo a 2 mm y la división en parches 3D. Lo cargas con trust_remote_code=True, lo que significa que estás ejecutando el código del repositorio de NVIDIA dentro de tu proceso. La inferencia necesita PyTorch con CUDA, y la tarjeta menciona Ampere, Hopper y Lovelace, con pruebas en H100 y L40S. La entrada es un volumen NIfTI a la vez. No se ha publicado ninguna estrategia de batching, ni una cifra de rendimiento, ni una configuración de servicio en el repositorio más allá de un inference.py de ejemplo.
Kimi K3 te ofrece un modelo de razonamiento de propósito general con una ventana de contexto de 1.048.576 tokens, entrada de texto e imágenes, invocación nativa de herramientas, salidas estructuradas y esfuerzo de razonamiento configurable. Es el modelo al que recurrirías para leer cien guías clínicas en una sola solicitud, o una década de informes de un departamento. Su puntuación de recuperación de contexto largo de Artificial Analysis es 88,7 —la más alta de los modelos de esta serie y 8,4 puntos por encima de los 80,3 de Grok 4.6.
Dicho sin rodeos: NV-Reason-CT es un checkpoint especializado con una superficie de entrada limitada y código personalizado en el que debes confiar y que debes mantener. Kimi K3 es un modelo general con una amplia superficie de entrada que se comporta como infraestructura. Ambos se pueden descargar. Solo uno de ellos es un reemplazo directo.
La evidencia de CT, en su totalidad, y es breve.
Todo lo que se sabe públicamente sobre la calidad de NV-Reason-CT se basa en una única tabla de su propia model card: la tarea de clasificación de 18 etiquetas de CT-RATE con un umbral uniforme fijo, prompting directo de Sí/No, sin cabeza de clasificación, sin adaptación específica a la tarea. Macro-F1 0,614, Macro-AUROC 0,871.
Las filas de comparación son VoxelFM con 0,581/0,870, Pillar-0 con 0,544/0,861, ClinFusion-8B con 0,442, CT-CLIP con 0,398/0,733, Merlin con 0,358/0,662 y MedGemma 1.5 con 0,303. Cada uno de esos es un número reportado por el proveedor que figura en la ficha de NVIDIA y ninguno se ha reproducido de forma independiente todavía — el artículo tiene dos días.
Lo que la tabla establece es limitado y merece formularse con exactitud: un modelo generativo 3D sin cabeza específica para la tarea supera a las líneas base de preentrenamiento contrastivo 3D y a un modelo de frontera basado en cortes en la clasificación de TC con 18 etiquetas. Lo que no establece es nada acerca del razonamiento general, nada acerca de modalidades distintas de la TC de tórax y abdomen, y nada acerca de la ventaja en AUROC: 0,871 frente a 0,870 es un empate disfrazado con un decimal.
Los números de Kimi K3, y la salvedad del ranking de pesos abiertos
Artificial Analysis mide a Kimi K3 con un Índice de Inteligencia de 43,6, lo que lo sitúa en el puesto 19 de 145 modelos en esa tabla, según la instantánea de la clasificación de nuestra API de modelos. Su puntuación en GPQA Diamond es 93,5; en Humanity's Last Exam, 46,9; en SciCode, 59,5; en Terminal-Bench 2.1, 85,0; en AA Coding, 76,2 en el puesto 9; y en 𝜏²-banking, 46,0.
Una afirmación sobre la clasificación requiere cuidado, porque es fácil equivocarse y ya se ha errado antes. El AA Intelligence Index de Kimi K3, de 44, ocupa el tercer puesto entre los modelos de pesos abiertos en la tabla de pesos abiertos, por detrás de MiMo-V2.6-Pro con 46 y GLM-5.3 con 45. No es el líder de esa tabla, y no compite en la misma tabla que Grok 4.6 —Artificial Analysis registra a Grok 4.6 como propietario, por lo que su 44 pertenece a la clasificación general, no a la de pesos abiertos. Los dos índices parecen idénticos y no lo son.
Lo que el operador ve realmente
De aquí proviene la cifra de 588 millones, y vale la pena explicarla con claridad porque es la única evidencia en este artículo que es nuestra y no el marketing de cualquier otro.
Durante los últimos siete días, Kimi K3 movió 587,8 millones de tokens a través del playground de OrcaRouter. Su tiempo mediano hasta el primer token fue de 7,8 segundos, produjo 42,9 tokens de salida por segundo y su tasa de error durante ese periodo fue del 0,21 %: un fallo de cada 480 solicitudes aproximadamente. Esa tasa de error medida es algo que no se puede obtener de la ficha de un modelo, y es la cifra que decide si un modelo es seguro para ponerlo detrás de un trabajo por lotes.
Para NV-Reason-CT no hay equivalente, porque no es un endpoint alojado en ningún sitio — es un checkpoint que ejecutas tú mismo. No hay p50, ni tasa de errores, ni tiempo de actividad, ni nadie a quien recurrir en caso de fallo. Eso no es una crítica; es un hecho estructural del autoalojamiento, y es la razón por la que un grupo de investigación puede adoptar NV-Reason-CT un martes y un equipo de producción, por lo general, no.
Si estás ejecutando ambas mitades de esto —Kimi K3 como la capa general alojada y NV-Reason-CT en tu propio equipo con GPU—, el lado del enrutamiento es donde la mitad alojada obtiene su resiliencia. Kimi K3 se ofrece al precio de lista de Moonshot de $3.00 por millón de tokens de entrada y $15.00 por millón de salida sin ningún recargo; su tarifa de lectura de caché de $0.30 por millón es una décima parte de la de entrada y, como el precio se transfiere sin cambios, un recorte del proveedor llega a tu factura el mismo día. La conmutación por error automática entre proveedores es lo que mantiene vivo un trabajo por lotes cuando un endpoint ascendente se tambalea, y con una tasa de error del 0.21%, los tambaleos son lo bastante raros como para olvidarse de ellos hasta que dejan de serlo.
Las formas de los costos no se parecen entre sí
• Precio — capex de GPU de NV-Reason-CT más tu propio stack de servicio frente a Kimi K3 $3.00 / $15.00 por millón, $0.30 por lectura en caché
• Gasto mínimo viable — NV-Reason-CT una GPU Ampere o más reciente mantenida indefinidamente vs Kimi K3 una solicitud
• Contexto — NV-Reason-CT un volumen, 13.824 tokens fijos frente a Kimi K3 1.048.576 tokens
• Coste marginal de la milésima solicitud — NV-Reason-CT prácticamente cero una vez pagada la GPU frente a Kimi K3, lineal en tokens
• Dónde falla primero — rendimiento no verificado de NV-Reason-CT y sin estrategia de batching frente al costo de contexto largo de Kimi K3 a 1M de tokens por solicitud
• Modalidades — NV-Reason-CT 3D NIfTI, tórax o abdomen frente a Kimi K3 texto e imagen, cualquier cosa

La economía se invierte según el volumen. Kimi K3 no cuesta nada empezar y escala de forma lineal. NV-Reason-CT cuesta una GPU empezar y luego escala de forma casi plana —por eso 210 descargas no son una señal de fracaso. Es el número correcto para un checkpoint cuya audiencia son instituciones que ya poseen el hardware y que nunca aparecerán en absoluto en una estadística de rendimiento de tokens.

Cuál estás eligiendo en realidad
Si la tarea consiste en leer un volumen de TC y producir un hallazgo estructurado con una traza de razonamiento, Kimi K3 no puede hacerlo y NV-Reason-CT sí. No es que "lo haga peor": no puede, porque no hay ningún codificador volumétrico en ninguna parte de él, y aplanar una exploración en imágenes primero descarta las relaciones espaciales que la vía 3D existe para preservar.
Si el trabajo consiste en leer 400 páginas de notas de derivación, cotejarlas con un documento de protocolo y emitir una salida estructurada, NV-Reason-CT no está en la conversación y Kimi K3 es una de las mejores respuestas disponibles, con una tasa de error medida inferior a un cuarto de punto porcentual en nuestra red.

La verdadera decisión no está entre los dos. Está en si tu problema es un problema de volumen o un problema de texto, y la brecha de 210 frente a 588 millones es simplemente cómo se ve esa distinción desde fuera. Un modelo es un paper con pesos. El otro es una pieza de infraestructura. Ambos vale la pena tenerlos; ninguno sustituye al otro.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
