
NV-Reason-CT vs GLM-5.2: Uno de estos está obsoleto, y no es el que crees
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 97 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
El modelo más antiguo de esta comparación es el que se está retirando. GLM-5.2 se lanzó el 16 de junio de 2026; NV-Reason-CT tiene actividad en el repositorio fechada entre el 2 y el 25 de septiembre de 2026. Uno esperaría que el de septiembre fuera la incógnita y que el de junio fuera la opción consolidada. Lo contrario es cierto en el eje que importa para un pipeline de texto: GLM-5.2 ha sido reemplazado por GLM-5.3, que se lanzó el 18 de agosto de 2026, y ahora lleva un marcador de obsolescencia en la tabla de clasificación independiente donde se publican sus cifras. NV-Reason-CT, al margen de cualquier otra cosa que quede sin resolver sobre él, es la versión actual de lo único que hace.
Así que la primera frase útil de este artículo es la que menos probabilidades tiene de tener un lector: si hoy empiezas una compilación de texto y, por costumbre, recurres a GLM-5.2, detente y mira primero GLM-5.3. Cuesta $1.26 por millón de tokens de entrada y $3.96 por millón de salida, frente a los $1.40 y $4.40 de GLM-5.2 —es a la vez más nuevo y más barato—, y su índice de inteligencia independiente es 44.8 frente a 33.7, lo que representa un avance en la misma escala y no un movimiento lateral. Esa es una decisión separada de cualquier cosa relacionada con CT, y merece tomarse por separado.
Los dos modelos, y los dos tipos diferentes de lo obsoleto
Existe una distinción real entre un modelo que es antiguo y un modelo que ha sido reemplazado, y esta contraposición lo hace concreto.
• Qué hace — NV-Reason-CT lee un volumen de TC de tórax o abdomen y emite hallazgos estructurados por región anatómica; GLM-5.2 es un modelo de lenguaje solo de texto para razonamiento, código y trabajo con documentos extensos
• Publicado — los artefactos de NV-Reason-CT datan del 2 al 25 de septiembre de 2026; GLM-5.2, el 16 de junio de 2026, y GLM-5.3, el 18 de agosto de 2026
• Estado de generación — NV-Reason-CT es la versión 0.1, un lanzamiento inicial, no anunciado; GLM-5.2 es la generación anterior de una línea de productos en comercialización
• Posicionamiento independiente — no existen mediciones independientes de NV-Reason-CT; GLM-5.2 se sitúa en 33,7 en el Artificial Analysis Intelligence Index, con una marca de obsolescencia, frente a GLM-5.3 con 44,8
• Licencia y acceso — pesos de OpenMDW-1.1 que descargas; frente a un modelo de pesos abiertos ofrecido a $1,40 y $4,40 por millón de tokens, con lecturas en caché a $0,26
• Contexto — 13.824 tokens visuales por volumen sin ventana de chat; frente a 1.000.000 de tokens de entrada y 128.000 de salida
• Uso declarado — solo para investigación y educación, no es un dispositivo médico; en contra de su despliegue para uso general
La palabra «deprecated» cumple aquí una función precisa y conviene no sobreinterpretarla. Un marcador de deprecación en una tabla de clasificación significa que el evaluador ha dejado de considerar el modelo como vigente, normalmente porque un sucesor ha ocupado su lugar. No significa que los pesos se hayan retirado, que la API se haya desactivado o que el modelo haya dejado de funcionar. Los equipos con pipelines ajustados contra GLM-5.2 no están en problemas. Lo que sí significa es que sus cifras son una instantánea de antes de que existiera GLM-5.3, y que mezclarlas con números actuales de otros modelos es comparar una medición de junio con un campo de septiembre.
Los números que tiene cada lado, y cuánto valen
El historial de GLM-5.2 está inusualmente bien poblado, y proviene de dos fuentes que discrepan de maneras instructivas.
Según los propios informes de Z.ai, el modelo registra 99,12 en τ²-Bench, 62,1 en SWE-bench Pro, 54,7 en Humanity's Last Exam con herramientas y un máximo reportado de 82,7 en Terminal-Bench 2.1. Por el lado independiente, Artificial Analysis mide el mismo modelo en 77,9 en Terminal-Bench 2.1, 33,7 en su Intelligence Index, 89,5 en GPQA Diamond y 41,1 en Humanity's Last Exam. Hay otras cifras del proveedor —99,2 en AIME 2026, 92,5 en HMMT February 2026, 91 en IMOAnswerBench, 74,4 en FrontierSWE, 63,7 en ProgramBench, 76,8 en MCP-Atlas— y todas son de Z.ai.
Dos cosas de esa lista merecen mención. En primer lugar, la diferencia de 4,8 puntos en Terminal-Bench 2.1 entre el 82,7 mejor reportado por el proveedor y el 77,9 independiente no es una contradicción. Las cifras mejores reportadas por el proveedor suelen ser la mejor de varios arneses de evaluación, y la propia cifra de Z.ai para Terminus-2 en el mismo benchmark es 81: la medición independiente se sitúa dentro del propio rango del proveedor. En segundo lugar, la brecha en Humanity's Last Exam es mayor: 41,1 de forma independiente frente a una cifra del proveedor de 40,5 sin herramientas y 54,7 con ellas, lo que significa que el 54,7 destacado es una cifra asistida por herramientas y el 41,1 es la pura. Citar 54,7 junto a la puntuación sin herramientas de otro modelo sería un error real.
El historial de NV-Reason-CT no tiene esa estructura de dos fuentes, y ahí es precisamente donde es más débil. Sus resultados en CT-RATE —0.614 de F1 y 0.871 de AUROC en dieciocho etiquetas, con un umbral uniforme fijo, un prompt directo de sí/no y sin cabeza de clasificación ni adaptación específica a la tarea— son de la propia NVIDIA. Los modelos con los que se lo compara en ese artículo (VoxelFM 0.581, Pillar-0 0.544, ClinFusion-8B 0.442, CT-CLIP 0.398, Merlin 0.358, MedGemma 1.5 0.303) son todos modelos de imagen. Nada se ha reproducido de forma independiente, y el modelo lleva semanas disponible para su descarga. También informa un macro-F1 derivado de informes de 0.592 y un estudio preliminar con radiólogos expertos que vincula la revisión asistida con una reducción del 50 % en el tiempo medio de interpretación reportado, que los propios autores señalan como de muestra pequeña grave.
Así que la comparación de procedencia no favorece al modelo más nuevo, y este es el punto que merece detenerse a considerar. GLM-5.2 es el modelo más antiguo, ya superado, y sus cifras son más fiables que las de NV-Reason-CT, porque alguien externo a la empresa ejecutó el banco de pruebas. Estar al día no es lo mismo que estar verificado.

Por qué la deprecación importa más de lo que parece
Existe un fallo específico que esta comparación está diseñada para prevenir, y no tiene nada que ver con CT en absoluto.
Un equipo que construye una canalización de texto clínico busca un modelo de pesos abiertos para ejecutarlo en su propio hardware, porque los datos son sensibles. Encuentran GLM-5.2, que tiene licencia MIT, 743 mil millones de parámetros con aproximadamente 40 mil millones activos, cumple los requisitos y tiene un historial de benchmarks bien documentado. Ajustan contra él. Seis meses después descubren que la generación actual es GLM-5.3, que tiene contexto de 1M con un límite de salida de 128K, que es más barato a $1.26 y $3.96, y que la decisión que creían estar tomando —sobre qué modelo de pesos abiertos estandarizarse— era en realidad una decisión sobre qué generación, y la tomaron por accidente.
Ese es un accidente costoso de descubrir tarde, y se puede evitar con una sola búsqueda. La guía concreta:
• Comprueba si el modelo sobre el que vas a estandarizar es la generación actual — un marcador de obsolescencia en la tabla de clasificación es la señal más rápida, y la lista de modelos del propio proveedor es la autoritativa
• No mezcles una instantánea de junio con cifras de septiembre — el índice de 33.7 de GLM-5.2 se midió antes de que GLM-5.3 existiera, y colocarlo junto al índice de un modelo actual compara dos momentos distintos de un campo en movimiento
• Cuidado con el nombre — un anuncio de "GLM-5.3 Prime" es un nivel de servicio que lleva los mismos pesos a aproximadamente el doble del precio de lista, no un modelo aparte. Comprueba los pesos que hay detrás de cualquier SKU antes de pagar un sobreprecio por él
• Trata una tarifa anunciada más baja como una pregunta, no como una respuesta — que GLM-5.3 sea más barato que su predecesor es inusual y merece verificarse con tu propia carga de trabajo en lugar de darlo por sentado
Nada de eso convierte a GLM-5.2 en una mala elección. Un modelo de 743B con licencia MIT a $1.40 y $4.40 que un equipo ya ha ajustado es algo perfectamente razonable para seguir ejecutando, y un modelo de generación intermedia con un historial consolidado a veces es exactamente lo que quiere un flujo de trabajo regulado. La cuestión es que debería ser una elección, tomada deliberadamente, en lugar de un valor predeterminado heredado de una lista que estaba vigente en julio.
La trampa de comparar un modelo de texto con un modelo CT
La razón por la que este emparejamiento parece siquiera plausible es que ambos son modelos de pesos abiertos publicados en 2026, y un lector que hojea un catálogo ve dos entradas comparables. No son comparables, y la discrepancia tiene una forma específica.
GLM-5.2 admite 1.000.000 de tokens. Un único volumen de TC de NV-Reason-CT cuesta 13.824 tokens visuales. Según esa aritmética, GLM-5.2 podría albergar setenta estudios de TC y aún tener espacio, lo que invita a concluir que un modelo de texto con un contexto suficientemente largo hace redundante al modelo de imágenes. La conclusión no se sigue, y la razón es la interfaz, no el presupuesto.
Esos 13.824 tokens no son un resumen. Son un cubo de 384 milímetros remuestreado a 2 mm isotrópicos, cortado en parches de 8 x 8 x 8 sobre una cuadrícula de 24 x 24 x 24 y entregado a un backbone de lenguaje sin submuestreo espacial ni capa de fusión; por eso la ruta activa es de 4,35B parámetros de los 4,69B totales, y por eso el cómputo se dedica a mantener la resolución en lugar de comprimirla y eliminarla. GLM-5.2 es solo texto. No tiene ninguna ruta de visión, así que la pregunta de cómo manejaría un escaneo no se plantea; la respuesta es que no se le puede dar uno de ninguna forma. Las dos tarjetas de modelo describen una diferencia de seiscientas veces en el presupuesto de tokens que no tiene nada que ver con la comparación, porque uno de ellos no tiene forma de recibir la entrada.
El error inverso es igual de factible. NV-Reason-CT admite tórax y abdomen, toma un archivo NIfTI en lugar de un prompt, no tiene uso de herramientas, y su tarjeta de modelo lo restringe a investigación y educación y afirma que no es un dispositivo médico y que las salidas pueden ser incorrectas. No puede normalizar un corpus de informes, escribir un arnés de evaluación ni razonar sobre un documento de directrices. Un modelo de imágenes de 4,7B no es sustituto de un modelo de texto de 743B, ni lo es a la inversa.

Poniendo el texto medio en una tecla
Si la pregunta es sobre qué modelo de texto usar para el trabajo del pipeline, hoy la respuesta probablemente sea GLM-5.3 en lugar de GLM-5.2, y ambos están en nuestro catálogo bajo una misma clave. z-ai/glm-5.2se sirve a la tarifa de lista del proveedor Z.ai sin recargo, y GLM-5.3 junto a él, dentro de una única API que cubre más de 200 modelos. Mantener ambos disponibles importa más de lo habitual durante un cambio de generación: puedes medir el sucesor con tu propio corpus antes de decidirte, conservar el actual como respaldo mientras lo haces y cambiar sin un segundo contrato ni un cambio de código.
La tarifa de traspaso merece una frase por la misma razón por la que importa en cualquier modelo cuyo proveedor cambie los precios. Al no haber una capa de recargo de por medio, un cambio de tarifa del proveedor llega a nuestro lado el mismo día. La conmutación por error automática cubre que un proveedor se degrade a mitad de lote, lo que en un trabajo de extracción largo es el fallo que de verdad cuesta una noche entera, y el DSL de enrutamiento te permite enviar cada solicitud al modelo que debería encargarse de ella en lugar de apuntarlo todo a un solo endpoint.
NV-Reason-CT no está en nuestra plataforma, y ningún modelo de NVIDIA lo está. Vale la pena decirlo claramente en vez de dejarlo a la inferencia: el lado de CT de esta arquitectura son pesos descargados en tu propio hardware, bajo una licencia que lo permite y una tarjeta de modelo que prohíbe el uso clínico. No lo alojamos y no vamos a escribir una frase que sugiera lo contrario.
El orden en el que tomar estas decisiones
La secuencia correcta para una compilación clínica no es la que implica la comparación.
Empieza por la cuestión de la generación de texto, y comiénzala comprobando qué generación es la actual —GLM-5.3 en lugar de GLM-5.2, en precio y en capacidad medida—, a menos que tengas una razón para quedarte como estás. Luego mide la latencia por estudio del modelo CT en tu propio hardware, porque esa cifra no está publicada y condiciona el resto del presupuesto. Después diseña el pipeline para que las dos mitades sean reemplazables de forma independiente, ya que una está en un ciclo de vida cercano a preview y la otra está en la versión 0.1.
Lo único que no hay que hacer es tratarlos como una elección. Un modelo de texto 743B reemplazado y un modelo CT 4.69B actual no tienen ninguna tarea en común. La comparación solo vale la pena por lo que revela: que el artefacto más nuevo tiene la evidencia más débil detrás, que el más antiguo está silenciosamente fuera de generación, y que ambos hechos son invisibles para cualquiera que lea una fila de catálogo que los enumera uno al lado del otro como si fueran alternativas.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
