Una tarjeta destacada generada titulada 'NV-Reason-CT vs GLM-5.2' con el subtítulo 'Una de estas está obsoleta, y no es la que crees'. Dos tarjetas enfrentadas están separadas por un par de flechas azules: la tarjeta izquierda está etiquetada como 'NV-Reason-CT' con un icono de escaneo corporal y 'lanzada en septiembre de 2026 - actual - solo TC de tórax y abdomen'; la tarjeta derecha está etiquetada como 'GLM-5.2' con un icono de chip y 'lanzada en junio de 2026 - reemplazada por GLM-5.3 - obsoleta en Artificial Analysis'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

NV-Reason-CT vs GLM-5.2: Uno de estos está obsoleto, y no es el que crees

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El modelo más antiguo de esta comparación es el que se está retirando. GLM-5.2 se lanzó el 16 de junio de 2026; NV-Reason-CT tiene actividad en el repositorio fechada entre el 2 y el 25 de septiembre de 2026. Uno esperaría que el de septiembre fuera la incógnita y que el de junio fuera la opción consolidada. Lo contrario es cierto en el eje que importa para un pipeline de texto: GLM-5.2 ha sido reemplazado por GLM-5.3, que se lanzó el 18 de agosto de 2026, y ahora lleva un marcador de obsolescencia en la tabla de clasificación independiente donde se publican sus cifras. NV-Reason-CT, al margen de cualquier otra cosa que quede sin resolver sobre él, es la versión actual de lo único que hace.

Así que la primera frase útil de este artículo es la que menos probabilidades tiene de tener un lector: si hoy empiezas una compilación de texto y, por costumbre, recurres a GLM-5.2, detente y mira primero GLM-5.3. Cuesta $1.26 por millón de tokens de entrada y $3.96 por millón de salida, frente a los $1.40 y $4.40 de GLM-5.2 —es a la vez más nuevo y más barato—, y su índice de inteligencia independiente es 44.8 frente a 33.7, lo que representa un avance en la misma escala y no un movimiento lateral. Esa es una decisión separada de cualquier cosa relacionada con CT, y merece tomarse por separado.

Los dos modelos, y los dos tipos diferentes de lo obsoleto

Existe una distinción real entre un modelo que es antiguo y un modelo que ha sido reemplazado, y esta contraposición lo hace concreto.

• Qué hace — NV-Reason-CT lee un volumen de TC de tórax o abdomen y emite hallazgos estructurados por región anatómica; GLM-5.2 es un modelo de lenguaje solo de texto para razonamiento, código y trabajo con documentos extensos

• Publicado — los artefactos de NV-Reason-CT datan del 2 al 25 de septiembre de 2026; GLM-5.2, el 16 de junio de 2026, y GLM-5.3, el 18 de agosto de 2026

• Estado de generación — NV-Reason-CT es la versión 0.1, un lanzamiento inicial, no anunciado; GLM-5.2 es la generación anterior de una línea de productos en comercialización

• Posicionamiento independiente — no existen mediciones independientes de NV-Reason-CT; GLM-5.2 se sitúa en 33,7 en el Artificial Analysis Intelligence Index, con una marca de obsolescencia, frente a GLM-5.3 con 44,8

• Licencia y acceso — pesos de OpenMDW-1.1 que descargas; frente a un modelo de pesos abiertos ofrecido a $1,40 y $4,40 por millón de tokens, con lecturas en caché a $0,26

• Contexto — 13.824 tokens visuales por volumen sin ventana de chat; frente a 1.000.000 de tokens de entrada y 128.000 de salida

• Uso declarado — solo para investigación y educación, no es un dispositivo médico; en contra de su despliegue para uso general

La palabra «deprecated» cumple aquí una función precisa y conviene no sobreinterpretarla. Un marcador de deprecación en una tabla de clasificación significa que el evaluador ha dejado de considerar el modelo como vigente, normalmente porque un sucesor ha ocupado su lugar. No significa que los pesos se hayan retirado, que la API se haya desactivado o que el modelo haya dejado de funcionar. Los equipos con pipelines ajustados contra GLM-5.2 no están en problemas. Lo que sí significa es que sus cifras son una instantánea de antes de que existiera GLM-5.3, y que mezclarlas con números actuales de otros modelos es comparar una medición de junio con un campo de septiembre.

Los números que tiene cada lado, y cuánto valen

El historial de GLM-5.2 está inusualmente bien poblado, y proviene de dos fuentes que discrepan de maneras instructivas.

Según los propios informes de Z.ai, el modelo registra 99,12 en τ²-Bench, 62,1 en SWE-bench Pro, 54,7 en Humanity's Last Exam con herramientas y un máximo reportado de 82,7 en Terminal-Bench 2.1. Por el lado independiente, Artificial Analysis mide el mismo modelo en 77,9 en Terminal-Bench 2.1, 33,7 en su Intelligence Index, 89,5 en GPQA Diamond y 41,1 en Humanity's Last Exam. Hay otras cifras del proveedor —99,2 en AIME 2026, 92,5 en HMMT February 2026, 91 en IMOAnswerBench, 74,4 en FrontierSWE, 63,7 en ProgramBench, 76,8 en MCP-Atlas— y todas son de Z.ai.

Dos cosas de esa lista merecen mención. En primer lugar, la diferencia de 4,8 puntos en Terminal-Bench 2.1 entre el 82,7 mejor reportado por el proveedor y el 77,9 independiente no es una contradicción. Las cifras mejores reportadas por el proveedor suelen ser la mejor de varios arneses de evaluación, y la propia cifra de Z.ai para Terminus-2 en el mismo benchmark es 81: la medición independiente se sitúa dentro del propio rango del proveedor. En segundo lugar, la brecha en Humanity's Last Exam es mayor: 41,1 de forma independiente frente a una cifra del proveedor de 40,5 sin herramientas y 54,7 con ellas, lo que significa que el 54,7 destacado es una cifra asistida por herramientas y el 41,1 es la pura. Citar 54,7 junto a la puntuación sin herramientas de otro modelo sería un error real.

El historial de NV-Reason-CT no tiene esa estructura de dos fuentes, y ahí es precisamente donde es más débil. Sus resultados en CT-RATE —0.614 de F1 y 0.871 de AUROC en dieciocho etiquetas, con un umbral uniforme fijo, un prompt directo de sí/no y sin cabeza de clasificación ni adaptación específica a la tarea— son de la propia NVIDIA. Los modelos con los que se lo compara en ese artículo (VoxelFM 0.581, Pillar-0 0.544, ClinFusion-8B 0.442, CT-CLIP 0.398, Merlin 0.358, MedGemma 1.5 0.303) son todos modelos de imagen. Nada se ha reproducido de forma independiente, y el modelo lleva semanas disponible para su descarga. También informa un macro-F1 derivado de informes de 0.592 y un estudio preliminar con radiólogos expertos que vincula la revisión asistida con una reducción del 50 % en el tiempo medio de interpretación reportado, que los propios autores señalan como de muestra pequeña grave.

Así que la comparación de procedencia no favorece al modelo más nuevo, y este es el punto que merece detenerse a considerar. GLM-5.2 es el modelo más antiguo, ya superado, y sus cifras son más fiables que las de NV-Reason-CT, porque alguien externo a la empresa ejecutó el banco de pruebas. Estar al día no es lo mismo que estar verificado.

A generated scoreboard titled 'Provenance, not recency, decides what to trust' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; independent checks, none; model status, version 0.1, unannounced, current; licence, OpenMDW-1.1, research and education only. The right column, headed 'GLM-5.2', lists five rows: AA Intelligence 33.7, GPQA Diamond 89.5; provenance, vendor and Artificial Analysis; independent checks, yes, with a 4.8-point vendor-versus-independent gap on Terminal-Bench 2.1; model status, superseded by GLM-5.3 and deprecated by the evaluator; licence, open weights at $1.40 and $4.40 per million. A footer reads 'The superseded model is the better-verified one. Recency is not the same as evidence.'

Por qué la deprecación importa más de lo que parece

Existe un fallo específico que esta comparación está diseñada para prevenir, y no tiene nada que ver con CT en absoluto.

Un equipo que construye una canalización de texto clínico busca un modelo de pesos abiertos para ejecutarlo en su propio hardware, porque los datos son sensibles. Encuentran GLM-5.2, que tiene licencia MIT, 743 mil millones de parámetros con aproximadamente 40 mil millones activos, cumple los requisitos y tiene un historial de benchmarks bien documentado. Ajustan contra él. Seis meses después descubren que la generación actual es GLM-5.3, que tiene contexto de 1M con un límite de salida de 128K, que es más barato a $1.26 y $3.96, y que la decisión que creían estar tomando —sobre qué modelo de pesos abiertos estandarizarse— era en realidad una decisión sobre qué generación, y la tomaron por accidente.

Ese es un accidente costoso de descubrir tarde, y se puede evitar con una sola búsqueda. La guía concreta:

• Comprueba si el modelo sobre el que vas a estandarizar es la generación actual — un marcador de obsolescencia en la tabla de clasificación es la señal más rápida, y la lista de modelos del propio proveedor es la autoritativa

• No mezcles una instantánea de junio con cifras de septiembre — el índice de 33.7 de GLM-5.2 se midió antes de que GLM-5.3 existiera, y colocarlo junto al índice de un modelo actual compara dos momentos distintos de un campo en movimiento

• Cuidado con el nombre — un anuncio de "GLM-5.3 Prime" es un nivel de servicio que lleva los mismos pesos a aproximadamente el doble del precio de lista, no un modelo aparte. Comprueba los pesos que hay detrás de cualquier SKU antes de pagar un sobreprecio por él

• Trata una tarifa anunciada más baja como una pregunta, no como una respuesta — que GLM-5.3 sea más barato que su predecesor es inusual y merece verificarse con tu propia carga de trabajo en lugar de darlo por sentado

Nada de eso convierte a GLM-5.2 en una mala elección. Un modelo de 743B con licencia MIT a $1.40 y $4.40 que un equipo ya ha ajustado es algo perfectamente razonable para seguir ejecutando, y un modelo de generación intermedia con un historial consolidado a veces es exactamente lo que quiere un flujo de trabajo regulado. La cuestión es que debería ser una elección, tomada deliberadamente, en lugar de un valor predeterminado heredado de una lista que estaba vigente en julio.

La trampa de comparar un modelo de texto con un modelo CT

La razón por la que este emparejamiento parece siquiera plausible es que ambos son modelos de pesos abiertos publicados en 2026, y un lector que hojea un catálogo ve dos entradas comparables. No son comparables, y la discrepancia tiene una forma específica.

GLM-5.2 admite 1.000.000 de tokens. Un único volumen de TC de NV-Reason-CT cuesta 13.824 tokens visuales. Según esa aritmética, GLM-5.2 podría albergar setenta estudios de TC y aún tener espacio, lo que invita a concluir que un modelo de texto con un contexto suficientemente largo hace redundante al modelo de imágenes. La conclusión no se sigue, y la razón es la interfaz, no el presupuesto.

Esos 13.824 tokens no son un resumen. Son un cubo de 384 milímetros remuestreado a 2 mm isotrópicos, cortado en parches de 8 x 8 x 8 sobre una cuadrícula de 24 x 24 x 24 y entregado a un backbone de lenguaje sin submuestreo espacial ni capa de fusión; por eso la ruta activa es de 4,35B parámetros de los 4,69B totales, y por eso el cómputo se dedica a mantener la resolución en lugar de comprimirla y eliminarla. GLM-5.2 es solo texto. No tiene ninguna ruta de visión, así que la pregunta de cómo manejaría un escaneo no se plantea; la respuesta es que no se le puede dar uno de ninguna forma. Las dos tarjetas de modelo describen una diferencia de seiscientas veces en el presupuesto de tokens que no tiene nada que ver con la comparación, porque uno de ellos no tiene forma de recibir la entrada.

El error inverso es igual de factible. NV-Reason-CT admite tórax y abdomen, toma un archivo NIfTI en lugar de un prompt, no tiene uso de herramientas, y su tarjeta de modelo lo restringe a investigación y educación y afirma que no es un dispositivo médico y que las salidas pueden ser incorrectas. No puede normalizar un corpus de informes, escribir un arnés de evaluación ni razonar sobre un documento de directrices. Un modelo de imágenes de 4,7B no es sustituto de un modelo de texto de 743B, ni lo es a la inversa.

A generated scoreboard titled 'Two open-weight models, two different jobs' listing six paired rows. Row one: what it reads, one-channel NIfTI volumes in Hounsfield units against text only. Row two: context, 13,824 visual tokens per volume against 1,000,000 tokens in and 128,000 out. Row three: parameters, 4.69B total and 4.35B active against 743B total and about 40B active. Row four: generation status, version 0.1 current, unannounced against superseded by GLM-5.3. Row five: price, self-hosted with no rate card against $1.40 and $4.40 per million, or $1.26 and $3.96 for the successor. Row six: stated use, research and education, not a medical device against general purpose. A footer reads 'GLM-5.2 figures per the provider and Artificial Analysis; NV-Reason-CT figures per the authors paper.'

Poniendo el texto medio en una tecla

Si la pregunta es sobre qué modelo de texto usar para el trabajo del pipeline, hoy la respuesta probablemente sea GLM-5.3 en lugar de GLM-5.2, y ambos están en nuestro catálogo bajo una misma clave. z-ai/glm-5.2se sirve a la tarifa de lista del proveedor Z.ai sin recargo, y GLM-5.3 junto a él, dentro de una única API que cubre más de 200 modelos. Mantener ambos disponibles importa más de lo habitual durante un cambio de generación: puedes medir el sucesor con tu propio corpus antes de decidirte, conservar el actual como respaldo mientras lo haces y cambiar sin un segundo contrato ni un cambio de código.

La tarifa de traspaso merece una frase por la misma razón por la que importa en cualquier modelo cuyo proveedor cambie los precios. Al no haber una capa de recargo de por medio, un cambio de tarifa del proveedor llega a nuestro lado el mismo día. La conmutación por error automática cubre que un proveedor se degrade a mitad de lote, lo que en un trabajo de extracción largo es el fallo que de verdad cuesta una noche entera, y el DSL de enrutamiento te permite enviar cada solicitud al modelo que debería encargarse de ella en lugar de apuntarlo todo a un solo endpoint.

NV-Reason-CT no está en nuestra plataforma, y ningún modelo de NVIDIA lo está. Vale la pena decirlo claramente en vez de dejarlo a la inferencia: el lado de CT de esta arquitectura son pesos descargados en tu propio hardware, bajo una licencia que lo permite y una tarjeta de modelo que prohíbe el uso clínico. No lo alojamos y no vamos a escribir una frase que sugiera lo contrario.

El orden en el que tomar estas decisiones

La secuencia correcta para una compilación clínica no es la que implica la comparación.

Empieza por la cuestión de la generación de texto, y comiénzala comprobando qué generación es la actual —GLM-5.3 en lugar de GLM-5.2, en precio y en capacidad medida—, a menos que tengas una razón para quedarte como estás. Luego mide la latencia por estudio del modelo CT en tu propio hardware, porque esa cifra no está publicada y condiciona el resto del presupuesto. Después diseña el pipeline para que las dos mitades sean reemplazables de forma independiente, ya que una está en un ciclo de vida cercano a preview y la otra está en la versión 0.1.

Lo único que no hay que hacer es tratarlos como una elección. Un modelo de texto 743B reemplazado y un modelo CT 4.69B actual no tienen ninguna tarea en común. La comparación solo vale la pena por lo que revela: que el artefacto más nuevo tiene la evidencia más débil detrás, que el más antiguo está silenciosamente fuera de generación, y que ambos hechos son invisibles para cualquiera que lea una fila de catálogo que los enumera uno al lado del otro como si fueran alternativas.

A screenshot of the OrcaRouter model page for GLM 5.2, showing the identifier z-ai/glm-5.2 with a Featured badge and tags for Tools, JSON and Reasoning, the description of it as Z.ai's flagship model for long-horizon tasks with a 1M-token context window and up to 128K output tokens, a side panel listing a 1M-token context window and 128K maximum output with text input and text output, and a stat strip reading $1.40 per million input tokens, $4.40 per million output tokens, and a p50 time to first token under five seconds.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario