Um cartão hero gerado intitulado 'NV-Reason-CT vs GLM-5.2' com o subtítulo 'Um destes está obsoleto, e não é o que você imagina'. Dois cartões frente a frente são separados por um par de setas azuis: o cartão da esquerda está rotulado 'NV-Reason-CT' com um ícone de escaneamento corporal e 'lançado em setembro de 2026 - atual - apenas TC de tórax e abdômen'; o cartão da direita está rotulado 'GLM-5.2' com um ícone de chip e 'lançado em junho de 2026 - substituído pelo GLM-5.3 - obsoleto no Artificial Analysis'. O logotipo do OrcaRouter está composto no canto inferior direito.
Guides & Insights

NV-Reason-CT vs GLM-5.2: Um Destes Está Obsoleto, e Não É o Que Você Pensa

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O modelo mais antigo nesta comparação é o que está sendo descontinuado. GLM-5.2 foi lançado em 16 de junho de 2026; NV-Reason-CT tem atividade no repositório datada entre 2 e 25 de setembro de 2026. Você esperaria que o de setembro fosse a incógnita e que o de junho fosse a escolha consolidada. O oposto é verdadeiro no eixo que importa para um pipeline de texto: o GLM-5.2 foi substituído pelo GLM-5.3, lançado em 18 de agosto de 2026, e agora carrega um marcador de descontinuação no ranking independente onde seus números são publicados. O NV-Reason-CT, seja lá o que mais esteja em aberto a seu respeito, é o lançamento atual da única coisa que ele faz.

Então, a primeira frase útil deste artigo é justamente aquela que um leitor tem menos probabilidade de já ter: se você está começando um build de texto hoje e recorre ao GLM-5.2 por hábito, pare e olhe primeiro para o GLM-5.3. Ele custa US$ 1,26 por milhão de tokens de entrada e US$ 3,96 por milhão de tokens de saída, contra US$ 1,40 e US$ 4,40 do GLM-5.2 — é mais novo e mais barato ao mesmo tempo —, e seu índice de inteligência independente é 44,8 contra 33,7, o que representa um degrau acima na mesma escala, e não um passo lateral. Essa é uma decisão separada de qualquer coisa relacionada a CT, e merece ser tomada separadamente.

Os dois modelos, e os dois tipos diferentes de obsoleto

Há uma distinção real entre um modelo que é antigo e um modelo que foi superado, e este emparelhamento torna isso concreto.

• O que faz — O NV-Reason-CT lê um volume de TC de tórax ou abdômen e emite achados estruturados por região anatômica; o GLM-5.2 é um modelo de linguagem somente texto para raciocínio, código e trabalho com documentos longos

• Lançado — os artefactos do NV-Reason-CT datam de 2 a 25 de setembro de 2026; o GLM-5.2 em 16 de junho de 2026, com o GLM-5.3 a chegar a seguir em 18 de agosto de 2026

• Estado de geração — NV-Reason-CT é a versão 0.1, um lançamento inicial, não anunciado; GLM-5.2 é a geração anterior de uma linha de produtos já comercializada

• Posição independente — não existem medições independentes do NV-Reason-CT; o GLM-5.2 é medido em 33,7 no Artificial Analysis Intelligence Index, com um marcador de descontinuação, contra o GLM-5.3 em 44,8

• Licença e acesso — pesos OpenMDW-1.1 que você baixa; contra um modelo de pesos abertos servido a $1,40 e $4,40 por milhão de tokens, com leituras em cache a $0,26

• Contexto — 13.824 tokens visuais por volume sem janela de chat; contra 1.000.000 tokens de entrada e 128.000 de saída

• Uso declarado — apenas para pesquisa e educação, não é um dispositivo médico; contra a implantação de uso geral

A palavra "deprecated" está fazendo um trabalho preciso aqui e vale a pena não superinterpretar. Um marcador de depreciação em um ranking significa que o avaliador deixou de tratar o modelo como atual, geralmente porque um sucessor tomou seu lugar. Não significa que os pesos foram retirados, que a API foi desligada ou que o modelo parou de funcionar. Equipes com pipelines ajustados para o GLM-5.2 não estão em apuros. O que isso significa é que seus números são um instantâneo de antes de o GLM-5.3 existir, e que misturá-los com números atuais de outros modelos é comparar uma medição de junho com um campo de setembro.

Os números que cada lado tem, e quanto valem

O histórico do GLM-5.2 é excepcionalmente bem preenchido e vem de duas fontes que discordam de maneiras instrutivas.

Segundo o próprio relatório da Z.ai, o modelo alcança 99,12 no τ²-Bench, 62,1 no SWE-bench Pro, 54,7 no Humanity's Last Exam com ferramentas e um melhor resultado reportado de 82,7 no Terminal-Bench 2.1. Do lado independente, a Artificial Analysis mede o mesmo modelo em 77,9 no Terminal-Bench 2.1, 33,7 no seu Intelligence Index, 89,5 no GPQA Diamond e 41,1 no Humanity's Last Exam. Há outros números do fornecedor — 99,2 no AIME 2026, 92,5 no HMMT February 2026, 91 no IMOAnswerBench, 74,4 no FrontierSWE, 63,7 no ProgramBench, 76,8 no MCP-Atlas — e todos são da Z.ai.

Duas coisas nessa lista merecem ser mencionadas. Primeiro, a diferença de 4,8 pontos no Terminus-Bench 2.1 entre os 82,7 do melhor resultado relatado pelo fornecedor e os 77,9 independentes não é uma contradição. Os números mais bem relatados pelo fornecedor costumam ser o melhor de vários harnesses, e o próprio número do Terminus-2 da Z.ai para o mesmo benchmark é 81 — a medição independente fica dentro do intervalo do próprio fornecedor. Segundo, a divisão no Humanity's Exam é maior: 41,1 de forma independente contra um número do fornecedor de 40,5 sem ferramentas e 54,7 com elas, o que significa que o 54,7 em destaque é um número assistido por ferramentas e o 41,1 é o número bruto. Citar 54,7 ao lado da pontuação bruta de outro seria um erro real.

O histórico do NV-Reason-CT não tem essa estrutura de duas fontes, e é exatamente aí que ele é mais fraco. Seus resultados no CT-RATE — 0,614 de F1 e 0,871 de AUROC em dezoito rótulos, com um limiar uniforme fixo e um prompt direto de sim/não, e sem cabeça de classificação nem adaptação específica à tarefa — são da própria NVIDIA. Os modelos com os quais ele é comparado nesse artigo (VoxelFM 0,581, Pillar-0 0,544, ClinFusion-8B 0,442, CT-CLIP 0,398, Merlin 0,358, MedGemma 1.5 0,303) são todos modelos de imagem. Nada foi reproduzido de forma independente, e o modelo está disponível para download há semanas. Ele também relata um macro-F1 derivado de laudo de 0,592 e um estudo preliminar com radiologistas especialistas que associa a revisão assistida a uma redução de 50% no tempo médio de interpretação relatado, que os próprios autores apontam como um grave problema de amostra pequena.

Então, a comparação de proveniência não favorece o modelo mais novo, e este é o ponto que vale a pena ponderar. O GLM-5.2 é o modelo mais antigo, já substituído, e seus números são mais confiáveis do que os do NV-Reason-CT, porque alguém de fora da empresa executou o harness. Ser atual não é o mesmo que ser verificado.

A generated scoreboard titled 'Provenance, not recency, decides what to trust' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; independent checks, none; model status, version 0.1, unannounced, current; licence, OpenMDW-1.1, research and education only. The right column, headed 'GLM-5.2', lists five rows: AA Intelligence 33.7, GPQA Diamond 89.5; provenance, vendor and Artificial Analysis; independent checks, yes, with a 4.8-point vendor-versus-independent gap on Terminal-Bench 2.1; model status, superseded by GLM-5.3 and deprecated by the evaluator; licence, open weights at $1.40 and $4.40 per million. A footer reads 'The superseded model is the better-verified one. Recency is not the same as evidence.'

Por que a depreciação importa mais do que parece

Há uma falha específica que esta comparação foi projetada para evitar, e isso não tem nada a ver com CT.

Uma equipe que constrói um pipeline de texto clínico sai em busca de um modelo de pesos abertos para executar em seu próprio hardware, porque os dados são sensíveis. Eles encontram o GLM-5.2, licenciado sob MIT, com 743 bilhões de parâmetros e cerca de 40 bilhões ativos, que atende aos requisitos e tem um histórico de benchmarks bem documentado. Eles fazem ajustes com base nele. Seis meses depois, descobrem que a geração atual é o GLM-5.3, que ele tem contexto de 1M com teto de saída de 128K, que é mais barato a $1,26 e $3,96, e que a decisão que pensavam estar tomando — em qual modelo de pesos abertos padronizar — era na verdade uma decisão sobre qual geração, e a tomaram por acidente.

Isso é um acidente caro para se descobrir tarde, e é evitável com uma única consulta. A orientação concreta:

• Verifique se o modelo que você está prestes a adotar como padrão é a geração atual — um marcador de descontinuação no ranking é o sinal mais rápido, e a lista de modelos do próprio fornecedor é a fonte autoritativa

• Não misture um instantâneo de junho com números de setembro — o índice de 33,7 do GLM-5.2 foi medido antes de o GLM-5.3 existir, e colocá-lo ao lado do índice de um modelo atual compara dois momentos diferentes em um campo em movimento

• Cuidado com o nome — uma listagem "GLM-5.3 Prime" é um nível de serviço que carrega os mesmos pesos por aproximadamente o dobro do preço de tabela, e não um modelo separado. Confira os pesos por trás de qualquer SKU antes de pagar mais caro por ele

• Trate uma tarifa anunciada mais baixa como uma pergunta, não como uma resposta — o GLM-5.3 ser mais barato do que seu antecessor é incomum e merece ser verificado com sua própria carga de trabalho, em vez de presumido

Nada disso faz do GLM-5.2 uma má escolha. Um modelo de 743B licenciado sob a licença MIT, a US$ 1,40 e US$ 4,40, em relação ao qual uma equipe já fez ajustes, é uma coisa perfeitamente razoável de se manter em execução, e um modelo de geração intermediária com um histórico consolidado às vezes é exatamente o que um fluxo de trabalho regulamentado quer. O ponto é que deveria ser uma escolha, feita de forma deliberada, em vez de um padrão herdado de uma lista que era atual em julho.

A armadilha ao comparar um modelo de texto com um modelo de TC

O motivo pelo qual este emparelhamento parece minimamente plausível é que ambos são modelos de pesos abertos lançados em 2026, e um leitor que percorre um catálogo vê dois itens de linha comparáveis. Eles não são comparáveis, e a incompatibilidade tem uma forma específica.

GLM-5.2 comporta 1.000.000 de tokens. Um único volume de TC do NV-Reason-CT custa 13.824 tokens visuais. Por essa aritmética, o GLM-5.2 poderia comportar setenta exames de TC e ainda ter espaço, o que convida à conclusão de que um modelo de texto com contexto suficientemente longo torna o modelo de imagens redundante. A conclusão não se sustenta, e a razão está na interface, não no orçamento.

Esses 13.824 tokens não são um resumo. Eles são um cubo de 384 milímetros reamostrado para 2 mm isotrópicos, cortado em patches de 8 x 8 x 8 em uma grade de 24 x 24 x 24, entregue a um backbone de linguagem sem downsampling espacial e sem camada de mesclagem — e é por isso que a via ativa é de 4,35B parâmetros dos 4,69B totais, e por que a computação é gasta mantendo a resolução em vez de comprimi-la. O GLM-5.2 é somente texto. Ele não tem nenhum caminho de visão, então a questão de como lidaria com uma varredura não se coloca; a resposta é que não se pode fornecer uma a ele de forma alguma. Os dois model cards descrevem uma diferença de seiscentas vezes no orçamento de tokens que não tem nada a ver com a comparação, porque um deles não tem como receber a entrada.

O erro inverso é igualmente possível. O NV-Reason-CT oferece suporte a tórax e abdômen, recebe um arquivo NIfTI em vez de um prompt, não faz uso de ferramentas, e sua ficha do modelo o restringe à pesquisa e à educação, além de afirmar que não é um dispositivo médico e que as saídas podem estar incorretas. Ele não consegue normalizar um corpus de laudos, escrever um harness de avaliação ou raciocinar sobre um documento de diretrizes. Um modelo de imagem de 4,7B não é substituto para um modelo de texto de 743B, assim como o inverso também não é.

A generated scoreboard titled 'Two open-weight models, two different jobs' listing six paired rows. Row one: what it reads, one-channel NIfTI volumes in Hounsfield units against text only. Row two: context, 13,824 visual tokens per volume against 1,000,000 tokens in and 128,000 out. Row three: parameters, 4.69B total and 4.35B active against 743B total and about 40B active. Row four: generation status, version 0.1 current, unannounced against superseded by GLM-5.3. Row five: price, self-hosted with no rate card against $1.40 and $4.40 per million, or $1.26 and $3.96 for the successor. Row six: stated use, research and education, not a medical device against general purpose. A footer reads 'GLM-5.2 figures per the provider and Artificial Analysis; NV-Reason-CT figures per the authors paper.'

Colocando metade do texto em uma única tecla

Se a questão é qual modelo de texto usar para executar o trabalho do pipeline, a resposta hoje é provavelmente GLM-5.3 em vez de GLM-5.2 — e ambos estão no nosso catálogo sob uma única chave. z-ai/glm-5.2 é servido à tarifa da lista de provedores da Z.ai sem qualquer margem, e o GLM-5.3 ao lado dele, dentro de uma única API que abrange mais de 200 modelos. Manter ambos disponíveis importa mais do que o habitual durante uma mudança de geração: pode avaliar o sucessor no seu próprio corpus antes de se comprometer, manter o titular como alternativa enquanto o faz, e mudar sem um segundo contrato ou alteração de código.

A taxa de repasse merece uma frase pelo mesmo motivo pelo qual importa em qualquer modelo cujo fornecedor reajusta preços. Sem uma camada de markup no meio, uma mudança de tarifa do fornecedor chega até nós no mesmo dia. O failover automático cobre a degradação de um provedor no meio do lote, que, para um trabalho de extração longo, é a falha que realmente custa uma noite, e a DSL de roteamento permite enviar requisições individuais ao modelo que deve tratá-las, em vez de apontar tudo para um único endpoint.

O NV-Reason-CT não está na nossa plataforma, e nenhum modelo da NVIDIA está. Vale a pena dizê-lo claramente, em vez de deixar à inferência: o lado CT desta arquitetura são pesos descarregados no seu próprio hardware, sob uma licença que o permite e um cartão de modelo que proíbe uso clínico. Não o alojamos e não vamos escrever uma frase que sugira o contrário.

A ordem para tomar essas decisões

A sequência correta para um build clínico não é a que a comparação implica.

Comece pela questão da geração de texto e comece verificando qual geração é a atual — GLM-5.3, e não GLM-5.2, tanto em preço quanto em capacidade medida —, a menos que você tenha um motivo para ficar como está. Em seguida, meça a latência por estudo do modelo CT no seu próprio hardware, porque esse número não é publicado e determina o restante do orçamento. Depois, projete o pipeline de modo que as duas metades possam ser substituídas de forma independente, já que uma está em um ciclo de vida adjacente ao de preview e a outra está na versão 0.1.

A única coisa a não fazer é tratar os dois como uma escolha. Um modelo de texto 743B ultrapassado e um modelo CT 4.69B atual não têm nenhuma tarefa em comum. A comparação só vale a pena pelo que revela: que o artefato mais recente tem por trás de si evidências mais fracas, que o mais antigo está discretamente fora de geração, e que ambos os fatos são invisíveis para qualquer pessoa que leia uma linha de catálogo que os lista lado a lado como se fossem alternativas.

A screenshot of the OrcaRouter model page for GLM 5.2, showing the identifier z-ai/glm-5.2 with a Featured badge and tags for Tools, JSON and Reasoning, the description of it as Z.ai's flagship model for long-horizon tasks with a 1M-token context window and up to 128K output tokens, a side panel listing a 1M-token context window and 128K maximum output with text input and text output, and a stat strip reading $1.40 per million input tokens, $4.40 per million output tokens, and a p50 time to first token under five seconds.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente