
NV-Reason-CT vs. Claude Opus 5: Um Erro de Categoria que Vale a Pena Levar a Sério
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 506 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 183 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Colocar NV-Reason-CT e Claude Opus 5 na mesma frase é um erro de categoria, e ainda assim vale a pena fazê-lo, porque o erro é instrutivo. O NV-Reason-CT é um modelo nativo de visão-linguagem 3D com 4,69 bilhões de parâmetros da NVIDIA que recebe um volume de TC de tórax ou abdômen em unidades Hounsfield e produz um relatório estruturado achado por achado. Não é um dispositivo médico e o próprio cartão do modelo diz isso. O Claude Opus 5 é o modelo geral de fronteira de texto e visão do fornecedor, lançado em 24 de julho de 2026, com uma janela de contexto de um milhão de tokens, um teto de saída de 128.000 tokens e uma taxa publicada de cinco dólares por milhão de tokens de entrada e vinte e cinco por milhão de saída. Um deles lê uma TC. O outro lê todo o resto.
O motivo pelo qual a comparação continua a ser feita — e continuará, sempre que alguém vê um novo VLM médico e recorre a uma régua familiar — é que ambos produzem prosa sobre uma imagem. Essa semelhança superficial está a causar verdadeiros danos à forma como as pessoas raciocinam sobre os dois, por isso vale a pena deslindar isto em detalhe.
O eixo real que eles compartilham, e aquele que não compartilham.
Eles se sobrepõem em exatamente um ponto, e ele é mais estreito do que parece.
• Modalidade em — O NV-Reason-CT recebe volumes NIfTI de canal único em unidades Hounsfield por meio de um processador tridimensional dedicado; o Claude Opus 5 recebe texto, imagens e arquivos, o que constitui uma interface de segunda geração para imagens e não consegue processar nativamente um estudo de TC volumétrico
• O que retorna — uma lista de achados organizada por região anatômica do NV-Reason-CT, em comparação com prosa geral, JSON estruturado ou chamadas de ferramentas do Claude Opus 5
• Unidades de trabalho — um volume de TC, reamostrado para 2 mm isotrópicos, recortado para a anatomia, dividido em patches de 8 x 8 x 8; em comparação com o que você colocar em um orçamento de tokens
• Contexto — o NV-Reason não tem nenhuma janela de chat; um único volume se torna 13.824 tokens visuais sem downsampling. O Claude Opus 5 comporta 1.000.000 de tokens de entrada e emite até 128.000
• Licença — OpenMDW-1.1, um modelo baixável que você executa em seu próprio hardware; em comparação com uma API hospedada
• Uso declarado — apenas para pesquisa e educação, explicitamente não é um dispositivo médico, para o NV-Reason-CT; contra assistência de propósito geral para Claude Opus 5
• Preço — sem preço de tabela, porque não há nada para comprar, apenas pesos para executar; em comparação com $5 e $25 por milhão de tokens, com leituras em cache a $0.50
A linha "modalidade de entrada" é onde nasce o erro de categoria. Ambos aceitam uma imagem, então ambos parecem modelos de imagem, e um leitor pergunta, com razão, qual é melhor em imagens. Mas um estudo de TC não é uma imagem. É um arranjo volumétrico com uma escala física em milímetros, uma unidade de densidade calibrada e anatomia que só faz sentido em três dimensões. A visão do Claude Opus 5 é genuinamente capaz e consegue discutir sensatamente uma radiografia ou uma lâmina de patologia. Essa é uma tarefa diferente de integrar um cubo de 384 milímetros de valores de Hounsfield com resolução de 2 mm e relatar a lobulação de um nódulo.
O que os números de cada lado realmente medem
Os dois modelos têm registros de benchmark que nunca se tocam, e é lendo-os lado a lado sem perceber isso que se tomam decisões ruins de compras.
O NV-Reason-CT relata seus resultados no benchmark público de TC de tórax CT-RATE, em dezoito rótulos, usando um limiar uniforme fixo e um prompt direto de sim/não, sem cabeça de classificação e sem adaptação específica à tarefa. Ele registra 0,614 de F1 e 0,871 de AUROC, à frente de VoxelFM com 0,581 e 0,870, Pillar-0 com 0,544 e 0,861, ClinFusion-8B com 0,442 de F1, CT-CLIP com 0,398 e 0,733, Merlin com 0,358 e 0,662, e MedGemma 1.5 com 0,303 de F1 quando recebe até 85 cortes axiais. Há também um macro-F1 derivado de laudo de 0,592. Todos esses números vêm do próprio artigo da NVIDIA. Nenhum deles foi reproduzido por mais ninguém, e o modelo está disponível para download há algumas semanas.
O histórico do Claude Opus 5 é de propósito geral e amplamente independente. A Artificial Analysis mede-o em 50,8 no seu Intelligence Index, 78 no seu Coding Index, 93,2 no GPQA Diamond e 54,9 no Humanity's Last Exam, com uma pontuação de recall de contexto longo de 79,33. Esses são números de terceiros em tarefas de raciocínio geral, código e conhecimento. Não há nenhum benchmark de imagem clínica nesse conjunto, e não há nenhuma linha de CT-RATE em lugar nenhum do registro publicado do Claude Opus 5.
Então, a afirmação honesta não é que um está à frente. É que os dois modelos nunca foram medidos na mesma tarefa por ninguém. Qualquer frase da forma "NV-Reason-CT é melhor que Claude Opus 5 em imagens médicas" é não falsificável como está escrita, porque ninguém executou o experimento. A própria tabela de comparação da NVIDIA não contém nenhum modelo de fronteira geral.

Onde as pessoas entendem mal a questão da interface
A única sobreposição técnica genuinamente interessante é aquela sobre a qual ninguém discute: como deveria ser uma interface entre um modelo de CT e um modelo de texto.
Um instinto razoável é alimentar o Claude Opus 5 com um conjunto de imagens de TC ou um volume com downsampling e pedir que ele raciocine. Com 1.000.000 de tokens de contexto, isso soa generoso, e diante de um estudo com apenas 13.824 tokens visuais, parece haver espaço de sobra. O espaço não é o problema. O pipeline de visão do Claude Opus 5 trata uma imagem como uma figura bidimensional com uma escala de pixels. Uma TC de tórax apresentada assim perde o espaçamento entre cortes que torna uma lesão mensurável e a calibração de densidade que faz de "vidro fosco" um limiar em vez de uma descrição. Você pode entregar a ele uma montagem de cortes axiais e receber um parágrafo que soa coerente. O que você não consegue é uma medição.
É precisamente nisso que o design do NV-Reason-CT investe sua computação. A grade 24 x 24 x 24 de um volume de 384 milímetros é entregue ao modelo de linguagem em resolução total, sem subamostragem espacial e sem camada de fusão, e é por isso que a via ativa tem 4,35 bilhões de parâmetros em vez de algo muito menor. A arquitetura é uma aposta de que manter o detalhe espacial vale o custo em tokens. É uma aposta sobre representação, não sobre capacidade linguística, e o Claude Opus 5 não é participante dela.
O padrão produtivo é o entediante: use o modelo de CT para a leitura volumétrica e use um modelo de texto para tudo ao redor dela. Geração e normalização de laudos, resumos de coortes, arcabouços de avaliação, conversão de arquivos DICOM para NIfTI em escala, triagem de quais exames uma pessoa deve analisar primeiro. Isso é trabalho com documentos longos e código, e é aí que um modelo de contexto de 1M justifica seu custo.
Custo, em duas unidades que não se convertem
Claude Opus 5 é cobrado por uso. Cinco dólares por milhão de tokens de entrada e vinte e cinco por milhão de saída, leituras de cache a cinquenta centavos, gravações de cache a dez dólares. Para um pipeline que normaliza um corpus de relatórios ou escreve e reescreve código de avaliação, isso gera uma previsão que você pode montar: tokens de entrada, tokens de saída, leituras em cache, e uma fatura bem mais barata se você acertar no cache.
O NV-Reason-CT não tem preço. Você baixa 4,69 bilhões de parâmetros e paga em eletricidade, horas de GPU e tempo de engenharia. Não há nenhuma cifra de throughput publicada para um estudo completo de 13.824 tokens, e nenhuma variante quantizada disponível, então o custo por estudo de executá-lo é um número que você mesmo teria que medir. Isso é normal para pesos de pesquisa e também é a maior diferença prática entre os dois: um tem uma tabela de preços, o outro tem uma conta que você não consegue ver até já tê-la pago.
A comparação que realmente importa é por estudo, não por token. Uma leitura de TC é uma unidade de trabalho. Uma passagem de normalização de laudo sobre o mesmo caso é um trabalho de texto medido em milhares de tokens. Atribuir um valor em dólares à primeira significa conhecer o seu hardware; atribuir um à segunda é aritmética.
A armadilha no meio da comparação
Há um erro específico que vale a pena nomear, porque é o erro que este confronto convida a cometer. É tratar o NV-Reason-CT como um ajuste fino especializado de um modelo geral e, portanto, assumir que o modelo geral será suficientemente próximo na maioria dos casos e muito mais flexível.
Não é um ajuste fino. É um transformador de visão 3D chamado Primus, inicializado a partir de COLIPRI, acoplado a um backbone de linguagem Qwen3.5-4B com embedding rotativo de posição multi-eixo 3D, treinado em aproximadamente 550.000 exemplos estruturados de perguntas e respostas extraídos de 70.111 volumes de CT abrangendo CT-RATE, CancerVerse e uma coleção interna do NIH, e depois ajustado com GRPO em relação a uma recompensa que pondera o F1 do conjunto de anormalidades em 2,0, uma pontuação de estrutura de relatório específica da região em 0,5 e uma penalidade suave de comprimento em 1,0. O codificador tridimensional é o ponto central do modelo. Uma interface bidimensional ou baseada em fatias é um instrumento diferente, e a própria comparação do artigo mostra quanto vale essa diferença: MedGemma 1.5 com 0,303 de F1 quando alimentado com até 85 fatias axiais, contra 0,614 para o modelo volumétrico nativo.
O erro inverso é igualmente comum e igualmente dispendioso: presumir que, por o NV-Reason-CT ser especializado, deve usá-lo para tudo o que é clínico. Ele suporta tórax e abdómen e nada mais, a sua invocação é um ficheiro NIfTI em vez de uma mensagem de chat, e os termos da sua licença dizem apenas investigação e educação. Não vai ler uma lâmina de patologia, responder a uma pergunta sobre uma diretriz, nem escrever o código que processa em lote a sua conversão de DICOM. Recorrer a um modelo de CT para fazer trabalho de texto é o mesmo erro de categoria que recorrer a um modelo de texto para fazer volumetria, apenas apontando na direção oposta.

Como as duas metades se encaixam em um único sistema
Nenhum modelo substitui o outro, e a arquitetura sensata contém ambos — o que levanta a questão prática de como chamá-los.
O Claude Opus 5 é servido através do OrcaRouter como anthropic/claude-opus-5 à tarifa de tabela do provedor da Anthropic, sem qualquer margem, dentro de uma única API que abrange mais de 200 modelos. Isso importa menos para uma única chamada do que para o pipeline em torno dela: quando a metade de texto de um build clínico é um modelo entre vários candidatos, tê-los todos atrás de uma única chave significa que você pode compará-los no seu próprio corpus sem um segundo contrato ou alteração de código, e a DSL de roteamento permite enviar solicitações individuais para o modelo que deve tratá-las, enquanto o failover automático cobre você quando um provedor se degrada.
NV-Reason-CT não está na nossa plataforma, e nenhum modelo da NVIDIA está. São pesos que descarrega e executa no seu próprio hardware, o que é exatamente o que a licença permite e, dado que a entrada são dados volumétricos derivados de pacientes, é provavelmente o que quer de qualquer forma. Não vamos insinuar que encaminhamos um modelo que não hospedamos. O lado textual da build é onde somos úteis; o lado volumétrico é onde está por sua conta com um modelo de 4,69B e uma GPU.

O veredito que resiste ao escrutínio
Se você precisa de um volume de TC transformado em achados estruturados, há um modelo para isso, ele veio do grupo de pesquisa da NVIDIA, e é um download em vez de uma chamada de API. Se você precisa de um corpus de relatórios normalizados, de uma estrutura de avaliação escrita, de uma tarefa de conversão DICOM scriptada, ou de uma coorte resumida, também há um modelo para isso, e ele tem uma tabela de preços.
A linha a defender é que não se demonstrou que qualquer um dos dois seja melhor que o outro em nenhum aspecto, porque o experimento não foi conduzido. O que se demonstrou é que uma interface nativa tridimensional supera uma baseada em fatias num benchmark público de TC de tórax por uma margem que os autores estimam em cerca de três pontos de F1, e que um modelo de fronteira geral é medido de forma independente no topo da área em raciocínio, código e trabalho com contexto longo. Essas são duas afirmações sobre duas tarefas diferentes. Ler essas afirmações como um ranking é o erro de categoria, e ele sobrevive até o momento em que alguém publique o confronto direto que ninguém publicou ainda.
