Um cartão hero gerado com o título 'NV-Reason-CT vs Grok 4.6' e o subtítulo 'Quem lê o exame, e quem lê o laudo'. Três chips alinham-se na parte inferior: 'Um volume de TC vs 500.000 tokens', '0,871 vs 0,870 é empate' e 'Grok 4.6: $2,00 / $6,00 por M'. O logotipo do OrcaRouter é composto no canto inferior direito.
Guides & Insights

NV-Reason-CT vs Grok 4.6: Quem lê a imagem e quem lê o laudo

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Há duas maneiras de colocar uma IA em um pipeline de TC, e apenas uma delas é sobre a imagem. NV-Reason-CT é a primeira: um modelo de visão-linguagem 3D de 4,69 bilhões de parâmetros que lê volumes NIfTI diretamente e foi publicado no Hugging Face em 8 de setembro de 2026, sem um post de lançamento da NVIDIA. Grok 4.6 é a segunda: um modelo de texto e imagem de 500.000 tokens que foi lançado em 12 de agosto de 2026, custa US$ 2,00 por milhão de tokens de entrada e é muito bom na parte do trabalho que acontece depois que alguém já anotou o achado. Coloque-os em uma comparação e a pergunta de sempre — qual deles é melhor — acaba se revelando mal formulada. Eles não estão competindo pelo mesmo espaço no pipeline. Estão competindo pela mesma linha orçamentária.

O que foi realmente lançado de cada lado

O NV-Reason-CT surgiu como um repositório, um artigo e um Space de demonstração, não como um produto. O repositório do GitHub em NVIDIA-Medtech foi criado em 2 de setembro de 2026; os pesos do Hugging Face vieram em 8 de setembro; o preprint do arXiv, NV-Reason-CT: Modelo de Linguagem Visual 3D para Análise de TC, foi publicado em 23 de setembro com dezesseis autores da NVIDIA, do NIH e da Universidade de Zurique. A sala de imprensa da NVIDIA não traz nada sobre isso. O model card descreve a versão 0.1 e restringe o uso à pesquisa e à educação.

Grok 4.6 é o tipo oposto de lançamento. É um endpoint comercial de primeira classe, listado como "Latest" na documentação do desenvolvedor do fornecedor, com preço em uma tabela de preços publicada, e disponível como um modelo compatível com OpenAI que integrações existentes adotam alterando uma URL base. Ele sucedeu o Grok 4.5 com a mesma janela de contexto, a mesma superfície de entrada e o mesmo preço base.

Essa assimetria é toda a história desta comparação. Um é um artefato de pesquisa que por acaso pode ser baixado. O outro é infraestrutura. Ler um em contraste com o outro revela onde a linha entre "artefato de pesquisa" e "infraestrutura" atualmente se situa na área de imagens médicas — e não é onde você imaginaria.

A divisão do trabalho, em insumos e produtos

• Entrada volumétrica — NV-Reason-CT lê volumes NIfTI .nii/.nii.gz em unidades Hounsfield, apenas tórax ou abdômen vs Grok 4.6 lê texto, imagens e arquivos, sem via volumétrica • Tratamento espacial — NV-Reason-CT converte um volume de 384×384×384 mm em uma grade 24×24×24 de 13.824 tokens com MRoPE 3D, sem subamostragem vs Grok 4.6 trata uma imagem como uma figura 2D • Contexto — NV-Reason-CT um volume é um prefixo fixo, sem janela de contexto no sentido usual vs Grok 4.6 500.000 tokens • Saída — NV-Reason-CT relatório estruturado, resposta ou traço de raciocínio com pensamento desativável vs Grok 4.6 texto com saídas estruturadas e chamadas de ferramentas • Licença — NV-Reason-CT OpenMDW-1.1, pesos BF16 de 10,6 GB vs Grok 4.6 proprietário, somente via API • Preço — NV-Reason-CT capex de GPU, sem tarifa por token vs Grok 4.6 US$ 2,00 / US$ 6,00 por milhão, dobrado acima de 200 mil de entrada

A generated scoreboard titled 'NV-Reason-CT vs Grok 4.6 - the scoreboard'. Left column 'NV-Reason-CT': Volumetric input NIfTI, Hounsfield, chest or abdomen; Spatial handling 24x24x24 grid, no downsampling; Context one volume, a fixed prefix; Output report, answer or reasoning trace; Licence OpenMDW-1.1, 10.6 GB BF16; Price GPU capex, no per-token rate. Right column 'Grok 4.6': Volumetric input none - 2D images, text, files; Spatial handling an image is a picture; Context 500,000 tokens; Output text, structured outputs, tools; Licence proprietary, API only; Price $2.00 / $6.00, doubled above 200K. A footer reads 'NV-Reason-CT figures from NVIDIA's model card and paper; Grok 4.6 pricing per the vendor rate card.'

O par soa como uma passagem de bastão natural. O NV-Reason-CT produz o achado a partir do volume; o Grok 4.6 é o modelo ao qual você entregaria mil desses achados, numa única janela de contexto, para procurar padrões em uma coorte. Ninguém publicou esse pipeline. É a arquitetura óbvia, e vale dizer sem rodeios que ela não foi testada.

Os números do Grok 4.6, e de quem são

Dois números referentes ao Grok 4.6 circulam juntos e não são o mesmo tipo de coisa. A pontuação de 94,9 no GPQA Diamond é medida pela Artificial Analysis, não reportada pelo fornecedor — o que é a mais confiável das duas categorias justamente porque um terceiro a executou. A pontuação de 44 no Artificial Analysis Intelligence Index, na revisão v4.3.2 do índice, coloca o Grok 4.6 na 28ª posição entre 211 em sua classe. A Artificial Analysis também registra o modelo como proprietário: os pesos não estão disponíveis publicamente.

No mesmo quadro, a AA mede o Terminal-Bench 2.1 em 88,4, o SciCode em 56,5, o Humanity's Last Exam em 42,9, o 𝜏²-banking em 50,7 e o recall de contexto longo em 80,3. Esses são instrumentos de raciocínio geral. Nenhum deles pode ser executado em um volume de TC 3D, e isso não é uma crítica ao Grok 4.6 — é uma afirmação sobre o que a suíte de benchmarks mede.

O lado CT tem exatamente uma tabela, e ela é dos autores.

Toda a base pública de evidências do NV-Reason-CT é uma única tabela de classificação nos 18 rótulos do CT-RATE, com um limiar fixo e uniforme, usando um prompt direto de Sim/Não sem cabeça de classificação. Ele relata Macro-F1 0,614 e Macro-AUROC 0,871, contra VoxelFM com 0,581/0,870, Pillar-0 com 0,544/0,861, ClinFusion-8B com 0,442, CT-CLIP com 0,398/0,733, Merlin com 0,358/0,662, e MedGemma 1.5 com 0,303.

Estes são reportados pelo fornecedor, provenientes do model card, e rotulo-os como tal porque nenhuma parte independente os reproduziu ainda. Duas coisas merecem atenção dentro da tabela. A margem de F1 sobre o VoxelFM é de 0,033, o que é uma diferença real em 18 rótulos com um limiar fixo. A margem de AUROC sobre o mesmo modelo é de 0,001, o que é um empate. Ambos os números aparecem na mesma linha da mesma tabela, e apenas um deles sustenta uma alegação.

A outra coisa que a tabela informa diz respeito ao enquadramento do próprio artigo. Os modelos de comparação são sistemas de pré-treinamento contrastivo 3D, um MLLM generativo fundido 2D/3D e um modelo de fronteira baseado em fatias. Os autores optaram por comparar com sistemas que ingerem volumes, porque a única afirmação significativa aqui é que um modelo 3D generativo pode superar modelos 3D discriminativos na classificação sem uma cabeça. Isso não diz nada sobre como o NV-Reason-CT se compara a um modelo de fronteira geral em qualquer aspecto, porque essa comparação não existe neste eixo.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Para onde vai o dinheiro, e por que a fronteira entre níveis importa

A tabela de preços do Grok 4.6 tem um detalhe que, silenciosamente, decide muita arquitetura: prompts acima de 200 mil tokens de entrada são cobrados pelo dobro da tarifa base — US$ 4,00 na entrada, US$ 12,00 na saída, com a tarifa de leitura de cache subindo de US$ 0,50 para US$ 1,00. Um job de revisão de coorte que acumula descobertas em um único contexto longo é exatamente a carga de trabalho que cruza essa linha. Abaixo dela, a tarifa de leitura de cache de US$ 0,50 por milhão equivale a um quarto do preço de entrada, e é isso que torna o loop de um grande prefixo fixo ao longo de milhares de relatórios acessível, e não apenas possível.

Por meio do OrcaRouter, o Grok 4.6 é servido ao preço de tabela desse fornecedor com margem zero, pelo que a aritmética de escalões acima é a aritmética que realmente paga, e qualquer ajuste futuro à mesma chega à sua fatura no mesmo dia, em vez de só na próxima renovação. A razão para encaminhar uma tarefa como esta em vez de codificar um único endpoint é que a metade de revisão de coortes de um pipeline clínico é onde vai querer experimentar três modelos diferentes antes de se decidir — e com uma única chave compatível com OpenAI com failover automático entre fornecedores, essa experiência custa uma mudança de nome de modelo.

A metade CT do pipeline não tem essa opção. O NV-Reason-CT não está hospedado no OrcaRouter — é um checkpoint de 10,6 GB com código de modelo personalizado que você mesmo executa, em silício Ampere, Hopper ou Lovelace, com trust_remote_code=True. Não vamos insinuar o contrário. Se você está montando esse pipeline, está comprando GPUs para uma metade e tokens para a outra, e o fato de que ambas as metades podem ao menos ser gerenciadas a partir de um único console é a única alegação de integração que vale a pena fazer.

A screenshot of the OrcaRouter model page for Grok 4.6, showing the identifier grok/grok-4.6, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 500,000-token context window, the description of it as SpaceXAI's smartest model to date and the current flagship listed as Latest in the vendor's own developer docs, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $2.00 per million input tokens and $6.00 per million output tokens.

O que um segundo leitor realmente vale

O artigo do NV-Reason-CT inclui um estudo preliminar com radiologistas especialistas que relata "avaliações de confiança favoráveis para revisão assistida por IA" e uma redução de 50% no tempo médio relatado de interpretação e emissão de laudos. São números fortes, e vêm com uma ressalva que o próprio artigo declara: preliminar, e com o desenho de estudo dos próprios autores. Não há replicação independente publicada, e uma redução de 50% no tempo em um estudo de leitura controlada é exatamente o tipo de resultado que encolhe sob replicação. Vale a pena acompanhar. Não vale a pena citar como estabelecido.

Em contraste com isso, a contribuição do Grok 4.6 para um fluxo de trabalho de radiologia não é o diagnóstico de forma alguma. É a camada que lê os relatórios — a fila de triagem, a carta de acompanhamento, a codificação, o pacote de pré-autorização. Esse trabalho é texto, tem alto volume, é barato por unidade, e o modo de falha em caso de erro é administrativo, e não clínico. É também onde uma janela de contexto de 500K e uma leitura de cache de $0.50 realmente se justificam.

Portanto, a divisão em que esta comparação resulta é crua: o NV-Reason-CT tem uma via 3D real e nenhuma distribuição, nenhum preço e nenhuma verificação independente. O Grok 4.6 tem distribuição, um preço, cobertura independente de benchmarks e nenhuma via volumétrica. Se você precisa que o exame seja lido, só um deles consegue fazer isso. Se você precisa que a papelada em torno do exame seja tratada, só o outro é um produto.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente