
NV-Reason-CT vs Grok 4.6: Quem lê a imagem e quem lê o laudo
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 45 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Há duas maneiras de colocar uma IA em um pipeline de TC, e apenas uma delas é sobre a imagem. NV-Reason-CT é a primeira: um modelo de visão-linguagem 3D de 4,69 bilhões de parâmetros que lê volumes NIfTI diretamente e foi publicado no Hugging Face em 8 de setembro de 2026, sem um post de lançamento da NVIDIA. Grok 4.6 é a segunda: um modelo de texto e imagem de 500.000 tokens que foi lançado em 12 de agosto de 2026, custa US$ 2,00 por milhão de tokens de entrada e é muito bom na parte do trabalho que acontece depois que alguém já anotou o achado. Coloque-os em uma comparação e a pergunta de sempre — qual deles é melhor — acaba se revelando mal formulada. Eles não estão competindo pelo mesmo espaço no pipeline. Estão competindo pela mesma linha orçamentária.
O que foi realmente lançado de cada lado
O NV-Reason-CT surgiu como um repositório, um artigo e um Space de demonstração, não como um produto. O repositório do GitHub em NVIDIA-Medtech foi criado em 2 de setembro de 2026; os pesos do Hugging Face vieram em 8 de setembro; o preprint do arXiv, NV-Reason-CT: Modelo de Linguagem Visual 3D para Análise de TC, foi publicado em 23 de setembro com dezesseis autores da NVIDIA, do NIH e da Universidade de Zurique. A sala de imprensa da NVIDIA não traz nada sobre isso. O model card descreve a versão 0.1 e restringe o uso à pesquisa e à educação.
Grok 4.6 é o tipo oposto de lançamento. É um endpoint comercial de primeira classe, listado como "Latest" na documentação do desenvolvedor do fornecedor, com preço em uma tabela de preços publicada, e disponível como um modelo compatível com OpenAI que integrações existentes adotam alterando uma URL base. Ele sucedeu o Grok 4.5 com a mesma janela de contexto, a mesma superfície de entrada e o mesmo preço base.
Essa assimetria é toda a história desta comparação. Um é um artefato de pesquisa que por acaso pode ser baixado. O outro é infraestrutura. Ler um em contraste com o outro revela onde a linha entre "artefato de pesquisa" e "infraestrutura" atualmente se situa na área de imagens médicas — e não é onde você imaginaria.
A divisão do trabalho, em insumos e produtos
• Entrada volumétrica — NV-Reason-CT lê volumes NIfTI .nii/.nii.gz em unidades Hounsfield, apenas tórax ou abdômen vs Grok 4.6 lê texto, imagens e arquivos, sem via volumétrica • Tratamento espacial — NV-Reason-CT converte um volume de 384×384×384 mm em uma grade 24×24×24 de 13.824 tokens com MRoPE 3D, sem subamostragem vs Grok 4.6 trata uma imagem como uma figura 2D • Contexto — NV-Reason-CT um volume é um prefixo fixo, sem janela de contexto no sentido usual vs Grok 4.6 500.000 tokens • Saída — NV-Reason-CT relatório estruturado, resposta ou traço de raciocínio com pensamento desativável vs Grok 4.6 texto com saídas estruturadas e chamadas de ferramentas • Licença — NV-Reason-CT OpenMDW-1.1, pesos BF16 de 10,6 GB vs Grok 4.6 proprietário, somente via API • Preço — NV-Reason-CT capex de GPU, sem tarifa por token vs Grok 4.6 US$ 2,00 / US$ 6,00 por milhão, dobrado acima de 200 mil de entrada

O par soa como uma passagem de bastão natural. O NV-Reason-CT produz o achado a partir do volume; o Grok 4.6 é o modelo ao qual você entregaria mil desses achados, numa única janela de contexto, para procurar padrões em uma coorte. Ninguém publicou esse pipeline. É a arquitetura óbvia, e vale dizer sem rodeios que ela não foi testada.
Os números do Grok 4.6, e de quem são
Dois números referentes ao Grok 4.6 circulam juntos e não são o mesmo tipo de coisa. A pontuação de 94,9 no GPQA Diamond é medida pela Artificial Analysis, não reportada pelo fornecedor — o que é a mais confiável das duas categorias justamente porque um terceiro a executou. A pontuação de 44 no Artificial Analysis Intelligence Index, na revisão v4.3.2 do índice, coloca o Grok 4.6 na 28ª posição entre 211 em sua classe. A Artificial Analysis também registra o modelo como proprietário: os pesos não estão disponíveis publicamente.
No mesmo quadro, a AA mede o Terminal-Bench 2.1 em 88,4, o SciCode em 56,5, o Humanity's Last Exam em 42,9, o 𝜏²-banking em 50,7 e o recall de contexto longo em 80,3. Esses são instrumentos de raciocínio geral. Nenhum deles pode ser executado em um volume de TC 3D, e isso não é uma crítica ao Grok 4.6 — é uma afirmação sobre o que a suíte de benchmarks mede.
O lado CT tem exatamente uma tabela, e ela é dos autores.
Toda a base pública de evidências do NV-Reason-CT é uma única tabela de classificação nos 18 rótulos do CT-RATE, com um limiar fixo e uniforme, usando um prompt direto de Sim/Não sem cabeça de classificação. Ele relata Macro-F1 0,614 e Macro-AUROC 0,871, contra VoxelFM com 0,581/0,870, Pillar-0 com 0,544/0,861, ClinFusion-8B com 0,442, CT-CLIP com 0,398/0,733, Merlin com 0,358/0,662, e MedGemma 1.5 com 0,303.
Estes são reportados pelo fornecedor, provenientes do model card, e rotulo-os como tal porque nenhuma parte independente os reproduziu ainda. Duas coisas merecem atenção dentro da tabela. A margem de F1 sobre o VoxelFM é de 0,033, o que é uma diferença real em 18 rótulos com um limiar fixo. A margem de AUROC sobre o mesmo modelo é de 0,001, o que é um empate. Ambos os números aparecem na mesma linha da mesma tabela, e apenas um deles sustenta uma alegação.
A outra coisa que a tabela informa diz respeito ao enquadramento do próprio artigo. Os modelos de comparação são sistemas de pré-treinamento contrastivo 3D, um MLLM generativo fundido 2D/3D e um modelo de fronteira baseado em fatias. Os autores optaram por comparar com sistemas que ingerem volumes, porque a única afirmação significativa aqui é que um modelo 3D generativo pode superar modelos 3D discriminativos na classificação sem uma cabeça. Isso não diz nada sobre como o NV-Reason-CT se compara a um modelo de fronteira geral em qualquer aspecto, porque essa comparação não existe neste eixo.

Para onde vai o dinheiro, e por que a fronteira entre níveis importa
A tabela de preços do Grok 4.6 tem um detalhe que, silenciosamente, decide muita arquitetura: prompts acima de 200 mil tokens de entrada são cobrados pelo dobro da tarifa base — US$ 4,00 na entrada, US$ 12,00 na saída, com a tarifa de leitura de cache subindo de US$ 0,50 para US$ 1,00. Um job de revisão de coorte que acumula descobertas em um único contexto longo é exatamente a carga de trabalho que cruza essa linha. Abaixo dela, a tarifa de leitura de cache de US$ 0,50 por milhão equivale a um quarto do preço de entrada, e é isso que torna o loop de um grande prefixo fixo ao longo de milhares de relatórios acessível, e não apenas possível.
Por meio do OrcaRouter, o Grok 4.6 é servido ao preço de tabela desse fornecedor com margem zero, pelo que a aritmética de escalões acima é a aritmética que realmente paga, e qualquer ajuste futuro à mesma chega à sua fatura no mesmo dia, em vez de só na próxima renovação. A razão para encaminhar uma tarefa como esta em vez de codificar um único endpoint é que a metade de revisão de coortes de um pipeline clínico é onde vai querer experimentar três modelos diferentes antes de se decidir — e com uma única chave compatível com OpenAI com failover automático entre fornecedores, essa experiência custa uma mudança de nome de modelo.
A metade CT do pipeline não tem essa opção. O NV-Reason-CT não está hospedado no OrcaRouter — é um checkpoint de 10,6 GB com código de modelo personalizado que você mesmo executa, em silício Ampere, Hopper ou Lovelace, com trust_remote_code=True. Não vamos insinuar o contrário. Se você está montando esse pipeline, está comprando GPUs para uma metade e tokens para a outra, e o fato de que ambas as metades podem ao menos ser gerenciadas a partir de um único console é a única alegação de integração que vale a pena fazer.

O que um segundo leitor realmente vale
O artigo do NV-Reason-CT inclui um estudo preliminar com radiologistas especialistas que relata "avaliações de confiança favoráveis para revisão assistida por IA" e uma redução de 50% no tempo médio relatado de interpretação e emissão de laudos. São números fortes, e vêm com uma ressalva que o próprio artigo declara: preliminar, e com o desenho de estudo dos próprios autores. Não há replicação independente publicada, e uma redução de 50% no tempo em um estudo de leitura controlada é exatamente o tipo de resultado que encolhe sob replicação. Vale a pena acompanhar. Não vale a pena citar como estabelecido.
Em contraste com isso, a contribuição do Grok 4.6 para um fluxo de trabalho de radiologia não é o diagnóstico de forma alguma. É a camada que lê os relatórios — a fila de triagem, a carta de acompanhamento, a codificação, o pacote de pré-autorização. Esse trabalho é texto, tem alto volume, é barato por unidade, e o modo de falha em caso de erro é administrativo, e não clínico. É também onde uma janela de contexto de 500K e uma leitura de cache de $0.50 realmente se justificam.
Portanto, a divisão em que esta comparação resulta é crua: o NV-Reason-CT tem uma via 3D real e nenhuma distribuição, nenhum preço e nenhuma verificação independente. O Grok 4.6 tem distribuição, um preço, cobertura independente de benchmarks e nenhuma via volumétrica. Se você precisa que o exame seja lido, só um deles consegue fazer isso. Se você precisa que a papelada em torno do exame seja tratada, só o outro é um produto.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
