
NV-Reason-CT vs GPT-5.6 Sol: 13.824 Tokens Visuais Antes de Você Digitar uma Palavra
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 45 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Toda e qualquer tomografia computadorizada de tórax que você envia para NV-Reason-CT custa 13.824 tokens visuais antes de o prompt começar. Isso não é uma peculiaridade nem uma escolha de ajuste — é o design inteiro. O codificador de visão 3D nativo do modelo pega um volume de 384×384×384 mm e o transforma em uma grade 24×24×24, e a ficha técnica do modelo é explícita ao afirmar que todos os 13.824 tokens e suas coordenadas tridimensionais chegam ao modelo de linguagem "sem downsampling espacial". Compare isso com aquilo pelo que você provavelmente já está pagando. GPT-5.6 Sol aceita texto, imagens e arquivos, e uma imagem enviada a ele é uma imagem 2D — um corte, uma captura de tela de um visualizador de DICOM, uma figura de radiologia colada de um PDF. Um desses modelos tem um caminho volumétrico. O outro tem uma janela de contexto. A maioria das comparações entre eles desmorona diante dessa distinção, e o desmoronamento é a parte interessante.
O lançamento que ninguém anunciou
A NVIDIA não publicou uma palavra sobre o NV-Reason-CT em sua sala de imprensa. Não há post de lançamento, slide de keynote, comunicado à imprensa. O que existe é um repositório no Hugging Face criado em 8 de setembro de 2026, um repositório no GitHub sob a organização NVIDIA-Medtech criado em 2 de setembro, um Space de demonstração no Gradio e um preprint no arXiv — NV-Reason-CT: Modelo de Linguagem Visual 3D para Análise de CT — enviado em 23 de setembro de 2026 por uma equipe de dezesseis autores da NVIDIA com coautores no NIH e na Universidade de Zurique.
Isso é um padrão real, e vale a pena nomeá-lo com precisão em vez de tratá-lo como um mistério. O grupo de imagens médicas da NVIDIA divulga os pesos silenciosamente e deixa que o artigo e o repositório façam o anúncio. O antecessor, NV-Reason-CXR-3B, saiu em outubro de 2025 da mesma forma. A diferença aqui é a escala: é a primeira vez que esse grupo estende a receita de raios X 2D para volumes 3D nativos, e o artigo foi publicado há dois dias.
O que é possível saber a partir do repositório: arquitetura, licença, dados de treinamento, a tabela de benchmark. O que ainda não está confirmado: se a NVIDIA pretende que isto seja uma linha de produto suportada, se virão mais checkpoints e como se comporta sob a avaliação de qualquer pessoa que não os autores. O repositório está na versão 0.1 e descreve-se como destinado apenas à pesquisa e à educação.
O que cada modelo realmente aceita
É aqui que um confronto direto fica honesto rapidamente. Os dois modelos não compartilham uma superfície de entrada.
NV-Reason-CT lê volumes NIfTI — .nii ou .nii.gz — com intensidades de voxel em unidades Hounsfield. Ele recorta automaticamente para o tórax ou o abdômen usando unidades Hounsfield pulmonares e uma heurística de morfologia 3D, reamostra para resolução isotrópica de 2 mm, e aceita apenas "chest" ou "abdomen" como valores de anatomia. Ele produz texto: um relatório estruturado, uma resposta ou um traço de raciocínio passo a passo, com um interruptor para desligar o raciocínio para respostas curtas.
O GPT-5.6 Sol lê texto, imagens e ficheiros, com uma janela de contexto de 1 050 000 tokens e até 128 000 tokens de saída numa única resposta. Não tem codificador volumétrico. Dá-lhe uma TAC e tens primeiro de decidir como achatar trezentas e tantas fatias em algo que um codificador de imagens 2D aceite — uma montagem, um punhado de fatias-chave, uma projeção de intensidade máxima renderizada. Cada uma dessas escolhas deita fora as relações espaciais que o percurso 3D foi concebido para preservar.
Portanto, o enquadramento honesto não é “qual modelo é mais inteligente”. É que a via de imagem do Sol e a via 3D do NV-Reason-CT estão respondendo a perguntas diferentes. O Sol consegue raciocinar sobre a descrição que um radiologista faz de um exame. O NV-Reason-CT consegue raciocinar sobre o exame.
Existe um benchmark, e apenas um deles tem um número.
NV-Reason-CT relata Macro-F1 0,614 e Macro-AUROC 0,871 na tarefa de classificação de 18 rótulos do CT-RATE, usando um prompt direto de Sim/Não sem cabeça de classificação e sem adaptação específica para a tarefa. Esses são os números dos próprios autores no cartão do modelo, e a linha de comparação é a parte útil: VoxelFM com 0,581 de Macro-F1, Pillar-0 com 0,544, ClinFusion-8B com 0,442, CT-CLIP com 0,398, Merlin com 0,358, MedGemma 1.5 com 0,303. No mesmo limiar uniforme fixo, um modelo 3D generativo supera as baselines de pré-treinamento contrastivo 3D e o modelo de fronteira baseado em fatias.
Um número nessa tabela merece ceticismo em vez de repetição: a diferença de AUROC. O NV-Reason-CT reporta 0,871 contra 0,870 do VoxelFM. Um milésimo de ponto, numa avaliação executada pelo fornecedor, não é uma vitória — é um empate dentro do ruído que a avaliação carrega. A diferença de 0,033 no Macro-F1 é a alegação fundamentada.
O GPT-5.6 Sol não tem um número CT-RATE porque o CT-RATE não é um benchmark no qual ele possa ser executado. Ele tem um Índice de Inteligência da Artificial Analysis de 47, uma pontuação no GPQA Diamond medida pela AA de 94,1 e uma pontuação no Humanity's Last Exam de 49,5 — todos instrumentos de raciocínio geral. Colocar 0,614 de Macro-F1 ao lado de 47 no Índice AA seria fazer aritmética com duas réguas diferentes. Não vou fazer isso, e você deveria desconfiar de qualquer um que faça.
Traços de raciocínio, dois produtos diferentes
Ambos os modelos emitem raciocínio. Essa é a única sobreposição filosófica genuína, e a diferença é instrutiva.
O GPT-5.6 Sol expõe esforço de raciocínio configurável, então você troca latência e custo por profundidade a cada solicitação, e pode solicitar o raciocínio de volta por meio de include_reasoning. É um recurso geral aplicado a tudo o que você enviar a ele.
O raciocínio do NV-Reason-CT é estreito de propósito. O corpus de treinamento é composto por aproximadamente 550.000 exemplos de QA estruturados extraídos de 70.111 volumes de TC únicos, e uma parte dele consiste em raciocínio de autoria de radiologistas, coletado a partir de interpretações especializadas gravadas e transcritas. A etapa de GRPO que se segue ao SFT usa recompensas verificáveis sobre conjuntos de anormalidades torácicas e abdominais — ou seja, o sinal de recompensa baseia-se em se um achado declarado está realmente presente no volume, não em se a prosa é bem escrita. O cartão do modelo descreve a saída como "observações revisáveis, diagnósticos diferenciais e incerteza", e traz um aviso explícito de que o raciocínio gerado "não é garantido que represente a computação interna do modelo". Esse aviso tem um papel concreto. É a diferença entre um traço que você pode verificar em relação aos dados e um traço que você só pode admirar.
O tamanho e a licença, numa só passagem
• Parâmetros — NV-Reason-CT 4,69B no total / 4,35B ativos na via de TC, de um backbone Qwen3.5-4B mais um Primus 3D ViT vs GPT-5.6 Sol não divulgado • Tamanho do checkpoint — NV-Reason-CT ~10,6 GB BF16 safetensors, executa em Ampere/Hopper/Lovelace vs GPT-5.6 Sol somente via API • Entrada — volumes de TC NIfTI 3D em unidades Hounsfield vs texto, imagem, arquivo • Contexto — NV-Reason-CT não aplicável, um volume é um prefixo fixo de 13.824 tokens vs Sol 1.050.000 tokens de entrada, 128.000 de saída • Licença — OpenMDW-1.1, pesos disponíveis para download vs proprietário, acesso somente via API • Disponibilidade — repositório do fornecedor e seus próprios pesos vs roteado no OrcaRouter a $4,00 / $20,00 por milhão, com a tarifa do Sol acima de 272 mil tokens de entrada dobrando para $8,00 / $30,00

O que a separação realmente custa a você
A comparação de custos só faz sentido depois que você aceita que as cargas de trabalho são diferentes, então aqui está a versão que de fato faz sentido.
Sol é cobrado por token e seu preço tem um degrau: $4.00 por milhão de entrada e $20.00 por milhão de saída até 272K tokens de prompt, depois $8.00 e $30.00. No OrcaRouter, ele é servido pelo preço de tabela da própria OpenAI, sem nenhum markup, o que importa mais do que parece — a tarifa que você vê é a tarifa que a OpenAI publica, então qualquer mudança de preço chega à sua fatura no mesmo dia, em vez de na próxima renovação de contrato. Sua taxa de leitura de cache é de $0.40 por milhão, um décimo da entrada, e é isso que torna loops agênticos longos com um grande prefixo fixo aritmeticamente sobrevivíveis.
O NV-Reason-CT não tem preço por token algum. Você baixa 10,6 GB e paga pela GPU. Essa é uma questão de capex versus opex, e ela só tem uma resposta: com volume suficientemente alto, hospedar por conta própria um modelo de 4,35 bilhões de parâmetros ativos vence em custo. Abaixo desse volume, não, e o ponto de equilíbrio depende inteiramente da utilização da sua GPU. Ninguém fora da NVIDIA publicou ainda um número de throughput para este checkpoint, então qualquer um que lhe cite um ponto de equilíbrio está adivinhando.

O que um roteador ajuda a resolver aqui é a parte do fluxo de trabalho que não é a varredura. Um pipeline de pesquisa clínica em produção raramente é um único modelo — é extração, uma etapa de raciocínio, uma etapa de sumarização, às vezes uma segunda opinião. O OrcaRouter expõe mais de 200 modelos por trás de um endpoint compatível com OpenAI com failover automático entre provedores, para que a metade de uso geral desse pipeline possa ser trocada ou redirecionada sem um segundo contrato. O NV-Reason-CT não é um dos modelos que roteamos; é um checkpoint que você mesmo executa. As duas metades do pipeline ainda podem ficar atrás de uma única chave.

A questão em aberto
O NV-Reason-CT tem dois dias de vida como artigo e dezessete dias como repositório, e o campo ao qual pertence é pequeno o suficiente para que o próximo ponto de dados seja informativo. Fique atento a três coisas: uma reprodução independente do CT-RATE, um segundo checkpoint da família e qualquer sinal de que o grupo médico da NVIDIA esteja tratando isso como uma linha, e não como um artigo. Até lá, a posição defensável é estreita e clara — este é o checkpoint de raciocínio em CT 3D nativo mais forte atualmente disponível para download, a julgar pela própria tabela dos autores, e não é um substituto para um modelo de fronteira geral em nada, exceto na leitura de uma CT.
