Um cartão hero gerado intitulado 'NV-Reason-CT vs GPT-5.6 Sol' com o subtítulo '13.824 tokens visuais antes de você digitar uma palavra'. Três chips aparecem na parte inferior: 'Especialista em CT de 4,69B vs não divulgado', 'NIfTI 3D na entrada, achados na saída' e 'Sol: 1.050.000 na entrada / 128.000 na saída'. O logotipo do OrcaRouter é composto no canto inferior direito.
Guides & Insights

NV-Reason-CT vs GPT-5.6 Sol: 13.824 Tokens Visuais Antes de Você Digitar uma Palavra

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Toda e qualquer tomografia computadorizada de tórax que você envia para NV-Reason-CT custa 13.824 tokens visuais antes de o prompt começar. Isso não é uma peculiaridade nem uma escolha de ajuste — é o design inteiro. O codificador de visão 3D nativo do modelo pega um volume de 384×384×384 mm e o transforma em uma grade 24×24×24, e a ficha técnica do modelo é explícita ao afirmar que todos os 13.824 tokens e suas coordenadas tridimensionais chegam ao modelo de linguagem "sem downsampling espacial". Compare isso com aquilo pelo que você provavelmente já está pagando. GPT-5.6 Sol aceita texto, imagens e arquivos, e uma imagem enviada a ele é uma imagem 2D — um corte, uma captura de tela de um visualizador de DICOM, uma figura de radiologia colada de um PDF. Um desses modelos tem um caminho volumétrico. O outro tem uma janela de contexto. A maioria das comparações entre eles desmorona diante dessa distinção, e o desmoronamento é a parte interessante.

O lançamento que ninguém anunciou

A NVIDIA não publicou uma palavra sobre o NV-Reason-CT em sua sala de imprensa. Não há post de lançamento, slide de keynote, comunicado à imprensa. O que existe é um repositório no Hugging Face criado em 8 de setembro de 2026, um repositório no GitHub sob a organização NVIDIA-Medtech criado em 2 de setembro, um Space de demonstração no Gradio e um preprint no arXiv — NV-Reason-CT: Modelo de Linguagem Visual 3D para Análise de CT — enviado em 23 de setembro de 2026 por uma equipe de dezesseis autores da NVIDIA com coautores no NIH e na Universidade de Zurique.

Isso é um padrão real, e vale a pena nomeá-lo com precisão em vez de tratá-lo como um mistério. O grupo de imagens médicas da NVIDIA divulga os pesos silenciosamente e deixa que o artigo e o repositório façam o anúncio. O antecessor, NV-Reason-CXR-3B, saiu em outubro de 2025 da mesma forma. A diferença aqui é a escala: é a primeira vez que esse grupo estende a receita de raios X 2D para volumes 3D nativos, e o artigo foi publicado há dois dias.

O que é possível saber a partir do repositório: arquitetura, licença, dados de treinamento, a tabela de benchmark. O que ainda não está confirmado: se a NVIDIA pretende que isto seja uma linha de produto suportada, se virão mais checkpoints e como se comporta sob a avaliação de qualquer pessoa que não os autores. O repositório está na versão 0.1 e descreve-se como destinado apenas à pesquisa e à educação.

O que cada modelo realmente aceita

É aqui que um confronto direto fica honesto rapidamente. Os dois modelos não compartilham uma superfície de entrada.

NV-Reason-CT lê volumes NIfTI — .nii ou .nii.gz — com intensidades de voxel em unidades Hounsfield. Ele recorta automaticamente para o tórax ou o abdômen usando unidades Hounsfield pulmonares e uma heurística de morfologia 3D, reamostra para resolução isotrópica de 2 mm, e aceita apenas "chest" ou "abdomen" como valores de anatomia. Ele produz texto: um relatório estruturado, uma resposta ou um traço de raciocínio passo a passo, com um interruptor para desligar o raciocínio para respostas curtas.

O GPT-5.6 Sol lê texto, imagens e ficheiros, com uma janela de contexto de 1 050 000 tokens e até 128 000 tokens de saída numa única resposta. Não tem codificador volumétrico. Dá-lhe uma TAC e tens primeiro de decidir como achatar trezentas e tantas fatias em algo que um codificador de imagens 2D aceite — uma montagem, um punhado de fatias-chave, uma projeção de intensidade máxima renderizada. Cada uma dessas escolhas deita fora as relações espaciais que o percurso 3D foi concebido para preservar.

Portanto, o enquadramento honesto não é “qual modelo é mais inteligente”. É que a via de imagem do Sol e a via 3D do NV-Reason-CT estão respondendo a perguntas diferentes. O Sol consegue raciocinar sobre a descrição que um radiologista faz de um exame. O NV-Reason-CT consegue raciocinar sobre o exame.

Existe um benchmark, e apenas um deles tem um número.

NV-Reason-CT relata Macro-F1 0,614 e Macro-AUROC 0,871 na tarefa de classificação de 18 rótulos do CT-RATE, usando um prompt direto de Sim/Não sem cabeça de classificação e sem adaptação específica para a tarefa. Esses são os números dos próprios autores no cartão do modelo, e a linha de comparação é a parte útil: VoxelFM com 0,581 de Macro-F1, Pillar-0 com 0,544, ClinFusion-8B com 0,442, CT-CLIP com 0,398, Merlin com 0,358, MedGemma 1.5 com 0,303. No mesmo limiar uniforme fixo, um modelo 3D generativo supera as baselines de pré-treinamento contrastivo 3D e o modelo de fronteira baseado em fatias.

Um número nessa tabela merece ceticismo em vez de repetição: a diferença de AUROC. O NV-Reason-CT reporta 0,871 contra 0,870 do VoxelFM. Um milésimo de ponto, numa avaliação executada pelo fornecedor, não é uma vitória — é um empate dentro do ruído que a avaliação carrega. A diferença de 0,033 no Macro-F1 é a alegação fundamentada.

O GPT-5.6 Sol não tem um número CT-RATE porque o CT-RATE não é um benchmark no qual ele possa ser executado. Ele tem um Índice de Inteligência da Artificial Analysis de 47, uma pontuação no GPQA Diamond medida pela AA de 94,1 e uma pontuação no Humanity's Last Exam de 49,5 — todos instrumentos de raciocínio geral. Colocar 0,614 de Macro-F1 ao lado de 47 no Índice AA seria fazer aritmética com duas réguas diferentes. Não vou fazer isso, e você deveria desconfiar de qualquer um que faça.

Traços de raciocínio, dois produtos diferentes

Ambos os modelos emitem raciocínio. Essa é a única sobreposição filosófica genuína, e a diferença é instrutiva.

O GPT-5.6 Sol expõe esforço de raciocínio configurável, então você troca latência e custo por profundidade a cada solicitação, e pode solicitar o raciocínio de volta por meio de include_reasoning. É um recurso geral aplicado a tudo o que você enviar a ele.

O raciocínio do NV-Reason-CT é estreito de propósito. O corpus de treinamento é composto por aproximadamente 550.000 exemplos de QA estruturados extraídos de 70.111 volumes de TC únicos, e uma parte dele consiste em raciocínio de autoria de radiologistas, coletado a partir de interpretações especializadas gravadas e transcritas. A etapa de GRPO que se segue ao SFT usa recompensas verificáveis sobre conjuntos de anormalidades torácicas e abdominais — ou seja, o sinal de recompensa baseia-se em se um achado declarado está realmente presente no volume, não em se a prosa é bem escrita. O cartão do modelo descreve a saída como "observações revisáveis, diagnósticos diferenciais e incerteza", e traz um aviso explícito de que o raciocínio gerado "não é garantido que represente a computação interna do modelo". Esse aviso tem um papel concreto. É a diferença entre um traço que você pode verificar em relação aos dados e um traço que você só pode admirar.

O tamanho e a licença, numa só passagem

• Parâmetros — NV-Reason-CT 4,69B no total / 4,35B ativos na via de TC, de um backbone Qwen3.5-4B mais um Primus 3D ViT vs GPT-5.6 Sol não divulgado • Tamanho do checkpoint — NV-Reason-CT ~10,6 GB BF16 safetensors, executa em Ampere/Hopper/Lovelace vs GPT-5.6 Sol somente via API • Entrada — volumes de TC NIfTI 3D em unidades Hounsfield vs texto, imagem, arquivo • Contexto — NV-Reason-CT não aplicável, um volume é um prefixo fixo de 13.824 tokens vs Sol 1.050.000 tokens de entrada, 128.000 de saída • Licença — OpenMDW-1.1, pesos disponíveis para download vs proprietário, acesso somente via API • Disponibilidade — repositório do fornecedor e seus próprios pesos vs roteado no OrcaRouter a $4,00 / $20,00 por milhão, com a tarifa do Sol acima de 272 mil tokens de entrada dobrando para $8,00 / $30,00

A generated scoreboard titled 'NV-Reason-CT vs GPT-5.6 Sol - the scoreboard'. Left column 'NV-Reason-CT': Input 3D NIfTI CT, chest or abdomen; Volume prefix 13,824 tokens, fixed; Parameters 4.69B total / 4.35B active; CT-RATE Macro-F1 0.614 (vendor-reported); Licence OpenMDW-1.1, weights published; Price GPU capex, no per-token rate. Right column 'GPT-5.6 Sol': Input text, image, file; Context / output 1,050,000 in / 128,000 out; Parameters undisclosed; CT-RATE Macro-F1 not applicable; Licence proprietary, API only; Price $4.00 / $20.00 per M. A footer reads 'NV-Reason-CT figures are the authors' own and unreproduced; GPT-5.6 Sol pricing per OpenAI's rate card as routed by OrcaRouter.'

O que a separação realmente custa a você

A comparação de custos só faz sentido depois que você aceita que as cargas de trabalho são diferentes, então aqui está a versão que de fato faz sentido.

Sol é cobrado por token e seu preço tem um degrau: $4.00 por milhão de entrada e $20.00 por milhão de saída até 272K tokens de prompt, depois $8.00 e $30.00. No OrcaRouter, ele é servido pelo preço de tabela da própria OpenAI, sem nenhum markup, o que importa mais do que parece — a tarifa que você vê é a tarifa que a OpenAI publica, então qualquer mudança de preço chega à sua fatura no mesmo dia, em vez de na próxima renovação de contrato. Sua taxa de leitura de cache é de $0.40 por milhão, um décimo da entrada, e é isso que torna loops agênticos longos com um grande prefixo fixo aritmeticamente sobrevivíveis.

O NV-Reason-CT não tem preço por token algum. Você baixa 10,6 GB e paga pela GPU. Essa é uma questão de capex versus opex, e ela só tem uma resposta: com volume suficientemente alto, hospedar por conta própria um modelo de 4,35 bilhões de parâmetros ativos vence em custo. Abaixo desse volume, não, e o ponto de equilíbrio depende inteiramente da utilização da sua GPU. Ninguém fora da NVIDIA publicou ainda um número de throughput para este checkpoint, então qualquer um que lhe cite um ponto de equilíbrio está adivinhando.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

O que um roteador ajuda a resolver aqui é a parte do fluxo de trabalho que não é a varredura. Um pipeline de pesquisa clínica em produção raramente é um único modelo — é extração, uma etapa de raciocínio, uma etapa de sumarização, às vezes uma segunda opinião. O OrcaRouter expõe mais de 200 modelos por trás de um endpoint compatível com OpenAI com failover automático entre provedores, para que a metade de uso geral desse pipeline possa ser trocada ou redirecionada sem um segundo contrato. O NV-Reason-CT não é um dos modelos que roteamos; é um checkpoint que você mesmo executa. As duas metades do pipeline ainda podem ficar atrás de uma única chave.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol, showing the identifier openai/gpt-5.6-sol, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 1,050,000-token context window with 128K maximum output, the description of it as the flagship of OpenAI's GPT-5.6 series, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $4.00 per million input tokens and $20.00 per million output tokens with a p50 time to first token of 10.00 s.

A questão em aberto

O NV-Reason-CT tem dois dias de vida como artigo e dezessete dias como repositório, e o campo ao qual pertence é pequeno o suficiente para que o próximo ponto de dados seja informativo. Fique atento a três coisas: uma reprodução independente do CT-RATE, um segundo checkpoint da família e qualquer sinal de que o grupo médico da NVIDIA esteja tratando isso como uma linha, e não como um artigo. Até lá, a posição defensável é estreita e clara — este é o checkpoint de raciocínio em CT 3D nativo mais forte atualmente disponível para download, a julgar pela própria tabela dos autores, e não é um substituto para um modelo de fronteira geral em nada, exceto na leitura de uma CT.