Um cartão hero gerado intitulado 'NV-Reason-CT vs Qwen3.8 Max' com o subtítulo 'O fine-tune e a família de onde ele veio'. Três chips percorrem a parte inferior: 'Backbone: Qwen/Qwen3.5-4B', '13.824 tokens vs 1.000.000', e '3,5% vs 0,21% de erro medido'. O logotipo do OrcaRouter é composto no canto inferior direito.
Guides & Insights

NV-Reason-CT vs Qwen3.8 Max: O ajuste fino e a família de onde ele veio

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A primeira linha do NV-Reason-CT, ficha do modelo, revela algo que a maioria das pessoas deixa passar. O modelo base é Qwen/Qwen3.5-4B, listado nos metadados do repositório como uma relação de fine-tune. Então, quando a NVIDIA precisou de um modelo de linguagem para acoplar um transformer de visão 3D Primus, pegou um Qwen. Compare esse checkpoint com Qwen3.8 Max — o carro-chefe de 1.000.000 de tokens da própria Alibaba, lançado em 3 de agosto de 2026 — e você está olhando para um fine-tune e o negócio da família. Um é um especialista de 4,69B que lê volumes de TC de tórax e abdômen e foi publicado no Hugging Face em 8 de setembro de 2026 sem anúncio. O outro é um carro-chefe generalista com entrada de texto, imagem e vídeo, uma tabela de preços publicada e 37,2 milhões de tokens de tráfego medido em nossa rede na última semana. A pergunta interessante não é qual vence. É o que um fine-tune de 4B pode fazer que o carro-chefe de sua família não pode, e por que a resposta é mais específica do que você esperaria.

O que o ajuste fino trouxe, concretamente

O enquadramento da lacuna feito pela própria NVIDIA é excepcionalmente preciso, e é a frase mais útil do repositório: a maioria dos sistemas de visão-linguagem “ou opera em imagens 2D ou comprime características volumétricas antes da decodificação de linguagem”. Essa é uma descrição de toda uma classe de modelos, e inclui todos os modelos multimodais gerais de ponta do mercado.

A correção é arquitetural, e não uma questão de escala. Um volume de entrada de 384×384×384 mm torna-se uma grade 24×24×24 de 13.824 tokens visuais. Esses tokens e suas coordenadas tridimensionais entram no modelo de linguagem sem downsampling espacial, e o MRoPE 3D preserva as relações espaciais dentro do decodificador. Os volumes de entrada são recortados com reconhecimento anatômico para o tórax ou o abdômen usando unidades Hounsfield pulmonares e, em seguida, reamostrados para resolução isotrópica de 2 mm.

Leia isso em contraste com o que o Qwen3.8 Max aceita. Texto, imagem e vídeo — e o vídeo é a coisa mais próxima nesta série de uma entrada volumétrica, o que faz dele o ponto de comparação honesto, em vez de retórico. Um vídeo é uma pilha de quadros 2D ordenados pelo tempo. Um volume de TC é uma pilha de fatias 2D ordenadas pela posição física ao longo do eixo z, em unidades Hounsfield, com um espaçamento conhecido em milímetros. Ambos são arranjos tridimensionais. Apenas um deles tem um sistema de coordenadas físicas no qual o achado de um radiologista pode ser localizado, e apenas um deles é medido numa unidade que significa algo fora de um sensor de imagem. Um modelo treinado em vídeo aprende continuidade temporal. Um modelo treinado em volumes de TC aprende que uma massa em uma fatia é a mesma massa na fatia seguinte oito milímetros abaixo.

O corpus de treinamento é a verdadeira diferença.

É aqui que os dois modelos deixam de ser comparáveis por completo, e é a parte que uma ficha técnica esconde.

NV-Reason-CT foi treinado de ponta a ponta com ajuste fino supervisionado seguido de Group Relative Policy Optimization em aproximadamente 550.000 exemplos estruturados de QA extraídos de 70.111 volumes de TC únicos. As fontes são o CT-RATE — 47.149 casos do Hospital Mega da Universidade Medipol de Istambul, com relatórios radiológicos correspondentes —, um conjunto interno do NIH de 15.991 casos e os 22.720 casos do CancerVerse em quatro fases de contraste e treze tipos de tumor maligno. O corpus inclui relatórios padronizados, QA com foco em anormalidades, diálogo multiturno e raciocínio escrito por radiologistas transcrito de interpretações especializadas gravadas. A etapa de GRPO usa recompensas verificáveis sobre conjuntos de anormalidades torácicas e abdominais, o que significa que o sinal de recompensa verifica se um achado declarado está presente no volume, em vez de verificar se a prosa soa clínica.

O corpus de treinamento do Qwen3.8 Max não é publicado com nada parecido com esse nível de detalhe, e não ajudaria se fosse, porque a capacidade em questão é geral. Em vez disso, seus números do Artificial Analysis são a evidência relevante: um Intelligence Index de 45,4, colocando-o em 15º de 145 modelos no snapshot da nossa API, AA Coding 76,2 na 9ª posição, Terminal-Bench 2.1 com 88,8, GPQA Diamond 92,8, Humanity's Last Exam 43,1, SciCode 52,1 e recall de contexto longo 80,3. Essas são medições de terceiros, não alegações de fornecedores, o que as torna os números mais confiáveis de ambos os lados desta página.

Saída de raciocínio, dois contratos diferentes

Ambos os modelos emitem traços de raciocínio e ambos permitem desativá-los. A semelhança termina na interface.

Qwen3.8 Max expõe enable_thinking e reasoning_effort, juntamente com toda a superfície de amostragem — temperatura, top_p, seed, penalidades, saídas estruturadas, chamada de ferramentas. É uma capacidade de raciocínio geral que você direciona para o que tiver. Seu raciocínio é tão bom quanto o problema que você lhe apresenta, e ele não tem como verificar uma afirmação contra nada além do texto que lhe foi fornecido.

O raciocínio do NV-Reason-CT tem um contrato mais restrito com o leitor, e o cartão do modelo declara o limite explicitamente: o raciocínio gerado é "saída de modelo revisável e não há garantia de que represente a computação interna do modelo". Essa ressalva tem efeito real, e é o tipo de frase que só aparece quando uma equipe pensou no que um clínico fará com um traço que soa plausível. O cartão descreve a saída como observações revisáveis, diagnósticos diferenciais e incerteza. Um traço que você pode conferir com o volume, em outras palavras, em vez de um que você só pode ler.

Taxa de transferência, do único lugar onde podemos medi-la

O Qwen3.8 Max movimentou 37,2 milhões de tokens pelo playground próprio da OrcaRouter nos últimos sete dias. Seu tempo mediano até o primeiro token foi de 1,96 segundos — confortavelmente o mais rápido dos modelos desta série — a 53,3 tokens de saída por segundo. Sua taxa de erro nesse período foi de 3,5%.

Esses dois números puxam em direções opostas, e ambos importam. A latência é excelente e torna o modelo agradável de iterar. A taxa de erro é cerca de dezessete vezes maior que os 0,21% do Kimi K3 no mesmo período, e é esse número que decide se você o coloca atrás de uma chamada síncrona voltada ao usuário ou de um job em lote com retentativas. Este é um comportamento medido na nossa rede, não um benchmark, e é o tipo de coisa que uma tabela de preços nunca te conta.

O NV-Reason-CT não tem medição equivalente em lugar nenhum. É um checkpoint BF16 de 10,6 GB com código de modelo personalizado, carregado com trust_remote_code=True em hardware Ampere, Hopper ou Lovelace, testado pela NVIDIA em H100 e L40S. Não há p50, taxa de erro nem número de throughput publicados. Quem lhe disser o volume de ponto de equilíbrio em que a auto-hospedagem disso supera pagar por token está chutando.

Preço e formato, lado a lado

• Preço — capex de GPU do NV-Reason-CT, sem tarifa por token vs. Qwen3.8 Max US$ 2,00 / US$ 6,00 por milhão de tokens, US$ 0,25 de leitura em cache, US$ 2,50 de gravação em cache

• Entrada — volumes de TC NIfTI 3D NV-Reason-CT em unidades Hounsfield, apenas tórax ou abdômen vs Qwen3.8 Max texto, imagem e vídeo

• Contexto — NV-Reason-CT um volume, um prefixo fixo de 13.824 tokens vs Qwen3.8 Max 1.000.000 de tokens

• Parâmetros — NV-Reason-CT 4,69B no total / 4,35B ativos na via CT vs Qwen3.8 Max não divulgado

• Licença — NV-Reason-CT OpenMDW-1.1, pesos publicados vs. Qwen3.8 Max proprietário, acesso somente via API

• Pontuações independentes — NV-Reason-CT: nenhum vs. Qwen3.8 Max, Índice de Inteligência AA 45,4, GPQA Diamond 92,8

A generated scoreboard titled 'NV-Reason-CT vs Qwen3.8 Max - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex, no per-token rate; Input 3D NIfTI CT, chest or abdomen; Context one volume, 13,824-token prefix; Parameters 4.69B total / 4.35B active; Licence OpenMDW-1.1, weights published; Independent score none published. Right column 'Qwen3.8 Max': Price $2.00 / $6.00, $0.25 cached read; Input text, image and video; Context 1,000,000 tokens; Parameters undisclosed; Licence proprietary, API only; Independent score AA Index 45.4, GPQA Diamond 92.8. A footer reads 'Qwen3.8 Max scores per Artificial Analysis; NV-Reason-CT figures are the authors' own, from the model card.'

A economia de cache do Qwen3.8 Max recompensa um formato específico: uma leitura em cache de US$ 0,25 contra uma entrada nova de US$ 2,00 é um desconto de oito vezes, e a gravação em cache de US$ 2,50 significa que um prefixo longo e reutilizável se paga rapidamente. Essa é a carga de trabalho de um prompt de sistema mais um documento de protocolo reutilizado em milhares de requisições. O NV-Reason-CT tem o perfil de custo oposto — custo marginal quase zero por varredura depois que a GPU é comprada, e um piso rígido de uma GPU mantida indefinidamente.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Comandando a família juntos

A arquitetura natural aqui, e vale dizer que ninguém a publicou, é o ajuste fino para o volume e o carro-chefe para tudo ao redor. O NV-Reason-CT produz o achado estruturado; o Qwen3.8 Max cuida do texto de encaminhamento, da correspondência de protocolos, da codificação, da carta de acompanhamento — o trabalho de texto de alto volume no qual uma janela de um milhão de tokens e um desconto de cache de oito vezes realmente justificam seu lugar.

Se esse é o seu pipeline, metade dele é um checkpoint que você hospeda e metade são tokens que você compra, e é na segunda metade que um roteador faz algo que um endpoint de um único fornecedor não consegue. O Qwen3.8 Max é servido pelo OrcaRouter ao preço de tabela da Aliba​ba, sem nenhum markup, então os US$ 2,00 / US$ 6,00 acima são o que você paga e qualquer mudança futura de preço cai na sua fatura no mesmo dia, e não na renovação. O failover automático entre provedores importa mais do que o normal quando a própria taxa de erro medida do modelo é de 3,5% — uma nova tentativa que vai para um endpoint diferente e saudável é a diferença entre uma oscilação passageira e um lote fracassado. E, como a metade geral do pipeline é um nome de modelo por trás de um endpoint compatível com a OpenAI que cobre mais de 200 modelos, trocar por outra coisa para uma semana de experimento custa uma mudança de string, não uma integração.

NV-Reason-CT, para deixar claro, não está no OrcaRouter e não estará — é inferência 3D de código personalizado que você mesmo executa. A versão honesta da história da integração é que o especialista auto-hospedado e o generalista roteado podem ficar sob uma única chave, e a alegação inteira é só essa.

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the identifier qwen/qwen3.8-max, input text + image + video, output text, the Vision, Tools, JSON and Reasoning badges, a 1,000,000-token context window with a p50 time to first token of 1.96 seconds, the description of it as Alibaba's newest flagship positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $2.00 per million input tokens, $6.00 per million output tokens and 37.2M tokens of seven-day traffic.

O veredito que realmente se sustenta

Esta comparação está sendo arquivada em "qual é melhor" e não deveria. O Qwen3.8 Max é avaliado por terceiros em raciocínio geral e supera a maior parte do mercado; o NV-Reason-CT tem uma única tabela com seus próprios números em um único benchmark de CT, e uma contagem de 4,69 bilhões de parâmetros que seria banal em qualquer comparação geral. Em qualquer benchmark geral, o modelo principal vence, e o motivo é que o benchmark geral é aquilo para o qual ele foi construído.

Na única tarefa para a qual o NV-Reason-CT foi criado — ler um volume de TC de tórax ou abdômen e dizer o que há nele, com um rastro que alguém possa verificar — o Qwen3.8 Max não é um concorrente mais fraco. Ele não tem codificador volumétrico, então não pode de modo algum ser executado sobre a entrada sem que alguém primeiro decida como achatar uma varredura em imagens. É nessa decisão que vai parar a informação espacial. É exatamente esse o ponto de um ajuste fino de 4B com um caminho 3D nativo e um prefixo fixo de 13.824 tokens, e é por isso que o interessante neste modelo é a pequenez de seu backbone, e não seu tamanho.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente