
NV-Reason-CT vs Nemotron 3 Ultra: Um logotipo, duas filosofias de lançamento
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 45 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
A NVIDIA lançou dois modelos de pesos abertos este ano e não contou nada a ninguém sobre um deles. Nemotron 3 Ultra chegou ao Hugging Face em 4 de junho de 2026 como um carro-chefe de 550B no total e 55B ativos, com um relatório técnico, um regime de licenciamento OpenMDW-1.1 e todo um lançamento de conjuntos de dados abertos de pré-treinamento e pós-treinamento por trás. NV-Reason-CT chegou em 8 de setembro de 2026 como um especialista em CT de 4,69B de parâmetros, com um repositório, um Space de demonstração e um preprint no arXiv duas semanas depois que menciona o lançamento em um bloco de citação. Não houve anúncio para o segundo. Compare-os e você não está realmente comparando capacidades — um carro-chefe geral de 550B e um especialista médico de 4,69B não se sobrepõem. Você está comparando duas teorias diferentes de como lançar um modelo, ambas operadas pela mesma empresa, com três meses de diferença.
O que cada repositório realmente contém
O lançamento do Nemotron 3 Ultra é um pipeline aberto completo. O checkpoint NVFP4 no Hugging Face atraiu 249.746 downloads e 338 curtidas; o equivalente BF16, o checkpoint base e os conjuntos de dados de pós-treinamento estão todos publicados junto com ele. Ele é em doze idiomas, somente texto, construído sobre um híbrido latente de mistura de especialistas Mamba2-Transformer com predição de múltiplos tokens, e carrega a licença openmdw-1.1. O Artificial Analysis o posiciona em um Intelligence Index de 47,7 na precisão NVFP4 distribuída e 48,2 em precisão total — o mais alto entre qualquer modelo de pesos abertos dos EUA, segundo esse quadro. Nossa cobertura anterior dos modelos professores Nemotron registra o preço mediano dos provedores em cerca de US$ 0,60 por milhão de tokens de entrada e US$ 2,60 por milhão de saída, e o número de vazão de 183 tokens de saída por segundo da NVIDIA em medição de terceiros.
NV-Reason-CT é um artefato muito menor e muito mais fechado. Dez vírgula seis gigabytes de pesos BF16, um model.py de 10 KB, um processor.py de 26 KB, um template de chat e um inference.py. Um Space de demonstração. Um artigo. Duzentos e dez downloads até esta semana. Nenhum lançamento de dataset. Nenhum relatório técnico. Nenhuma configuração de serving além de um exemplo de volume único.
O contraste não é sobre tamanho — é sobre o que um engenheiro downstream pode fazer com o artefato. O lançamento do Ultra foi projetado para que outra pessoa possa reproduzir o treinamento. O lançamento do NV-Reason-CT foi projetado para que outra pessoa possa executar a inferência. Essas são promessas diferentes.
Apenas um deles é construído sobre a própria stack da NVIDIA
Aqui está o detalhe que surpreende as pessoas, e é verificável no frontmatter da ficha do modelo: o modelo base do NV-Reason-CT é Qwen/Qwen3.5-4B, com uma relação de fine-tune, não um checkpoint Nemotron. A NVIDIA acoplou um transformer de visão Primus 3D — inicializado com os pesos do COLIPRI — a um modelo de linguagem Qwen e treinou o par de ponta a ponta com ajuste fino supervisionado seguido de Group Relative Policy Optimization.
Isso não é uma crítica e não é um escândalo. É a norma do setor para trabalho de visão-linguagem, e a NVIDIA divulga isso claramente nos metadados do repositório. Mas isso significa que a suposição mais natural sobre essa comparação — de que o NV-Reason-CT é um derivado do Nemotron — é falsa. Os dois modelos nesta página compartilham um logotipo e uma família de licenças e essencialmente nada mais. Nenhuma arquitetura compartilhada, nenhum tokenizer compartilhado, nenhum dado de treinamento compartilhado, nenhum caminho de serving compartilhado.
Tamanho, nos números que decidem onde ele roda
• Parâmetros — NV-Reason-CT 4,69B no total / 4,35B ativos na via CT vs Nemotron 3 Ultra 550B no total / 55B ativos LatentMoE esparso • Checkpoint em disco — NV-Reason-CT ~10,6 GB BF16 vs Nemotron 3 Ultra centenas de gigabytes em BF16, publicado adicionalmente em NVFP4 • Entrada — volumes de TC NIfTI 3D do NV-Reason-CT em unidades Hounsfield, somente tórax ou abdômen, um prefixo de volume de 13.824 tokens vs texto do Nemotron 3 Ultra, até 1M tokens de contexto com limite de saída de 65K • Contexto — NV-Reason-CT não aplicável no sentido usual vs Nemotron 3 Ultra 1.000.000 tokens • Licença — ambos sob OpenMDW-1.1 • Hardware — NV-Reason-CT Ampere / Hopper / Lovelace, testado em H100 e L40S vs Nemotron 3 Ultra serviço multi-GPU com 55B ativos • Pontuação independente — NV-Reason-CT nenhuma publicada vs Nemotron 3 Ultra AA Intelligence Index 47,7 NVFP4 / 48,2 precisão completa

A linha prática é a da memória. Um modelo de 4,69B com um codificador 3D cabe em uma única placa, e um grupo de pesquisa consegue justificar isso. Um modelo de 550B no total, com 55B ativos, precisa de infraestrutura real de serving mesmo quantizado. Nenhum dos dois é um experimento de fim de semana, mas estão em ordens diferentes desse problema.
Dois regimes de avaliação que não podem ser combinados numa média
A evidência do Ultra é a capacidade geral: um Índice de Inteligência da Artificial Analysis na casa dos quarenta e poucos, cobertura de benchmarks em raciocínio, codificação e tarefas agênticas, e números divulgados pelo fornecedor para a família, incluindo SWE-Bench Verified 71.9, MMLU-Pro 86.3 e LiveCodeBench v6 89.0 — sendo esses três últimos números da própria NVIDIA e identificados como tal.
As evidências do NV-Reason-CT são uma única tabela. Macro-F1 0,614 e Macro-AUROC 0,871 na tarefa de classificação de 18 rótulos do CT-RATE, em um limiar uniforme fixo, usando um prompt direto de Sim/Não sem cabeça de classificação, contra VoxelFM em 0,581/0,870, Pillar-0 em 0,544/0,861, ClinFusion-8B em 0,442, CT-CLIP em 0,398/0,733, Merlin em 0,358/0,662 e MedGemma 1.5 em 0,303. Os números da NVIDIA, mais uma vez, no card do modelo, ainda sem reprodução independente.

Um AA Intelligence Index de 47,7 e um CT-RATE Macro-F1 de 0,614 não são duas medições de uma mesma coisa. São medições de duas coisas. Não há maneira defensável de dizer que o Ultra é "melhor" do que o NV-Reason-CT, e a razão não é preferência de pontuação — é que os instrumentos não se sobrepõem de forma alguma. A única comparação honesta neste emparelhamento é a de para o que cada modelo é credenciado, no sentido literal de quais evidências existem de que ele faz o seu trabalho.
Por que o lançamento discreto é a opção racional
Coloque-se na equipe de imageamento médico. Você tem um modelo 3D de TC funcional. Você quer que radiologistas, estudantes de medicina e pesquisadores o usem. O que uma palestra principal lhe proporciona?
Um evento de lançamento gera expectativas sobre suporte, roadmaps e longevidade que uma equipe de pesquisa não consegue atender. Ele convida à avaliação de propósito geral em benchmarks nos quais um modelo de 4,69B preso a uma modalidade parecerá pouco impressionante por razões estruturalmente irrelevantes. E coloca um modelo que explicitamente "não deve ser usado como substituto do julgamento clínico profissional" diante de um público que não lê os termos da licença. Um repositório, um artigo e um Space de demonstração alcançam exatamente o público que lê os três, e deixam o artefato falar no seu próprio ritmo. A string de versão é "0.1". O card diz apenas pesquisa e educação. Esse é um lançamento projetado para ser citado, não comprado.
O lançamento do Ultra é o oposto e é igualmente racional — um carro-chefe precisa de distribuição, uma tabela de preços e suporte de ecossistema, e é por isso que veio com conjuntos de dados e um relatório.
Onde um roteador se encaixa, e onde não
Nenhum destes modelos está no OrcaRouter, e não vou sugerir o contrário: o NV-Reason-CT é um checkpoint de 10,6 GB com código de modelo personalizado que você mesmo hospeda, e o Nemotron 3 Ultra, com 55B ativos, é servido através da própria API da NVIDIA e de várias plataformas de terceiros.

O que uma camada de roteamento faz por uma equipe que trabalha com os dois é mais restrito e ainda assim útil. Um pipeline de pesquisa clínica que usa o NV-Reason-CT para o volume e um modelo generalista para o texto ao redor precisa de um lugar para trocar esse modelo generalista sem um segundo contrato, e um endpoint compatível com OpenAI que cobre mais de 200 modelos com failover automático entre provedores é esse lugar. Ele mantém o especialista auto-hospedado e o generalista hospedado sob uma única chave, em vez de duas integrações.
O que tirar do emparelhamento
Lidos como concorrentes, os dois modelos são um erro de categoria. Lidos como estudo de caso, são excepcionalmente claros. Mesmo fornecedor, mesma família de licenças, mesmo ano — e duas estratégias de lançamento escolhidas para corresponder a duas intenções a jusante completamente diferentes. Um é infraestrutura com um ecossistema acoplado. O outro é um artigo com pesos acoplados, lançado para que um público pequeno e específico possa executá-lo e citá-lo.
Se você está procurando um modelo genérico de pesos abertos, o NV-Reason-CT não é um candidato e nunca foi pensado para ser. Se você lê volumes de TC de tórax e abdômen programaticamente, o Nemotron 3 Ultra não pode ajudá-lo e nunca foi pensado para isso. A única sobreposição real entre eles é o logotipo, e a única lição real é que a NVIDIA está disposta a lançar discretamente quando o público é pequeno e técnico o suficiente para encontrar o repositório sem ajuda.
