
NV-Reason-CT vs Kimi K3: 210 Downloads e 588 Milhões de Tokens
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 45 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Um desses modelos foi baixado 210 vezes do Hugging Face. O outro movimentou 588 milhões de tokens pelo nosso próprio playground nos últimos sete dias. Ambos são open-weights, ambos podem ser baixados agora mesmo, e a diferença entre esses dois números é a coisa mais útil nesta comparação. NV-Reason-CT é o modelo 3D de visão-linguagem de 4,69 bilhões de parâmetros da NVIDIA para tomografia computadorizada de tórax e abdômen, publicado no Hugging Face em 8 de setembro de 2026 sem nenhum anúncio. Kimi K3 é o carro-chefe de 1.048.576 tokens da MoonshotAI, lançado em 15 de julho de 2026 e agora um dos modelos mais movimentados da nossa rede. Ambos são "abertos" no sentido que importa para um formulário de compras. Mas não são abertos da mesma forma de maneira alguma.
Dois significados de "você pode baixá-lo"
Comece pelo que cada download realmente deposita no seu disco, porque é aqui que a maioria das comparações de open-weights fica vaga.
O NV-Reason-CT fornece a você model.safetensors com aproximadamente 10,6 GB em BF16, além de um model.py e um substancial processor.py — 26 KB de código de processamento personalizado que implementa o recorte ciente da anatomia, a reamostragem de 2 mm e a patchificação 3D. Você o carrega com trust_remote_code=True, o que significa que você está executando o código do repositório da NVIDIA dentro do seu processo. A inferência exige CUDA PyTorch, e a ficha técnica lista Ampere, Hopper e Lovelace, com testes em H100 e L40S. A entrada é um volume NIfTI por vez. Não há nenhuma abordagem de batching publicada, nenhuma métrica de throughput e nenhuma configuração de serving no repositório além de um inference.py exemplo.
O Kimi K3 oferece um modelo de raciocínio de uso geral com uma janela de contexto de 1.048.576 tokens, entrada de texto e imagem, chamada nativa de ferramentas, saídas estruturadas e esforço de raciocínio configurável. É o modelo que você buscaria para ler cem diretrizes clínicas em uma única solicitação, ou uma década de relatórios de um departamento. Sua pontuação de recuperação de contexto longo no Artificial Analysis é 88,7 — a mais alta entre os modelos desta série e 8,4 pontos acima dos 80,3 do Grok 4.6.
Dito de forma simples: NV-Reason-CT é um checkpoint especializado com uma superfície de entrada estreita e código personalizado no qual você precisa confiar e que precisa manter. Kimi K3 é um modelo geral com uma superfície de entrada ampla que se comporta como infraestrutura. Ambos são baixáveis. Apenas um deles é uma substituição direta.
A evidência da TC, na íntegra, e ela é curta.
Tudo o que se sabe publicamente sobre a qualidade do NV-Reason-CT baseia-se numa única tabela do seu próprio model card: a tarefa de classificação de 18 rótulos do CT-RATE, com um limiar uniforme fixo, prompting direto de Sim/Não, sem cabeça de classificação e sem adaptação específica à tarefa. Macro-F1 0,614, Macro-AUROC 0,871.
As linhas de comparação são VoxelFM em 0,581/0,870, Pillar-0 em 0,544/0,861, ClinFusion-8B em 0,442, CT-CLIP em 0,398/0,733, Merlin em 0,358/0,662 e MedGemma 1.5 em 0,303. Todos esses são números informados pelo fornecedor na ficha da NVIDIA e nenhum foi reproduzido de forma independente até agora — o artigo tem dois dias.
O que a tabela estabelece é restrito e vale a pena enunciar com exatidão: um modelo 3D generativo sem cabeça específica de tarefa supera baselines de pré-treinamento contrastivo 3D e um modelo de fronteira baseado em fatias na classificação de TC com 18 rótulos. O que ela não estabelece é nada sobre raciocínio geral, nada sobre modalidades além de TC torácica e abdominal, e nada sobre a vantagem de AUROC — 0,871 contra 0,870 é um empate vestindo uma vírgula decimal.
Os números do Kimi K3 e a ressalva do ranking de pesos abertos
A Artificial Analysis mede o Kimi K3 com um Intelligence Index de 43,6, o que o coloca em 19º de 145 modelos nessa tabela, no snapshot da classificação da nossa API de modelos. A pontuação dele no GPQA Diamond é 93,5; no Humanity's Last Exam, 46,9; no SciCode, 59,5; no Terminal-Bench 2.1, 85,0; no AA Coding, 76,2, em 9º lugar; e no 𝜏²-banking, 46,0.
Uma afirmação de ranking exige cuidado, porque é fácil errar e já erraram antes. O AA Intelligence Index do Kimi K3, de 44, ocupa o terceiro lugar entre os modelos de pesos abertos no ranking de pesos abertos, atrás do MiMo-V2.6-Pro, com 46, e do GLM-5.3, com 45. Ele não é o líder desse ranking, e não concorre no mesmo ranking que o Grok 4.6 — a Artificial Analysis registra o Grok 4.6 como proprietário, então seu 44 pertence ao ranking geral, não ao de pesos abertos. Os dois índices parecem idênticos, mas não são.
O que o operador realmente vê
É daqui que vem o número de 588 milhões, e vale a pena explicá-lo em detalhes, porque é a única evidência neste artigo que é nossa, e não o marketing de qualquer outra pessoa.
Nos últimos sete dias, o Kimi K3 movimentou 587,8 milhões de tokens pelo playground do OrcaRouter. Seu tempo mediano até o primeiro token foi de 7,8 segundos, produziu 42,9 tokens de saída por segundo, e sua taxa de erro nesse período foi de 0,21% — uma falha em aproximadamente 480 requisições. Essa taxa de erro medida é aquilo que você não consegue obter de uma ficha de modelo, e é o número que decide se um modelo é seguro para colocar atrás de um trabalho em lote.
Para o NV-Reason-CT não há equivalente, porque ele não é um endpoint hospedado em lugar nenhum — é um checkpoint que você mesmo executa. Não há p50, nem taxa de erro, nem tempo de atividade, e não há ninguém para quem fazer failover. Isso não é uma crítica; é um fato estrutural da auto-hospedagem, e é a razão pela qual um grupo de pesquisa pode adotar o NV-Reason-CT numa terça-feira, enquanto uma equipe de produção geralmente não pode.
Se você estiver executando as duas metades disso — o Kimi K3 como a camada geral hospedada e o NV-Reason-CT na sua própria máquina com GPU —, é no lado do roteamento que a metade hospedada obtém sua resiliência. O Kimi K3 é servido pelo preço de tabela do próprio Moonshot, de US$ 3,00 por milhão de tokens de entrada e US$ 15,00 por milhão de saída, sem nenhuma margem adicional; sua taxa de leitura de cache de US$ 0,30 por milhão é um décimo da de entrada e, como o preço é repassado sem alteração, um corte do fornecedor chega à sua fatura no mesmo dia. O failover automático entre provedores é o que mantém um job em lote vivo quando um endpoint upstream oscila — e, com uma taxa de erro de 0,21%, as oscilações são raras o bastante para que seja fácil esquecê-las até que não sejam.
As formas de custo não se assemelham entre si.
• Preço — CAPEX de GPU do NV-Reason-CT mais seu próprio stack de serving vs. Kimi K3 US$ 3,00 / US$ 15,00 por milhão, US$ 0,30 por leitura em cache
• Gasto mínimo viável — NV-Reason-CT uma GPU Ampere ou mais recente mantida indefinidamente vs. Kimi K3 uma requisição
• Contexto — NV-Reason-CT um volume, 13.824 tokens fixos vs Kimi K3 1.048.576 tokens
• Custo marginal da milésima requisição — NV-Reason-CT efetivamente zero depois que a GPU é paga, vs Kimi K3 linear em tokens
• Onde isso quebra primeiro — throughput não verificado do NV-Reason-CT e ausência de estratégia de batching vs. custo de contexto longo do Kimi K3 a 1M de tokens por requisição
• Modalidades — NV-Reason-CT 3D NIfTI, tórax ou abdômen vs Kimi K3 texto e imagem, qualquer coisa

A economia se inverte dependendo do volume. Kimi K3 não custa nada para começar e escala linearmente. NV-Reason-CT custa uma GPU para começar e depois escala de forma quase plana — e é por isso que 210 downloads não é um sinal de fracasso. É o número correto para um checkpoint cujo público são instituições que já possuem o hardware, e que nunca aparecerão em nenhuma estatística de throughput de tokens.

Qual deles você está realmente escolhendo
Se o trabalho é ler um volume de TC e produzir um achado estruturado com um traço de raciocínio, o Kimi K3 não consegue fazer isso, e o NV-Reason-CT consegue. Não "faz isso pior" — não consegue, porque não há nenhum codificador volumétrico em lugar algum nele, e achatar uma varredura em imagens primeiro descarta as relações espaciais que o caminho 3D existe para preservar.
Se a tarefa for ler 400 páginas de notas de encaminhamento, compará-las com um documento de protocolo e emitir saída estruturada, o NV-Reason-CT não entra na conversa, e o Kimi K3 é uma das melhores respostas disponíveis, com uma taxa de erro medida inferior a um quarto de por cento em nossa rede.

A verdadeira decisão não é entre os dois. É se o seu problema é um problema de volume ou um problema de texto, e a diferença de 210 contra 588 milhões é simplesmente como essa distinção se parece vista de fora. Um modelo é um artigo com pesos. O outro é uma peça de infraestrutura. Vale a pena ter ambos; nenhum substitui o outro.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
