
NV-Reason-CT vs DeepSeek V4 Pro: O Custo de Ler uma Varredura e Quando Executar o Lote
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 506 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 183 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Eis um fato operacional que molda mais orçamentos de pipelines clínicos do que qualquer benchmark: DeepSeek V4 Pro custa US$ 0,66 por milhão de tokens de entrada e US$ 1,98 por milhão de tokens de saída, e essas tarifas dobram durante duas janelas por dia, 01:00 às 04:00 e 06:00 às 10:00 UTC. Trabalho em lote executado fora dessas janelas custa metade do que custa dentro delas. Enquanto isso, NV-Reason-CT, o modelo de raciocínio de CT 3D de 4,69 bilhões de parâmetros da NVIDIA, não tem nenhuma tabela de preços — é um conjunto de pesos que você baixa e executa, sem nenhum número publicado de throughput para um único estudo de 13.824 tokens. Um desses modelos, você agenda. O outro, você precisa medir antes de poder orçá-lo.
Essa assimetria é a maneira útil de entrar nesta comparação, porque os dois modelos ocupam extremos opostos do pipeline e falham financeiramente de maneiras opostas. O NV-Reason-CT é um instrumento de custo fixo: o estudo marginal é quase gratuito depois que o hardware é adquirido, mas a decisão de hardware é grande e a latência por estudo não é documentada. O DeepSeek V4 Pro é um motor de custo variável: nada para comprar, tudo medido, e o medidor tem um cronograma que dá para ler no calendário.
O que cada um é, em uma linha cada.
• Trabalho — O NV-Reason-CT lê um volume de TC de tórax ou abdômen e emite achados estruturados; o DeepSeek V4 Pro lê e escreve texto
• Arquitetura — um transformer de visão 3D chamado Primus, inicializado a partir do COLIPRI, com um backbone de linguagem Qwen3.5-4B e embedding rotativo de posição multi-eixo 3D, com 4,69 bilhões de parâmetros, dos quais 4,35 bilhões são ativos; em comparação com uma mistura de especialistas de 1,6 trilhão de parâmetros com 49 bilhões ativos por token
• Entrada — volumes NIfTI de canal único (.nii, .nii.gz) em unidades Hounsfield, com orientação LPS, reamostrados para 2 mm isotrópicos e recortados para a anatomia; em comparação com texto
• Contexto — um único volume torna-se 13.824 tokens visuais numa grade 24 x 24 x 24, sem downsampling espacial e sem camada de fusão; contra 1.048.576 tokens na entrada e 384.000 na saída
• Anatomias suportadas — tórax e abdômen, e nada mais; contra tudo o que o texto pode descrever
• Preço — sem preço de tabela, auto-hospedado, sem throughput publicado por estudo; contra $0,66 / $1,98 por milhão de tokens, dobrando nas duas janelas UTC citadas acima, com leituras de cache a $0,022
• Latência medida — não publicada; em comparação com um tempo mediano até o primeiro token de 3.483 milissegundos a 96,01 tokens de saída por segundo, com uma taxa de erro de 0,75%
Há duas linhas ali que valem mais do que uma linha cada uma. A linha de contexto é a óbvia — um milhão de tokens contra 13.824 —, mas as unidades não são comparáveis, e é um erro lê-las como uma lacuna de capacidade em qualquer direção. 13.824 tokens é o que custa representar fielmente um estudo de TC. Um milhão de tokens é quanto texto ao redor você consegue reter. O primeiro número é uma afirmação sobre resolução; o segundo é uma afirmação sobre memória.
A linha de latência é a que acaba sendo ignorada. A mediana de 3,48 segundos até o primeiro token e os 96 tokens por segundo do DeepSeek V4 Pro são números medidos e publicados, e permitem dimensionar um trabalho de texto no papel. A ausência de qualquer número equivalente para o NV-Reason-CT não é uma crítica ao modelo; é o motivo pelo qual não se pode calcular o custo de um pipeline de CT antes que alguém o execute. Processar 13.824 tokens visuais com um modelo de 4,69B não é uma computação pequena, e até você medir o tempo disso no seu próprio hardware, você está adivinhando.
Lendo os dois registros de benchmark sem se enganar
O histórico do DeepSeek V4 Pro é uma mistura de medição independente e divulgação do fornecedor, e a mistura é instrutiva porque contém um número que parece alarmante e não é.
• Artificial Analysis Intelligence Index — 36, o que o coloca no 72,4º percentil dos modelos medidos
• GPQA Diamond — 92,8, o que está próximo do topo da área
• Humanity's Last Exam — 41, e 41 no MMLU-Pro, 62,51 no índice de matemática
• τ²-Bench — 96,20, com IFBench em 76,46 e tau_banking em 39,59
• Recall de contexto longo — 80,33
• SciCode e Terminal-Bench — 51 e 78,65 na segunda versão do Terminal-Bench
Um índice composto de 36 ao lado de um GPQA Diamond de 92,8 parece uma contradição até você perceber o que é um índice. É uma agregação de muitas avaliações, e um modelo que é excelente em algumas delas e apenas adequado em outras ficará em posição intermediária na soma enquanto lidera rankings individuais. Qualquer pessoa que cite o 36 isoladamente para argumentar que o DeepSeek V4 Pro é de nível médio está citando uma média como se fosse um máximo. Qualquer pessoa que cite o 92,8 isoladamente para argumentar que ele lidera o campo está citando um máximo como se fosse uma média. Ambos os números são da Artificial Analysis, e ambos são verdadeiros.
O registo do NV-Reason-CT não tem tal mistura, e esse é o problema honesto que apresenta. Os seus números no CT-RATE — 0,614 de F1 e 0,871 de AUROC em dezoito rótulos, usando um limiar uniforme fixo e um prompt direto de sim/não, sem cabeça de classificação e sem adaptação específica à tarefa — vêm do próprio artigo da NVIDIA e de mais nenhum lugar. O conjunto de comparação desse artigo (VoxelFM com 0,581, Pillar-0 com 0,544, ClinFusion-8B com 0,442, CT-CLIP com 0,398, Merlin com 0,358, MedGemma 1.5 com 0,303) é inteiramente composto por outros modelos de imagem. Não aparece nele um único modelo de texto geral, e nenhum terceiro reproduziu qualquer um dos números.

A questão do agendamento, resolvida
O preço por tempo de uso do DeepSeek V4 Pro é o aspecto mais acionável operacionalmente de qualquer um dos dois modelos, por isso merece uma análise detalhada e concreta.
Uma carga de trabalho realista do lado textual para um programa de CT não tem glamour. Consiste em extrair campos estruturados de um corpus de relatórios históricos para ter rótulos com que treinar, converter árvores de diretórios DICOM em NIfTI em escala, escrever e reescrever o sistema de avaliação, normalizar unidades e terminologia em quatro conjuntos de dados e resumir coortes. Digamos cem milhões de tokens de entrada e dez milhões de tokens de saída para um programa de dimensão média, o que é um número deliberadamente redondo que representa "muito trabalho textual".
• Dentro de uma janela duplicada — $1,32 e $3,96 por milhão, ou seja, $132 mais $39,60 nesses volumes
• Fora dessas janelas — $0,66 e $1,98 por milhão, ou seja, $66 mais $19,80
• A diferença — cerca de US$ 86, ou 49% da fatura fora de pico, por mover um trabalho que é, por natureza, passível de processamento em lote
• Leituras em cache — $0,022 por milhão, o que equivale a um sexagésimo da tarifa de entrada, então qualquer prefixo de prompt que você reutilize em todo o corpus fica praticamente gratuito
Isso não é um erro de arredondamento, e está disponível porque o trabalho é assíncrono. A extração de relatórios não precisa acontecer às 14:00. Nada em um trabalho de conversão DICOM se importa com o horário. A estrutura de preços é um convite direto para agendar, e um pipeline que a ignora está pagando um prêmio de 49% pelo privilégio de executar quando bem entender. As leituras de cache importam pelo mesmo motivo: um prompt de sistema compartilhado ou um esquema de extração fixo, reutilizado em milhares de relatórios, fica a um sexagésimo da taxa de entrada.
O NV-Reason-CT não tem uma alavanca equivalente, porque não tem medidor. O custo de ler um exame é o que a sua GPU custa por hora dividido pelo número de exames por hora que consegue processar, e o segundo número é o que ninguém publicou. Se um único estudo leva dois segundos, uma única L40S dá conta de um grande programa com tranquilidade. Se leva vinte, a aritmética de hardware muda completamente. A NVIDIA testou em H100 e L40S, o que lhe diz a classe da placa, não a taxa.
A armadilha em assumir que podem ser substituídos
O erro que esta comparação convida a cometer é mais sutil do que o habitual erro de categoria, porque há uma versão dele que parece razoável num slide.
DeepSeek V4 Pro suporta 1.048.576 tokens e gera até 384.000. Um volume de TC é, segundo o cálculo do modelo que o lê corretamente, de apenas 13.824 tokens. Assim, um modelo de texto com uma janela de um milhão de tokens tem espaço para setenta e poucos exames de TC nessa contagem de tokens. A aritmética está correta e a conclusão — de que você poderia alimentar um modelo de texto com dados de TC e economizar a infraestrutura de imagem — está errada, pelo motivo pelo qual o número 13.824 existe em primeiro lugar.
Esse número não é um resumo comprimido de uma varredura. É a varredura, com resolução isotrópica de 2 mm em um cubo de 384 milímetros, cortada em 8 x 8 x 8 fragmentos, entregue ao modelo de linguagem sem subamostragem espacial e sem camada de mesclagem. A contagem de tokens é alta justamente porque nada foi descartado: o espaçamento entre fatias que torna um nódulo mensurável, os valores de densidade que fazem de uma textura um limiar em vez de um adjetivo. Um modelo de texto não consegue ingerir esses tokens como volumes, assim como um documento também não consegue. Ele tem o orçamento. Ele não tem a interface.
A própria comparação interna do artigo quantifica a diferença. O MedGemma 1.5, ao qual se fornecem até 85 cortes axiais — o melhor que um front-end bidimensional ou de cortes empilhados pode razoavelmente fazer — alcança 0,303 de F1, contra 0,614 do modelo volumétrico nativo. Essa lacuna é o valor do codificador tridimensional, e nenhuma janela de contexto, por maior que seja, a fecha.
A substituição inversa falha por razões mais simples. O NV-Reason-CT é compatível com tórax e abdômen, recebe um arquivo NIfTI em vez de um prompt, não faz uso de ferramentas, e seu cartão de modelo o restringe a pesquisa e educação e declara que não é um dispositivo médico e que as saídas podem estar incorretas. Ele não consegue extrair campos de um relatório, nem escrever o script que monta seu corpus.

Onde nos encaixamos, e onde deliberadamente não o fazemos.
O DeepSeek V4 Pro é servido através do OrcaRouter como deepseek/deepseek-v4-pro, à tarifa de tabela do provedor com zero markup, dentro de uma única API que cobre mais de 200 modelos. O repasse importa mais do que o habitual para um modelo com preço que varia conforme o horário: quando um fornecedor altera uma tarifa ou uma janela, a tarifa do nosso lado muda no mesmo dia, porque não há camada de markup intermediária segurando um número antigo. O failover automático cobre o caso em que um provedor se degrada no meio do lote, o que, para um longo trabalho de extração não assistido, é o modo de falha que de fato custa uma noite, e a DSL de roteamento permite enviar solicitações individuais ao modelo que deveria tratá-las, em vez de passar tudo por um único endpoint.
O NV-Reason-CT não está na nossa plataforma. Nenhum modelo da NVIDIA está. O lado de CT dessa arquitetura é o seu próprio hardware com os seus próprios pesos baixados, e não vamos escrever uma frase que permita ao leitor pensar o contrário. Dado que a entrada são dados volumétricos derivados de pacientes e a licença é a OpenMDW-1.1, sem qualquer serviço hospedado associado, a execução local é onde esse modelo pertence, de qualquer forma.
O que o emparelhamento realmente lhe diz
Os dois modelos não competem, e o objetivo de compará-los é que eles falham de maneiras diferentes. O NV-Reason-CT oferece uma capacidade que nada mais em aberto oferece — raciocínio nativo em TC tridimensional na resolução total do estudo — e exige que você aceite um custo por estudo sem orçamento definido, uma capacidade de processamento não publicada e uma licença que proíbe a implantação clínica. O DeepSeek V4 Pro oferece um motor medido com latência publicada, taxa de erro publicada, medições independentes e um preço que você pode reduzir pela metade olhando para um relógio, e não consegue ver uma tomografia de forma alguma.
Se você está construindo a coisa em vez de comprá-la, a forma que sobrevive ao contato é a chata. Execute a leitura de CT localmente, faça o orçamento medindo em vez de cotar, e sincronize tudo o que for textual ao redor disso com a janela fora de pico. O cronograma que ninguém deveria copiar é o que roda cem milhões de tokens de extração às 02:00 UTC porque foi quando o lote por acaso ficou pronto.

