
NV-Reason-CT vs Gemini 3.1 Pro: A Superfície de Entrada Mais Ampla, e Ainda Assim Não um Leitor de CT
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 506 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 183 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Noventa e quatro por cento. Essa é a taxa de erro que nosso próprio catálogo registra atualmente para uma rota que atende Gemini 3.1 Pro — 93,93%, juntamente com um tempo mediano até o primeiro token que se lê como um teto de dez segundos e um valor de throughput de 978 tokens por segundo. Interprete isso como uma declaração sobre o modelo e você tirará exatamente a conclusão errada. Interprete-o como uma declaração sobre uma camada de pré-visualização sob carga e ele se torna a coisa mais útil da página, porque é o que um pipeline clínico realmente experimenta quando depende de uma rota que não foi provisionada para tráfego de produção.
O modelo do outro lado desta comparação não tem esse problema nem essa medição. NV-Reason-CT é o raciocinador nativo de TC 3D da NVIDIA com 4,69 bilhões de parâmetros, disponível para download sob a OpenMDW-1.1, sem nenhum número de throughput publicado e sem hospedagem em lugar algum. Assim, um lado deste confronto oferece a superfície de entrada mais ampla do setor, com um perfil de disponibilidade em torno do qual você precisa projetar; o outro oferece uma única capacidade estreita, com uma latência que você mesmo precisa medir. Nenhum dos dois tem um painel de monitoramento em que você possa confiar desde o primeiro dia, e por motivos opostos.
Dois modelos, duas definições de "multimodal"
A palavra está fazendo muito trabalho em ambas as descrições de produto e quase nada disso é compartilhado.
• Entradas aceitas — o Gemini 3.1 Pro aceita texto, imagens, áudio, vídeo e arquivos; o NV-Reason-CT aceita um volume NIfTI de canal único em unidades Hounsfield, e nada mais
• O que significa "3D" — O NV-Reason-CT reamostra para 2 mm isotrópicos num cubo de 384 milímetros e divide-o em patches de 8 x 8 x 8 para uma grelha de 24 x 24 x 24; a entrada de vídeo do Gemini 3.1 Pro é uma sequência de fotogramas bidimensionais com uma linha temporal
• Contexto — 1.048.576 tokens de entrada e 65.536 de saída para o Gemini 3.1 Pro; um volume é 13.824 tokens visuais para o NV-Reason-CT, sem downsampling e sem camada de fusão, e não há janela de chat em torno dele
• Lançamento — 19 de fevereiro de 2026 para o Gemini 3.1 Pro, em um slug de pré-visualização; uma divulgação de pesquisa não anunciada para o NV-Reason-CT, com atividade no repositório datada de 2 a 25 de setembro de 2026
• Preço — $2 e $12 por milhão de tokens até 200.000 tokens, depois $4 e $18, com leituras de cache a $0.20 e gravações de cache a $0.375; em comparação com pesos auto-hospedados sem tabela de preços
• Capacidades — visão, áudio, uso de ferramentas, saída JSON e raciocínio para o Gemini 3.1 Pro; achados estruturados por região anatômica para o NV-Reason-CT, sem ferramentas
• Licença e estado — uma API de pré-visualização alojada; em relação a pesos OpenMDW-1.1 cujo cartão de modelo indica apenas investigação e educação e afirma claramente que não é um dispositivo médico
Uma entrada de vídeo e uma entrada de TC volumétrica parecem próximas à distância e não poderiam estar mais distantes de perto. Vídeo são quadros ao longo do tempo. Um exame de TC é um único volume estático com três eixos espaciais, uma escala física em milímetros e uma unidade de densidade calibrada, em que o que está sendo medido é a densidade de uma estrutura cujo tamanho importa. O Gemini 3.1 Pro assistirá a uma gravação cirúrgica e descreverá o que aconteceu. Ele não medirá um nódulo. Isso não é uma limitação que o Google deixou de resolver; é um problema diferente que ninguém solucionou com um modelo geral.
O que os dois registros de benchmark abrangem e o que deixam de fora
O Gemini 3.1 Pro tem um histórico independente, e ele é bom nos eixos que mede.
• GPQA Diamond — 94.1, o valor mais alto em todo este conjunto de artigos
• Humanity's Last Exam — 47, com uma pontuação de recall de contexto longo de 82, novamente a mais alta nesta comparação
• IFBench e SciCode — 77,14 e 58,7
• τ²-Bench — 95,61, com tau_banking em 21,44 e Terminal-Bench Hard em 53,79
• Inteligência e Codificação da Artificial Analysis — 29,7 e 68,8
• Latência medida — uma mediana de dez segundos até o primeiro token, que parece ser um limite máximo em vez de uma mediana real, a 978 tokens por segundo e uma taxa de erro de 93,93%
Observe o formato disso: um perfil de conhecimento e de contexto longo no topo da comparação, um índice de inteligência na parte inferior central, e uma medida de disponibilidade inutilizável. Todos os três descrevem o mesmo modelo na mesma rota. Um GPQA Diamond alto significa que ele sabe muito. Um composto de 29,7 significa que ele não lidera em tudo. Uma taxa de erro de 93,93% significa que, neste caminho específico, a maioria das suas solicitações não será concluída — e isso é quase certamente um fato de capacidade e provisionamento de um endpoint de pré-visualização, e não uma propriedade dos pesos. Não podemos provar qual dos dois é o caso a partir do exterior. O que podemos dizer é que nenhum desses três números é um erro de digitação, e qualquer arquitetura que leia apenas o primeiro terá uma semana ruim.
O histórico do NV-Reason-CT é mais restrito e vem com uma ressalva diferente. Seus 0,614 de F1 e 0,871 de AUROC no CT-RATE, em dezoito rótulos com um limiar uniforme fixo e um prompt direto de sim/não, sem cabeça de classificação nem adaptação específica à tarefa, são números da própria NVIDIA, do próprio artigo da NVIDIA. O conjunto de comparação por trás deles — VoxelFM com 0,581, Pillar-0 com 0,544, ClinFusion-8B com 0,442, CT-CLIP com 0,398, Merlin com 0,358, MedGemma 1.5 com 0,303 — contém apenas modelos de imagem. Nenhum modelo multimodal geral aparece, o que significa que a pergunta "como o Gemini 3.1 Pro se sairia no CT-RATE" não foi feita, muito menos respondida.

O problema do nível de pré-visualização, devidamente enunciado
Esta é a parte da comparação que não tem nada a ver com CT e tem tudo a ver com conduzir qualquer atividade clínica.
Uma taxa de erro de 93,93% não é uma degradação sutil. É uma rota em que a esmagadora maioria das chamadas falha. A reação natural é declarar o modelo inutilizável, e essa reação está errada por dois motivos. Primeiro, uma taxa de erro medida em um endpoint de pré-visualização reflete capacidade, cota e roteamento regional, não a habilidade do modelo. Os níveis de pré-visualização do Google são notoriamente provisionados para avaliação, e não para produção, e um slug com nome de pré-visualização é um slug que pode ser limitado sem aviso prévio. Segundo, a medição é um instantâneo de um caminho em um único momento. Ela vai mudar. O que não vai mudar é a lição: uma dependência de uma rota de pré-visualização é uma dependência de uma decisão de capacidade tomada por outra pessoa.
As mitigações são pouco glamorosas, e são precisamente a razão pela qual o roteamento existe como disciplina, e não como uma conveniência.
• Nunca codifique diretamente um slug de pré-visualização em um caminho de produção — coloque a funcionalidade atrás de uma interface para que o modelo por trás dela possa ser substituído sem um deploy
• Tentar novamente e recorrer a um provedor diferente ou a um modelo diferente — para uma tarefa de extração em lote, uma taxa de falha de 94% é sobrevivível se as falhas forem encaminhadas para outro lugar e fatal se não forem
• Meça sua própria taxa de erro em vez de herdar uma — o valor de 93,93% é o número do nosso catálogo para uma rota, e o seu dependerá da sua região, do seu volume e do formato da sua carga de trabalho
• Mantenha um segundo modelo aquecido para qualquer coisa em um cronograma clínico — o modo de falha contra o qual você está se protegendo não é uma resposta ruim, é a ausência de resposta
A mesma disciplina se aplica na direção oposta no lado CT, onde não há rota alguma. Um modelo auto-hospedado não tem uma taxa de erro do provedor; tem uma taxa de erro de hardware, um ônus de manutenção e um teto de capacidade definido por quantas GPUs você comprou. O modo de falha é uma fila, e a mitigação é agendamento em vez de failover. Problema diferente, mesma regra: saiba de qual número você está realmente dependendo.
Onde um contexto longo realmente ajuda, e onde não.
A janela de 1.048.576 tokens do Gemini 3.1 Pro e a pontuação de recall de contexto longo de 82 pontos são vantagens reais e vale a pena usá-las de forma deliberada, e não acidental.
O ponto em que compensam num programa de TC não é o exame. É tudo o que o rodeia. Uma única passagem de extração sobre uma longa nota operatória e os seus relatórios associados, mantendo o documento inteiro em contexto para que os campos sejam consistentes entre si. Um resumo de coorte que tem de manter centenas de narrativas de pacientes ao mesmo tempo para encontrar o padrão entre elas. Uma tarefa de conversão em que o esquema, uma centena de registos de exemplo e o registo de erros precisam de estar visíveis na mesma chamada. São tarefas em que uma janela longa muda a resposta, e não apenas a conveniência.
O ponto em que isso não ajuda é a própria varredura, e a razão merece ser enunciada com precisão porque é exatamente o erro que esta comparação convida a cometer. Uma TC de tórax representada da forma como o NV-Reason-CT a representa custa 13.824 tokens. O Gemini 3.1 Pro poderia manter setenta desses estudos dentro de sua janela e ainda sobrar espaço. A restrição não é espaço. É que a via de visão do Gemini 3.1 Pro trata uma imagem como uma figura com escala de pixels, então um estudo apresentado dessa forma já perdeu o espaçamento entre cortes e a calibração de densidade antes de o primeiro token ser emitido. Você pode gastar um milhão de tokens em um volume e ainda assim não ter um volume. A própria comparação do artigo torna concreto o custo disso: MedGemma 1.5 com 0,303 de F1 quando alimentado com até 85 cortes axiais, contra 0,614 para o modelo volumétrico nativo, o que é uma diferença de aproximadamente o dobro.
Onde nos encaixamos, e a única coisa que não diremos
O Gemini 3.1 Pro é servido pelo OrcaRouter como google/gemini-3.1-pro-preview à tarifa de tabela do provedor, sem markup, dentro de uma única API que cobre mais de 200 modelos. Para um modelo que atualmente está em um nível de pré-visualização, essa combinação é mais útil do que parece. Markup zero significa que uma mudança de tarifa do fornecedor chega ao nosso lado no mesmo dia, em vez de ser absorvida por uma camada intermediária que mantém um número antigo. O failover automático significa que uma rota que começa a falhar não derruba um lote junto com ela — o que, dada uma taxa de erro medida na casa dos noventa em um caminho, não é hipotético. E uma DSL de roteamento para enviar solicitações individuais ao modelo que deve processá-las permite colocar o trabalho de contexto longo em um modelo e o trabalho barato de alto volume em outro sem manter duas integrações.
O NV-Reason-CT não está na nossa plataforma. Nenhum modelo da NVIDIA está. São pesos que você baixa e executa por conta própria, e a forma honesta de enquadrar isto é que as duas metades desta arquitetura vivem em locais completamente diferentes: uma atrás de uma API com uma tabela de preços e um risco de pré-visualização, a outra no seu próprio hardware com uma licença OpenMDW-1.1 e um valor de throughput que você mesmo tem de produzir.


A decisão que sobrevive ao contato com a produção
Se o seu problema é compreensão de texto, áudio, vídeo ou documentos em contexto longo, o Gemini 3.1 Pro é medido de forma independente no topo da área em conhecimento e recall, e a única coisa que fica entre ele e um pipeline de produção é a confiabilidade da rota — que é um problema de engenharia solucionável, não um problema de modelo. Coloque-o atrás de failover, não fixe no código o slug de pré-visualização e meça sua própria taxa de erro em vez de confiar na de qualquer um, inclusive na nossa.
Se o seu problema é um volume de TC de tórax ou de abdômen, há exatamente um modelo aberto nesta comparação que pode resolvê-lo, e não é aquele com a janela de um milhão de tokens, e o número que deve reger o seu planejamento não é a sua pontuação F1. É a latência por estudo que ninguém publicou. Meça-a antes de prometer a alguém um número de vazão.
A comparação vale a pena porque separa duas coisas que são constantemente confundidas: amplitude de entrada e profundidade de representação. O Gemini 3.1 Pro tem a maior superfície de entrada já lançada e o melhor recall de contexto longo deste conjunto, e ainda assim não consegue ler um estudo de TC como um estudo de TC. O NV-Reason-CT consegue ler um e nada mais. Um pipeline precisa dos dois, precisa deles em infraestruturas diferentes, e precisa saber qual dos dois números de cada lado é o que vai te acionar às três da manhã.
