Una hero card generata intitolata 'NV-Reason-CT vs Gemini 3.1 Pro' con il sottotitolo 'La più ampia superficie di input, e ancora non un lettore di CT'. Due card contrapposte sono separate da una coppia di frecce blu: la card di sinistra è etichettata 'NV-Reason-CT' con un'icona di scansione corporea e 'solo torace e addome - 13.824 token visivi per volume - OpenMDW-1.1'; la card di destra è etichettata 'Gemini 3.1 Pro' con un'icona a chip e 'input audio, video, immagini, file, testo - contesto 1M - livello preview'. Il logo OrcaRouter è sovrapposto nell'angolo in basso a destra.
Guides & Insights

NV-Reason-CT vs Gemini 3.1 Pro: La più ampia superficie di input, e ancora non un lettore CT

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Novantaquattro percento. Questo è il tasso di errore che il nostro stesso catalogo attualmente registra per una rotta che serve Gemini 3.1 Pro — 93,93%, insieme a un tempo mediano al primo token che si legge come un tetto di dieci secondi e a una cifra di throughput di 978 token al secondo. Interpretalo come un'affermazione sul modello e trarrai esattamente la conclusione sbagliata. Interpretalo come un'affermazione su un tier di anteprima sotto carico e diventa la cosa più utile della pagina, perché è ciò che una pipeline clinica sperimenta davvero quando dipende da una rotta che non è stata provisionata per il traffico di produzione.

Il modello dall'altra parte di questo confronto non ha questo problema né questa misurazione. NV-Reason-CT è il ragionatore CT 3D nativo da 4,69 miliardi di parametri di NVIDIA, scaricabile con licenza OpenMDW-1.1, senza alcun dato pubblicato sul throughput e senza alcun hosting da nessuna parte. Quindi un lato di questo confronto ti offre la più ampia superficie di input del settore con un profilo di disponibilità attorno a cui devi progettare; l'altro ti offre un'unica capacità ristretta con una latenza che devi misurare da solo. Nessuno dei due ha una dashboard di monitoraggio di cui potersi fidare dal primo giorno, e per ragioni opposte.

Due modelli, due definizioni di "multimodale"

La parola sta facendo un gran lavoro in entrambe le descrizioni di prodotto, e quasi niente di quel lavoro è condiviso.

• Input accettati — Gemini 3.1 Pro accetta testo, immagini, audio, video e file; NV-Reason-CT accetta un volume NIfTI a canale singolo in unità Hounsfield, e nient'altro

• Che cosa significa "3D" — NV-Reason-CT ricampiona a una risoluzione isotropa di 2 mm su un cubo di 384 millimetri e lo suddivide in patch 8 x 8 x 8 per una griglia 24 x 24 x 24; l'input video di Gemini 3.1 Pro è una sequenza di fotogrammi bidimensionali con una linea temporale

• Contesto — 1.048.576 token in ingresso e 65.536 in uscita per Gemini 3.1 Pro; un volume è di 13.824 token visivi per NV-Reason-CT, senza downsampling e senza livello di merging, e non c'è una finestra di chat attorno ad esso

• Rilascio — 19 febbraio 2026 per Gemini 3.1 Pro, su uno slug di anteprima; un rilascio di ricerca non annunciato per NV-Reason-CT, con attività del repository datata dal 2 al 25 settembre 2026

• Prezzo — 2 $ e 12 $ per milione di token fino a 200.000 token, poi 4 $ e 18 $, con letture dalla cache a 0,20 $ e scritture nella cache a 0,375 $; rispetto a pesi self-hosted senza listino prezzi

• Funzionalità — visione, audio, uso di strumenti, output JSON e ragionamento per Gemini 3.1 Pro; risultati strutturati per regione anatomica per NV-Reason-CT, senza strumenti

• Licenza e stato — un'API di anteprima ospitata; rispetto ai pesi OpenMDW-1.1 la cui model card dichiara solo ricerca e istruzione e afferma chiaramente che non è un dispositivo medico

Un input video e un input CT volumetrico sembrano vicini da lontano e non potrebbero essere più distanti da vicino. Il video è una sequenza di fotogrammi nel tempo. Uno studio CT è un singolo volume statico con tre assi spaziali, una scala fisica in millimetri e un'unità di densità calibrata, in cui ciò che viene misurato è la densità di una struttura di cui conta la dimensione. Gemini 3.1 Pro guarderà una registrazione chirurgica e descriverà cosa è successo. Non misurerà un nodulo. Non è un limite che Google non ha affrontato; è un problema diverso che nessuno ha risolto con un modello generale.

Cosa coprono i due record di benchmark e cosa tralasciano

Gemini 3.1 Pro ha un track record indipendente ed è un buon track record sugli assi che misura.

• GPQA Diamond — 94,1, il valore più alto in tutta questa serie di articoli

• Humanity's Last Exam — 47, con un punteggio di richiamo su contesto lungo di 82, ancora il più alto in questo confronto

• IFBench e SciCode — 77,14 e 58,7

• τ²-Bench — 95,61, con tau_banking a 21,44 e Terminal-Bench Hard a 53,79

• Artificial Analysis Intelligence and Coding — 29,7 e 68,8

• Latenza misurata — una mediana di dieci secondi al primo token, che sembra essere un limite massimo piuttosto che una vera mediana, a 978 token al secondo e un tasso di errore del 93,93%

Osserva la forma di questo: un profilo di conoscenza e di contesto lungo in cima al confronto, un indice di intelligenza nella parte medio-bassa e una misura di disponibilità inutilizzabile. Tutti e tre descrivono lo stesso modello sullo stesso percorso. Un GPQA Diamond alto significa che sa davvero molto. Un composito di 29,7 significa che non è in testa su tutto. Un tasso di errore del 93,93% significa che, su questo particolare percorso, la maggior parte delle tue richieste non andrà a buon fine — e questo è quasi certamente un fatto di capacità e provisioning di un endpoint in anteprima, più che una proprietà dei pesi. Dall'esterno non possiamo dimostrare quale delle due cose sia. Quello che possiamo dire è che nessuno di quei tre numeri è un errore di battitura e che qualsiasi architettura che legge solo il primo passerà una brutta settimana.

Il record di NV-Reason-CT è più ristretto e comporta un'avvertenza diversa. I suoi 0,614 F1 e 0,871 AUROC su CT-RATE, su diciotto etichette con una soglia uniforme fissa e un prompt diretto sì/no e nessuna testa di classificazione o adattamento specifico per il compito, sono i numeri di NVIDIA dal paper di NVIDIA stesso. L'insieme di confronto dietro di essi — VoxelFM a 0,581, Pillar-0 a 0,544, ClinFusion-8B a 0,442, CT-CLIP a 0,398, Merlin a 0,358, MedGemma 1.5 a 0,303 — contiene solo modelli di imaging. Non compare alcun modello multimodale generale, il che significa che la domanda "come se la caverebbe Gemini 3.1 Pro su CT-RATE" non è stata posta, figuriamoci risolta.

A generated scoreboard titled 'Breadth on one side, depth on the other' with two columns. The left column, headed 'Gemini 3.1 Pro', lists six rows: inputs, text, image, audio, video, file; context, 1,048,576 in and 65,536 out; GPQA Diamond 94.1; AA Intelligence 29.7; route reliability, 93.93% measured error rate; price, $2 and $12 per million tokens, doubling past 200k. The right column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI in Hounsfield units; context, 13,824 visual tokens per volume, no chat window; CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; route reliability, not applicable, self-hosted; price, no rate card, no published throughput. A footer reads 'The 93.93% error rate describes a preview route under load, not the quality of the weights.'

Il problema del livello di anteprima, formulato correttamente

Questa è la parte del confronto che non ha nulla a che fare con la CT e che ha tutto a che fare con la gestione di qualsiasi attività clinica.

Un tasso di errore del 93,93% non è un degrado lieve. È una rotta in cui la stragrande maggioranza delle chiamate fallisce. La reazione naturale è dichiarare il modello inutilizzabile, e quella reazione è sbagliata per due motivi. Primo, un tasso di errore misurato su un endpoint di anteprima riflette capacità, quota e instradamento regionale, non le capacità del modello. I livelli di anteprima di Google sono notoriamente dimensionati per la valutazione anziché per la produzione, e uno slug che porta il nome di un'anteprima è uno slug che può essere limitato senza preavviso. Secondo, la misurazione è un'istantanea di un percorso in un preciso momento. Cambierà. Ciò che non cambierà è la lezione: una dipendenza da una rotta di anteprima è una dipendenza da una decisione sulla capacità che qualcun altro prende.

Le mitigazioni sono poco appariscenti e sono la ragione stessa per cui l'instradamento esiste come disciplina anziché come semplice comodità.

• Non codificare mai in modo fisso uno slug di anteprima in un percorso di produzione — metti la funzionalità dietro un'interfaccia, così che il modello che vi sta dietro possa essere sostituito senza un deploy

• Riprova e passa a un altro provider o a un modello diverso — per un processo di estrazione batch, un tasso di fallimento del 94% è sopravvivibile se i fallimenti vengono indirizzati altrove e fatale se non lo sono

• Misura il tuo tasso di errore invece di ereditarne uno — il valore del 93,93% è il numero del nostro catalogo per una rotta, e il tuo dipenderà dalla tua regione, dal tuo volume e dalla forma del tuo carico di lavoro

• Tieni pronto un secondo modello per qualsiasi cosa su una tempistica clinica — la modalità di errore da cui ti stai proteggendo non è una risposta sbagliata, è nessuna risposta

La stessa disciplina si applica nella direzione opposta sul lato CT, dove non esiste alcuna rotta. Un modello self-hosted non ha un tasso di errore del provider; ha un tasso di errore hardware, un onere di manutenzione e un tetto di capacità determinato dal numero di GPU acquistate. La modalità di guasto è una coda, e la mitigazione è la pianificazione anziché il failover. Problema diverso, stessa regola: sappi su quale numero stai effettivamente facendo affidamento.

Dove un contesto lungo aiuta davvero, e dove no

La finestra da 1.048.576 token di Gemini 3.1 Pro e il punteggio di 82 punti nel richiamo su contesto lungo sono vantaggi reali e vale la pena sfruttarli in modo intenzionale anziché accidentale.

Il punto in cui ripagano in un programma TC non è la scansione. È tutto ciò che vi sta attorno. Una singola passata di estrazione su una lunga nota operatoria e sui relativi referti, mantenendo l'intero documento nel contesto affinché i campi siano coerenti tra loro. Un riepilogo di coorte che deve tenere insieme centinaia di narrazioni di pazienti contemporaneamente per trovare lo schema che le accomuna. Un processo di conversione in cui lo schema, un centinaio di record di esempio e il registro degli errori devono essere tutti visibili nella stessa chiamata. Sono attività in cui una finestra lunga cambia la risposta, non solo la comodità.

Il punto in cui non è d'aiuto è la scansione stessa, e vale la pena enunciare con precisione la ragione, proprio perché è l'errore che questo confronto invita a commettere. Una TC del torace rappresentata nel modo in cui la rappresenta NV-Reason-CT costa 13.824 token. Gemini 3.1 Pro potrebbe contenere settanta studi di questo tipo nella sua finestra con ampio margine. Il vincolo non è lo spazio. È che il percorso visivo di Gemini 3.1 Pro tratta un'immagine come una figura con una scala in pixel, quindi uno studio presentato in quel modo ha perso la spaziatura tra le fette e la calibrazione della densità prima che venga emesso il primo token. Puoi spendere un milione di token su un volume e comunque non avere un volume. Il confronto presente nello stesso articolo rende concreto il costo di tutto ciò: MedGemma 1.5 a 0,303 F1 quando viene alimentato con fino a 85 sezioni assiali, contro 0,614 per il modello volumetrico nativo, che è un divario di circa il doppio.

Dove ci collochiamo, e l'unica cosa che non diremo

Gemini 3.1 Pro viene servito tramite OrcaRouter come google/gemini-3.1-pro-preview alla tariffa di listino del provider, senza alcun ricarico, all'interno di un'unica API che copre più di 200 modelli. Per un modello attualmente in anteprima, questa combinazione è più utile di quanto sembri. Zero ricarico significa che una variazione delle tariffe del fornitore arriva dalla nostra parte lo stesso giorno, invece di essere assorbita da uno strato intermedio che conserva un vecchio valore. Il failover automatico fa sì che una rotta che inizia a fallire non si porti dietro l'intero batch — il che, visto un tasso di errore misurato oltre il 90% su un percorso, non è un'ipotesi teorica. E un DSL di routing che invia le singole richieste al modello che dovrebbe gestirle ti permette di affidare il lavoro a contesto lungo a un modello e il lavoro economico ad alto volume a un altro, senza dover mantenere due integrazioni.

NV-Reason-CT non è sulla nostra piattaforma. Nessun modello NVIDIA lo è. Sono pesi che scarichi ed esegui da solo, e la descrizione onesta è che le due metà di questa architettura vivono in luoghi del tutto diversi: una dietro un'API con un tariffario e un rischio di anteprima, l'altra sul tuo hardware con una licenza OpenMDW-1.1 e un valore di throughput che devi produrre tu stesso.

A generated scoreboard titled 'What each side gives you, and what it costs' listing five paired rows. Row one: widest input surface, audio, video, image and file against text only, one modality at a time. Row two: longest context, 1,048,576 tokens in against 13,824 tokens per volume. Row three: highest benchmark, GPQA Diamond 94.1 against CT-RATE F1 0.614. Row four: weakest measured figure, a 93.93% route error rate against no published throughput at all. Row five: dependency, a hosted preview tier against your own GPUs. A footer reads 'Both sides carry a number nobody should build on without measuring it themselves.'A screenshot of the OrcaRouter model page for Gemini 3.1 Pro, showing the identifier google/gemini-3.1-pro-preview with tags for Vision, Audio, Video, Tools, JSON and Reasoning, the description of it as a multimodal model accepting text, image, audio, video and file input, and a side panel listing a 1,048,576-token context window with up to 65,536 output tokens. A stat strip reads $2.00 per million input tokens, $12.00 per million output tokens, a median time to first token, and an error rate of 93.93 percent.

La decisione che sopravvive al contatto con la produzione

Se il tuo problema è la comprensione di testo, audio, video o documenti su contesto lungo, Gemini 3.1 Pro è misurato in modo indipendente ai vertici del settore su conoscenza e recall, e l'unica cosa che si frappone tra esso e una pipeline di produzione è l'affidabilità delle route — che è un problema di ingegneria risolvibile, non un problema del modello. Mettilo dietro un failover, non hard-codare lo slug di anteprima e misura il tuo tasso di errore invece di fidarti di quello di chiunque altro, incluso il nostro.

Se il tuo problema è un volume CT del torace o dell'addome, in questo confronto c'è esattamente un modello aperto in grado di affrontarlo; non è quello con la finestra da un milione di token, e il numero che dovrebbe guidare la tua pianificazione non è il suo punteggio F1. È la latenza per studio che nessuno ha pubblicato. Misurala prima di promettere a chiunque una cifra di throughput.

Il confronto vale la pena farlo perché separa due cose che vengono costantemente confuse: ampiezza dell'input e profondità della rappresentazione. Gemini 3.1 Pro ha la più ampia superficie di input mai rilasciata da chiunque e il miglior richiamo su contesti lunghi di questo insieme, eppure non riesce a leggere uno studio CT come uno studio CT. NV-Reason-CT riesce a leggerne uno e nient'altro. Una pipeline ha bisogno di entrambi, ha bisogno che stiano su infrastrutture diverse e ha bisogno di sapere quale dei due numeri su ciascun lato sia quello che ti manderà un avviso alle tre del mattino.