
NV-Reason-CT vs Gemini 3.1 Pro: La più ampia superficie di input, e ancora non un lettore CT
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 506 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 183 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Novantaquattro percento. Questo è il tasso di errore che il nostro stesso catalogo attualmente registra per una rotta che serve Gemini 3.1 Pro — 93,93%, insieme a un tempo mediano al primo token che si legge come un tetto di dieci secondi e a una cifra di throughput di 978 token al secondo. Interpretalo come un'affermazione sul modello e trarrai esattamente la conclusione sbagliata. Interpretalo come un'affermazione su un tier di anteprima sotto carico e diventa la cosa più utile della pagina, perché è ciò che una pipeline clinica sperimenta davvero quando dipende da una rotta che non è stata provisionata per il traffico di produzione.
Il modello dall'altra parte di questo confronto non ha questo problema né questa misurazione. NV-Reason-CT è il ragionatore CT 3D nativo da 4,69 miliardi di parametri di NVIDIA, scaricabile con licenza OpenMDW-1.1, senza alcun dato pubblicato sul throughput e senza alcun hosting da nessuna parte. Quindi un lato di questo confronto ti offre la più ampia superficie di input del settore con un profilo di disponibilità attorno a cui devi progettare; l'altro ti offre un'unica capacità ristretta con una latenza che devi misurare da solo. Nessuno dei due ha una dashboard di monitoraggio di cui potersi fidare dal primo giorno, e per ragioni opposte.
Due modelli, due definizioni di "multimodale"
La parola sta facendo un gran lavoro in entrambe le descrizioni di prodotto, e quasi niente di quel lavoro è condiviso.
• Input accettati — Gemini 3.1 Pro accetta testo, immagini, audio, video e file; NV-Reason-CT accetta un volume NIfTI a canale singolo in unità Hounsfield, e nient'altro
• Che cosa significa "3D" — NV-Reason-CT ricampiona a una risoluzione isotropa di 2 mm su un cubo di 384 millimetri e lo suddivide in patch 8 x 8 x 8 per una griglia 24 x 24 x 24; l'input video di Gemini 3.1 Pro è una sequenza di fotogrammi bidimensionali con una linea temporale
• Contesto — 1.048.576 token in ingresso e 65.536 in uscita per Gemini 3.1 Pro; un volume è di 13.824 token visivi per NV-Reason-CT, senza downsampling e senza livello di merging, e non c'è una finestra di chat attorno ad esso
• Rilascio — 19 febbraio 2026 per Gemini 3.1 Pro, su uno slug di anteprima; un rilascio di ricerca non annunciato per NV-Reason-CT, con attività del repository datata dal 2 al 25 settembre 2026
• Prezzo — 2 $ e 12 $ per milione di token fino a 200.000 token, poi 4 $ e 18 $, con letture dalla cache a 0,20 $ e scritture nella cache a 0,375 $; rispetto a pesi self-hosted senza listino prezzi
• Funzionalità — visione, audio, uso di strumenti, output JSON e ragionamento per Gemini 3.1 Pro; risultati strutturati per regione anatomica per NV-Reason-CT, senza strumenti
• Licenza e stato — un'API di anteprima ospitata; rispetto ai pesi OpenMDW-1.1 la cui model card dichiara solo ricerca e istruzione e afferma chiaramente che non è un dispositivo medico
Un input video e un input CT volumetrico sembrano vicini da lontano e non potrebbero essere più distanti da vicino. Il video è una sequenza di fotogrammi nel tempo. Uno studio CT è un singolo volume statico con tre assi spaziali, una scala fisica in millimetri e un'unità di densità calibrata, in cui ciò che viene misurato è la densità di una struttura di cui conta la dimensione. Gemini 3.1 Pro guarderà una registrazione chirurgica e descriverà cosa è successo. Non misurerà un nodulo. Non è un limite che Google non ha affrontato; è un problema diverso che nessuno ha risolto con un modello generale.
Cosa coprono i due record di benchmark e cosa tralasciano
Gemini 3.1 Pro ha un track record indipendente ed è un buon track record sugli assi che misura.
• GPQA Diamond — 94,1, il valore più alto in tutta questa serie di articoli
• Humanity's Last Exam — 47, con un punteggio di richiamo su contesto lungo di 82, ancora il più alto in questo confronto
• IFBench e SciCode — 77,14 e 58,7
• τ²-Bench — 95,61, con tau_banking a 21,44 e Terminal-Bench Hard a 53,79
• Artificial Analysis Intelligence and Coding — 29,7 e 68,8
• Latenza misurata — una mediana di dieci secondi al primo token, che sembra essere un limite massimo piuttosto che una vera mediana, a 978 token al secondo e un tasso di errore del 93,93%
Osserva la forma di questo: un profilo di conoscenza e di contesto lungo in cima al confronto, un indice di intelligenza nella parte medio-bassa e una misura di disponibilità inutilizzabile. Tutti e tre descrivono lo stesso modello sullo stesso percorso. Un GPQA Diamond alto significa che sa davvero molto. Un composito di 29,7 significa che non è in testa su tutto. Un tasso di errore del 93,93% significa che, su questo particolare percorso, la maggior parte delle tue richieste non andrà a buon fine — e questo è quasi certamente un fatto di capacità e provisioning di un endpoint in anteprima, più che una proprietà dei pesi. Dall'esterno non possiamo dimostrare quale delle due cose sia. Quello che possiamo dire è che nessuno di quei tre numeri è un errore di battitura e che qualsiasi architettura che legge solo il primo passerà una brutta settimana.
Il record di NV-Reason-CT è più ristretto e comporta un'avvertenza diversa. I suoi 0,614 F1 e 0,871 AUROC su CT-RATE, su diciotto etichette con una soglia uniforme fissa e un prompt diretto sì/no e nessuna testa di classificazione o adattamento specifico per il compito, sono i numeri di NVIDIA dal paper di NVIDIA stesso. L'insieme di confronto dietro di essi — VoxelFM a 0,581, Pillar-0 a 0,544, ClinFusion-8B a 0,442, CT-CLIP a 0,398, Merlin a 0,358, MedGemma 1.5 a 0,303 — contiene solo modelli di imaging. Non compare alcun modello multimodale generale, il che significa che la domanda "come se la caverebbe Gemini 3.1 Pro su CT-RATE" non è stata posta, figuriamoci risolta.

Il problema del livello di anteprima, formulato correttamente
Questa è la parte del confronto che non ha nulla a che fare con la CT e che ha tutto a che fare con la gestione di qualsiasi attività clinica.
Un tasso di errore del 93,93% non è un degrado lieve. È una rotta in cui la stragrande maggioranza delle chiamate fallisce. La reazione naturale è dichiarare il modello inutilizzabile, e quella reazione è sbagliata per due motivi. Primo, un tasso di errore misurato su un endpoint di anteprima riflette capacità, quota e instradamento regionale, non le capacità del modello. I livelli di anteprima di Google sono notoriamente dimensionati per la valutazione anziché per la produzione, e uno slug che porta il nome di un'anteprima è uno slug che può essere limitato senza preavviso. Secondo, la misurazione è un'istantanea di un percorso in un preciso momento. Cambierà. Ciò che non cambierà è la lezione: una dipendenza da una rotta di anteprima è una dipendenza da una decisione sulla capacità che qualcun altro prende.
Le mitigazioni sono poco appariscenti e sono la ragione stessa per cui l'instradamento esiste come disciplina anziché come semplice comodità.
• Non codificare mai in modo fisso uno slug di anteprima in un percorso di produzione — metti la funzionalità dietro un'interfaccia, così che il modello che vi sta dietro possa essere sostituito senza un deploy
• Riprova e passa a un altro provider o a un modello diverso — per un processo di estrazione batch, un tasso di fallimento del 94% è sopravvivibile se i fallimenti vengono indirizzati altrove e fatale se non lo sono
• Misura il tuo tasso di errore invece di ereditarne uno — il valore del 93,93% è il numero del nostro catalogo per una rotta, e il tuo dipenderà dalla tua regione, dal tuo volume e dalla forma del tuo carico di lavoro
• Tieni pronto un secondo modello per qualsiasi cosa su una tempistica clinica — la modalità di errore da cui ti stai proteggendo non è una risposta sbagliata, è nessuna risposta
La stessa disciplina si applica nella direzione opposta sul lato CT, dove non esiste alcuna rotta. Un modello self-hosted non ha un tasso di errore del provider; ha un tasso di errore hardware, un onere di manutenzione e un tetto di capacità determinato dal numero di GPU acquistate. La modalità di guasto è una coda, e la mitigazione è la pianificazione anziché il failover. Problema diverso, stessa regola: sappi su quale numero stai effettivamente facendo affidamento.
Dove un contesto lungo aiuta davvero, e dove no
La finestra da 1.048.576 token di Gemini 3.1 Pro e il punteggio di 82 punti nel richiamo su contesto lungo sono vantaggi reali e vale la pena sfruttarli in modo intenzionale anziché accidentale.
Il punto in cui ripagano in un programma TC non è la scansione. È tutto ciò che vi sta attorno. Una singola passata di estrazione su una lunga nota operatoria e sui relativi referti, mantenendo l'intero documento nel contesto affinché i campi siano coerenti tra loro. Un riepilogo di coorte che deve tenere insieme centinaia di narrazioni di pazienti contemporaneamente per trovare lo schema che le accomuna. Un processo di conversione in cui lo schema, un centinaio di record di esempio e il registro degli errori devono essere tutti visibili nella stessa chiamata. Sono attività in cui una finestra lunga cambia la risposta, non solo la comodità.
Il punto in cui non è d'aiuto è la scansione stessa, e vale la pena enunciare con precisione la ragione, proprio perché è l'errore che questo confronto invita a commettere. Una TC del torace rappresentata nel modo in cui la rappresenta NV-Reason-CT costa 13.824 token. Gemini 3.1 Pro potrebbe contenere settanta studi di questo tipo nella sua finestra con ampio margine. Il vincolo non è lo spazio. È che il percorso visivo di Gemini 3.1 Pro tratta un'immagine come una figura con una scala in pixel, quindi uno studio presentato in quel modo ha perso la spaziatura tra le fette e la calibrazione della densità prima che venga emesso il primo token. Puoi spendere un milione di token su un volume e comunque non avere un volume. Il confronto presente nello stesso articolo rende concreto il costo di tutto ciò: MedGemma 1.5 a 0,303 F1 quando viene alimentato con fino a 85 sezioni assiali, contro 0,614 per il modello volumetrico nativo, che è un divario di circa il doppio.
Dove ci collochiamo, e l'unica cosa che non diremo
Gemini 3.1 Pro viene servito tramite OrcaRouter come google/gemini-3.1-pro-preview alla tariffa di listino del provider, senza alcun ricarico, all'interno di un'unica API che copre più di 200 modelli. Per un modello attualmente in anteprima, questa combinazione è più utile di quanto sembri. Zero ricarico significa che una variazione delle tariffe del fornitore arriva dalla nostra parte lo stesso giorno, invece di essere assorbita da uno strato intermedio che conserva un vecchio valore. Il failover automatico fa sì che una rotta che inizia a fallire non si porti dietro l'intero batch — il che, visto un tasso di errore misurato oltre il 90% su un percorso, non è un'ipotesi teorica. E un DSL di routing che invia le singole richieste al modello che dovrebbe gestirle ti permette di affidare il lavoro a contesto lungo a un modello e il lavoro economico ad alto volume a un altro, senza dover mantenere due integrazioni.
NV-Reason-CT non è sulla nostra piattaforma. Nessun modello NVIDIA lo è. Sono pesi che scarichi ed esegui da solo, e la descrizione onesta è che le due metà di questa architettura vivono in luoghi del tutto diversi: una dietro un'API con un tariffario e un rischio di anteprima, l'altra sul tuo hardware con una licenza OpenMDW-1.1 e un valore di throughput che devi produrre tu stesso.


La decisione che sopravvive al contatto con la produzione
Se il tuo problema è la comprensione di testo, audio, video o documenti su contesto lungo, Gemini 3.1 Pro è misurato in modo indipendente ai vertici del settore su conoscenza e recall, e l'unica cosa che si frappone tra esso e una pipeline di produzione è l'affidabilità delle route — che è un problema di ingegneria risolvibile, non un problema del modello. Mettilo dietro un failover, non hard-codare lo slug di anteprima e misura il tuo tasso di errore invece di fidarti di quello di chiunque altro, incluso il nostro.
Se il tuo problema è un volume CT del torace o dell'addome, in questo confronto c'è esattamente un modello aperto in grado di affrontarlo; non è quello con la finestra da un milione di token, e il numero che dovrebbe guidare la tua pianificazione non è il suo punteggio F1. È la latenza per studio che nessuno ha pubblicato. Misurala prima di promettere a chiunque una cifra di throughput.
Il confronto vale la pena farlo perché separa due cose che vengono costantemente confuse: ampiezza dell'input e profondità della rappresentazione. Gemini 3.1 Pro ha la più ampia superficie di input mai rilasciata da chiunque e il miglior richiamo su contesti lunghi di questo insieme, eppure non riesce a leggere uno studio CT come uno studio CT. NV-Reason-CT riesce a leggerne uno e nient'altro. Una pipeline ha bisogno di entrambi, ha bisogno che stiano su infrastrutture diverse e ha bisogno di sapere quale dei due numeri su ciascun lato sia quello che ti manderà un avviso alle tre del mattino.
