
NV-Reason-CT vs Claude Opus 5: un errore di categoria da prendere sul serio
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 506 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 183 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Mettere NV-Reason-CT e Claude Opus 5 nella stessa frase è un errore di categoria, e vale comunque la pena farlo, perché l'errore è istruttivo. NV-Reason-CT è un modello visione-linguaggio 3D nativo da 4,69 miliardi di parametri di NVIDIA che prende un volume TC toracico o addominale in unità Hounsfield e produce una descrizione strutturata reperto per reperto. Non è un dispositivo medico e la sua stessa scheda modello lo dice. Claude Opus 5 è il modello generale di frontiera per testo e visione del fornitore, rilasciato il 24 luglio 2026, con una finestra di contesto di un milione di token, un limite di output di 128.000 token e una tariffa pubblicata di cinque dollari per milione di token in input e venticinque per milione in output. Uno di questi legge una TC. L'altro legge tutto il resto.
Il motivo per cui il paragone continua a essere fatto — e continuerà a esserlo, ogni volta che qualcuno vede un nuovo VLM medico e cerca un metro di paragone familiare — è che entrambi producono prosa su un'immagine. Questa somiglianza superficiale sta facendo veri danni al modo in cui le persone ragionano sui due, quindi vale la pena analizzarla nel dettaglio.
L'asse effettivo che condividono, e quello che non condividono
Si sovrappongono in esattamente un punto, e questo è più stretto di quanto sembri.
• Modalità in — NV-Reason-CT accetta volumi NIfTI a canale singolo in unità Hounsfield attraverso un processore tridimensionale dedicato; Claude Opus 5 accetta testo, immagini e file, un'interfaccia di seconda generazione per le immagini, e non è in grado di acquisire nativamente uno studio CT volumetrico
• Cosa restituisce — un elenco di reperti organizzato per regione anatomica da NV-Reason-CT, a confronto con prosa generica, JSON strutturato o chiamate di strumenti di Claude Opus 5
• Unità di lavoro — un volume TC, ricampionato a 2 mm isotropici, ritagliato sull'anatomia, suddiviso in patch 8 x 8 x 8; rispetto a qualunque cosa si inserisca in un budget di token
• Contesto — NV-Reason-CT non ha alcuna finestra di chat; un singolo volume diventa 13.824 token visivi senza alcun sottocampionamento. Claude Opus 5 contiene 1.000.000 di token in ingresso ed emette fino a 128.000
• Licenza — OpenMDW-1.1, un modello scaricabile che esegui sul tuo hardware; rispetto a un'API ospitata
• Uso dichiarato — solo per ricerca e istruzione, esplicitamente non un dispositivo medico, per NV-Reason-CT; contro l'assistenza generica per Claude Opus 5
• Prezzo — nessun prezzo di listino, perché non c'è nulla da comprare, solo pesi da eseguire; contro 5 $ e 25 $ per milione di token, con letture in cache a 0,50 $
La riga "modality in" è dove nasce l'errore di categoria. Entrambi accettano un'immagine, quindi entrambi sembrano modelli per immagini, e un lettore si chiede ragionevolmente quale sia migliore con le immagini. Ma uno studio TC non è un'immagine. È un array volumetrico con una scala fisica in millimetri, un'unità di densità calibrata e un'anatomia che ha senso solo in tre dimensioni. La visione di Claude Opus 5 è davvero capace e discuterà sensatamente una radiografia o un vetrino patologico. Questo è un compito diverso dall'integrare un cubo di 384 millimetri di valori Hounsfield a una risoluzione di 2 mm e riferire sulla lobulazione di un nodulo.
Cosa misurano effettivamente i numeri su ciascun lato
I due modelli hanno record di benchmark che non si incontrano mai, ed è leggendoli fianco a fianco senza notarlo che si prendono le cattive decisioni di approvvigionamento.
NV-Reason-CT riporta i suoi risultati sul benchmark pubblico CT-RATE di TC toraciche, su diciotto etichette, utilizzando una soglia uniforme fissa e un prompt diretto sì/no, senza alcun head di classificazione e senza adattamento specifico per il task. Registra 0,614 di F1 e 0,871 di AUROC, davanti a VoxelFM con 0,581 e 0,870, Pillar-0 con 0,544 e 0,861, ClinFusion-8B con 0,442 di F1, CT-CLIP con 0,398 e 0,733, Merlin con 0,358 e 0,662, e MedGemma 1.5 con 0,303 di F1 quando gli vengono fornite fino a 85 sezioni assiali. C'è anche un macro-F1 derivato dal report di 0,592. Ognuno di questi valori proviene dal paper di NVIDIA stessa. Nessuno è stato riprodotto da altri, e il modello è scaricabile da qualche settimana.
Il record di Claude Opus 5 è di tipo general-purpose e in gran parte indipendente. Artificial Analysis lo misura a 50,8 sul suo Intelligence Index, 78 sul suo Coding Index, 93,2 su GPQA Diamond e 54,9 su Humanity's Last Exam, con un punteggio di recall su contesto lungo di 79,33. Questi sono numeri di terze parti su compiti di ragionamento generale, codice e conoscenza. Non c'è alcun benchmark di imaging clinico in quel set, e non c'è alcuna riga CT-RATE da nessuna parte nel record pubblicato di Claude Opus 5.
Quindi l'affermazione onesta non è che uno dei due sia in vantaggio. È che i due modelli non sono mai stati misurati sullo stesso compito da nessuno. Qualsiasi frase della forma "NV-Reason-CT è migliore di Claude Opus 5 nell'imaging medico" è non falsificabile così com'è scritta, perché nessuno ha eseguito l'esperimento. La tabella di confronto di NVIDIA stessa non contiene alcun modello di frontiera generale.

Dove le persone sbagliano sulla questione dell'interfaccia
L'unica sovrapposizione tecnica davvero interessante è quella su cui nessuno discute: come dovrebbe essere un'interfaccia tra un modello CT e un modello testuale.
Un istinto ragionevole è dare in pasto a Claude Opus 5 una serie di immagini TC o un volume sottocampionato e chiedergli di ragionare. Con 1.000.000 di token di contesto sembra generoso, e rispetto a uno studio che è solo 13.824 token visivi sembra esserci spazio in abbondanza. Lo spazio non è il problema. La pipeline di visione di Claude Opus 5 tratta un'immagine come una figura bidimensionale con una scala in pixel. Una TC del torace presentata in quel modo perde la spaziatura tra le sezioni che rende una lesione misurabile e la calibrazione di densità che rende "vetro smerigliato" una soglia anziché una descrizione. Puoi consegnargli un montaggio di sezioni assiali e ottenere un paragrafo che suona coerente. Quello che non puoi ottenere è una misurazione.
È esattamente ciò su cui il design di NV-Reason-CT spende la sua potenza di calcolo. La griglia 24 x 24 x 24 di un volume di 384 millimetri viene passata al modello linguistico a piena risoluzione, senza downsampling spaziale e senza strato di merging, ed è per questo che il percorso attivo conta 4,35 miliardi di parametri anziché qualcosa di molto più piccolo. L'architettura è una scommessa sul fatto che mantenere il dettaglio spaziale valga il costo in token. È una scommessa sulla rappresentazione, non sulle capacità linguistiche, e Claude Opus 5 non vi prende parte.
Il pattern produttivo è quello noioso: usa il modello CT per la lettura volumetrica e usa un modello di testo per tutto ciò che ci sta attorno. Generazione e normalizzazione di referti, riepiloghi di coorte, framework di valutazione, conversione di archivi DICOM in NIfTI su larga scala, triage di quali studi una persona dovrebbe esaminare per prima. Questo è lavoro su documenti lunghi e codice, ed è qui che un modello con contesto da 1M giustifica la sua tariffa.
Costo, in due unità che non si convertono
Claude Opus 5 è a consumo. Cinque dollari per milione di token in input e venticinque per milione in output, letture dalla cache a cinquanta centesimi, scritture in cache a dieci dollari. Per una pipeline che normalizza un corpus di report o scrive e riscrive codice di valutazione, questo produce una previsione su cui puoi costruire: token in ingresso, token in uscita, letture in cache e una bolletta molto più economica se gestisci bene la cache.
NV-Reason-CT non ha un prezzo. Scarichi 4,69 miliardi di parametri e paghi in elettricità, ore di GPU e tempo di ingegneria. Non esiste alcun dato pubblicato sul throughput per uno studio completo da 13.824 token, e non viene offerta alcuna variante quantizzata, quindi il costo per studio del suo utilizzo è un numero che dovresti misurare da solo. Questo è normale per i pesi di ricerca ed è anche la più grande differenza pratica tra i due: uno ha un listino prezzi, l'altro ha una bolletta che non puoi vedere finché non l'hai già pagata.
La comparazione che conta davvero è per esame, non per token. Una lettura TC è un’unità di lavoro. Una passata di normalizzazione del referto sullo stesso caso è un lavoro testuale misurato in migliaia di token. Attribuire una cifra in dollari al primo significa conoscere il proprio hardware; attribuirla al secondo è aritmetica.
La trappola nel mezzo del confronto
C'è un errore specifico che vale la pena nominare, perché è quello che questo confronto invita a commettere. È trattare NV-Reason-CT come un fine-tuning specialistico di un modello generale, e quindi presumere che il modello generale sarà abbastanza vicino nella maggior parte dei casi e molto più flessibile.
Non è un fine-tuning. È un transformer di visione 3D chiamato Primus, inizializzato da COLIPRI, agganciato a un backbone linguistico Qwen3.5-4B con embedding posizionale rotatorio multi-asse 3D, addestrato su circa 550.000 esempi strutturati di domanda-risposta tratti da 70.111 volumi CT provenienti da CT-RATE, CancerVerse e una collezione interna NIH, e poi messo a punto con GRPO rispetto a una ricompensa che pesa con 2,0 l'F1 sull'insieme delle anomalie, con 0,5 un punteggio di struttura del referto specifico per regione e con 1,0 una penalità morbida sulla lunghezza. L'encoder tridimensionale è il punto centrale del modello. Un front end bidimensionale o basato su singole slice è uno strumento diverso, e il confronto presente nel paper stesso mostra quanto valga questa differenza: MedGemma 1.5 a 0,303 di F1 quando riceve fino a 85 slice assiali, contro 0,614 per il modello volumetrico nativo.
Il errore inverso è altrettanto comune e altrettanto costoso: supporre che, poiché NV-Reason-CT è specializzato, si debba usarlo per tutto ciò che è clinico. Supporta torace e addome e nient'altro, la sua invocazione è un file NIfTI anziché un messaggio di chat, e i termini della sua licenza indicano solo ricerca e istruzione. Non leggerà un vetrino di patologia, non risponderà a una domanda su una linea guida, né scriverà il codice che gestisce in batch la conversione dei tuoi DICOM. Ricorrere a un modello CT per svolgere un lavoro testuale è lo stesso errore di categoria che ricorrere a un modello testuale per eseguire analisi volumetriche, solo puntando nella direzione opposta.

Come le due metà si inseriscono in un unico sistema
Nessuno dei due modelli sostituisce l'altro, e l'architettura sensata li contiene entrambi — il che solleva la questione pratica di come invocarli.
Claude Opus 5 viene servito tramite OrcaRouter come anthropic/claude-opus-5 alla tariffa di listino del provider Anthropic senza alcun ricarico, all'interno di un'unica API che copre più di 200 modelli. Questo conta meno per una singola chiamata di quanto conti per la pipeline che la circonda: quando la metà testuale di una build clinica è un modello tra diversi candidati, averli tutti dietro un'unica chiave significa poterli confrontare sul proprio corpus senza un secondo contratto né una modifica al codice, e il DSL di routing consente di inviare singole richieste al modello che dovrebbe gestirle, mentre il failover automatico ti copre quando un provider si degrada.
NV-Reason-CT non è sulla nostra piattaforma, e nessun modello NVIDIA lo è. Sono pesi che scarichi ed esegui sul tuo hardware, che è esattamente ciò che la licenza ti consente di fare e, dato che l'input è dati volumetrici derivati da pazienti, è probabilmente ciò che vuoi comunque. Non abbiamo intenzione di insinuare che instradiamo un modello che non ospitiamo. Il lato testuale della build è dove siamo utili; il lato volumetrico è dove sei da solo con un modello da 4,69B e una GPU.

Il verdetto che resiste allo scrutinio
Se hai bisogno di ottenere reperti strutturati da un volume TC, esiste un modello per farlo, proviene dal gruppo di ricerca di NVIDIA ed è un download anziché una chiamata API. Se hai bisogno di normalizzare un corpus di referti, scrivere un'infrastruttura di valutazione, creare uno script per un job di conversione DICOM o riassumere una coorte, esiste un modello anche per questo, e ha un tariffario.
La posizione da tenere ferma è che non è stato dimostrato che l'uno sia migliore dell'altro in nulla, perché l'esperimento non è stato eseguito. Ciò che è stato dimostrato è che un'interfaccia tridimensionale nativa supera una basata su fette su un benchmark pubblico di TC del torace con un margine che gli autori indicano in circa tre punti F1, e che un modello di frontiera generalista è misurato indipendentemente ai vertici del settore su ragionamento, codice e attività a contesto lungo. Quelle sono due affermazioni su due compiti diversi. Leggerle come una classifica è l'errore di categoria, e sopravvive fino al momento in cui qualcuno pubblica il testa a testa che nessuno ha ancora pubblicato.
