
NV-Reason-CT vs Grok 4.6: chi legge la scansione e chi legge il referto
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 45 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 182 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Ci sono due modi per inserire un'IA in una pipeline TC e solo uno dei due riguarda l'immagine. NV-Reason-CT è il primo: un modello vision-linguistico 3D da 4,69 miliardi di parametri che legge direttamente i volumi NIfTI ed è stato pubblicato su Hugging Face l'8 settembre 2026 senza un post di lancio da parte di NVIDIA. Grok 4.6 è il secondo: un modello testo e immagini da 500.000 token che è stato rilasciato il 12 agosto 2026, costa 2,00 dollari per milione di token di input ed è molto bravo nella parte del lavoro che avviene dopo che qualcuno ha già messo per iscritto il referto. Mettendoli a confronto, la solita domanda — quale dei due è migliore — si rivela mal posta. Non competono per la stessa posizione nella pipeline. Competono per la stessa voce di budget.
Cosa è stato effettivamente rilasciato da ciascuna parte
NV-Reason-CT è arrivato come un repository, un paper e uno Space demo, non come un prodotto. Il repository GitHub nell'organizzazione NVIDIA-Medtech è stato creato il 2 settembre 2026; i pesi di Hugging Face sono arrivati l'8 settembre; il preprint arXiv, NV-Reason-CT: Modello Linguistico Visivo 3D per l'Analisi CT, è stato pubblicato il 23 settembre con sedici autori provenienti da NVIDIA, NIH e Università di Zurigo. La newsroom di NVIDIA non riporta nulla al riguardo. La scheda del modello descrive la versione 0.1 e limita l'uso alla ricerca e all'istruzione.
Grok 4.6 è una release del tipo opposto. È un endpoint commerciale di prima classe, elencato come "Latest" nella documentazione per sviluppatori del fornitore, con prezzo basato su una tabella tariffaria pubblicata e disponibile come modello compatibile con OpenAI che le integrazioni esistenti adottano cambiando un URL di base. È succeduto a Grok 4.5 con la stessa finestra di contesto, la stessa superficie di input e lo stesso prezzo di base.
Quell’asimmetria è tutta la storia di questo confronto. Uno è un artefatto di ricerca che guarda caso è scaricabile. L’altro è infrastruttura. Leggerli l’uno contro l’altro ti dice dove cade attualmente la linea tra "artefatto di ricerca" e "infrastruttura" nell’imaging medico — e non è dove immagineresti.
La divisione del lavoro, negli input e negli output
• Input volumetrico — NV-Reason-CT legge volumi NIfTI .nii/.nii.gz in unità Hounsfield, solo torace o addome vs Grok 4.6 legge testo, immagini e file, nessun percorso volumetrico • Gestione spaziale — NV-Reason-CT converte un volume di 384×384×384 mm in una griglia 24×24×24 di 13.824 token con MRoPE 3D, senza downsampling vs Grok 4.6 tratta un'immagine come una figura 2D • Contesto — NV-Reason-CT un volume è un prefisso fisso, nessuna finestra di contesto nel senso usuale vs Grok 4.6 500.000 token • Output — NV-Reason-CT report strutturato, risposta o traccia di ragionamento con pensiero disattivabile vs Grok 4.6 testo con output strutturati e chiamate a strumenti • Licenza — NV-Reason-CT OpenMDW-1.1, pesi BF16 da 10,6 GB vs Grok 4.6 proprietario, solo API • Prezzo — NV-Reason-CT capex GPU, nessuna tariffa per token vs Grok 4.6 $2,00 / $6,00 per milione, raddoppiato oltre 200K di input

La coppia si legge come un naturale passaggio di consegne. NV-Reason-CT produce il riscontro dal volume; Grok 4.6 è il modello a cui consegneresti un migliaio di quei riscontri, in un'unica finestra di contesto, per cercare pattern in una coorte. Nessuno ha pubblicato quella pipeline. È l'architettura ovvia, e vale la pena dire chiaramente che non è testata.
I numeri di Grok 4.6, e di chi sono
Due cifre per Grok 4.6 circolano insieme e non sono lo stesso tipo di cosa. Il punteggio GPQA Diamond di 94.9 è misurato da Artificial Analysis, non dichiarato dal fornitore — ed è il più affidabile dei due tipi di dato proprio perché a eseguirlo è stata una terza parte. Il punteggio dell'Artificial Intelligence Index di 44, sulla revisione v4.3.2 dell'indice, colloca Grok 4.6 alla posizione 28 su 211 nella sua classe. Artificial Analysis registra inoltre il modello come proprietario: i pesi non sono disponibili pubblicamente.
Sulla stessa classifica, AA misura Terminal-Bench 2.1 a 88,4, SciCode a 56,5, Humanity's Last Exam a 42,9, 𝜏²-banking a 50,7 e recall su contesto lungo a 80,3. Sono strumenti di ragionamento generale. Nessuno di essi può essere eseguito su un volume TC 3D, e questa non è una critica a Grok 4.6 — è un'affermazione su ciò che misura la suite di benchmark.
Il lato CT ha esattamente una tabella, ed è quella degli autori.
L'intera base di evidenze pubbliche di NV-Reason-CT è una singola tabella di classificazione sulle 18 etichette di CT-RATE, a una soglia uniforme fissa, utilizzando un prompt diretto Sì/No senza testa di classificazione. Riporta Macro-F1 0,614 e Macro-AUROC 0,871, rispetto a VoxelFM a 0,581/0,870, Pillar-0 a 0,544/0,861, ClinFusion-8B a 0,442, CT-CLIP a 0,398/0,733, Merlin a 0,358/0,662, e MedGemma 1.5 a 0,303.
Questi sono dati dichiarati dal fornitore, provenienti dalla model card, e li etichetto come tali perché nessun soggetto indipendente li ha ancora riprodotti. Due cose meritano attenzione nella tabella. Il margine F1 rispetto a VoxelFM è 0,033, che è uno scarto reale su 18 etichette con una soglia fissa. Il margine AUROC rispetto allo stesso modello è 0,001, che è un pareggio. Entrambi i numeri compaiono nella stessa riga della stessa tabella, e solo uno dei due porta con sé una rivendicazione.
L'altra cosa che la tabella ti dice riguarda l'inquadramento dato dal paper stesso. I modelli di confronto sono sistemi di pretraining contrastivo 3D, un MLLM generativo 2D/3D fuso e un modello frontier basato su slice. Gli autori hanno scelto di confrontarsi con sistemi che ingeriscono volumi, perché l'unica affermazione significativa qui è che un modello generativo 3D può battere i modelli discriminativi 3D nella classificazione senza una testa. Non dice nulla su come NV-Reason-CT si confronti con un modello frontier generale in qualsiasi ambito, perché quel confronto non esiste su questo asse.

Dove vanno i soldi, e perché il confine del livello è importante
Il tariffario di Grok 4.6 contiene un dettaglio che decide silenziosamente molto dell'architettura: i prompt oltre 200K token di input vengono fatturati al doppio della tariffa base — $4,00 in input, $12,00 in output, con la tariffa di lettura cache che sale da $0,50 a $1,00. Un lavoro di revisione di coorte che accumula risultati in un unico contesto lungo è esattamente il carico di lavoro che supera quella soglia. Al di sotto di essa, la tariffa di lettura cache di $0,50 per milione è un quarto del prezzo di input, ed è ciò che rende conveniente, e non solo possibile, ripetere un grande prefisso fisso su migliaia di report.
Tramite OrcaRouter, Grok 4.6 viene erogato al prezzo di listino di quel provider senza alcun ricarico, quindi l'aritmetica dei livelli di cui sopra è l'aritmetica che paghi effettivamente, e qualsiasi futura modifica ad essa si ripercuote sulla tua fattura lo stesso giorno anziché al rinnovo successivo. Il motivo per instradare un lavoro come questo invece di codificare in modo rigido un singolo endpoint è che la metà dedicata alla revisione della coorte di una pipeline clinica è dove vorrai provare tre modelli diversi prima di decidere — e su un'unica chiave compatibile con OpenAI con failover automatico tra provider, quell'esperimento costa solo un cambio di nome del modello.
La metà CT della pipeline non ha un'opzione del genere. NV-Reason-CT non è ospitato su OrcaRouter — è un checkpoint da 10,6 GB con codice modello personalizzato che esegui tu stesso, su hardware Ampere, Hopper o Lovelace, con trust_remote_code=True. Non intendiamo insinuare il contrario. Se stai costruendo questa pipeline, stai acquistando GPU per una metà e token per l'altra, e il fatto che entrambe le metà possano almeno essere gestite da un'unica console è l'unica rivendicazione di integrazione che valga la pena fare.

Quanto vale davvero un secondo lettore
Il paper NV-Reason-CT include uno studio preliminare condotto da radiologi esperti che riporta «valutazioni di fiducia favorevoli per la revisione assistita dall'IA» e una riduzione del 50% del tempo medio dichiarato di interpretazione e refertazione. Sono numeri solidi, ma comportano una riserva che il paper stesso dichiara: preliminare, e con il disegno di studio degli stessi autori. Non esiste alcuna replicazione indipendente pubblicata, e una riduzione del 50% del tempo in uno studio di lettura controllato è esattamente il tipo di risultato che si ridimensiona con la replicazione. Vale la pena monitorarlo. Non vale la pena citarlo come dato acquisito.
Letto in quest'ottica, il contributo di Grok 4.6 a un flusso di lavoro radiologico non è affatto la diagnosi. È lo strato che legge i referti — la coda di triage, la lettera di follow-up, la codifica, il pacchetto di autorizzazione preventiva. Quel lavoro è testo, è ad alto volume, è economico per unità, e la modalità di fallimento dello sbagliarlo è amministrativa anziché clinica. È anche il punto in cui una finestra di contesto da 500K e una lettura della cache da 0,50 $ si guadagnano davvero il loro posto.
Quindi la divisione su cui approda questo confronto è netta: NV-Reason-CT ha un vero percorso 3D e nessuna distribuzione, nessun prezzo e nessuna verifica indipendente. Grok 4.6 ha distribuzione, un prezzo, copertura di benchmark indipendenti e nessun percorso volumetrico di alcun tipo. Se ti serve la lettura della scansione, solo uno dei due può farla. Se ti serve che venga gestita la documentazione relativa alla scansione, solo l'altro è un prodotto.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
