
NV-Reason-CT vs DeepSeek V4 Pro: il costo di leggere una scansione e quando eseguire il batch
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 506 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 183 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Ecco un fatto operativo che influenza più budget di pipeline cliniche di qualunque benchmark: DeepSeek V4 Pro costa $0,66 per milione di token di input e $1,98 per milione di token di output, e tali tariffe raddoppiano durante due finestre ogni giorno, dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC. Il lavoro in batch eseguito al di fuori di queste finestre costa la metà di quanto costa all'interno. Nel frattempo NV-Reason-CT, il modello di ragionamento 3D CT da 4,69 miliardi di parametri di NVIDIA, non ha alcun listino prezzi — è un insieme di pesi che scarichi ed esegui, senza alcun dato pubblicato di throughput per un singolo studio da 13.824 token. Uno di questi modelli lo pianifichi. L'altro devi misurarlo prima di poterlo mettere a budget.
Quell'asimmetria è il modo utile per entrare in questo confronto, perché i due modelli occupano estremità opposte della pipeline e falliscono in modi finanziariamente opposti. NV-Reason-CT è uno strumento a costo fisso: lo studio marginale è quasi gratuito una volta acquistato l'hardware, ma la decisione sull'hardware è impegnativa e la latenza per studio non è documentata. DeepSeek V4 Pro è un motore a costo variabile: nulla da acquistare, tutto misurato, e il contatore ha un programma che si può leggere sul calendario.
Che cos'è ciascuno, una riga per ognuno
• Lavoro — NV-Reason-CT legge un volume TC toracico o addominale ed emette reperti strutturati; DeepSeek V4 Pro legge e scrive testo
• Architettura — un transformer di visione 3D chiamato Primus, inizializzato da COLIPRI, con un backbone linguistico Qwen3.5-4B e un embedding posizionale rotatorio multiasse 3D, con 4,69 miliardi di parametri di cui 4,35 miliardi attivi; contro una miscela di esperti da 1,6 trilioni di parametri con 49 miliardi attivi per token
• Input — volumi NIfTI a canale singolo (.nii, .nii.gz) in unità Hounsfield, orientati LPS, ricampionati a 2 mm isotropi e ritagliati all'anatomia; contro testo
• Contesto — un singolo volume diventa 13.824 token visivi in una griglia 24 x 24 x 24, senza downsampling spaziale e senza livello di merging; rispetto a 1.048.576 token in ingresso e 384.000 in uscita
• Anatomie supportate — torace e addome, e nient'altro; contro tutto ciò che il testo può descrivere
• Prezzo — nessun prezzo di listino, self-hosted, nessun throughput pubblicato per studio; rispetto a $0,66 / $1,98 per milione di token, che raddoppia nelle due finestre UTC indicate sopra, con letture dalla cache a $0,022
• Latenza misurata — non pubblicata; rispetto a un tempo mediano al primo token di 3.483 millisecondi a 96,01 token di output al secondo, con un tasso di errore dello 0,75%
Due righe, lì, valgono più di una riga ciascuna. La riga del contesto è quella ovvia — un milione di token contro 13.824 — ma le unità non sono comparabili ed è un errore leggerle come un divario di capacità in una direzione o nell'altra. 13.824 token è quanto costa rappresentare fedelmente uno studio CT. Un milione di token è quanto testo circostante si può tenere. Il primo numero è un'affermazione sulla risoluzione; il secondo è un'affermazione sulla memoria.
La riga della latenza è quella che viene saltata. La mediana di 3,48 secondi al primo token e i 96 token al secondo di DeepSeek V4 Pro sono dati misurati e pubblicati, e permettono di dimensionare su carta un lavoro di testo. L'assenza di qualsiasi dato equivalente per NV-Reason-CT non è una critica al modello; è il motivo per cui una pipeline CT non può essere preventivata prima che qualcuno la esegua. Un modello da 4,69B su 13.824 token visivi non è un calcolo di poco conto, e finché non lo si è cronometrato sul proprio hardware si sta tirando a indovinare.
Leggere i due record di benchmark senza ingannare te stesso
Il record di DeepSeek V4 Pro è un misto di misurazioni indipendenti e dati dichiarati dal fornitore, e la combinazione è istruttiva perché contiene un numero che sembra allarmante e non lo è.
• Artificial Analysis Intelligence Index — 36, che si colloca al 72,4° percentile dei modelli misurati
• GPQA Diamond — 92.8, che è ai vertici del settore
• Humanity's Last Exam — 41, e 41 su MMLU-Pro, 62,51 sull'indice di matematica
• τ²-Bench — 96,20, con IFBench a 76,46 e tau_banking a 39,59
• Richiamo su contesto lungo — 80.33
• SciCode e Terminal-Bench — 51 e 78,65 sulla seconda versione di Terminal-Bench
Un indice composito di 36 accanto a un GPQA Diamond di 92,8 sembra una contraddizione, finché non si nota cos’è un indice. È un aggregato su molte valutazioni, e un modello eccellente in una manciata di esse e appena adeguato in altre si collocherà a metà classifica nella somma pur primeggiando in singole graduatorie. Chi cita il 36 da solo per sostenere che DeepSeek V4 Pro è di fascia media sta citando una media come se fosse un massimo. Chi cita il 92,8 da solo per sostenere che è in testa al settore sta citando un massimo come se fosse una media. Entrambi i numeri provengono da Artificial Analysis, ed entrambi sono veri.
Il record di NV-Reason-CT non presenta una simile miscela, ed è questo il problema autentico che lo riguarda. I suoi dati CT-RATE — 0,614 F1 e 0,871 AUROC su diciotto etichette, usando una soglia uniforme fissa e un prompt diretto sì/no senza testa di classificazione e senza adattamento specifico al compito — provengono dal paper di NVIDIA stesso e da nessun'altra parte. L'insieme di confronto in quel paper (VoxelFM a 0,581, Pillar-0 a 0,544, ClinFusion-8B a 0,442, CT-CLIP a 0,398, Merlin a 0,358, MedGemma 1.5 a 0,303) è interamente composto da altri modelli di imaging. Non compare un solo modello di testo generale, e nessuna terza parte ha riprodotto alcuno dei numeri.

La questione della pianificazione, esaminata a fondo
Il prezzo a tempo su DeepSeek V4 Pro è la cosa più concretamente utile a livello operativo di entrambi i modelli, quindi merita una spiegazione dettagliata.
Un carico di lavoro realistico sul versante testuale per un programma CT non è affascinante. Consiste nell'estrarre campi strutturati da un corpus di referti storici per avere etichette su cui addestrare, nel convertire su larga scala alberi di directory DICOM in NIfTI, nello scrivere e riscrivere l'harness di valutazione, nel normalizzare unità e terminologia su quattro dataset e nel riassumere le coorti. Diciamo cento milioni di token di input e dieci milioni di token di output per un programma di medie dimensioni, una cifra volutamente arrotondata che sta per «un sacco di lavoro testuale».
• All'interno di una finestra raddoppiata — $1,32 e $3,96 per milione, quindi $132 più $39,60 su quei volumi
• Al di fuori di quelle finestre — 0,66 $ e 1,98 $ per milione, quindi 66 $ più 19,80 $
• La differenza — circa $86, ovvero il 49% della bolletta nelle ore non di punta, per spostare un lavoro che per natura può essere eseguito in batch
• Letture in cache — 0,022 $ per milione, ovvero un sessantesimo della tariffa di input, quindi qualsiasi prefisso del prompt riutilizzato nel corpus è praticamente gratuito
Non è un errore di arrotondamento, ed è disponibile perché il lavoro è asincrono. L'estrazione dei referti non deve avvenire alle 14:00. A un job di conversione DICOM non importa che ora sia. La struttura dei prezzi è un invito diretto a pianificare, e una pipeline che la ignora paga un sovrapprezzo del 49% per il privilegio di girare quando ne ha voglia. Le letture dalla cache contano per lo stesso motivo: un system prompt condiviso o uno schema di estrazione fisso, riutilizzato su migliaia di referti, costa un sessantesimo della tariffa di input.
NV-Reason-CT non ha una leva equivalente, perché non ha un contatore. Il costo per leggere una scansione è dato da quanto costa all'ora la tua GPU diviso per quante scansioni all'ora riesci a farle elaborare, e il secondo numero è quello che nessuno ha pubblicato. Se un singolo studio richiede due secondi, una singola L40S gestisce comodamente un programma di grandi dimensioni. Se ne richiede venti, l'aritmetica dell'hardware cambia completamente. NVIDIA ha testato su H100 e L40S, il che ti dice la classe della scheda, non la velocità.
L'insidia nel supporre che possano essere sostituiti
L'errore che questo accostamento induce a commettere è più sottile del solito errore di categoria, perché ne esiste una versione che su una slide sembra ragionevole.
DeepSeek V4 Pro contiene 1.048.576 token e ne emette fino a 384.000. Un volume TC è, secondo il calcolo del modello che lo legge correttamente, solo 13.824 token. Quindi un modello testuale con una finestra di un milione di token ha spazio per una settantina di studi TC con quel numero di token. L'aritmetica è corretta e la conclusione — che si potrebbero dare dati TC in pasto a un modello testuale e risparmiarsi l'infrastruttura di imaging — è sbagliata, per la ragione stessa per cui esiste il numero 13.824.
Quel numero non è un riassunto compresso di una scansione. È la scansione, a una risoluzione isotropica di 2 mm su un cubo di 384 millimetri, tagliata in patch 8 x 8 x 8, consegnata al modello linguistico senza sottocampionamento spaziale e senza livello di fusione. Il conteggio dei token è alto proprio perché non è stato scartato nulla: la spaziatura tra le fette che rende misurabile un nodulo, i valori di densità che fanno di una texture una soglia invece che un aggettivo. Un modello di testo non può acquisire quei token come volumi, non più di quanto possa fare un documento. Ha il budget. Non ha l'interfaccia.
Il confronto interno dello stesso paper quantifica la differenza. MedGemma 1.5, a cui vengono fornite fino a 85 sezioni assiali — il massimo che un front end bidimensionale o a sezioni impilate possa ragionevolmente fare — ottiene un punteggio F1 di 0,303 contro 0,614 del modello volumetrico nativo. Quel divario è il valore dell'encoder tridimensionale, e nessuna ampiezza della finestra di contesto può colmarlo.
La sostituzione inversa fallisce per motivi più semplici. NV-Reason-CT supporta torace e addome, accetta un file NIfTI anziché un prompt, non ha uso di strumenti, e la sua model card lo limita a ricerca e istruzione e dichiara che non è un dispositivo medico e che gli output possono essere errati. Non può estrarre campi da un report, e non può scrivere lo script che costruisce il tuo corpus.

Dove ci inseriamo, e dove deliberatamente no
DeepSeek V4 Pro è servito tramite OrcaRouter come deepseek/deepseek-v4-pro, alla tariffa di listino del provider senza alcun ricarico, all'interno di un'unica API che copre oltre 200 modelli. Il pass-through conta più del solito per un modello con un prezzo che varia in base all'ora del giorno: quando un fornitore cambia una tariffa o una finestra, la tariffa dalla nostra parte cambia lo stesso giorno, perché non c'è alcuno strato di ricarico nel mezzo che mantenga un vecchio numero. Il failover automatico copre il caso in cui un provider peggiora a metà batch, che per un lungo lavoro di estrazione non presidiato è la modalità di guasto che ti costa davvero una notte, e il DSL di routing ti permette di inviare le singole richieste al modello che dovrebbe gestirle invece di far passare tutto da un unico endpoint.
NV-Reason-CT non è sulla nostra piattaforma. Nessun modello NVIDIA lo è. Il lato CT di questa architettura è il vostro hardware con i vostri pesi scaricati, e non scriveremo una frase che lasci pensare al lettore il contrario. Dato che l'input è costituito da dati volumetrici derivati da pazienti e la licenza è OpenMDW-1.1 senza alcun servizio ospitato associato, l'esecuzione locale è comunque il posto a cui quel modello appartiene.
Cosa ti dice davvero l'abbinamento
I due modelli non competono, e il punto di confrontarli è che falliscono in modo diverso. NV-Reason-CT ti offre una capacità che nessun altro nell'open fornisce — ragionamento CT tridimensionale nativo alla piena risoluzione dell'esame — e ti chiede di accettare un costo per esame non preventivato, un throughput non pubblicato e una licenza che vieta l'impiego clinico. DeepSeek V4 Pro ti offre un motore a consumo con una latenza pubblicata, un tasso di errore pubblicato, misurazioni indipendenti e un prezzo che puoi dimezzare guardando l'orologio, e non è in grado di vedere affatto una scansione.
Se stai costruendo la cosa invece di comprarla, la forma che sopravvive al contatto è quella noiosa. Esegui la lettura CT in locale, calcolane il budget misurando invece di preventivare, e metti tutto ciò che è testuale attorno ad essa a un appuntamento con la finestra fuori picco. L'unica pianificazione che nessuno dovrebbe copiare è quella che esegue cento milioni di token di estrazione alle 02:00 UTC perché è il momento in cui è capitato che il batch fosse pronto.

