Una hero card generata intitolata 'NV-Reason-CT vs GPT-5.6 Sol' con il sottotitolo '13.824 visual token prima che tu digiti una parola'. Tre chip sono disposti lungo la parte inferiore: 'specialista CT da 4,69B vs non divulgato', 'NIfTI 3D in ingresso, reperti in uscita' e 'Sol: 1.050.000 in / 128.000 out'. Il logo OrcaRouter è inserito in compositing in basso a destra.
Guides & Insights

NV-Reason-CT vs GPT-5.6 Sol: 13.824 token visivi prima di digitare una parola

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ogni singola TC del torace che invii a NV-Reason-CT costa 13.824 token visivi prima che inizi il prompt. Non è una stranezza né una scelta di messa a punto — è l'intero design. L'encoder di visione 3D nativo del modello prende un volume di 384×384×384 mm e lo trasforma in una griglia 24×24×24, e la scheda del modello è esplicita: tutti i 13.824 token e le loro coordinate tridimensionali raggiungono il modello linguistico "senza sottocampionamento spaziale". Confrontalo con ciò che probabilmente stai già pagando. GPT-5.6 Sol accetta testo, immagini e file, e un'immagine che gli viene inviata è un'immagine 2D — una sezione, uno screenshot di un visualizzatore DICOM, una figura radiologica incollata da un PDF. Uno di questi modelli ha un percorso volumetrico. L'altro ha una finestra di contesto. La maggior parte dei confronti tra loro crolla di fronte a questa distinzione, e il crollo è la parte interessante.

La release che nessuno ha annunciato

NVIDIA non ha pubblicato una parola su NV-Reason-CT nella sua newsroom. Non esiste un post di lancio, una slide di keynote o un comunicato stampa. Ciò che esiste è un repository Hugging Face creato l'8 settembre 2026, un repository GitHub sotto l'organizzazione NVIDIA-Medtech creato il 2 settembre, uno Space demo Gradio e un preprint arXiv — NV-Reason-CT: 3D Visual Language Model for CT Analysis — inviato il 23 settembre 2026 da un team di sedici autori di NVIDIA con coautori presso il NIH e l'Università di Zurigo.

Questo è un vero schema, e vale la pena definirlo con precisione invece di trattarlo come un mistero. Il gruppo di imaging medico di NVIDIA rilascia i pesi in sordina e lascia che siano il paper e il repository a fare l'annuncio. Il predecessore, NV-Reason-CXR-3B, è uscito a ottobre 2025 allo stesso modo. La differenza qui è la scala: è la prima volta che quel gruppo estende la ricetta dalle radiografie 2D a volumi 3D nativi, e il paper ha due giorni.

Ciò che è conoscibile dal repository: architettura, licenza, dati di addestramento, la tabella di benchmark. Ciò che non è ancora confermato: se NVIDIA intende questo come una linea di prodotto supportata, se seguiranno altri checkpoint e come si comporta sotto la valutazione di qualcun altro oltre agli autori. Il repository è alla versione 0.1 e si descrive come destinato esclusivamente alla ricerca e all'istruzione.

Cosa accetta effettivamente ciascun modello

È qui che un testa a testa diventa onesto in fretta. I due modelli non condividono una superficie di input.

NV-Reason-CT legge volumi NIfTI — .nii oppure .nii.gz — con intensità dei voxel in unità Hounsfield. Esegue automaticamente il ritaglio sul torace o sull'addome utilizzando le unità Hounsfield del polmone e un'euristica di morfologia 3D, ricampiona a una risoluzione isotropa di 2 mm e accetta solo "chest" o "abdomen" come valori di anatomia. Restituisce testo: un referto strutturato, una risposta oppure una traccia di ragionamento passo dopo passo, con un'opzione per disattivare il ragionamento in modo da ottenere risposte brevi.

GPT-5.6 Sol legge testo, immagini e file, con una finestra di contesto di 1.050.000 token e fino a 128.000 token di output in una singola risposta. Non dispone di alcun encoder volumetrico. Dagli in pasto una TC e devi prima decidere come appiattire trecento e passa sezioni in qualcosa che un encoder di immagini 2D possa accettare: un montaggio, una manciata di sezioni chiave, una proiezione di massima intensità renderizzata. Ognuna di queste scelte getta via le relazioni spaziali che il percorso 3D era stato costruito per preservare.

Quindi la formulazione onesta non è "quale modello sia più intelligente". È che il percorso di immagini di Sol e il percorso 3D di NV-Reason-CT rispondono a domande diverse. Sol può ragionare sulla descrizione di una scansione fatta da un radiologo. NV-Reason-CT può ragionare sulla scansione.

Esiste un solo benchmark, e solo uno di essi ha un numero sopra.

NV-Reason-CT riporta Macro-F1 0,614 e Macro-AUROC 0,871 sul compito di classificazione a 18 etichette di CT-RATE, usando un prompt diretto Sì/No senza testa di classificazione e senza adattamento specifico al compito. Questi sono i numeri forniti dagli autori nella scheda del modello, e la riga di confronto è la parte utile: VoxelFM a 0,581 Macro-F1, Pillar-0 a 0,544, ClinFusion-8B a 0,442, CT-CLIP a 0,398, Merlin a 0,358, MedGemma 1.5 a 0,303. Sulla stessa soglia uniforme fissa, un modello generativo 3D batte le baseline di pretraining contrastivo 3D e il modello frontier basato su slice.

Un numero in quella tabella merita scetticismo anziché essere ripetuto: il divario AUROC. NV-Reason-CT riporta 0,871 contro lo 0,870 di VoxelFM. Un millesimo di punto, su una valutazione condotta dal fornitore, non è una vittoria — è un pareggio entro qualunque rumore comporti la valutazione. Il divario Macro-F1 di 0,033 è l'affermazione comprovata.

GPT-5.6 Sol non ha un valore CT-RATE perché CT-RATE non è un benchmark su cui può essere eseguito. Ha un Artificial Analysis Intelligence Index di 47, un punteggio GPQA Diamond misurato da AA di 94,1 e un punteggio Humanity's Last Exam di 49,5 — tutti strumenti di ragionamento generale. Mettere 0,614 Macro-F1 accanto a 47 sull'AA Index sarebbe fare aritmetica con due righelli diversi. Non ho intenzione di farlo, e dovresti diffidare di chiunque lo faccia.

Tracce di ragionamento, due prodotti diversi

Entrambi i modelli emettono ragionamenti. Questa è l'unica autentica sovrapposizione filosofica, e la differenza è istruttiva.

GPT-5.6 Sol espone uno sforzo di ragionamento configurabile, quindi per ogni richiesta bilanci latenza e costo rispetto alla profondità, e puoi richiedere che il ragionamento venga restituito tramite include_reasoning. È una capacità generale applicata a qualunque cosa gli invii.

Il ragionamento di NV-Reason-CT è ristretto di proposito. Il corpus di addestramento è composto da circa 550.000 esempi QA strutturati tratti da 70.111 volumi CT unici, e una parte di esso è costituita da ragionamenti redatti da radiologi, raccolti da interpretazioni esperte registrate e trascritte. La fase GRPO che segue l'SFT utilizza ricompense verificabili su insiemi di anomalie toraciche e addominali — il che significa che il segnale di ricompensa si basa sull'effettiva presenza nel volume di un reperto dichiarato, non su quanto la prosa scorra bene. La model card descrive l'output come "osservazioni rivedibili, diagnosi differenziali e incertezza", e reca un'avvertenza esplicita sul fatto che il ragionamento generato "non è garantito che rappresenti il calcolo interno del modello". Quell'avvertenza ha un peso reale. È la differenza tra una traccia che puoi verificare rispetto ai dati e una traccia che puoi solo ammirare.

La dimensione e la licenza, in un solo passaggio

• Parametri — NV-Reason-CT 4,69B totali / 4,35B attivi nel percorso CT, da un backbone Qwen3.5-4B più un Primus 3D ViT vs GPT-5.6 Sol non divulgati • Dimensione del checkpoint — NV-Reason-CT ~10,6 GB BF16 safetensors, funziona su Ampere/Hopper/Lovelace vs GPT-5.6 Sol solo API • Input — volumi CT NIfTI 3D in unità Hounsfield vs testo, immagine, file • Contesto — NV-Reason-CT non applicabile, un volume è un prefisso fisso di 13.824 token vs Sol 1.050.000 token in ingresso, 128.000 in uscita • Licenza — OpenMDW-1.1, pesi scaricabili vs proprietaria, solo accesso API • Disponibilità — repository del fornitore e i propri pesi vs instradato su OrcaRouter a $4,00 / $20,00 per milione, con la tariffa di Sol oltre 272K token di input che raddoppia a $8,00 / $30,00

A generated scoreboard titled 'NV-Reason-CT vs GPT-5.6 Sol - the scoreboard'. Left column 'NV-Reason-CT': Input 3D NIfTI CT, chest or abdomen; Volume prefix 13,824 tokens, fixed; Parameters 4.69B total / 4.35B active; CT-RATE Macro-F1 0.614 (vendor-reported); Licence OpenMDW-1.1, weights published; Price GPU capex, no per-token rate. Right column 'GPT-5.6 Sol': Input text, image, file; Context / output 1,050,000 in / 128,000 out; Parameters undisclosed; CT-RATE Macro-F1 not applicable; Licence proprietary, API only; Price $4.00 / $20.00 per M. A footer reads 'NV-Reason-CT figures are the authors' own and unreproduced; GPT-5.6 Sol pricing per OpenAI's rate card as routed by OrcaRouter.'

Quanto ti costa davvero la separazione

Il confronto dei costi ha senso solo una volta che si accetta che i carichi di lavoro sono diversi, quindi ecco la versione che ha davvero senso.

Sol viene fatturato per token e il suo prezzo ha un salto: $4,00 per milione di input e $20,00 per milione di output fino a 272K token di prompt, poi $8,00 e $30,00. Su OrcaRouter è servito al prezzo di listino di OpenAI stesso senza alcun ricarico, il che conta più di quanto sembri — la tariffa che vedi è quella che OpenAI pubblica, quindi qualsiasi variazione di prezzo arriva sulla tua fattura lo stesso giorno anziché al prossimo rinnovo contrattuale. La sua tariffa di lettura della cache è $0,40 per milione, un decimo dell'input, ed è ciò che rende aritmeticamente sostenibili i lunghi cicli agentici con un ampio prefisso fisso.

NV-Reason-CT non ha alcun prezzo per token. Scarichi 10,6 GB e paghi per la GPU. Questa è una questione di capex contro opex, e ha una sola risposta: con un volume sufficientemente alto, l'hosting autonomo di un modello con 4,35 miliardi di parametri attivi conviene in termini di costi. Al di sotto di quel volume no, e il punto di pareggio dipende interamente dall'utilizzo della tua GPU. Nessuno al di fuori di NVIDIA ha ancora pubblicato un dato di throughput per questo checkpoint, quindi chiunque ti citi un punto di pareggio sta tirando a indovinare.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Ciò in cui un router è davvero d'aiuto qui è la parte del flusso di lavoro che non è la scansione. Una pipeline di ricerca clinica in produzione raramente è un singolo modello — è estrazione, una fase di ragionamento, una fase di sintesi, a volte un secondo parere. OrcaRouter espone oltre 200 modelli dietro un unico endpoint compatibile con OpenAI con failover automatico tra provider, così la metà generalista di quella pipeline può essere sostituita o reindirizzata senza un secondo contratto. NV-Reason-CT non è uno dei modelli che instradiamo; è un checkpoint che esegui tu stesso. Le due metà della pipeline possono comunque stare dietro un'unica chiave.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol, showing the identifier openai/gpt-5.6-sol, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 1,050,000-token context window with 128K maximum output, the description of it as the flagship of OpenAI's GPT-5.6 series, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $4.00 per million input tokens and $20.00 per million output tokens with a p50 time to first token of 10.00 s.

La questione aperta

NV-Reason-CT ha due giorni come articolo e diciassette giorni come repository, e il campo a cui appartiene è abbastanza piccolo che il prossimo punto dati sarà informativo. Tieni d'occhio tre cose: una riproduzione indipendente di CT-RATE, un secondo checkpoint della famiglia e qualsiasi segnale che il gruppo medico di NVIDIA lo stia trattando come una linea anziché come un articolo. Fino ad allora, la posizione difendibile è ristretta e chiara — questo è il più forte checkpoint di ragionamento CT nativo 3D attualmente scaricabile, giudicato sulla tabella degli stessi autori, e non è un sostituto di un modello di frontiera generale in nulla, tranne che nel leggere una CT.