Una hero card generata intitolata 'NV-Reason-CT vs Qwen3.8 Max' con il sottotitolo 'Il fine-tune e la famiglia da cui proviene'. Lungo la parte inferiore si trovano tre chip: 'Backbone: Qwen/Qwen3.5-4B', '13.824 token vs 1.000.000' e '3,5% vs 0,21% di errore misurato'. Il logo OrcaRouter è sovrapposto in basso a destra.
Guides & Insights

NV-Reason-CT vs Qwen3.8 Max: Il fine-tuning e la famiglia da cui proviene

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La prima riga della NV-Reason-CT model card ti dice qualcosa che la maggior parte delle persone liquida in fretta. Il modello base è Qwen/Qwen3.5-4B, indicato nei metadati del repository come relazione di fine-tune. Così, quando NVIDIA ha avuto bisogno di un modello linguistico a cui agganciare un transformer visivo Primus 3D, ha preso un Qwe​n. Confronta quel checkpoint con Qwen3.8 Max — il flagship da 1.000.000 di token di Aliba​ba, rilasciato il 3 agosto 2026 — e stai guardando un fine-tune e l'azienda di famiglia. Uno è uno specialista da 4,69B che legge volumi TC toracici e addominali ed è stato pubblicato su Hugging Face l'8 settembre 2026 senza alcun annuncio. L'altro è un flagship generalista con input testuale, immagini e video, un listino prezzi pubblicato e 37,2 milioni di token di traffico misurato sulla nostra rete nell'ultima settimana. La domanda interessante non è quale dei due vinca. È che cosa può fare un fine-tune da 4B che il flagship della sua famiglia non può fare, e perché la risposta è più specifica di quanto ti aspetteresti.

Che cosa ha fruttato concretamente il fine-tuning

Il modo in cui NVIDIA stessa inquadra il divario è insolitamente preciso, ed è la frase più utile del repository: la maggior parte dei sistemi visione-linguaggio «o opera su immagini 2D o comprime le caratteristiche volumetriche prima della decodifica linguistica». Questa è la descrizione di un'intera classe di modelli, e include ogni modello di punta multimodale generalista sul mercato.

La correzione è architetturale anziché una questione di scala. Un volume di input di 384×384×384 mm diventa una griglia 24×24×24 di 13.824 token visivi. Quei token e le loro coordinate tridimensionali entrano nel modello linguistico senza alcun downsampling spaziale, e MRoPE 3D preserva le relazioni spaziali all’interno del decoder. I volumi di input vengono ritagliati con consapevolezza anatomica sul torace o sull’addome utilizzando le unità Hounsfield del polmone, quindi ricampionati a una risoluzione isotropa di 2 mm.

Confronta questo con ciò che Qwen3.8 Max accetta. Testo, immagine e video — e il video è la cosa più vicina in questa serie a un input volumetrico, il che lo rende il punto di confronto onesto anziché retorico. Un video è una pila di fotogrammi 2D ordinati nel tempo. Un volume TC è una pila di sezioni 2D ordinate per posizione fisica lungo l'asse z, in unità Hounsfield, con una spaziatura millimetrica nota. Entrambi sono array tridimensionali. Solo uno dei due ha un sistema di coordinate fisiche a cui può essere localizzato il reperto di un radiologo, e solo uno dei due è misurato in un'unità che significhi qualcosa al di fuori di un sensore d'immagine. Un modello addestrato sul video impara la continuità temporale. Un modello addestrato su volumi TC impara che una massa in una sezione è la stessa massa nella sezione successiva otto millimetri più in basso.

Il corpus di addestramento è la vera differenza

Questo è il punto in cui i due modelli smettono del tutto di essere confrontabili, ed è la parte che una scheda tecnica nasconde.

NV-Reason-CT è stato addestrato end-to-end con fine-tuning supervisionato seguito da Group Relative Policy Optimization su circa 550.000 esempi strutturati di QA tratti da 70.111 volumi CT unici. Le fonti sono CT-RATE — 47.149 casi dall'Istanbul Medipol University Mega Hospital con referti radiologici abbinati — un set interno NIH di 15.991 casi, e i 22.720 casi di CancerVerse distribuiti su quattro fasi di contrasto e tredici tipi di tumori maligni. Il corpus include referti standardizzati, QA incentrate sulle anomalie, dialogo multi-turno e ragionamenti redatti da radiologi trascritti da interpretazioni esperte registrate. La fase GRPO utilizza ricompense verificabili su set di anomalie toraciche e addominali, il che significa che il segnale di ricompensa verifica se un reperto dichiarato è presente nel volume piuttosto che se la prosa suona clinica.

Il corpus di addestramento di Qwen3.8 Max non è pubblicato con un livello di dettaglio anche solo lontanamente simile, e non sarebbe d'aiuto se lo fosse, perché la capacità obiettivo è generale. I suoi dati di Artificial Analysis sono invece le prove rilevanti: un Intelligence Index di 45,4 che lo colloca al 15º posto su 145 modelli nello snapshot della nostra API, AA Coding 76,2 al 9º posto, Terminal-Bench 2.1 a 88,8, GPQA Diamond 92,8, Humanity's Last Exam 43,1, SciCode 52,1 e recall su contesto lungo 80,3. Si tratta di misurazioni di terze parti, non di dichiarazioni del fornitore, il che le rende i numeri più affidabili su entrambi i lati di questa pagina.

Output del ragionamento, due contratti diversi

Entrambi i modelli emettono tracce di ragionamento ed entrambi ti permettono di disattivarle. La somiglianza finisce all'interfaccia.

Qwen3.8 Max espone enable_thinking e reasoning_effort, insieme all'intera superficie di campionamento — temperatura, top_p, seed, penalità, output strutturati, chiamata di strumenti. È una capacità di ragionamento generale che puoi indirizzare verso qualunque cosa tu abbia. Il suo pensiero è tanto buono quanto il problema che gli sottoponi, e non ha alcun modo di verificare un'affermazione se non rispetto al testo che gli è stato fornito.

Il ragionamento di NV-Reason-CT ha un contratto più ristretto con il lettore, e la scheda del modello dichiara esplicitamente il limite: il ragionamento generato è "output del modello verificabile e non è garantito che rappresenti il calcolo interno del modello". Quell'avvertenza svolge un ruolo concreto, ed è il tipo di frase che compare solo quando un team ha riflettuto su che cosa farà un clinico con una traccia che suona plausibile. La scheda descrive l'output come osservazioni verificabili, diagnosi differenziali e incertezza. Una traccia che si può verificare rispetto al volume, in altre parole, anziché una che si può solo leggere.

Throughput, dall'unico posto in cui possiamo misurarlo

Qwen3.8 Max ha fatto passare 37,2 milioni di token attraverso il playground di OrcaRouter negli ultimi sette giorni. Il suo tempo mediano al primo token è stato di 1,96 secondi — comodamente il più veloce tra i modelli di questa serie — a 53,3 token di output al secondo. Il suo tasso di errore in quella finestra è stato del 3,5%.

Quei due valori tirano in direzioni opposte ed entrambi contano. La latenza è eccellente e rende piacevole iterare sul modello. Il tasso di errore è circa diciassette volte superiore allo 0,21% di Kimi K3 nello stesso intervallo, ed è il numero che decide se metterlo dietro una chiamata sincrona rivolta all'utente o un job batch con retry. Questo è un comportamento misurato sulla nostra rete, non un benchmark, ed è il genere di cosa che un listino prezzi non ti dice mai.

NV-Reason-CT non ha alcuna misurazione equivalente da nessuna parte. È un checkpoint BF16 da 10,6 GB con codice del modello personalizzato, caricato con trust_remote_code=True su hardware Ampere, Hopper o Lovelace, testato da NVIDIA su H100 e L40S. Non vengono pubblicati né p50, né tasso di errore, né cifra di throughput. Chiunque ti dica il volume di crossover al quale l'hosting autonomo di questo batte il pagamento per token sta tirando a indovinare.

Prezzo e forma, fianco a fianco

• Prezzo — capex GPU NV-Reason-CT, nessuna tariffa per token rispetto a Qwen3.8 Max 2,00 $ / 6,00 $ per milione di token, 0,25 $ lettura in cache, 2,50 $ scrittura in cache

• Input — Volumi TC 3D NIfTI NV-Reason-CT in unità Hounsfield, solo torace o addome vs Qwen3.8 Max testo, immagine e video

• Contesto — NV-Reason-CT un volume, un prefisso fisso di 13.824 token rispetto a Qwen3.8 Max 1.000.000 di token

• Parametri — NV-Reason-CT 4,69B totali / 4,35B attivi nel percorso CT rispetto a Qwen3.8 Max non divulgati

• Licenza — NV-Reason-CT OpenMDW-1.1, pesi pubblicati rispetto a Qwen3.8 Max proprietario, accesso solo tramite API

• Punteggi indipendenti — NV-Reason-CT nessuno vs Qwen3.8 Max AA Intelligence Index 45.4, GPQA Diamond 92.8

A generated scoreboard titled 'NV-Reason-CT vs Qwen3.8 Max - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex, no per-token rate; Input 3D NIfTI CT, chest or abdomen; Context one volume, 13,824-token prefix; Parameters 4.69B total / 4.35B active; Licence OpenMDW-1.1, weights published; Independent score none published. Right column 'Qwen3.8 Max': Price $2.00 / $6.00, $0.25 cached read; Input text, image and video; Context 1,000,000 tokens; Parameters undisclosed; Licence proprietary, API only; Independent score AA Index 45.4, GPQA Diamond 92.8. A footer reads 'Qwen3.8 Max scores per Artificial Analysis; NV-Reason-CT figures are the authors' own, from the model card.'

L'economia della cache di Qwen3.8 Max premia una forma specifica: una lettura dalla cache da $0,25 rispetto a un input fresco da $2,00 è uno sconto di otto volte, e la scrittura in cache da $2,50 significa che un lungo prefisso riutilizzabile si ripaga rapidamente. Questo è il carico di lavoro di un prompt di sistema più un documento di protocollo riutilizzato in migliaia di richieste. NV-Reason-CT ha il profilo di costo opposto — costo marginale quasi nullo per scansione una volta acquistata la GPU, e un limite minimo rigido di una GPU occupata a tempo indefinito.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Gestire la famiglia insieme

L'architettura naturale qui, e vale la pena dirlo, nessuno l'ha pubblicata, è il fine-tune per il volume e il modello di punta per tutto ciò che gli sta attorno. NV-Reason-CT produce il riscontro strutturato; Qwen3.8 Max gestisce il testo di referral, il matching dei protocolli, la codifica, la lettera di follow-up — il lavoro testuale ad alto volume dove una finestra da un milione di token e uno sconto sulla cache di otto volte si guadagnano davvero il loro posto.

Se questa è la tua pipeline, metà è un checkpoint che ospiti tu e metà sono token che acquisti, e la seconda metà è dove un router fa qualcosa che un endpoint di un singolo fornitore non può fare. Qwen3.8 Max viene servito tramite OrcaRouter al prezzo di listino di Aliba​ba con markup zero, quindi i $2,00 / $6,00 di cui sopra sono ciò che paghi e qualsiasi futura variazione di prezzo arriva sulla tua fattura lo stesso giorno anziché al rinnovo. Il failover automatico tra provider conta più del solito quando il tasso di errore misurato del modello stesso è del 3,5% — un nuovo tentativo che va verso un endpoint sano diverso è la differenza tra un intoppo temporaneo e un batch fallito. E poiché la metà generale della pipeline è un unico nome di modello dietro un endpoint compatibile con OpenAI che copre oltre 200 modelli, sostituirlo con qualcos'altro per l'esperimento di una settimana costa un cambio di stringa, non un'integrazione.

NV-Reason-CT, per essere chiari, non è su OrcaRouter e non lo sarà — è un'inferenza 3D in codice personalizzato che esegui tu stesso. La versione onesta della storia dell'integrazione è che lo specialista self-hosted e il generalista instradato possono stare sotto un'unica chiave, e questo è tutto ciò che si sostiene.

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the identifier qwen/qwen3.8-max, input text + image + video, output text, the Vision, Tools, JSON and Reasoning badges, a 1,000,000-token context window with a p50 time to first token of 1.96 seconds, the description of it as Alibaba's newest flagship positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $2.00 per million input tokens, $6.00 per million output tokens and 37.2M tokens of seven-day traffic.

Il verdetto che regge davvero

Questo accostamento viene archiviato sotto «quale è migliore», e non dovrebbe. Qwen3.8 Max viene misurato da terzi sui benchmark generali e batte gran parte della concorrenza; NV-Reason-CT ha una sola tabella di numeri propri su un unico benchmark CT, e un conteggio di parametri di 4,69B che non sarebbe degno di nota in qualsiasi confronto generale. Su qualsiasi benchmark generale, vince il benchmark generale, e il motivo è che il benchmark generale è quello per cui è stato pensato.

Nell'unico compito per il quale NV-Reason-CT è stato creato — leggere un volume TC toracico o addominale e dire cosa contiene, con una traccia che qualcuno possa verificare — Qwen3.8 Max non è un concorrente più debole. Non ha un encoder volumetrico, quindi non può essere eseguito affatto sull'input senza che qualcuno decida prima come appiattire una scansione in immagini. È in quella decisione che finisce l'informazione spaziale. Questo è l'intero punto di un fine-tuning da 4B con un percorso 3D nativo e un prefisso fisso di 13.824 token, ed è il motivo per cui la cosa interessante di questo modello è la piccolezza del suo backbone invece della sua dimensione.