Una hero card generata intitolata 'NV-Reason-CT vs Kimi K3' con il sottotitolo '210 download e 588 milioni di token'. Tre chip sono allineate lungo la parte inferiore: '210 download HF vs 587.8M token / 7d', '0.21% di errore misurato sulla nostra rete' e 'Un volume vs 1,048,576 token'. Il logo OrcaRouter è composto in basso a destra.
Guides & Insights

NV-Reason-CT vs Kimi K3: 210 download e 588 milioni di token

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Uno di questi modelli è stato scaricato 210 volte da Hugging Face. L'altro ha movimentato 588 milioni di token attraverso il nostro playground negli ultimi sette giorni. Entrambi sono open-weights, entrambi sono scaricabili in questo momento, e il divario tra questi due numeri è la cosa più utile in questo confronto. NV-Reason-CT è il modello visione-linguaggio 3D da 4,69 miliardi di parametri di NVIDIA per TC toraciche e addominali, pubblicato su Hugging Face l'8 settembre 2026 senza alcun annuncio. Kimi K3 è il modello di punta di MoonshotAI da 1.048.576 token, rilasciato il 15 luglio 2026 e ormai uno dei modelli più trafficati sulla nostra rete. Entrambi sono «open» nel senso che conta per un modulo di procurement. Non sono però affatto open allo stesso modo.

Due significati di "puoi scaricarlo"

Parti da ciò che ogni download deposita realmente sul tuo disco, perché è proprio qui che la maggior parte dei confronti tra modelli open-weights si ammorbidisce.

NV-Reason-CT ti fornisce model.safetensors a circa 10,6 GB in BF16, più un model.py e un sostanzioso processor.py — 26 KB di codice di elaborazione personalizzato che implementa il cropping anatomy-aware, il ricampionamento a 2 mm e la patchificazione 3D. Lo carichi con trust_remote_code=True, il che significa che stai eseguendo il codice del repository NVIDIA all'interno del tuo processo. L'inferenza richiede CUDA PyTorch, e la scheda elenca Ampere, Hopper e Lovelace, con test su H100 e L40S. L'input è un volume NIfTI alla volta. Non è pubblicata alcuna modalità di batching, nessun dato di throughput e nessuna configurazione di serving nel repository, al di fuori di un esempio inference.py.

Kimi K3 ti offre un modello di ragionamento generalista con una finestra di contesto di 1.048.576 token, input di testo e immagini, invocazione nativa degli strumenti, output strutturati e sforzo di ragionamento configurabile. È il modello a cui ricorreresti per leggere cento linee guida cliniche in un'unica richiesta, o un decennio di report di un reparto. Il suo punteggio di richiamo su contesto lungo di Artificial Analysis è 88,7 — il più alto tra i modelli di questa serie e ben 8,4 punti sopra gli 80,3 di Grok 4.6.

In parole semplici: NV-Reason-CT è un checkpoint specializzato con una superficie di input ristretta e codice personalizzato di cui devi fidarti e che devi mantenere. Kimi K3 è un modello generale con un'ampia superficie di input che si comporta come un'infrastruttura. Entrambi sono scaricabili. Solo uno dei due si integra senza modifiche.

La prova CT, per intero, ed è breve

Tutto ciò che è pubblicamente noto sulla qualità di NV-Reason-CT si basa su un'unica tabella nella sua stessa model card: il compito di classificazione a 18 etichette di CT-RATE con una soglia uniforme fissa, prompting diretto Sì/No, nessun classification head, nessun adattamento specifico al compito. Macro-F1 0,614, Macro-AUROC 0,871.

Le righe di confronto sono VoxelFM a 0,581/0,870, Pillar-0 a 0,544/0,861, ClinFusion-8B a 0,442, CT-CLIP a 0,398/0,733, Merlin a 0,358/0,662 e MedGemma 1.5 a 0,303. Ognuno di questi è un numero dichiarato dal fornitore nella scheda di NVIDIA e nessuno è ancora stato riprodotto in modo indipendente — il paper ha due giorni.

Ciò che la tabella stabilisce è limitato e vale la pena affermarlo con precisione: un modello generativo 3D senza testa specifica per il compito batte le baseline di pre-addestramento contrastivo 3D e un modello di frontiera basato su slice nella classificazione TC a 18 etichette. Ciò che non stabilisce è nulla riguardo al ragionamento generale, nulla riguardo a modalità diverse dalla TC del torace e dell'addome, e nulla riguardo al vantaggio AUROC — 0,871 contro 0,870 è un pareggio che indossa un punto decimale.

I numeri di Kimi K3, e la precisazione sulla classifica open-weights

Artificial Analysis misura Kimi K3 con un Intelligence Index di 43,6, che lo colloca al 19º posto su 145 modelli in quella classifica, secondo l'istantanea del ranking della nostra API per modelli. Il suo punteggio GPQA Diamond è 93,5, Humanity's Last Exam 46,9, SciCode 59,5, Terminal-Bench 2.1 85,0, AA Coding 76,2 al 9º posto, e 𝜏²-banking 46,0.

Un'affermazione sulla classifica richiede attenzione, perché è facile sbagliarla ed è già stata sbagliata in passato. L'AA Intelligence Index di Kimi K3 pari a 44 si colloca terzo tra i modelli open-weights nella classifica open-weights, dietro MiMo-V2.6-Pro a 46 e GLM-5.3 a 45. Non è il leader in quella classifica, e non compete nella stessa classifica di Grok 4.6 — Artificial Analysis registra Grok 4.6 come proprietario, quindi il suo 44 appartiene alla classifica generale, non a quella open-weights. I due indici sembrano identici e non lo sono.

Ciò che l'operatore vede effettivamente

È da qui che viene il numero di 588 milioni, e vale la pena chiarirlo perché è l'unico elemento di prova in questo articolo che è nostro invece che marketing di qualcun altro.

Negli ultimi sette giorni, Kimi K3 ha movimentato 587,8 milioni di token attraverso il playground di OrcaRouter. Il suo tempo mediano al primo token è stato di 7,8 secondi, ha generato 42,9 token di output al secondo e il suo tasso di errore in quella finestra è stato dello 0,21% — un errore ogni circa 480 richieste. Quel tasso di errore misurato è la cosa che non puoi ricavare da una model card, ed è il numero che decide se un modello è sicuro da mettere dietro un batch job.

Per NV-Reason-CT non esiste un equivalente, perché non è un endpoint ospitato da nessuna parte — è un checkpoint che esegui tu stesso. Non c'è un p50, né un tasso di errore, né un uptime, e nessuno a cui fare failover. Non è una critica; è un fatto strutturale del self-hosting, ed è il motivo per cui un gruppo di ricerca può adottare NV-Reason-CT di martedì e un team di produzione generalmente non può.

Se stai eseguendo entrambe le metà di questo sistema — Kimi K3 come livello generale ospitato e NV-Reason-CT sul tuo server GPU — è sul lato del routing che la metà ospitata trova la sua resilienza. Kimi K3 viene erogato al prezzo di listino di Moonshot stesso, 3,00 $ per milione di token in input e 15,00 $ per milione in output, senza alcun ricarico; la sua tariffa di lettura della cache, 0,30 $ per milione, è un decimo di quella di input e, poiché il prezzo viene trasferito invariato, un taglio del fornitore arriva sulla tua fattura lo stesso giorno. Il failover automatico tra provider è ciò che mantiene in vita un processo batch quando un endpoint a monte vacilla — e con un tasso di errore dello 0,21%, i vacillamenti sono abbastanza rari da dimenticarsene facilmente, finché non lo sono più.

Le forme dei costi non si assomigliano tra loro

• Prezzo — capex GPU NV-Reason-CT più il tuo stack di serving rispetto a Kimi K3 $3,00 / $15,00 per milione, $0,30 per lettura dalla cache

• Spesa minima sostenibile — NV-Reason-CT: una GPU Ampere o più recente mantenuta indefinitamente vs Kimi K3: una richiesta

• Contesto — NV-Reason-CT un volume, 13.824 token fissi rispetto a Kimi K3 1.048.576 token

• Costo marginale della millesima richiesta — NV-Reason-CT effettivamente zero una volta pagata la GPU, rispetto a Kimi K3 lineare nei token

• Dove cede per primo — throughput non verificato di NV-Reason-CT e nessuna strategia di batching contro il costo del contesto lungo di Kimi K3 a 1M di token per richiesta

• Modalità — NV-Reason-CT 3D NIfTI, torace o addome vs Kimi K3 testo e immagine, qualsiasi cosa

A generated scoreboard titled 'NV-Reason-CT vs Kimi K3 - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex plus your serving stack; Minimum viable spend one Ampere-or-newer GPU; Context one volume, 13,824 tokens; Marginal cost of request #1000 effectively zero; Breaks first at unverified throughput, no batching; Modalities 3D NIfTI, chest or abdomen. Right column 'Kimi K3': Price $3.00 / $15.00 per M, $0.30 cached read; Minimum viable spend one request; Context 1,048,576 tokens; Marginal cost of request #1000 linear in tokens; Breaks first at long-context cost at 1M per request; Modalities text and image, anything. A footer reads 'Kimi K3 traffic and error rate measured on OrcaRouter's playground over seven days; NV-Reason-CT has no hosted endpoint to measure.'

L'economia si inverte a seconda del volume. Kimi K3 non costa nulla per iniziare e scala linearmente. NV-Reason-CT costa una GPU per iniziare e poi scala in modo quasi piatto — ecco perché 210 download non è un segnale di fallimento. È il numero corretto per un checkpoint il cui pubblico è costituito da istituzioni che possiedono già l'hardware e che non compariranno mai in una statistica di throughput dei token.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Quale stai effettivamente scegliendo?

Se il compito è leggere un volume TC e produrre un reperto strutturato con una traccia di ragionamento, Kimi K3 non può farlo e NV-Reason-CT sì. Non «lo fa peggio» — non può, perché non c'è alcun encoder volumetrico al suo interno, e appiattire una scansione in immagini scarta innanzitutto le relazioni spaziali che il percorso 3D esiste per preservare.

Se il compito è leggere 400 pagine di note di segnalazione, confrontarle con un documento di protocollo e produrre output strutturato, NV-Reason-CT non entra in gioco e Kimi K3 è una delle risposte migliori disponibili, con un tasso di errore misurato inferiore a un quarto di punto percentuale sulla nostra rete.

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier kimi/kimi-k3, input text + image, output text, the Vision, Tools, JSON and Reasoning badges, a 1M-token context window with a p50 time to first token of 7.77 seconds, the description of it as MoonshotAI's 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $3.00 per million input tokens, $15.00 per million output tokens and 591.2M tokens of seven-day traffic.

La vera decisione non è tra i due. È se il tuo problema è un problema di volume o un problema di testo, e il divario tra 210 e 588 milioni è semplicemente ciò che quella distinzione sembra dall'esterno. Un modello è un paper con i pesi. L'altro è un pezzo di infrastruttura. Vale la pena avere entrambi; nessuno dei due sostituisce l'altro.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno