
NV-Reason-CT vs GLM-5.2: Uno di questi è deprecato, e non è quello che pensi
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 97 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 182 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Il modello più vecchio in questo confronto è quello che viene ritirato. GLM-5.2 è stato rilasciato il 16 giugno 2026; NV-Reason-CT ha attività nel repository datata tra il 2 e il 25 settembre 2026. Ti aspetteresti che quello di settembre fosse l'incognita e quello di giugno la scelta consolidata. Sull'asse che conta per una pipeline di testo vale il contrario: GLM-5.2 è stato superato da GLM-5.3, pubblicato il 18 agosto 2026, e ora reca un marcatore di deprecazione sulla classifica indipendente dove vengono pubblicati i suoi dati. NV-Reason-CT, qualunque altra cosa resti irrisolta al riguardo, è la versione attuale dell'unica cosa che fa.
Quindi la prima frase utile in questo articolo è quella che un lettore ha meno probabilità di avere: se oggi stai avviando una build di testo e per abitudine stai per usare GLM-5.2, fermati e guarda prima GLM-5.3. Costa $1,26 per milione di token di input e $3,96 per milione di output rispetto ai $1,40 e $4,40 di GLM-5.2 — è sia più recente sia più economico — e il suo indice di intelligenza indipendente è 44,8 contro 33,7, il che è un passo avanti sulla stessa scala, non un passo laterale. Questa è una decisione separata da qualunque cosa abbia a che fare con CT, e merita di essere presa separatamente.
I due modelli, e i due diversi tipi di stale
Esiste una distinzione reale tra un modello vecchio e un modello superato, e questo abbinamento la rende concreta.
• Cosa fa — NV-Reason-CT legge un volume TC del torace o dell'addome e produce referti strutturati per regione anatomica; GLM-5.2 è un modello linguistico solo testuale per il ragionamento, il codice e l'elaborazione di documenti lunghi
• Rilasciato — gli artefatti di NV-Reason-CT risalgono al periodo dal 2 al 25 settembre 2026; GLM-5.2 al 16 giugno 2026, con GLM-5.3 a seguire il 18 agosto 2026
• Stato della generazione — NV-Reason-CT è la versione 0.1, una release iniziale, non annunciata; GLM-5.2 è la generazione precedente di una linea di prodotti già in commercio
• Posizionamento indipendente — non esistono misurazioni indipendenti di NV-Reason-CT; GLM-5.2 è misurato a 33,7 sull'Artificial Analysis Intelligence Index, con un marcatore di deprecazione, rispetto a GLM-5.3 a 44,8
• Licenza e accesso — Pesi OpenMDW-1.1 che scarichi; rispetto a un modello open-weight erogato a $1,40 e $4,40 per milione di token, con letture in cache a $0,26
• Contesto — 13.824 token visivi per volume senza finestra di chat; rispetto a 1.000.000 di token in ingresso e 128.000 in uscita
• Uso dichiarato — solo per ricerca e istruzione, non è un dispositivo medico; contrario alla distribuzione per uso generale
La parola «deprecato» qui svolge un ruolo preciso, e vale la pena non sovrainterpretarla. Un marcatore di deprecazione su una classifica significa che il valutatore ha smesso di considerare il modello come attuale, di solito perché un successore ne ha preso il posto. Non significa che i pesi siano stati ritirati, che l’API sia stata disattivata o che il modello abbia smesso di funzionare. I team con pipeline ottimizzate su GLM-5.2 non sono in difficoltà. Ciò che significa, invece, è che i suoi numeri sono un’istantanea di prima che GLM-5.3 esistesse, e che mescolarli con i numeri attuali di altri modelli equivale a confrontare una misurazione di giugno con un campo di settembre.
I numeri che ciascuna parte ha, e quanto valgono
Il record di GLM-5.2 è insolitamente ben popolato e proviene da due fonti che non concordano in un punto.
Secondo quanto riportato direttamente da Z.ai, il modello registra 99,12 su τ²-Bench, 62,1 su SWE-bench Pro, 54,7 su Humanity's Last Exam con strumenti e un miglior risultato dichiarato di 82,7 su Terminal-Bench 2.1. Sul fronte indipendente, Artificial Analysis misura lo stesso modello a 77,9 su Terminal-Bench 2.1, 33,7 sul suo Intelligence Index, 89,5 su GPQA Diamond e 41,1 su Humanity's Last Exam. Ci sono altri dati forniti dal produttore — 99,2 su AIME 2026, 92,5 su HMMT February 2026, 91 su IMOAnswerBench, 74,4 su FrontierSWE, 63,7 su ProgramBench, 76,8 su MCP-Atlas — e sono tutti di Z.ai.
Due cose in quella lista meritano di essere nominate. In primo luogo, lo scarto di 4,8 punti su Terminal-Bench 2.1 tra l'82,7 del miglior dato riportato dal fornitore e il 77,9 indipendente non è una contraddizione. I valori migliori riportati dai fornitori sono in genere il migliore risultato tra diversi harness, e il numero Terminus-2 di Z.ai per lo stesso benchmark è 81: la misurazione indipendente rientra nell'intervallo dello stesso fornitore. In secondo luogo, la divergenza su Humanity's Last Exam è maggiore: 41,1 in modo indipendente contro un dato del fornitore di 40,5 senza strumenti e 54,7 con essi, il che significa che il 54,7 in evidenza è un numero assistito da strumenti e il 41,1 è quello puro. Citare 54,7 accanto al punteggio puro di un altro modello sarebbe un vero errore.
Il record di NV-Reason-CT non presenta una simile struttura a due fonti, ed è proprio qui che è più debole. I suoi risultati su CT-RATE — 0,614 F1 e 0,871 AUROC su diciotto etichette, con una soglia uniforme fissa, un prompt diretto sì/no e nessuna testa di classificazione né adattamento specifico per il compito — sono di NVIDIA. I modelli con cui viene confrontato in quel paper (VoxelFM 0,581, Pillar-0 0,544, ClinFusion-8B 0,442, CT-CLIP 0,398, Merlin 0,358, MedGemma 1.5 0,303) sono tutti modelli di imaging. Nulla è stato riprodotto in modo indipendente, e il modello è scaricabile da settimane. Riporta inoltre un macro-F1 derivato dal referto di 0,592 e uno studio preliminare su radiologi esperti che collega la revisione assistita a una riduzione del 50% del tempo medio di interpretazione riportato, che gli autori stessi segnalano come un grave problema di campione ridotto.
Quindi il confronto sulla provenienza non favorisce il modello più recente, e questo è il punto su cui vale la pena soffermarsi. GLM-5.2 è il modello più vecchio, ormai superato, e i suoi numeri sono più affidabili di quelli di NV-Reason-CT, perché qualcuno esterno all'azienda ha eseguito il banco di prova. Essere attuali non è la stessa cosa che essere verificati.

Perché la deprecazione conta più di quanto sembri
C'è un fallimento specifico che questo confronto è progettato per prevenire, e non riguarda affatto la CT.
Un team che costruisce una pipeline di testo clinico va in cerca di un modello open-weight da eseguire sul proprio hardware, perché i dati sono sensibili. Trova GLM-5.2, con licenza MIT, 743 miliardi di parametri di cui circa 40 miliardi attivi, che fa al caso suo e ha un track record di benchmark ben documentato. Ci fa fine-tuning. Sei mesi dopo scopre che la generazione attuale è GLM-5.3, che ha un contesto da 1M con un tetto di output di 128K, che è più economico a $1.26 e $3.96, e che la decisione che pensava di stare prendendo — su quale modello open-weight standardizzarsi — era in realtà una decisione su quale generazione, e l'ha presa per caso.
Si tratta di un incidente costoso da scoprire troppo tardi, ed è evitabile con una sola ricerca. La guida concreta:
• Verifica se il modello su cui stai per standardizzare è la generazione attuale — un indicatore di deprecazione nella classifica è il segnale più rapido, e l'elenco dei modelli del fornitore stesso è quello autorevole
• Non mescolare un'istantanea di giugno con i dati di settembre — l'indice 33,7 di GLM-5.2 è stato misurato prima che GLM-5.3 esistesse, e metterlo accanto all'indice di un modello attuale significa confrontare due momenti diversi in un ambito in evoluzione
• Fai attenzione al nome — una voce "GLM-5.3 Prime" è un livello di servizio che utilizza gli stessi pesi a circa il doppio del prezzo di listino, non un modello separato. Controlla i pesi dietro qualsiasi SKU prima di pagare un sovrapprezzo
• Considera una tariffa principale più bassa come una domanda, non come una risposta — che GLM-5.3 costi meno del suo predecessore è insolito e vale la pena verificarlo sul tuo carico di lavoro invece di darlo per scontato
Niente di tutto ciò rende GLM-5.2 una cattiva scelta. Un modello da 743B con licenza MIT a $1,40 e $4,40 su cui un team ha già fatto tuning è una cosa del tutto ragionevole da continuare a eseguire, e un modello di metà generazione con un track record consolidato è talvolta esattamente ciò che vuole un flusso di lavoro regolamentato. Il punto è che dovrebbe essere una scelta, fatta deliberatamente, anziché un'impostazione predefinita ereditata da un elenco che era aggiornato a luglio.
La trappola nel confrontare un modello testuale con un modello CT
Il motivo per cui questo abbinamento sembra del tutto plausibile è che entrambi sono modelli open-weight rilasciati nel 2026, e un lettore che scorre un catalogo vede due voci comparabili. Non sono comparabili e la discrepanza ha una forma specifica.
GLM-5.2 gestisce 1.000.000 di token. Un singolo volume TC di NV-Reason-CT costa 13.824 token visivi. Con questa aritmetica, GLM-5.2 potrebbe contenere settanta studi TC e avere ancora spazio, il che invita a concludere che un modello testuale con contesto sufficientemente lungo renda superfluo il modello di imaging. La conclusione non segue, e il motivo è l'interfaccia, non il budget.
Quei 13.824 token non sono un riassunto. Sono un cubo di 384 millimetri ricampionato a 2 mm isotropici, diviso in patch 8 x 8 x 8 su una griglia 24 x 24 x 24, passato a un backbone linguistico senza downsampling spaziale e senza strato di merging — il che spiega perché il percorso attivo è di 4,35 miliardi di parametri sui 4,69 miliardi totali, e perché la potenza di calcolo viene spesa per mantenere la risoluzione anziché comprimerla. GLM-5.2 è solo testo. Non ha alcun percorso di visione, quindi la domanda su come gestirebbe una scansione non si pone; la risposta è che non può riceverne una in nessuna forma. Le due model card descrivono una differenza di seicento volte nel budget di token che non ha nulla a che fare con il confronto, perché uno dei due non ha modo di ricevere l'input.
È altrettanto possibile commettere l'errore inverso. NV-Reason-CT supporta torace e addome, accetta un file NIfTI invece di un prompt, non utilizza strumenti e la sua model card lo limita a ricerca e istruzione e dichiara che non è un dispositivo medico e che gli output possono essere errati. Non può normalizzare un corpus di referti, scrivere un sistema di valutazione né ragionare su un documento di linee guida. Un modello di imaging da 4,7B non è un sostituto di un modello testuale da 743B, così come non lo è il contrario.

Mettendo la metà del testo su un tasto
Se la domanda è su quale modello di testo far eseguire il lavoro della pipeline, oggi la risposta è probabilmente GLM-5.3 anziché GLM-5.2 — ed entrambi sono nel nostro catalogo sotto un'unica chiave. z-ai/glm-5.2 viene servito alla tariffa di listino del provider Z.ai senza alcun ricarico, e GLM-5.3 accanto a esso, all'interno di un'unica API che copre più di 200 modelli. Mantenere disponibili entrambi conta più del solito durante un cambio di generazione: puoi misurare il successore sul tuo corpus prima di impegnarti, tenere quello attuale come fallback nel frattempo, e passare senza un secondo contratto o una modifica al codice.
La tariffa pass-through merita una frase per lo stesso motivo per cui conta su qualsiasi modello il cui fornitore riprezza. Senza alcun livello di markup in mezzo, una variazione della tariffa del fornitore arriva dalla nostra parte lo stesso giorno. Il failover automatico copre un provider che si degrada a metà batch, che per un lungo lavoro di estrazione è il guasto che costa davvero una notte, e il DSL di routing ti consente di inviare singole richieste al modello che dovrebbe gestirle invece di puntare tutto su un unico endpoint.
NV-Reason-CT non è sulla nostra piattaforma, e nessun modello NVIDIA lo è. Vale la pena affermarlo chiaramente anziché lasciarlo all'inferenza: il lato CT di questa architettura consiste in pesi scaricati sul vostro hardware, sotto una licenza che lo consente e una model card che ne vieta l'uso clinico. Non lo ospitiamo e non scriveremo una frase che suggerisca il contrario.
L'ordine in cui prendere queste decisioni
La sequenza corretta per una build clinica non è quella che il confronto lascia intendere.
Inizia con la questione della generazione di testo, e inizia verificando quale generazione è attuale — GLM-5.3 invece di GLM-5.2, sul prezzo e sulla capacità misurata, a meno che tu non abbia una ragione per restare fermo. Poi misura la latenza per studio del modello CT sul tuo hardware, perché quel numero non è pubblicato e determina il resto del budget. Poi progetta la pipeline in modo che le due metà siano sostituibili in modo indipendente, poiché una è su un ciclo di vita adiacente alla preview e l'altra è alla versione 0.1.
L'unica cosa da non fare è trattare i due come una scelta. Un modello testuale 743B superato e un modello CT 4.69B attuale non hanno alcun compito in comune. Il confronto vale la pena solo per ciò che rivela: che l'artefatto più recente ha alle spalle prove più deboli, che quello più vecchio è silenziosamente fuori generazione, e che entrambi i fatti sono invisibili a chiunque legga una riga di catalogo che li elenca fianco a fianco come se fossero alternative.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
