
NV-Reason-CT vs GPT-5.6 Sol : 13 824 tokens visuels avant même de taper un mot
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 45 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 182 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Chaque scanner thoracique que vous envoyez à NV-Reason-CTcoûte 13 824 tokens visuels avant même que le prompt ne commence. Ce n'est ni une bizarrerie ni un choix de réglage — c'est tout le design. L'encodeur de vision 3D natif du modèle prend un volume de 384×384×384 mm et le transforme en une grille de 24×24×24, et la fiche du modèle précise explicitement que les 13 824 tokens et leurs coordonnées tridimensionnelles parviennent au modèle de langage « sans sous-échantillonnage spatial ». Comparez cela à ce que vous payez probablement déjà.GPT-5.6 Sol accepte le texte, les images et les fichiers, et une image qui lui est envoyée est une image 2D — une coupe, une capture d'écran d'une visionneuse DICOM, une figure radiologique collée depuis un PDF. L'un de ces modèles dispose d'un chemin volumétrique. L'autre a une fenêtre de contexte. La plupart des comparaisons entre eux s'effondrent sur cette distinction, et c'est cet effondrement qui est la partie intéressante.
La sortie que personne n'a annoncée
NVIDIA n'a pas publié un seul mot sur NV-Reason-CT dans sa salle de presse. Il n'y a pas d'article de lancement, pas de diapositive de keynote, pas de communiqué de presse. Ce qui existe, c'est un dépôt Hugging Face créé le 8 septembre 2026, un dépôt GitHub sous l'organisation NVIDIA-Medtech créé le 2 septembre, un Space de démonstration Gradio, et une prépublication arXiv — NV-Reason-CT : modèle de langage visuel 3D pour l'analyse CT — soumise le 23 septembre 2026 par une équipe de seize auteurs de NVIDIA avec des coauteurs au NIH et à l'Université de Zurich.
C'est un vrai schéma, et il vaut la peine de le nommer précisément plutôt que de le traiter comme un mystère. Le groupe d'imagerie médicale de NVIDIA publie les poids discrètement et laisse l'article et le dépôt faire l'annonce. Le prédécesseur, NV-Reason-CXR-3B, est sorti en octobre 2025 de la même manière. La différence ici, c'est l'échelle : c'est la première fois que ce groupe étend la recette des radiographies 2D à des volumes 3D natifs, et l'article a deux jours.
Ce que l’on peut savoir du dépôt : l’architecture, la licence, les données d’entraînement, le tableau des benchmarks. Ce qui n’est pas encore confirmé : si NVIDIA entend en faire une gamme de produits prise en charge, si d’autres checkpoints suivront, et comment il résiste à l’évaluation de quiconque d’autre que les auteurs. Le dépôt est en version 0.1 et se décrit comme étant uniquement destiné à la recherche et à l’éducation.
Ce que chaque modèle accepte réellement
C'est ici qu'une comparaison directe devient vite révélatrice. Les deux modèles ne partagent pas la même surface d'entrée.
NV-Reason-CT lit les volumes NIfTI — .nii ou .nii.gz — avec des intensités de voxels en unités Hounsfield. Il recadre automatiquement sur le thorax ou l'abdomen à l'aide des unités Hounsfield des poumons et d'une heuristique de morphologie 3D, rééchantillonne à une résolution isotrope de 2 mm, et n'accepte que "chest" ou "abdomen" comme valeurs d'anatomie. Il génère du texte : un rapport structuré, une réponse ou une trace de raisonnement étape par étape, avec un interrupteur permettant de désactiver le raisonnement pour les réponses courtes.
GPT-5.6 Sol lit du texte, des images et des fichiers, avec une fenêtre de contexte de 1 050 000 jetons et jusqu'à 128 000 jetons de sortie en une seule réponse. Il n'a pas d'encodeur volumétrique. Fournissez-lui un scanner CT et vous devez d'abord décider comment aplatir trois cents et quelques coupes en quelque chose qu'un encodeur d'images 2D acceptera — un montage, une poignée de coupes clés, une projection d'intensité maximale rendue. Chacun de ces choix sacrifie les relations spatiales que la voie 3D avait été conçue pour préserver.
Donc, la formulation honnête n’est pas « quel modèle est le plus intelligent ». C’est que la voie d’image de Sol et la voie 3D de NV-Reason-CT répondent à des questions différentes. Sol peut raisonner sur la description d’un examen faite par un radiologue. NV-Reason-CT peut raisonner sur l’examen.
Un benchmark existe, et un seul d’entre eux porte un numéro.
NV-Reason-CT rapporte un Macro-F1 de 0,614 et un Macro-AUROC de 0,871 sur la tâche de classification à 18 étiquettes de CT-RATE, en utilisant une invite directe Oui/Non sans tête de classification ni adaptation spécifique à la tâche. Ce sont les propres chiffres des auteurs issus de la fiche du modèle, et la ligne de comparaison est la partie utile : VoxelFM à 0,581 Macro-F1, Pillar-0 à 0,544, ClinFusion-8B à 0,442, CT-CLIP à 0,398, Merlin à 0,358, MedGemma 1.5 à 0,303. Sur le même seuil uniforme fixe, un modèle 3D génératif surpasse les références de pré-entraînement contrastif 3D et le modèle de pointe basé sur des coupes.
Un chiffre dans ce tableau mérite le scepticisme plutôt que la répétition : l’écart d’AUROC. NV-Reason-CT annonce 0,871 contre 0,870 pour VoxelFM. Un millième de point, dans une évaluation menée par le fournisseur, n’est pas une victoire — c’est une égalité, quelle que soit l’ampleur du bruit que comporte l’évaluation. L’écart de Macro-F1 de 0,033 est, lui, l’affirmation étayée.
GPT-5.6 Sol n'a pas de score CT-RATE, car CT-RATE n'est pas un benchmark sur lequel il peut être évalué. Il obtient un indice d'intelligence Artificial Analysis de 47, un score GPQA Diamond mesuré par AA de 94,1 et un score à Humanity's Last Exam de 49,5 — autant d'instruments de raisonnement général. Placer 0,614 de Macro-F1 à côté de 47 sur l'indice AA reviendrait à faire de l'arithmétique avec deux règles différentes. Je ne vais pas m'y prêter, et vous devriez vous méfier de quiconque le ferait.
Traces de raisonnement, deux produits différents
Les deux modèles émettent un raisonnement. C’est le seul véritable recoupement philosophique, et la différence est instructive.
GPT-5.6 Sol expose un effort de raisonnement configurable : à chaque requête, vous arbitrez donc entre latence et coût, d'un côté, et profondeur, de l'autre, et vous pouvez récupérer le raisonnement via include_reasoning. C'est une capacité générale qui s'applique à tout ce que vous lui envoyez.
Le raisonnement de NV-Reason-CT est volontairement limité. Le corpus d’entraînement comprend environ 550 000 exemples de questions-réponses structurées issus de 70 111 volumes CT uniques, et une partie de ce corpus est constituée de raisonnements rédigés par des radiologues, recueillis à partir d’interprétations expertes enregistrées et transcrites. L’étape GRPO qui suit le SFT utilise des récompenses vérifiables sur des ensembles d’anomalies thoraciques et abdominales — ce qui signifie que le signal de récompense repose sur la présence effective, dans le volume, d’une constatation énoncée, et non sur le fait que la prose se lise bien. La fiche du modèle décrit la sortie comme « des observations examinables, des diagnostics différentiels et de l’incertitude », et elle comporte une mise en garde explicite selon laquelle le raisonnement généré « n’est pas garanti de représenter le calcul interne du modèle ». Cette mise en garde joue un rôle bien réel. C’est la différence entre une trace que l’on peut vérifier par rapport aux données et une trace que l’on ne peut qu’admirer.
La taille et la licence, en une seule passe
• Paramètres — NV-Reason-CT 4,69 B au total / 4,35 B actifs dans la voie CT, à partir d'un backbone Qwen3.5-4B plus un Primus 3D ViT vs GPT-5.6 Sol non divulgué • Taille du checkpoint — NV-Reason-CT ~10,6 Go BF16 safetensors, fonctionne sur Ampere/Hopper/Lovelace vs GPT-5.6 Sol uniquement via API • Entrée — volumes CT NIfTI 3D en unités Hounsfield vs texte, image, fichier • Contexte — NV-Reason-CT sans objet, un volume correspond à un préfixe fixe de 13 824 jetons vs Sol 1 050 000 jetons en entrée, 128 000 en sortie • Licence — OpenMDW-1.1, poids téléchargeables vs propriétaire, accès API uniquement • Disponibilité — dépôt du fournisseur et ses propres poids vs acheminé sur OrcaRouter à 4,00 $ / 20,00 $ par million, avec le tarif de Sol au-delà de 272 K jetons d'entrée doublant à 8,00 $ / 30,00 $

Ce que la séparation vous coûte réellement
La comparaison des coûts n'a de sens qu'une fois que l'on accepte que les charges de travail sont différentes, voici donc la version qui, elle, a du sens.
Sol est facturé au token et son prix présente un effet de falaise : $4.00 par million de tokens d'entrée et $20.00 par million de tokens de sortie jusqu'à 272K tokens de prompt, puis $8.00 et $30.00. Sur OrcaRouter, il est servi au prix catalogue d'OpenAI lui-même, sans marge, ce qui compte plus qu'il n'y paraît — le tarif que vous voyez est celui qu'OpenAI publie, de sorte que toute variation de prix se répercute sur votre facture le jour même plutôt qu'au prochain renouvellement de contrat. Son tarif de lecture du cache est de $0.40 par million, soit un dixième du tarif d'entrée, ce qui rend les longues boucles agentiques avec un grand préfixe fixe viables d'un point de vue arithmétique.
NV-Reason-CT n’a pas du tout de prix par token. Vous téléchargez 10,6 Go et payez le GPU. C’est une question de capex contre opex, et elle n’a qu’une seule réponse : à un volume suffisamment élevé, l’auto-hébergement d’un modèle à 4,35 B de paramètres actifs est plus avantageux en termes de coût. En dessous de ce volume, ce n’est pas le cas, et le point de bascule dépend entièrement de votre taux d’utilisation du GPU. Personne en dehors de NVIDIA n’a encore publié de chiffre de débit pour ce checkpoint, donc quiconque vous cite un point de bascule ne fait que deviner.

Ce à quoi un routeur sert ici, c'est la partie du flux de travail qui n'est pas le scan. Un pipeline de recherche clinique en production est rarement un seul modèle — il s'agit d'extraction, d'une étape de raisonnement, d'une étape de synthèse, parfois d'un second avis. OrcaRouter expose plus de 200 modèles derrière un seul point de terminaison compatible OpenAI avec un basculement automatique entre fournisseurs, de sorte que la moitié polyvalente de ce pipeline peut être remplacée ou redirigée sans second contrat. NV-Reason-CT ne fait pas partie des modèles que nous routons ; c'est un checkpoint que vous exécutez vous-même. Les deux moitiés du pipeline peuvent toujours se trouver derrière une seule clé.

La question ouverte
NV-Reason-CT a deux jours en tant qu’article et dix-sept jours en tant que dépôt, et le domaine auquel il appartient est suffisamment restreint pour que le prochain point de données soit instructif. Surveillez trois choses : une reproduction indépendante de CT-RATE, un deuxième checkpoint dans la famille, et tout signe que le groupe médical de NVIDIA traite cela comme une gamme plutôt qu’un article. D’ici là, la position défendable est étroite et claire — il s’agit du checkpoint de raisonnement CT natif 3D le plus solide actuellement téléchargeable, jugé sur le propre tableau des auteurs, et il ne remplace pas un modèle de frontière généraliste pour quoi que ce soit, hormis la lecture d’un CT.
