
NV-Reason-CT vs Claude Opus 5 : une erreur de catégorie à prendre au sérieux
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 506 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 183 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Mettre NV-Reason-CT et Claude Opus 5 dans la même phrase est une erreur de catégorie, et cela vaut tout de même la peine d'être fait, car l'erreur est instructive. NV-Reason-CT est un modèle vision-langage 3D natif de 4,69 milliards de paramètres de NVIDIA qui prend un volume de scanner thoracique ou abdominal en unités Hounsfield et produit un compte rendu structuré, constat par constat. Ce n'est pas un dispositif médical, et sa propre fiche de modèle le dit. Claude Opus 5 est le modèle de texte et de vision généraliste de pointe de l'éditeur, publié le 24 juillet 2026, avec une fenêtre de contexte d'un million de jetons, un plafond de sortie de 128 000 jetons, et un tarif publié de cinq dollars par million de jetons d'entrée et de vingt-cinq par million de jetons de sortie. L'un lit un scanner. L'autre lit tout le reste.
La raison pour laquelle cette comparaison ne cesse d’être faite — et elle le sera, chaque fois que quelqu’un verra un nouveau VLM médical et s’emparera d’un repère familier — c’est que tous deux produisent de la prose à propos d’une image. Cette similitude de surface nuit réellement à la manière dont les gens raisonnent sur l’un et l’autre, il vaut donc la peine de la décortiquer en détail.
L’axe réel qu’ils partagent, et celui qu’ils ne partagent pas
Ils se chevauchent à exactement un endroit, et il est plus étroit qu'il n'y paraît.
• Modalité en — NV-Reason-CT reçoit des volumes NIfTI à un canal en unités Hounsfield via un processeur tridimensionnel dédié ; Claude Opus 5 reçoit du texte, des images et des fichiers, une interface de deuxième génération pour les images qui ne peut pas ingérer nativement une étude CT volumétrique
• Ce qui est renvoyé — une liste de constatations organisée par région anatomique issue de NV-Reason-CT, par opposition à de la prose générale, du JSON structuré ou des appels d'outils provenant de Claude Opus 5
• Unités de travail — un volume CT, rééchantillonné à 2 mm isotropes, recadré sur l'anatomie, découpé en patchs de 8 x 8 x 8 ; par rapport à ce que vous mettez dans un budget de tokens
• Contexte — NV-Reason-CT n'a aucune fenêtre de chat ; un seul volume devient 13 824 jetons visuels, sans sous-échantillonnage. Claude Opus 5 accepte 1 000 000 de jetons en entrée et en émet jusqu'à 128 000
• Licence — OpenMDW-1.1, un modèle téléchargeable que vous exécutez sur votre propre matériel ; par opposition à une API hébergée
• Usage déclaré — recherche et éducation uniquement, explicitement pas un dispositif médical, pour NV-Reason-CT ; contre une assistance à usage général pour Claude Opus 5
• Prix — aucun prix catalogue, car il n'y a rien à acheter, seulement des poids à exécuter ; face à 5 $ et 25 $ par million de jetons, avec les lectures en cache à 0,50 $
La ligne « modalité d'entrée » est là où naît l'erreur de catégorie. Les deux acceptent une image, donc tous deux ressemblent à des modèles d'image, et un lecteur se demande raisonnablement lequel est meilleur en matière d'images. Mais un examen CT n'est pas une image. C'est un tableau volumétrique avec une échelle physique en millimètres, une unité de densité calibrée, et une anatomie qui n'a de sens qu'en trois dimensions. La vision de Claude Opus 5 est véritablement capable et elle discutera avec pertinence d'une radiographie ou d'une lame de pathologie. C'est une tâche différente de celle qui consiste à intégrer un cube de 384 millimètres de valeurs Hounsfield à une résolution de 2 mm et à rendre compte de la lobulation d'un nodule.
Ce que mesurent réellement les chiffres de chaque côté
Les deux modèles présentent des résultats de référence qui ne se recoupent jamais, et les lire côte à côte sans s’en apercevoir, c’est ainsi que l’on prend de mauvaises décisions d’approvisionnement.
NV-Reason-CT rapporte ses résultats sur le benchmark public CT-RATE de tomodensitométrie thoracique, sur dix-huit libellés, en utilisant un seuil uniforme fixe et une invite directe oui/non, sans tête de classification ni adaptation spécifique à la tâche. Il affiche 0,614 de F1 et 0,871 d'AUROC, devant VoxelFM à 0,581 et 0,870, Pillar-0 à 0,544 et 0,861, ClinFusion-8B à 0,442 de F1, CT-CLIP à 0,398 et 0,733, Merlin à 0,358 et 0,662, et MedGemma 1.5 à 0,303 de F1 lorsqu'on lui fournit jusqu'à 85 coupes axiales. Il y a aussi un macro-F1 de 0,592 dérivé des comptes rendus. Chacun de ces chiffres provient du propre article de NVIDIA. Aucun n'a été reproduit par quelqu'un d'autre, et le modèle est téléchargeable depuis quelques semaines.
Le palmarès de Claude Opus 5 est de portée générale et largement indépendant. Artificial Analysis le mesure à 50,8 sur son Intelligence Index, 78 sur son Coding Index, 93,2 sur GPQA Diamond et 54,9 sur Humanity's Last Exam, avec un score de rappel en contexte long de 79,33. Ce sont des chiffres de tiers sur des tâches de raisonnement général, de code et de connaissances. Aucun benchmark d'imagerie clinique ne figure dans cet ensemble, et il n'y a nulle part de ligne CT-RATE dans le palmarès publié de Claude Opus 5.
Donc, l'affirmation honnête n'est pas que l'un est en avance. C'est que les deux modèles n'ont jamais été mesurés sur la même tâche par qui que ce soit. Toute phrase de la forme « NV-Reason-CT est meilleur que Claude Opus 5 en imagerie médicale » est infalsifiable telle qu'écrite, car personne n'a mené l'expérience. Le tableau comparatif de NVIDIA lui-même ne contient aucun modèle généraliste de pointe.

Là où les gens se trompent sur la question de l’interface
Le seul recoupement technique vraiment intéressant est celui sur lequel personne ne se dispute : à quoi devrait ressembler une interface entre un modèle CT et un modèle de texte.
Un réflexe raisonnable consiste à soumettre à Claude Opus 5 un ensemble d’images TDM ou un volume sous-échantillonné et à lui demander de raisonner. Avec 1 000 000 de tokens de contexte, cela semble généreux, et face à un examen qui ne représente que 13 824 tokens visuels, cela ressemble à amplement de place. La place n’est pas le problème. Le pipeline de vision de Claude Opus 5 traite une image comme une image en deux dimensions dotée d’une échelle de pixels. Une TDM thoracique présentée ainsi perd l’espacement entre coupes qui rend une lésion mesurable et la calibration de densité qui fait du « verre dépoli » un seuil plutôt qu’une description. Vous pouvez lui soumettre un montage de coupes axiales et obtenir un paragraphe qui semble cohérent. Ce que vous ne pouvez pas obtenir, c’est une mesure.
C'est précisément ce sur quoi la conception de NV-Reason-CT dépense sa puissance de calcul. La grille 24 x 24 x 24 issue d'un volume de 384 millimètres est transmise au modèle de langage en pleine résolution, sans sous-échantillonnage spatial ni couche de fusion, ce qui explique pourquoi la voie active compte 4,35 B de paramètres plutôt que quelque chose de bien plus petit. L'architecture est un pari : conserver le détail spatial vaut le coût en tokens. C'est un pari sur la représentation, pas sur les capacités linguistiques, et Claude Opus 5 n'y participe pas.
Le schéma productif est celui qui est ennuyeux : utilisez le modèle CT pour la lecture volumétrique, et un modèle textuel pour tout ce qui l’entoure. Génération et normalisation de comptes rendus, synthèses de cohortes, harnais d’évaluation, conversion à grande échelle d’archives DICOM en NIfTI, tri des examens qu’un humain devrait examiner en premier. C’est du travail sur des documents longs et du code, et c’est là qu’un modèle à contexte de 1 M justifie son tarif.
Coût, en deux unités qui ne se convertissent pas
Claude Opus 5 est facturé à l'usage. Cinq dollars par million de jetons d'entrée et vingt-cinq par million de jetons de sortie, les lectures de cache à cinquante cents, les écritures de cache à dix dollars. Pour un pipeline qui normalise un corpus de rapports ou écrit et réécrit du code d'évaluation, cela produit une prévision que vous pouvez construire : jetons en entrée, jetons en sortie, lectures mises en cache, et une facture bien moins élevée si vous gérez correctement la mise en cache.
NV-Reason-CT n’a pas de prix. Vous téléchargez 4,69 milliards de paramètres et payez en électricité, en heures de GPU et en temps d’ingénierie. Il n’existe aucun chiffre de débit publié pour une étude complète de 13 824 tokens, et aucune variante quantifiée n’est proposée, de sorte que le coût par étude pour l’exécuter est un nombre que vous devez mesurer vous-même. C’est normal pour des poids de recherche, et c’est aussi la plus grande différence pratique entre les deux : l’un a une grille tarifaire, l’autre a une facture que vous ne pouvez pas voir avant de l’avoir déjà payée.
La comparaison qui compte vraiment se fait par examen, pas par jeton. Une lecture CT est une unité de travail. Une passe de normalisation de compte rendu sur le même cas est une tâche textuelle mesurée en milliers de jetons. Chiffrer la première en dollars suppose de connaître votre matériel ; chiffrer la seconde relève de l’arithmétique.
Le piège au milieu de la comparaison
Il y a une erreur précise qui mérite d’être nommée, car c’est celle que cette confrontation invite à commettre. C’est de traiter NV-Reason-CT comme un ajustement spécialisé d’un modèle général, et donc de supposer que le modèle général sera suffisamment proche dans la plupart des cas et bien plus flexible.
Ce n'est pas un fine-tuning. C'est un transformer de vision 3D appelé Primus, initialisé à partir de COLIPRI, greffé sur un socle linguistique Qwen3.5-4B avec un plongement positionnel rotatif multi-axes 3D, entraîné sur environ 550 000 exemples structurés de questions-réponses tirés de 70 111 volumes CT provenant de CT-RATE, CancerVerse et d'une collection interne du NIH, puis ajusté avec GRPO par rapport à une récompense qui pondère le F1 de l'ensemble d'anomalies à 2,0, un score de structure de compte rendu spécifique à la région à 0,5 et une pénalité de longueur douce à 1,0. L'encodeur tridimensionnel est tout l'intérêt du modèle. Une interface frontale bidimensionnelle ou basée sur des coupes est un instrument différent, et la comparaison de l'article lui-même montre ce que vaut cette différence : MedGemma 1.5 à 0,303 de F1 lorsqu'on lui fournit jusqu'à 85 coupes axiales, contre 0,614 pour le modèle volumétrique natif.
L’erreur inverse est tout aussi courante et tout aussi coûteuse : supposer que, parce que NV-Reason-CT est spécialisé, vous devriez l’utiliser pour tout ce qui est clinique. Il ne prend en charge que le thorax et l’abdomen, rien d’autre, son invocation se fait par un fichier NIfTI et non par un message de chat, et ses conditions d’utilisation indiquent qu’il est réservé à la recherche et à l’enseignement. Il ne lira pas une lame de pathologie, ne répondra pas à une question sur une recommandation et n’écrira pas le code qui traite par lots votre conversion DICOM. Recourir à un modèle CT pour un travail de texte est la même erreur de catégorie que recourir à un modèle de texte pour faire de la volumétrie, simplement dans l’autre sens.

Comment les deux moitiés s’intègrent dans un seul système
Aucun des deux modèles ne remplace l’autre, et l’architecture judicieuse intègre les deux — ce qui soulève la question pratique de savoir comment les appeler.
Claude Opus 5 est servi via OrcaRouter sous anthropic/claude-opus-5 au tarif fournisseur listé d'Anthropic, sans marge, au sein d'une seule API couvrant plus de 200 modèles. Cela compte moins pour un appel unique que pour le pipeline qui l'entoure : lorsque la partie texte d'un build clinique est un modèle parmi plusieurs candidats, les avoir tous derrière une seule clé signifie que vous pouvez les comparer sur votre propre corpus sans second contrat ni modification de code, et le DSL de routage vous permet d'envoyer des requêtes individuelles au modèle qui devrait les traiter, tandis que le basculement automatique vous couvre lorsqu'un fournisseur se dégrade.
NV-Reason-CT n'est pas sur notre plateforme, et aucun modèle NVIDIA ne l'est. Ce sont des poids que vous téléchargez et exécutez sur votre propre matériel, ce que la licence vous autorise précisément à faire et qui, étant donné que l'entrée est constituée de données volumétriques issues de patients, est probablement ce que vous souhaitez de toute façon. Nous n'allons pas laisser entendre que nous acheminons un modèle que nous n'hébergeons pas. Le volet textuel de la solution est là où nous sommes utiles ; le volet volumétrique est là où vous êtes livré à vous-même avec un modèle de 4,69 B et un GPU.

Le verdict qui résiste à un examen minutieux
Si vous avez besoin de lire un volume TDM pour en tirer des conclusions structurées, il existe un modèle pour cela : il est issu du groupe de recherche de NVIDIA, et il s'agit d'un téléchargement plutôt que d'un appel API. Si vous avez besoin de normaliser un corpus de comptes rendus, d'écrire un harnais d'évaluation, de scripter une tâche de conversion DICOM ou de résumer une cohorte, il existe aussi un modèle pour cela, et il dispose d'une grille tarifaire.
La position à tenir est que rien ne démontre que l’un soit meilleur que l’autre en quoi que ce soit, car l’expérience n’a pas été menée. Ce qui a été démontré, c’est qu’une interface tridimensionnelle native surpasse une interface fondée sur des coupes sur un benchmark public de tomodensitométrie thoracique, avec une marge que les auteurs estiment à environ trois points F1, et qu’un modèle de frontière généraliste est, selon des mesures indépendantes, au sommet du domaine pour le raisonnement, le code et les tâches à long contexte. Ce sont deux affirmations portant sur deux tâches différentes. Les lire comme un classement relève de l’erreur de catégorie, et cela tient jusqu’à ce que quelqu’un publie la comparaison directe que personne n’a encore publiée.
