Une carte héro générée intitulée « NV-Reason-CT vs Claude Opus 5 » avec le sous-titre « Une erreur de catégorie à prendre au sérieux ». Deux cartes face à face sont séparées par une paire de flèches bleues : la carte de gauche est étiquetée « NV-Reason-CT » avec une icône de scan corporel et « 4,69 Md de paramètres - 13 824 jetons par volume TDM - pas un dispositif médical » ; la carte de droite est étiquetée « Claude Opus 5 » avec une icône de puce et « 1 M de contexte - 128 K de sortie - 5 $ / 25 $ par million de jetons ». Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

NV-Reason-CT vs Claude Opus 5 : une erreur de catégorie à prendre au sérieux

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Mettre NV-Reason-CT et Claude Opus 5 dans la même phrase est une erreur de catégorie, et cela vaut tout de même la peine d'être fait, car l'erreur est instructive. NV-Reason-CT est un modèle vision-langage 3D natif de 4,69 milliards de paramètres de NVIDIA qui prend un volume de scanner thoracique ou abdominal en unités Hounsfield et produit un compte rendu structuré, constat par constat. Ce n'est pas un dispositif médical, et sa propre fiche de modèle le dit. Claude Opus 5 est le modèle de texte et de vision généraliste de pointe de l'éditeur, publié le 24 juillet 2026, avec une fenêtre de contexte d'un million de jetons, un plafond de sortie de 128 000 jetons, et un tarif publié de cinq dollars par million de jetons d'entrée et de vingt-cinq par million de jetons de sortie. L'un lit un scanner. L'autre lit tout le reste.

La raison pour laquelle cette comparaison ne cesse d’être faite — et elle le sera, chaque fois que quelqu’un verra un nouveau VLM médical et s’emparera d’un repère familier — c’est que tous deux produisent de la prose à propos d’une image. Cette similitude de surface nuit réellement à la manière dont les gens raisonnent sur l’un et l’autre, il vaut donc la peine de la décortiquer en détail.

L’axe réel qu’ils partagent, et celui qu’ils ne partagent pas

Ils se chevauchent à exactement un endroit, et il est plus étroit qu'il n'y paraît.

• Modalité en — NV-Reason-CT reçoit des volumes NIfTI à un canal en unités Hounsfield via un processeur tridimensionnel dédié ; Claude Opus 5 reçoit du texte, des images et des fichiers, une interface de deuxième génération pour les images qui ne peut pas ingérer nativement une étude CT volumétrique

• Ce qui est renvoyé — une liste de constatations organisée par région anatomique issue de NV-Reason-CT, par opposition à de la prose générale, du JSON structuré ou des appels d'outils provenant de Claude Opus 5

• Unités de travail — un volume CT, rééchantillonné à 2 mm isotropes, recadré sur l'anatomie, découpé en patchs de 8 x 8 x 8 ; par rapport à ce que vous mettez dans un budget de tokens

• Contexte — NV-Reason-CT n'a aucune fenêtre de chat ; un seul volume devient 13 824 jetons visuels, sans sous-échantillonnage. Claude Opus 5 accepte 1 000 000 de jetons en entrée et en émet jusqu'à 128 000

• Licence — OpenMDW-1.1, un modèle téléchargeable que vous exécutez sur votre propre matériel ; par opposition à une API hébergée

• Usage déclaré — recherche et éducation uniquement, explicitement pas un dispositif médical, pour NV-Reason-CT ; contre une assistance à usage général pour Claude Opus 5

• Prix — aucun prix catalogue, car il n'y a rien à acheter, seulement des poids à exécuter ; face à 5 $ et 25 $ par million de jetons, avec les lectures en cache à 0,50 $

La ligne « modalité d'entrée » est là où naît l'erreur de catégorie. Les deux acceptent une image, donc tous deux ressemblent à des modèles d'image, et un lecteur se demande raisonnablement lequel est meilleur en matière d'images. Mais un examen CT n'est pas une image. C'est un tableau volumétrique avec une échelle physique en millimètres, une unité de densité calibrée, et une anatomie qui n'a de sens qu'en trois dimensions. La vision de Claude Opus 5 est véritablement capable et elle discutera avec pertinence d'une radiographie ou d'une lame de pathologie. C'est une tâche différente de celle qui consiste à intégrer un cube de 384 millimètres de valeurs Hounsfield à une résolution de 2 mm et à rendre compte de la lobulation d'un nodule.

Ce que mesurent réellement les chiffres de chaque côté

Les deux modèles présentent des résultats de référence qui ne se recoupent jamais, et les lire côte à côte sans s’en apercevoir, c’est ainsi que l’on prend de mauvaises décisions d’approvisionnement.

NV-Reason-CT rapporte ses résultats sur le benchmark public CT-RATE de tomodensitométrie thoracique, sur dix-huit libellés, en utilisant un seuil uniforme fixe et une invite directe oui/non, sans tête de classification ni adaptation spécifique à la tâche. Il affiche 0,614 de F1 et 0,871 d'AUROC, devant VoxelFM à 0,581 et 0,870, Pillar-0 à 0,544 et 0,861, ClinFusion-8B à 0,442 de F1, CT-CLIP à 0,398 et 0,733, Merlin à 0,358 et 0,662, et MedGemma 1.5 à 0,303 de F1 lorsqu'on lui fournit jusqu'à 85 coupes axiales. Il y a aussi un macro-F1 de 0,592 dérivé des comptes rendus. Chacun de ces chiffres provient du propre article de NVIDIA. Aucun n'a été reproduit par quelqu'un d'autre, et le modèle est téléchargeable depuis quelques semaines.

Le palmarès de Claude Opus 5 est de portée générale et largement indépendant. Artificial Analysis le mesure à 50,8 sur son Intelligence Index, 78 sur son Coding Index, 93,2 sur GPQA Diamond et 54,9 sur Humanity's Last Exam, avec un score de rappel en contexte long de 79,33. Ce sont des chiffres de tiers sur des tâches de raisonnement général, de code et de connaissances. Aucun benchmark d'imagerie clinique ne figure dans cet ensemble, et il n'y a nulle part de ligne CT-RATE dans le palmarès publié de Claude Opus 5.

Donc, l'affirmation honnête n'est pas que l'un est en avance. C'est que les deux modèles n'ont jamais été mesurés sur la même tâche par qui que ce soit. Toute phrase de la forme « NV-Reason-CT est meilleur que Claude Opus 5 en imagerie médicale » est infalsifiable telle qu'écrite, car personne n'a mené l'expérience. Le tableau comparatif de NVIDIA lui-même ne contient aucun modèle généraliste de pointe.

A generated scoreboard titled 'NV-Reason-CT vs Claude Opus 5 - what each number measures' with two columns. The left column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI volumes in Hounsfield units; output, structured findings by anatomical region; benchmark, CT-RATE 0.614 F1 and 0.871 AUROC over 18 labels; provenance, authors' own paper, unreproduced; licence, OpenMDW-1.1, self-hosted; use, research and education, not a medical device. The right column, headed 'Claude Opus 5', lists six rows: input, text, images, files; output, general prose, JSON, tool calls; benchmark, AA Intelligence 50.8, GPQA Diamond 93.2, HLE 54.9; provenance, independent, Artificial Analysis; licence, hosted API; use, general purpose. A footer reads 'The two benchmark sets share no task, so neither column can be subtracted from the other.'

Là où les gens se trompent sur la question de l’interface

Le seul recoupement technique vraiment intéressant est celui sur lequel personne ne se dispute : à quoi devrait ressembler une interface entre un modèle CT et un modèle de texte.

Un réflexe raisonnable consiste à soumettre à Claude Opus 5 un ensemble d’images TDM ou un volume sous-échantillonné et à lui demander de raisonner. Avec 1 000 000 de tokens de contexte, cela semble généreux, et face à un examen qui ne représente que 13 824 tokens visuels, cela ressemble à amplement de place. La place n’est pas le problème. Le pipeline de vision de Claude Opus 5 traite une image comme une image en deux dimensions dotée d’une échelle de pixels. Une TDM thoracique présentée ainsi perd l’espacement entre coupes qui rend une lésion mesurable et la calibration de densité qui fait du « verre dépoli » un seuil plutôt qu’une description. Vous pouvez lui soumettre un montage de coupes axiales et obtenir un paragraphe qui semble cohérent. Ce que vous ne pouvez pas obtenir, c’est une mesure.

C'est précisément ce sur quoi la conception de NV-Reason-CT dépense sa puissance de calcul. La grille 24 x 24 x 24 issue d'un volume de 384 millimètres est transmise au modèle de langage en pleine résolution, sans sous-échantillonnage spatial ni couche de fusion, ce qui explique pourquoi la voie active compte 4,35 B de paramètres plutôt que quelque chose de bien plus petit. L'architecture est un pari : conserver le détail spatial vaut le coût en tokens. C'est un pari sur la représentation, pas sur les capacités linguistiques, et Claude Opus 5 n'y participe pas.

Le schéma productif est celui qui est ennuyeux : utilisez le modèle CT pour la lecture volumétrique, et un modèle textuel pour tout ce qui l’entoure. Génération et normalisation de comptes rendus, synthèses de cohortes, harnais d’évaluation, conversion à grande échelle d’archives DICOM en NIfTI, tri des examens qu’un humain devrait examiner en premier. C’est du travail sur des documents longs et du code, et c’est là qu’un modèle à contexte de 1 M justifie son tarif.

Coût, en deux unités qui ne se convertissent pas

Claude Opus 5 est facturé à l'usage. Cinq dollars par million de jetons d'entrée et vingt-cinq par million de jetons de sortie, les lectures de cache à cinquante cents, les écritures de cache à dix dollars. Pour un pipeline qui normalise un corpus de rapports ou écrit et réécrit du code d'évaluation, cela produit une prévision que vous pouvez construire : jetons en entrée, jetons en sortie, lectures mises en cache, et une facture bien moins élevée si vous gérez correctement la mise en cache.

NV-Reason-CT n’a pas de prix. Vous téléchargez 4,69 milliards de paramètres et payez en électricité, en heures de GPU et en temps d’ingénierie. Il n’existe aucun chiffre de débit publié pour une étude complète de 13 824 tokens, et aucune variante quantifiée n’est proposée, de sorte que le coût par étude pour l’exécuter est un nombre que vous devez mesurer vous-même. C’est normal pour des poids de recherche, et c’est aussi la plus grande différence pratique entre les deux : l’un a une grille tarifaire, l’autre a une facture que vous ne pouvez pas voir avant de l’avoir déjà payée.

La comparaison qui compte vraiment se fait par examen, pas par jeton. Une lecture CT est une unité de travail. Une passe de normalisation de compte rendu sur le même cas est une tâche textuelle mesurée en milliers de jetons. Chiffrer la première en dollars suppose de connaître votre matériel ; chiffrer la seconde relève de l’arithmétique.

Le piège au milieu de la comparaison

Il y a une erreur précise qui mérite d’être nommée, car c’est celle que cette confrontation invite à commettre. C’est de traiter NV-Reason-CT comme un ajustement spécialisé d’un modèle général, et donc de supposer que le modèle général sera suffisamment proche dans la plupart des cas et bien plus flexible.

Ce n'est pas un fine-tuning. C'est un transformer de vision 3D appelé Primus, initialisé à partir de COLIPRI, greffé sur un socle linguistique Qwen3.5-4B avec un plongement positionnel rotatif multi-axes 3D, entraîné sur environ 550 000 exemples structurés de questions-réponses tirés de 70 111 volumes CT provenant de CT-RATE, CancerVerse et d'une collection interne du NIH, puis ajusté avec GRPO par rapport à une récompense qui pondère le F1 de l'ensemble d'anomalies à 2,0, un score de structure de compte rendu spécifique à la région à 0,5 et une pénalité de longueur douce à 1,0. L'encodeur tridimensionnel est tout l'intérêt du modèle. Une interface frontale bidimensionnelle ou basée sur des coupes est un instrument différent, et la comparaison de l'article lui-même montre ce que vaut cette différence : MedGemma 1.5 à 0,303 de F1 lorsqu'on lui fournit jusqu'à 85 coupes axiales, contre 0,614 pour le modèle volumétrique natif.

L’erreur inverse est tout aussi courante et tout aussi coûteuse : supposer que, parce que NV-Reason-CT est spécialisé, vous devriez l’utiliser pour tout ce qui est clinique. Il ne prend en charge que le thorax et l’abdomen, rien d’autre, son invocation se fait par un fichier NIfTI et non par un message de chat, et ses conditions d’utilisation indiquent qu’il est réservé à la recherche et à l’enseignement. Il ne lira pas une lame de pathologie, ne répondra pas à une question sur une recommandation et n’écrira pas le code qui traite par lots votre conversion DICOM. Recourir à un modèle CT pour un travail de texte est la même erreur de catégorie que recourir à un modèle de texte pour faire de la volumétrie, simplement dans l’autre sens.

A generated scoreboard titled 'The two models, at a glance' listing six paired rows. Row one: parameters, 4.69B total and 4.35B active, against undisclosed. Row two: context, 13,824 visual tokens per volume against 1,000,000 input and 128,000 output tokens. Row three: input, one-channel NIfTI in Hounsfield units against text, images and files. Row four: availability, weights downloadable on Hugging Face against hosted API. Row five: price, self-hosted with no rate card against $5 and $25 per million tokens. Row six: status, unannounced research release against generally available. A footer reads 'NV-Reason-CT figures per the authors paper and model card; Claude Opus 5 figures per the provider rate card and Artificial Analysis.'

Comment les deux moitiés s’intègrent dans un seul système

Aucun des deux modèles ne remplace l’autre, et l’architecture judicieuse intègre les deux — ce qui soulève la question pratique de savoir comment les appeler.

Claude Opus 5 est servi via OrcaRouter sous anthropic/claude-opus-5 au tarif fournisseur listé d'Anthropic, sans marge, au sein d'une seule API couvrant plus de 200 modèles. Cela compte moins pour un appel unique que pour le pipeline qui l'entoure : lorsque la partie texte d'un build clinique est un modèle parmi plusieurs candidats, les avoir tous derrière une seule clé signifie que vous pouvez les comparer sur votre propre corpus sans second contrat ni modification de code, et le DSL de routage vous permet d'envoyer des requêtes individuelles au modèle qui devrait les traiter, tandis que le basculement automatique vous couvre lorsqu'un fournisseur se dégrade.

NV-Reason-CT n'est pas sur notre plateforme, et aucun modèle NVIDIA ne l'est. Ce sont des poids que vous téléchargez et exécutez sur votre propre matériel, ce que la licence vous autorise précisément à faire et qui, étant donné que l'entrée est constituée de données volumétriques issues de patients, est probablement ce que vous souhaitez de toute façon. Nous n'allons pas laisser entendre que nous acheminons un modèle que nous n'hébergeons pas. Le volet textuel de la solution est là où nous sommes utiles ; le volet volumétrique est là où vous êtes livré à vous-même avec un modèle de 4,69 B et un GPU.

A screenshot of the OrcaRouter model page for Claude Opus 5, showing the identifier anthropic/claude-opus-5, the description of it as Anthropic's most capable model for complex reasoning and long-horizon agentic work, a side panel listing a 1,000,000-token context window and 128,000 maximum output tokens with text, image and file input and text output, and a stat strip reading $5.00 per million input tokens, $25.00 per million output tokens, and a p50 time to first token under four seconds.

Le verdict qui résiste à un examen minutieux

Si vous avez besoin de lire un volume TDM pour en tirer des conclusions structurées, il existe un modèle pour cela : il est issu du groupe de recherche de NVIDIA, et il s'agit d'un téléchargement plutôt que d'un appel API. Si vous avez besoin de normaliser un corpus de comptes rendus, d'écrire un harnais d'évaluation, de scripter une tâche de conversion DICOM ou de résumer une cohorte, il existe aussi un modèle pour cela, et il dispose d'une grille tarifaire.

La position à tenir est que rien ne démontre que l’un soit meilleur que l’autre en quoi que ce soit, car l’expérience n’a pas été menée. Ce qui a été démontré, c’est qu’une interface tridimensionnelle native surpasse une interface fondée sur des coupes sur un benchmark public de tomodensitométrie thoracique, avec une marge que les auteurs estiment à environ trois points F1, et qu’un modèle de frontière généraliste est, selon des mesures indépendantes, au sommet du domaine pour le raisonnement, le code et les tâches à long contexte. Ce sont deux affirmations portant sur deux tâches différentes. Les lire comme un classement relève de l’erreur de catégorie, et cela tient jusqu’à ce que quelqu’un publie la comparaison directe que personne n’a encore publiée.