
NV-Reason-CT vs Grok 4.6 : Qui lit le scanner, et qui lit le rapport ?
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 45 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 182 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Il existe deux façons d'intégrer une IA à un pipeline de tomodensitométrie, et une seule d'entre elles concerne l'image. NV-Reason-CT est la première : un modèle de vision-langage 3D de 4,69 milliards de paramètres qui lit directement les volumes NIfTI et a été publié sur Hugging Face le 8 septembre 2026, sans article de lancement de NVIDIA. Grok 4.6 est la seconde : un modèle texte et image de 500 000 jetons, sorti le 12 août 2026, coûtant 2,00 $ par million de jetons d'entrée, et particulièrement performant sur la partie du travail qui intervient une fois que quelqu'un a déjà consigné le résultat. Si on les met en comparaison, la question habituelle — lequel est le meilleur — s'avère mal posée. Ils ne sont pas en concurrence pour la même place dans le pipeline. Ils sont en concurrence pour la même ligne budgétaire.
Ce qui a réellement été livré de chaque côté
NV-Reason-CT est arrivé sous la forme d’un dépôt, d’un article et d’un Space de démonstration, pas d’un produit. Le dépôt GitHub sous NVIDIA-Medtech a été créé le 2 septembre 2026 ; les poids Hugging Face ont suivi le 8 septembre ; la prépublication arXiv, NV-Reason-CT : modèle de langage visuel 3D pour l’analyse de tomodensitogrammes, est parue le 23 septembre avec seize auteurs de NVIDIA, des NIH et de l’Université de Zurich. La salle de presse de NVIDIA n’en dit rien. La fiche du modèle décrit la version 0.1 et limite son utilisation à la recherche et à l’enseignement.
Grok 4.6 est le type de version opposé. Il s'agit d'un point de terminaison commercial de premier ordre, répertorié comme « Latest » dans la documentation destinée aux développeurs du fournisseur, dont le tarif figure sur une grille tarifaire publiée, et disponible en tant que modèle compatible avec OpenAI que les intégrations existantes adoptent en changeant une URL de base. Il a succédé à Grok 4.5 avec la même fenêtre de contexte, la même surface d'entrée et la même tarification de base.
Cette asymétrie dit tout de cette comparaison. L’un est un artefact de recherche qui se trouve être téléchargeable. L’autre est une infrastructure. Les lire l’un par rapport à l’autre permet de savoir où se situe actuellement la frontière entre « artefact de recherche » et « infrastructure » en imagerie médicale — et ce n’est pas là où on l’imaginerait.
La division du travail, en intrants et extrants
• Entrée volumétrique — NV-Reason-CT lit des volumes NIfTI .nii/.nii.gz en unités Hounsfield, thorax ou abdomen uniquement, contre Grok 4.6 qui lit du texte, des images et des fichiers, sans voie volumétrique • Traitement spatial — NV-Reason-CT convertit un volume de 384×384×384 mm en une grille de 24×24×24 de 13 824 tokens avec MRoPE 3D, sans sous-échantillonnage, contre Grok 4.6 qui traite une image comme une image 2D • Contexte — NV-Reason-CT : un volume est un préfixe fixe, pas de fenêtre de contexte au sens habituel, contre Grok 4.6 : 500 000 tokens • Sortie — NV-Reason-CT : rapport structuré, réponse ou trace de raisonnement avec réflexion désactivable, contre Grok 4.6 : texte avec sorties structurées et appels d’outils • Licence — NV-Reason-CT OpenMDW-1.1, poids BF16 de 10,6 Go, contre Grok 4.6 propriétaire, API uniquement • Prix — NV-Reason-CT : CAPEX GPU, aucun tarif par token, contre Grok 4.6 : 2,00 $ / 6,00 $ par million, doublé au-delà de 200 K en entrée

Ce duo se lit comme une passation naturelle. NV-Reason-CT produit le constat à partir du volume ; Grok 4.6 est le modèle auquel on confierait un millier de ces constats, dans une seule fenêtre de contexte, pour détecter des motifs au sein d’une cohorte. Personne n’a publié ce pipeline. C’est l’architecture évidente, et il vaut la peine de dire sans détour qu’elle n’a pas été testée.
Les chiffres de Grok 4.6, et à qui ils appartiennent
Deux chiffres concernant Grok 4.6 circulent ensemble et ils ne relèvent pas de la même catégorie. Le score de 94,9 à GPQA Diamond est mesuré par Artificial Analysis, et non déclaré par le fournisseur — ce qui est la plus fiable des deux catégories, précisément parce qu'un tiers l'a mesuré. Le score de 44 à l'Artificial Analysis Intelligence Index, sur la révision v4.3.2 de l'indice, place Grok 4.6 au 28e rang sur 211 dans sa catégorie. Artificial Analysis consigne également le modèle comme propriétaire : les poids ne sont pas accessibles au public.
Sur le même classement, AA mesure Terminal-Bench 2.1 à 88,4, SciCode à 56,5, Humanity's Last Exam à 42,9, 𝜏²-banking à 50,7 et le rappel en contexte long à 80,3. Ce sont des instruments de raisonnement général. Aucun d'entre eux ne peut être exécuté sur un volume TDM 3D, et ce n'est pas une critique envers Grok 4.6 — c'est une affirmation sur ce que mesure la suite de benchmarks.
Le côté CT a exactement une table, et c'est celle des auteurs
L'intégralité de la base de preuves publiques de NV-Reason-CT est constituée d'un seul tableau de classification sur les 18 labels de CT-RATE, à un seuil uniforme fixe, à l'aide d'une invite directe Oui/Non sans tête de classification. Il rapporte un Macro-F1 de 0,614 et un Macro-AUROC de 0,871, face à VoxelFM à 0,581/0,870, Pillar-0 à 0,544/0,861, ClinFusion-8B à 0,442, CT-CLIP à 0,398/0,733, Merlin à 0,358/0,662, et MedGemma 1.5 à 0,303.
Ces résultats sont rapportés par le fournisseur, issus de la fiche du modèle, et je les présente comme tels parce qu’aucun tiers indépendant ne les a encore reproduits. Deux choses méritent d’être remarquées dans le tableau. La marge de F1 par rapport à VoxelFM est de 0,033, ce qui constitue un écart réel sur 18 étiquettes avec un seuil fixe. La marge d’AUROC par rapport au même modèle est de 0,001, ce qui correspond à une égalité. Les deux chiffres apparaissent dans la même ligne du même tableau, et un seul d’entre eux porte une affirmation.
L'autre chose que le tableau vous indique concerne le cadrage propre à l'article. Les modèles de comparaison sont des systèmes de pré-entraînement contrastif 3D, un MLLM génératif fusionné 2D/3D, et un modèle de pointe basé sur des tranches. Les auteurs ont choisi de se comparer à des systèmes qui ingèrent des volumes, car la seule affirmation pertinente ici est qu'un modèle 3D génératif peut battre des modèles 3D discriminatifs en classification sans tête. Cela ne dit rien sur la façon dont NV-Reason-CT se compare à un modèle de pointe général en quoi que ce soit, car cette comparaison n'existe pas sur cet axe.

Où va l’argent, et pourquoi la limite entre les paliers est importante
La grille tarifaire de Grok 4.6 comporte un détail qui décide discrètement de beaucoup de choix d’architecture : les prompts dépassant 200 K jetons d’entrée sont facturés au double du tarif de base — 4,00 $ en entrée, 12,00 $ en sortie, le tarif de lecture du cache passant de 0,50 $ à 1,00 $. Une tâche de revue de cohorte qui accumule des constats dans un seul contexte long est exactement la charge de travail qui franchit cette limite. En dessous, le tarif de lecture du cache de 0,50 $ par million représente un quart du prix d’entrée, ce qui permet de faire tourner en boucle un grand préfixe fixe sur des milliers de rapports de manière abordable, et non simplement possible.
Via OrcaRouter, Grok 4.6 est servi au prix catalogue de ce fournisseur, sans aucune marge, de sorte que l'arithmétique des paliers ci-dessus est bien celle que vous payez réellement, et toute modification future de celle-ci se répercute sur votre facture le jour même plutôt qu'au prochain renouvellement. La raison de router une tâche comme celle-ci plutôt que de coder en dur un seul point de terminaison, c'est que la moitié « revue de cohorte » d'un pipeline clinique est précisément l'endroit où vous voudrez essayer trois modèles différents avant de vous fixer — et avec une seule clé compatible OpenAI et un basculement automatique entre fournisseurs, cette expérience ne coûte qu'un changement de nom de modèle.
La moitié CT du pipeline ne propose pas une telle option. NV-Reason-CT n’est pas hébergé sur OrcaRouter — c’est un checkpoint de 10,6 Go avec du code de modèle personnalisé que vous exécutez vous-même, sur des puces Ampere, Hopper ou Lovelace, avec trust_remote_code=True. Nous n’allons pas laisser entendre le contraire. Si vous construisez ce pipeline, vous achetez des GPU pour une moitié et des tokens pour l’autre, et le fait que les deux moitiés puissent au moins être gérées depuis une seule console est la seule affirmation d’intégration qui vaille la peine d’être faite.

Ce que vaut réellement un second lecteur
L’article NV-Reason-CT inclut une étude préliminaire menée par des radiologues experts qui fait état d’« évaluations de confiance favorables pour la relecture assistée par IA » et d’une réduction de 50 % du temps moyen déclaré d’interprétation et de compte rendu. Ce sont des chiffres solides, et ils s’accompagnent d’une réserve que l’article énonce lui-même : le caractère préliminaire, et la conception de l’étude propre aux auteurs. Il n’existe aucune réplication indépendante publiée, et une réduction de 50 % du temps dans une étude de lecture contrôlée est exactement le type de résultat qui s’amenuise lors d’une réplication. Cela mérite d’être suivi. Cela ne mérite pas d’être cité comme établi.
Lu à la lumière de cela, la contribution de Grok 4.6 à un flux de travail en radiologie ne relève pas du tout du diagnostic. Elle constitue la couche qui lit les comptes rendus — la file de triage, le courrier de suivi, le codage, le dossier d’autorisation préalable. Ce travail est du texte, il est à fort volume, il coûte peu à l’unité, et son mode de défaillance en cas d’erreur est administratif plutôt que clinique. C’est aussi là qu’une fenêtre de contexte de 500K et une lecture de cache à 0,50 $ méritent réellement leur place.
Le clivage sur lequel débouche cette comparaison est donc sans nuance : NV-Reason-CT a un véritable parcours 3D et n'a ni distribution, ni prix, ni vérification indépendante. Grok 4.6 a une distribution, un prix, une couverture de benchmark indépendante, et aucun parcours volumétrique du tout. Si vous avez besoin qu'on lise le scan, un seul d'entre eux peut le faire. Si vous avez besoin que la paperasse autour du scan soit gérée, seul l'autre est un produit.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
