Une carte hero générée intitulée « NV-Reason-CT vs DeepSeek V4 Pro », avec le sous-titre « Le coût de la lecture d'un scan, et quand lancer le lot ». Deux cartes se faisant face sont séparées par une paire de flèches bleues : la carte de gauche est intitulée « NV-Reason-CT » avec une icône de scan corporel et « un volume TDM - 13 824 tokens visuels - aucun débit publié » ; la carte de droite est intitulée « DeepSeek V4 Pro » avec une icône de puce et « 1,6 T au total / 49 B actifs MoE - contexte de 1 M - 0,66 $ / 1,98 $ par M, doublés dans deux fenêtres UTC ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

NV-Reason-CT vs DeepSeek V4 Pro : le coût de la lecture d'un scan, et quand exécuter le lot

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Voici un fait opérationnel qui façonne plus de budgets de pipelines cliniques que n'importe quel benchmark : DeepSeek V4 Pro coûte 0,66 $ par million de tokens d'entrée et 1,98 $ par million de tokens de sortie, et ces tarifs doublent pendant deux fenêtres chaque jour, de 01:00 à 04:00 et de 06:00 à 10:00 UTC. Les traitements par lots exécutés en dehors de ces fenêtres coûtent moitié moins que ceux exécutés à l'intérieur. Pendant ce temps, NV-Reason-CT, le raisonneur 3D CT de NVIDIA à 4,69 milliards de paramètres, n'a pas du tout de grille tarifaire — c'est un ensemble de poids que vous téléchargez et exécutez, sans chiffre de débit publié pour une seule étude de 13 824 tokens. L'un de ces modèles, vous le planifiez. L'autre, vous devez le mesurer avant de pouvoir le budgéter.

Cette asymétrie est la bonne entrée en matière pour cette comparaison, car les deux modèles occupent des extrémités opposées du pipeline et échouent financièrement de manières opposées. NV-Reason-CT est un instrument à coût fixe : une fois le matériel acheté, l'étude marginale est presque gratuite, mais la décision matérielle est lourde et la latence par étude n'est pas documentée. DeepSeek V4 Pro est un moteur à coût variable : rien à acheter, tout est mesuré, et le compteur suit un barème que l'on peut lire directement sur le calendrier.

Ce qu’est chacun, en une ligne chacun

• Tâche — NV-Reason-CT lit un volume de TDM thoracique ou abdominal et émet des résultats structurés ; DeepSeek V4 Pro lit et écrit du texte

• Architecture — un transformeur de vision 3D appelé Primus, initialisé à partir de COLIPRI, avec un socle linguistique Qwen3.5-4B et un encodage positionnel rotatif multi-axes 3D, à 4,69 milliards de paramètres dont 4,35 milliards sont actifs ; face à un mélange d'experts de 1 600 milliards de paramètres avec 49 milliards d'actifs par token

• Entrée — volumes NIfTI monocanal (.nii, .nii.gz) en unités Hounsfield, orientés LPS, rééchantillonnés à 2 mm isotropes et recadrés sur l'anatomie ; par rapport au texte

• Contexte — un seul volume devient 13 824 tokens visuels dans une grille 24 x 24 x 24, sans sous-échantillonnage spatial ni couche de fusion ; contre 1 048 576 tokens en entrée et 384 000 en sortie

• Anatomies prises en charge — thorax et abdomen, et rien d’autre ; par opposition à tout ce que le texte peut décrire

• Prix — aucun prix catalogue, auto-hébergé, aucun débit publié par étude ; face à 0,66 $ / 1,98 $ par million de jetons, doublant dans les deux fenêtres UTC nommées ci-dessus, avec des lectures de cache à 0,022 $

• Latence mesurée — non publiée ; face à une médiane de 3 483 millisecondes avant le premier token, à 96,01 tokens de sortie par seconde, avec un taux d'erreur de 0,75 %

Deux lignes y méritent plus d’une ligne chacune. La ligne de contexte est l’évidence — un million de tokens contre 13 824 —, mais les unités ne sont pas comparables et c’est une erreur de les interpréter comme un écart de capacité, dans un sens ou dans l’autre. 13 824 tokens, c’est ce qu’il faut pour représenter fidèlement une étude CT. Un million de tokens, c’est la quantité de texte environnant que l’on peut conserver. Le premier nombre concerne la résolution ; le second concerne la mémoire.

La ligne de latence est celle que l’on saute. Les 3,48 secondes de médiane jusqu’au premier token et les 96 tokens par seconde de DeepSeek V4 Pro sont des chiffres mesurés et publiés, et ils permettent de dimensionner un travail textuel sur le papier. L’absence de toute donnée équivalente pour NV-Reason-CT n’est pas une critique du modèle ; c’est la raison pour laquelle un pipeline CT ne peut pas être chiffré avant que quelqu’un ne l’exécute. Un modèle de 4,69 B sur 13 824 tokens visuels n’est pas un petit calcul, et tant que vous ne l’avez pas chronométré sur votre propre matériel, vous devinez.

Lire les deux enregistrements de référence sans se leurrer

Le record de DeepSeek V4 Pro est un mélange de mesure indépendante et de déclaration du fournisseur, et ce mélange est instructif car il contient un chiffre qui semble alarmant et ne l’est pas.

• Artificial Analysis Intelligence Index — 36, ce qui le place au 72,4e percentile des modèles mesurés

• GPQA Diamond — 92,8, ce qui le place près du sommet du domaine

• Humanity's Last Exam — 41, et 41 sur MMLU-Pro, 62,51 sur l’indice de maths

• τ²-Bench — 96,20, avec IFBench à 76,46 et tau_banking à 39,59

• Rappel à long contexte — 80.33

• SciCode et Terminal-Bench — 51 et 78,65 sur la deuxième version de Terminal-Bench

Un indice composite de 36 à côté d’un GPQA Diamond de 92,8 ressemble à une contradiction jusqu’à ce que l’on comprenne ce qu’est un indice. C’est un agrégat de nombreuses évaluations, et un modèle qui excelle dans une poignée d’entre elles tout en étant simplement correct dans d’autres se classera au milieu du peloton sur la somme tout en dominant des classements individuels. Quiconque cite le 36 seul pour soutenir que DeepSeek V4 Pro est de milieu de gamme cite une moyenne comme s’il s’agissait d’un maximum. Quiconque cite le 92,8 seul pour soutenir qu’il domine le domaine cite un maximum comme s’il s’agissait d’une moyenne. Les deux chiffres proviennent d’Artificial Analysis, et les deux sont vrais.

Le bilan de NV-Reason-CT ne présente aucun mélange de ce type, et c’est là le problème, en toute honnêteté. Ses chiffres CT-RATE — 0,614 F1 et 0,871 AUROC sur dix-huit étiquettes, avec un seuil uniforme fixe et une invite directe oui/non, sans tête de classification ni adaptation spécifique à la tâche — proviennent de l’article de NVIDIA lui-même et de nulle part ailleurs. L’ensemble de comparaison de cet article (VoxelFM à 0,581, Pillar-0 à 0,544, ClinFusion-8B à 0,442, CT-CLIP à 0,398, Merlin à 0,358, MedGemma 1.5 à 0,303) est entièrement constitué d’autres modèles d’imagerie. Pas un seul modèle de texte général n’y figure, et aucun tiers n’a reproduit le moindre de ces chiffres.

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

La question de la planification, traitée en profondeur

La tarification en fonction du temps sur DeepSeek V4 Pro est l'élément le plus exploitable sur le plan opérationnel de l'un ou l'autre modèle, elle mérite donc une démonstration concrète.

Une charge de travail textuelle réaliste pour un programme de TC n'a rien de glamour. Il s'agit d'extraire des champs structurés d'un corpus de rapports historiques afin de disposer d'étiquettes pour l'entraînement, de convertir à grande échelle des arborescences de répertoires DICOM en NIfTI, d'écrire et de réécrire le harnais d'évaluation, de normaliser les unités et la terminologie sur quatre jeux de données, et de résumer des cohortes. Comptons cent millions de jetons en entrée et dix millions de jetons en sortie pour un programme de taille moyenne, un chiffre volontairement rond qui signifie « beaucoup de travail textuel ».

• Dans une fenêtre doublée — 1,32 $ et 3,96 $ par million, donc 132 $ plus 39,60 $ sur ces volumes

• En dehors de ces plages — 0,66 $ et 1,98 $ par million, soit 66 $ plus 19,80 $

• La différence — environ 86 $, soit 49 % de la facture en heures creuses, pour déplacer une tâche qui peut, par nature, être traitée par lots

• Lectures en cache — 0,022 $ par million, soit un soixantième du tarif d’entrée, donc tout préfixe de prompt que vous réutilisez dans le corpus est presque gratuit

Ce n'est pas une erreur d'arrondi, et c'est disponible parce que le travail est asynchrone. L'extraction des comptes rendus n'a pas besoin d'avoir lieu à 14 h 00. Rien dans une tâche de conversion DICOM ne se soucie de l'heure qu'il est. La structure tarifaire est une invitation directe à planifier, et un pipeline qui l'ignore paie une prime de 49 % pour le privilège de s'exécuter quand bon lui semble. Les lectures de cache comptent pour la même raison : un prompt système partagé ou un schéma d'extraction fixe, réutilisé sur des milliers de comptes rendus, revient à un soixantième du tarif d'entrée.

NV-Reason-CT n'a pas de levier équivalent, car il n'a pas de compteur. Le coût de lecture d'un scan correspond à ce que votre GPU coûte par heure divisé par le nombre de scans par heure que vous pouvez lui faire traiter, et c'est ce second chiffre que personne n'a publié. Si une seule étude prend deux secondes, un seul L40S gère confortablement un vaste programme. Si elle en prend vingt, l'arithmétique matérielle change complètement. NVIDIA a testé sur H100 et L40S, ce qui vous indique la catégorie de carte, pas le débit.

Le piège de supposer qu’on peut les remplacer

L'erreur que ce rapprochement invite à commettre est plus subtile que l'erreur de catégorie habituelle, car il en existe une version qui paraît raisonnable sur une diapositive.

DeepSeek V4 Pro dispose de 1 048 576 jetons et en émet jusqu’à 384 000. Un volume CT ne représente, selon l’estimation du modèle qui le lit correctement, que 13 824 jetons. Ainsi, un modèle de texte doté d’une fenêtre d’un million de jetons a de la place pour soixante-dix et quelques études CT à ce nombre de jetons. L’arithmétique est correcte et la conclusion — selon laquelle on pourrait fournir des données CT à un modèle de texte et s’épargner l’infrastructure d’imagerie — est fausse, et ce pour la raison même pour laquelle le chiffre de 13 824 existe au départ.

Ce nombre n’est pas un résumé compressé d’un scan. C’est le scan, à une résolution isotrope de 2 mm sur un cube de 384 millimètres, découpé en 8 x 8 x 8 patchs, remis au modèle de langage sans sous-échantillonnage spatial et sans couche de fusion. Le nombre de tokens est élevé précisément parce que rien n’a été jeté : l’espacement entre les coupes qui rend un nodule mesurable, les valeurs de densité qui font d’une texture un seuil plutôt qu’un adjectif. Un modèle de texte ne peut pas ingérer ces tokens sous forme de volumes, pas plus qu’un document ne peut le faire. Il a le budget. Il n’a pas l’interface.

La comparaison interne de l'article chiffre elle-même la différence. MedGemma 1.5, disposant de jusqu'à 85 coupes axiales — le mieux qu'un front-end bidimensionnel ou empilant des coupes puisse raisonnablement faire — obtient un score F1 de 0,303 contre 0,614 pour le modèle volumétrique natif. Cet écart représente la valeur de l'encodeur tridimensionnel, et aucune fenêtre de contexte, quelle que soit sa taille, ne le comble.

La substitution inverse échoue pour des raisons plus simples. NV-Reason-CT prend en charge le thorax et l’abdomen, accepte un fichier NIfTI plutôt qu’un prompt, n’a pas d’utilisation d’outils, et sa fiche de modèle le limite à la recherche et à l’éducation et indique qu’il ne s’agit pas d’un dispositif médical et que les sorties peuvent être incorrectes. Il ne peut pas extraire de champs d’un rapport, et il ne peut pas écrire le script qui construit votre corpus.

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

Là où nous nous situons, et là où nous ne le faisons délibérément pas

DeepSeek V4 Pro est servi via OrcaRouter en tant que deepseek/deepseek-v4-pro, au tarif catalogue du fournisseur, sans marge, au sein d'une API unique couvrant plus de 200 modèles. La répercussion compte plus que d'habitude pour un modèle à tarification horaire : lorsqu'un fournisseur modifie un tarif ou une plage horaire, le tarif de notre côté change le jour même, car aucune couche de marge intermédiaire ne retient un ancien montant. Le basculement automatique couvre le cas où un fournisseur se dégrade en cours de lot, ce qui, pour une longue tâche d'extraction sans surveillance, est le mode de défaillance qui vous coûte réellement une nuit, et le DSL de routage vous permet d'envoyer des requêtes individuelles au modèle qui devrait les traiter plutôt que de tout faire transiter par un seul point de terminaison.

NV-Reason-CT n'est pas sur notre plateforme. Aucun modèle NVIDIA non plus. Le volet CT de cette architecture repose sur votre propre matériel avec vos propres poids téléchargés, et nous n'allons pas écrire une phrase qui laisse un lecteur penser le contraire. Étant donné que l'entrée est constituée de données volumétriques issues de patients et que la licence est OpenMDW-1.1, sans aucun service hébergé associé, l'exécution locale est de toute façon l'endroit qui convient à ce modèle.

Ce que le couplage vous dit vraiment

Les deux modèles ne sont pas en concurrence, et l'intérêt de les comparer réside dans le fait qu'ils échouent différemment. NV-Reason-CT vous offre une capacité qu'aucun autre modèle ouvert ne propose — le raisonnement CT tridimensionnel natif à la résolution complète de l'examen — et vous demande d'accepter un coût par examen non budgété, un débit non publié et une licence qui interdit le déploiement clinique. DeepSeek V4 Pro vous offre un moteur à l'usage avec une latence publiée, un taux d'erreur publié, des mesures indépendantes et un prix que vous pouvez diviser par deux en regardant l'heure, et il ne peut pas voir le moindre scan.

Si vous construisez la chose plutôt que de l'acheter, la forme qui survit au contact est la plus banale. Exécutez la lecture CT en local, budgétez-la en mesurant plutôt qu'en citant un chiffre, et mettez tout ce qui est textuel autour d'elle en rendez-vous avec la fenêtre des heures creuses. Le seul planning que personne ne devrait copier est celui qui exécute cent millions de jetons d'extraction à 02:00 UTC parce que c'est le moment où le lot s'est trouvé prêt.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.