Une carte hero générée intitulée « NV-Reason-CT vs Gemini 3.1 Pro » avec le sous-titre « La surface d'entrée la plus large, et toujours pas un lecteur de CT ». Deux cartes face à face sont séparées par une paire de flèches bleues : la carte de gauche porte l'étiquette « NV-Reason-CT » avec une icône de scan corporel et « thorax et abdomen uniquement - 13 824 tokens visuels par volume - OpenMDW-1.1 » ; la carte de droite porte l'étiquette « Gemini 3.1 Pro » avec une icône de puce et « audio, vidéo, image, fichier, texte en entrée - contexte de 1 M - niveau preview ». Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

NV-Reason-CT vs Gemini 3.1 Pro : la surface d’entrée la plus large, et toujours pas un lecteur CT

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Quatre-vingt-quatorze pour cent. C'est le taux d'erreur que notre propre catalogue enregistre actuellement pour une route desservant Gemini 3.1 Pro — 93,93 %, accompagné d'un temps médian jusqu'au premier token qui se lit comme un plafond de dix secondes et d'un débit de 978 tokens par seconde. Interprétez cela comme une affirmation sur le modèle et vous en tirerez exactement la mauvaise conclusion. Interprétez-le comme une affirmation sur un niveau d'aperçu sous charge et il devient l'élément le plus utile de la page, car c'est ce qu'un pipeline clinique éprouve réellement lorsqu'il dépend d'une route qui n'a pas été provisionnée pour le trafic de production.

Le modèle de l'autre côté de cette comparaison n'a ni ce problème ni cette mesure.NV-Reason-CT est le raisonneur CT 3D natif de NVIDIA à 4,69 milliards de paramètres, téléchargeable sous OpenMDW-1.1, sans aucun chiffre de débit publié et sans hébergement nulle part. Ainsi, un côté de cette confrontation vous offre la surface d'entrée la plus large du domaine, avec un profil de disponibilité autour duquel vous devez concevoir ; l'autre vous offre une capacité étroite, avec une latence que vous devez mesurer vous-même. Aucun des deux n'a de tableau de bord de supervision auquel vous pouvez faire confiance dès le premier jour, et ce pour des raisons opposées.

Deux modèles, deux définitions de « multimodal »

Le mot fait beaucoup de travail dans les deux descriptions de produit, et presque rien de tout ce travail n’est partagé.

• Entrées acceptées — Gemini 3.1 Pro accepte du texte, des images, de l'audio, de la vidéo et des fichiers ; NV-Reason-CT accepte un volume NIfTI monocanal en unités Hounsfield, et rien d'autre

• Ce que signifie « 3D » — NV-Reason-CT rééchantillonne à 2 mm isotropes sur un cube de 384 millimètres et le découpe en patchs de 8 x 8 x 8 pour une grille de 24 x 24 x 24 ; l’entrée vidéo de Gemini 3.1 Pro est une séquence d’images bidimensionnelles avec une chronologie

• Contexte — 1 048 576 tokens en entrée et 65 536 en sortie pour Gemini 3.1 Pro ; un volume représente 13 824 tokens visuels pour NV-Reason-CT, sans sous-échantillonnage ni couche de fusion, et aucune fenêtre de chat ne l'entoure

• Publication — 19 février 2026 pour Gemini 3 Pro, sur un slug d'aperçu ; une sortie de recherche non annoncée pour NV-Reason-CT, avec une activité du dépôt datée du 2 au 25 septembre 2026

• Prix — 2 $ et 12 $ par million de jetons jusqu’à 200 000 jetons, puis 4 $ et 18 $, avec les lectures de cache à 0,20 $ et les écritures de cache à 0,375 $ ; par rapport à des poids auto-hébergés sans grille tarifaire

• Capacités — vision, audio, utilisation d'outils, sortie JSON et raisonnement pour Gemini 3.1 Pro ; résultats structurés par région anatomique pour NV-Reason-CT, sans outils

• Licence et statut — une API de prévisualisation hébergée ; par rapport aux poids OpenMDW-1.1 dont la fiche du modèle indique qu'ils sont réservés à la recherche et à l'éducation et précise clairement qu'il ne s'agit pas d'un dispositif médical

Une entrée vidéo et une entrée CT volumétrique semblent voisines de loin et ne pourraient pas être plus éloignées de près. La vidéo, ce sont des images au fil du temps. Une étude CT est un volume statique unique avec trois axes spatiaux, une échelle physique en millimètres et une unité de densité calibrée, où ce que l'on mesure est la densité d'une structure dont la taille compte. Gemini 3.1 Pro regardera un enregistrement chirurgical et décrira ce qui s'est passé. Il ne mesurera pas un nodule. Ce n'est pas une limitation que Google a échoué à traiter ; c'est un problème différent que personne n'a résolu avec un modèle général.

Ce que couvrent les deux enregistrements de référence, et ce qu'ils laissent de côté

Gemini 3.1 Pro possède un bilan indépendant, et c’est un bon bilan sur les axes qu’il mesure.

• GPQA Diamond — 94,1, le chiffre le plus élevé de toute cette série d'articles

• Humanity's Last Exam — 47, avec un score de rappel en contexte long de 82, à nouveau le plus élevé de cette comparaison

• IFBench et SciCode — 77,14 et 58,7

• τ²-Bench — 95,61, avec tau_banking à 21,44 et Terminal-Bench Hard à 53,79

• Artificial Analysis Intelligence et codage — 29,7 et 68,8

• Latence mesurée — une médiane de dix secondes jusqu'au premier token, qui semble être un plafond plutôt qu'une véritable médiane, à 978 tokens par seconde et un taux d'erreur de 93,93 %

Remarquez la forme que cela dessine : un profil de connaissances et de contexte long en haut de la comparaison, un indice d'intelligence dans la zone médiane inférieure, et une mesure de disponibilité inutilisable. Les trois décrivent le même modèle sur la même route. Un GPQA Diamond élevé signifie qu'il sait énormément de choses. Un score composite de 29,7 signifie qu'il n'est pas en tête sur tout. Un taux d'erreur de 93,93 % signifie que, sur ce chemin particulier, la plupart de vos requêtes n'aboutiront pas — et c'est presque certainement un fait de capacité et de provisionnement concernant un point de terminaison preview plutôt qu'une propriété des poids. Nous ne pouvons pas prouver lequel depuis l'extérieur. Ce que nous pouvons dire, c'est qu'aucun de ces trois chiffres n'est une coquille et que toute architecture qui ne lit que le premier va passer une sale semaine.

Le bilan de NV-Reason-CT est plus restreint et s'accompagne d'une réserve différente. Ses scores F1 de 0,614 et AUROC de 0,871 sur CT-RATE, sur dix-huit étiquettes avec un seuil uniforme fixe et une invite directe de type oui/non, sans tête de classification ni adaptation spécifique à la tâche, sont les propres chiffres de NVIDIA issus de son propre article. L'ensemble de comparaison derrière eux — VoxelFM à 0,581, Pillar-0 à 0,544, ClinFusion-8B à 0,442, CT-CLIP à 0,398, Merlin à 0,358, MedGemma 1.5 à 0,303 — ne contient que des modèles d'imagerie. Aucun modèle multimodal généraliste n'apparaît, ce qui signifie que la question « comment Gemini 3.1 Pro se comporterait-il sur CT-RATE » n'a pas été posée, et encore moins résolue.

A generated scoreboard titled 'Breadth on one side, depth on the other' with two columns. The left column, headed 'Gemini 3.1 Pro', lists six rows: inputs, text, image, audio, video, file; context, 1,048,576 in and 65,536 out; GPQA Diamond 94.1; AA Intelligence 29.7; route reliability, 93.93% measured error rate; price, $2 and $12 per million tokens, doubling past 200k. The right column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI in Hounsfield units; context, 13,824 visual tokens per volume, no chat window; CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; route reliability, not applicable, self-hosted; price, no rate card, no published throughput. A footer reads 'The 93.93% error rate describes a preview route under load, not the quality of the weights.'

Le problème du palier preview, correctement énoncé

C'est la partie de la comparaison qui n'a rien à voir avec CT et qui a tout à voir avec la gestion de toute activité clinique.

Un taux d’erreur de 93,93 % n’est pas une dégradation subtile. C’est une route où l’écrasante majorité des appels échouent. La réaction naturelle est de déclarer le modèle inutilisable, et cette réaction est erronée pour deux raisons. Premièrement, un taux d’erreur mesuré sur un point de terminaison preview reflète la capacité, les quotas et le routage régional, et non l’aptitude du modèle. Les paliers preview de Google sont réputés être provisionnés pour l’évaluation plutôt que pour la production, et un slug nommé d’après un preview est un slug qui peut être limité en débit sans préavis. Deuxièmement, la mesure est un instantané d’un chemin à un instant donné. Elle changera. Ce qui ne changera pas, c’est la leçon : dépendre d’une route preview, c’est dépendre d’une décision de capacité prise par quelqu’un d’autre.

Les mitigations sont peu glamour et c'est précisément la raison pour laquelle le routage existe en tant que discipline plutôt qu'en tant que simple commodité.

• Ne jamais coder en dur un identifiant d'aperçu dans un chemin de production — placez la fonctionnalité derrière une interface afin que le modèle qui la sous-tend puisse être remplacé sans déploiement

• Réessayez et basculez vers un autre fournisseur ou un autre modèle — pour une tâche d'extraction par lots, un taux d'échec de 94 % est surmontable si les échecs sont redirigés ailleurs, et fatal s'ils ne le sont pas

• Mesurez votre propre taux d'erreur plutôt que d'en hériter un — le chiffre de 93,93 % est celui de notre catalogue pour un itinéraire donné, et le vôtre dépendra de votre région, de votre volume et de la forme de votre charge de travail

• Gardez un second modèle en veille pour tout ce qui relève d'un calendrier clinique — le mode de défaillance contre lequel vous vous protégez n'est pas une mauvaise réponse, c'est l'absence de réponse

La même discipline s'applique dans la direction opposée du côté CT, où il n'y a aucune route du tout. Un modèle auto-hébergé n'a pas de taux d'erreur de fournisseur ; il a un taux d'erreur matériel, une charge de maintenance et un plafond de capacité fixé par le nombre de GPU que vous avez achetés. Le mode de défaillance est une file d'attente, et l'atténuation est la planification plutôt que le basculement. Problème différent, même règle : sachez sur quel nombre vous vous appuyez réellement.

Là où un long contexte aide vraiment, et là où ce n'est pas le cas.

La fenêtre de 1 048 576 jetons de Gemini 3.1 Pro et son score de rappel de 82 points en contexte long sont de véritables atouts, qu'il vaut la peine d'exploiter délibérément plutôt que par accident.

Dans un programme de CT, ce n'est pas sur le scan qu'ils sont payants. C'est sur tout ce qui l'entoure. Une seule passe d'extraction sur un long compte rendu opératoire et les rapports qui lui sont associés, en gardant tout le document en contexte afin que les champs soient cohérents entre eux. Un résumé de cohorte qui doit contenir des centaines de récits de patients à la fois pour faire apparaître le schéma qui les traverse. Une tâche de conversion où le schéma, une centaine d'enregistrements d'exemple et le journal des erreurs doivent tous être visibles dans le même appel. Ce sont des tâches où une longue fenêtre change la réponse, pas seulement le confort.

Là où cela n'aide pas, c'est l'examen lui-même, et la raison mérite d'être énoncée avec précision, car c'est l'erreur que cette confrontation invite à commettre. Un scanner thoracique représenté comme NV-Reason-CT le représente coûte 13 824 tokens. Gemini 3.1 Pro pourrait contenir soixante-dix examens de ce type dans sa fenêtre, avec de la marge. La contrainte n'est pas l'espace. C'est que la voie vision de Gemini 3.1 Pro traite une image comme une photo dotée d'une échelle de pixels ; un examen présenté de cette façon a donc perdu l'espacement entre coupes et la calibration de densité avant même l'émission du premier token. On peut dépenser un million de tokens sur un volume et ne toujours pas avoir un volume. La comparaison de l'article lui-même rend ce coût concret : MedGemma 1.5 à 0,303 de F1 lorsqu'on lui fournit jusqu'à 85 coupes axiales, contre 0,614 pour le modèle volumétrique natif, soit un écart d'environ le double.

Où nous nous situons, et la seule chose que nous ne dirons pas

Gemini 3.1 Pro est servi via OrcaRouter en tant que google/gemini-3.1-pro-previewau tarif catalogue du fournisseur, sans aucune marge, au sein d'une API unique couvrant plus de 200 modèles. Pour un modèle actuellement en phase de préversion, cette combinaison est plus utile qu'elle n'en a l'air. L'absence de marge signifie qu'un changement de tarif du fournisseur se répercute de notre côté le jour même, plutôt que d'être absorbé par une couche intermédiaire qui conserve un ancien chiffre. Le basculement automatique en cas de défaillance signifie qu'une route qui commence à échouer n'entraîne pas tout un lot avec elle — ce qui, compte tenu d'un taux d'erreur mesuré dans les 90 % sur un chemin, n'a rien d'hypothétique. Et un DSL de routage permettant d'envoyer chaque requête au modèle qui devrait la traiter vous permet de confier le travail à long contexte à un modèle et le travail volumineux et peu coûteux à un autre, sans maintenir deux intégrations.

NV-Reason-CT n’est pas sur notre plateforme. Aucun modèle NVIDIA ne l’est. Il s’agit de poids que vous téléchargez et exécutez vous-même, et la formulation honnête est que les deux moitiés de cette architecture vivent dans des endroits entièrement différents : l’une derrière une API avec une grille tarifaire et un risque de préversion, l’autre sur votre propre matériel avec une licence OpenMDW-1.1 et un chiffre de débit que vous devez produire vous-même.

A generated scoreboard titled 'What each side gives you, and what it costs' listing five paired rows. Row one: widest input surface, audio, video, image and file against text only, one modality at a time. Row two: longest context, 1,048,576 tokens in against 13,824 tokens per volume. Row three: highest benchmark, GPQA Diamond 94.1 against CT-RATE F1 0.614. Row four: weakest measured figure, a 93.93% route error rate against no published throughput at all. Row five: dependency, a hosted preview tier against your own GPUs. A footer reads 'Both sides carry a number nobody should build on without measuring it themselves.'A screenshot of the OrcaRouter model page for Gemini 3.1 Pro, showing the identifier google/gemini-3.1-pro-preview with tags for Vision, Audio, Video, Tools, JSON and Reasoning, the description of it as a multimodal model accepting text, image, audio, video and file input, and a side panel listing a 1,048,576-token context window with up to 65,536 output tokens. A stat strip reads $2.00 per million input tokens, $12.00 per million output tokens, a median time to first token, and an error rate of 93.93 percent.

La décision qui survit au contact avec la production

Si votre problème est la compréhension de texte, d'audio, de vidéo ou de documents en contexte long, Gemini 3.1 Pro est mesuré indépendamment au sommet du domaine en matière de connaissances et de rappel, et la seule chose qui le sépare d'un pipeline de production est la fiabilité du routage — un problème d'ingénierie soluble, et non un problème de modèle. Placez-le derrière un mécanisme de basculement, ne codez pas en dur le slug d'aperçu, et mesurez votre propre taux d'erreur plutôt que de faire confiance à celui de quiconque, y compris le nôtre.

Si votre problème est un volume de tomodensitométrie thoracique ou abdominale, il existe exactement un modèle ouvert dans cette comparaison qui peut y répondre, ce n’est pas celui doté d’une fenêtre d’un million de tokens, et le nombre qui devrait guider votre planification n’est pas son score F1. C’est la latence par étude que personne n’a publiée. Mesurez-la avant de promettre à quiconque un chiffre de débit.

La comparaison vaut la peine d’être faite, car elle sépare deux choses que l’on confond constamment : l’étendue des entrées et la profondeur de la représentation. Gemini 3.1 Pro offre la surface d’entrée la plus large jamais livrée et le meilleur rappel de contexte long de cet ensemble, et il est toujours incapable de lire un examen CT comme un examen CT. NV-Reason-CT peut en lire un, et rien d’autre. Un pipeline a besoin des deux, a besoin qu’ils reposent sur des infrastructures différentes, et doit savoir lequel des deux chiffres de chaque côté est celui qui vous alertera à trois heures du matin.