Une carte hero générée intitulée « NV-Reason-CT vs Qwen3.8 Max » avec le sous-titre « Le modèle fine-tuné et la famille dont il est issu ». Trois puces s’alignent en bas : « Backbone : Qwen/Qwen3.5-4B », « 13 824 tokens vs 1 000 000 » et « 3,5 % vs 0,21 % d’erreur mesurée ». Le logo OrcaRouter est incrusté en bas à droite.
Guides & Insights

NV-Reason-CT vs Qwen3.8 Max : le fine-tune et la famille dont il est issu

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La première ligne de la carte de modèle NV-Reason-CT vous dit quelque chose que la plupart des gens survolent. Le modèle de base est Qwen/Qwen3.5-4B, répertorié dans les métadonnées du dépôt comme une relation de fine-tuning. Alors quand NVIDIA avait besoin d'un modèle de langue sur lequel greffer un Primus 3D vision transformer, il a pris un Qwe​n. Comparez ce checkpoint avec Qwen3.8 Max — le propre fleuron à 1 000 000 de tokens d'Aliba​ba, lancé le 3 août 2026 — et vous regardez un fine-tuning et l'entreprise familiale. L'un est un spécialiste de 4,69B qui lit des volumes CT thoraciques et abdominaux et a été publié sur Hugging Face le 8 septembre 2026 sans aucune annonce. L'autre est un fleuron généraliste avec des entrées texte, image et vidéo, une grille tarifaire publiée, et 37,2 millions de tokens de trafic mesuré sur notre réseau au cours de la dernière semaine. La question intéressante n'est pas de savoir qui gagne. C'est ce qu'un fine-tuning de 4B peut faire que le fleuron de sa famille ne peut pas, et pourquoi la réponse est plus spécifique que vous ne l'attendriez.

Ce que le fine-tuning a apporté, concrètement

La formulation par NVIDIA elle-même de cet écart est d’une précision inhabituelle, et c’est la phrase la plus utile du dépôt : la plupart des systèmes vision-langage « soit fonctionnent sur des images 2D, soit compressent les caractéristiques volumétriques avant le décodage linguistique ». Cela décrit toute une classe de modèles, et inclut chaque modèle phare multimodal généraliste du marché.

La solution est architecturale plutôt qu’une question d’échelle. Un volume d’entrée de 384 × 384 × 384 mm devient une grille de 24 × 24 × 24, soit 13 824 jetons visuels. Ces jetons et leurs coordonnées tridimensionnelles entrent dans le modèle de langage sans sous-échantillonnage spatial, et 3D MRoPE préserve les relations spatiales à l’intérieur du décodeur. Les volumes d’entrée sont recadrés en tenant compte de l’anatomie, vers le thorax ou l’abdomen, à l’aide des unités Hounsfield des poumons, puis rééchantillonnés à une résolution isotrope de 2 mm.

Lisez cela par rapport à ce que Qwen3.8 Max accepte. Texte, image et vidéo — et la vidéo est ce qui, dans cette série, se rapproche le plus d'une entrée volumétrique, ce qui en fait le point de comparaison honnête plutôt que rhétorique. Une vidéo est un empilement d'images 2D ordonnées dans le temps. Un volume CT est un empilement de coupes 2D ordonnées par position physique le long de l'axe z, en unités Hounsfield, avec un espacement millimétrique connu. Les deux sont des tableaux tridimensionnels. Un seul des deux possède un système de coordonnées physiques auquel on peut localiser l'observation d'un radiologue, et un seul des deux est mesuré dans une unité qui signifie quelque chose en dehors d'un capteur d'image. Un modèle entraîné sur de la vidéo apprend la continuité temporelle. Un modèle entraîné sur des volumes CT apprend qu'une masse dans une coupe est la même masse dans la coupe suivante, huit millimètres plus bas.

Le corpus d'entraînement est la vraie différence

C'est ici que les deux modèles cessent complètement d'être comparables, et c'est la partie qu'une fiche technique dissimule.

NV-Reason-CT a été entraîné de bout en bout par un fine-tuning supervisé suivi d'une optimisation de politique relative de groupe (GRPO) sur environ 550 000 exemples de questions-réponses structurés tirés de 70 111 volumes CT uniques. Les sources sont CT-RATE — 47 149 cas provenant de l'Istanbul Medipol University Mega Hospital avec des comptes rendus de radiologie appariés —, un ensemble interne du NIH de 15 991 cas, et les 22 720 cas de CancerVerse répartis sur quatre phases de contraste et treize types de tumeurs malignes. Le corpus comprend des comptes rendus standardisés, des questions-réponses centrées sur les anomalies, des dialogues à plusieurs tours et des raisonnements rédigés par des radiologues transcrits à partir d'interprétations expertes enregistrées. L'étape GRPO utilise des récompenses vérifiables sur des ensembles d'anomalies thoraciques et abdominales, ce qui signifie que le signal de récompense vérifie si une constatation énoncée est présente dans le volume plutôt que si la prose semble clinique.

Le corpus d'entraînement de Qwen3.8 Max n'est pas publié avec un tel niveau de détail, et cela n'aiderait pas s'il l'était, car la capacité visée est générale. Ses chiffres Artificial Analysis constituent plutôt les preuves pertinentes : un Intelligence Index de 45,4 le plaçant 15e sur 145 modèles dans l'instantané de notre API, AA Coding 76,2 au 9e rang, Terminal-Bench 2.1 à 88,8, GPQA Diamond 92,8, Humanity's Last Exam 43,1, SciCode 52,1 et un rappel en contexte long de 80,3. Ce sont des mesures tierces, et non des affirmations de fournisseur, ce qui en fait les chiffres les plus dignes de confiance des deux côtés de cette page.

Sortie de raisonnement, deux contrats différents

Les deux modèles émettent des traces de raisonnement et tous deux vous permettent de les désactiver. La similitude s’arrête à l’interface.

Qwen3.8 Max expose enable_thinking et reasoning_effort, ainsi que l’ensemble de la surface d’échantillonnage — température, top_p, seed, pénalités, sorties structurées, appel d’outils. C’est une capacité de raisonnement générale que vous dirigez vers ce que vous avez. Sa réflexion vaut ce que vaut le problème que vous lui confiez, et elle n’a aucun moyen de vérifier une affirmation autrement qu’à partir du texte qui lui a été fourni.

Le raisonnement de NV-Reason-CT a un contrat plus étroit avec le lecteur, et la fiche du modèle énonce explicitement la limite : le raisonnement généré est « une sortie de modèle examinable et ne garantit pas de représenter le calcul interne du modèle ». Cette mise en garde fait un vrai travail, et c’est le genre de phrase qui n’apparaît que lorsqu’une équipe a réfléchi à ce qu’un clinicien fera d’une trace d’apparence plausible. La fiche décrit la sortie comme des observations examinables, des diagnostics différentiels et de l’incertitude. Une trace que l’on peut vérifier par rapport au volume, autrement dit, plutôt qu’une trace que l’on ne peut que lire.

Débit, depuis le seul endroit où nous pouvons le mesurer

Qwen3.8 Max a fait transiter 37,2 millions de jetons via le playground propre à OrcaRouter au cours des sept derniers jours. Son temps médian jusqu'au premier jeton était de 1,96 secondes — de loin le plus rapide des modèles de cette série — avec 53,3 jetons de sortie par seconde. Son taux d'erreur sur cette période était de 3,5 %.

Ces deux chiffres tirent dans des directions opposées et tous deux comptent. La latence est excellente et rend le modèle agréable àitérer. Le taux d'erreur est environ dix-sept fois supérieur au 0,21 % de Kimi K3 sur la même fenêtre, et c'est ce chiffre qui décide si vous le placez derrière un appel synchrone exposé à l'utilisateur ou un traitement par lots avec reprises. Il s'agit d'un comportement mesuré sur notre réseau, et non d'un benchmark, et c'est le genre de chose qu'une grille tarifaire ne vous dit jamais.

NV-Reason-CT n'a pas de mesure équivalente nulle part. C'est un checkpoint BF16 de 10,6 Go avec du code de modèle personnalisé, chargé avec trust_remote_code=True sur du matériel Ampere, Hopper ou Lovelace, testé par NVIDIA sur H100 et L40S. Aucun p50, aucun taux d'erreur et aucun chiffre de débit publié. Quiconque vous dit à partir de quel volume de bascule l'auto-hébergement de ce modèle est plus rentable que le paiement par token ne fait que deviner.

Prix et forme, côte à côte

• Prix — capex GPU NV-Reason-CT, pas de tarif par token vs Qwen3.8 Max 2,00 $ / 6,00 $ par million de tokens, 0,25 $ en lecture cache, 2,50 $ en écriture cache

• Entrée — volumes TDM 3D NIfTI NV-Reason-CT en unités Hounsfield, thorax ou abdomen uniquement, contre Qwen3.8 Max texte, image et vidéo

• Contexte — NV-Reason-CT un volume, un préfixe fixe de 13 824 jetons contre 1 000 000 de jetons pour Qwen3.8 Max

• Paramètres — NV-Reason-CT 4.69B au total / 4.35B actifs dans la voie CT, contre Qwen3.8 Max non divulgué

• Licence — NV-Reason-CT OpenMDW-1.1, poids publiés contre Qwen3.8 Max propriétaire, accès API uniquement

• Scores indépendants — NV-Reason-CT aucun contre Qwen3.8 Max AA Intelligence Index 45,4, GPQA Diamond 92,8

A generated scoreboard titled 'NV-Reason-CT vs Qwen3.8 Max - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex, no per-token rate; Input 3D NIfTI CT, chest or abdomen; Context one volume, 13,824-token prefix; Parameters 4.69B total / 4.35B active; Licence OpenMDW-1.1, weights published; Independent score none published. Right column 'Qwen3.8 Max': Price $2.00 / $6.00, $0.25 cached read; Input text, image and video; Context 1,000,000 tokens; Parameters undisclosed; Licence proprietary, API only; Independent score AA Index 45.4, GPQA Diamond 92.8. A footer reads 'Qwen3.8 Max scores per Artificial Analysis; NV-Reason-CT figures are the authors' own, from the model card.'

L’économie du cache de Qwen3.8 Max récompense une forme précise : une lecture en cache à 0,25 $ face à une entrée fraîche à 2,00 $ représente une réduction d’un facteur huit, et l’écriture en cache à 2,50 $ signifie qu’un long préfixe réutilisable est vite rentabilisé. C’est la charge de travail que représentent une invite système et un document de protocole réutilisés sur des milliers de requêtes. NV-Reason-CT présente le profil de coûts inverse — un coût marginal quasi nul par scan une fois le GPU acheté, et un plancher incompressible d’un GPU conservé indéfiniment.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Gérer la famille ensemble

L’architecture naturelle ici — et il faut préciser que personne ne l’a publiée —, c’est le modèle affiné pour le volume et le modèle phare pour tout ce qui l’entoure. NV-Reason-CT produit l’observation structurée ; Qwen3.8 Max se charge du texte d’orientation, de l’appariement des protocoles, du codage, de la lettre de suivi — le travail textuel à gros volume où une fenêtre d’un million de tokens et une réduction de cache de huit fois méritent réellement leur place.

Si tel est votre pipeline, la moitié de celui-ci est un checkpoint que vous hébergez et l'autre moitié des tokens que vous achetez, et c'est dans cette seconde moitié qu'un routeur fait quelque chose qu'un point de terminaison d'un seul fournisseur ne peut pas faire. Qwen3.8 Max est servi via OrcaRouter au prix catalogue d'Aliba​ba, sans aucune marge, donc les 2,00 $ / 6,00 $ ci-dessus correspondent à ce que vous payez, et toute évolution future des prix apparaît sur votre facture le jour même plutôt qu'au renouvellement. Le basculement automatique entre fournisseurs compte plus que d'ordinaire lorsque le taux d'erreur mesuré du modèle lui-même est de 3,5 % — une nouvelle tentative dirigée vers un autre point de terminaison sain, c'est la différence entre un incident passager et un lot en échec. Et comme la moitié générale du pipeline n'est qu'un nom de modèle derrière un point de terminaison compatible OpenAI couvrant plus de 200 modèles, remplacer par autre chose le temps d'une expérience d'une semaine coûte un simple changement de chaîne, pas une intégration.

NV-Reason-CT, pour être clair, n’est pas sur OrcaRouter et ne le sera pas — c’est de l’inférence 3D en code personnalisé que vous exécutez vous-même. La version honnête de l’histoire de l’intégration, c’est que le spécialiste auto-hébergé et le généraliste routé peuvent se trouver sous une seule clé, et c’est là toute l’affirmation.

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the identifier qwen/qwen3.8-max, input text + image + video, output text, the Vision, Tools, JSON and Reasoning badges, a 1,000,000-token context window with a p50 time to first token of 1.96 seconds, the description of it as Alibaba's newest flagship positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $2.00 per million input tokens, $6.00 per million output tokens and 37.2M tokens of seven-day traffic.

Le verdict qui tient vraiment

Cette comparaison est classée dans la catégorie « lequel est le meilleur », et elle ne devrait pas l'être. Qwen3.8 Max est évalué par des tiers sur le raisonnement général et surpasse la majeure partie de la concurrence ; NV-Reason-CT dispose d'un seul tableau de ses propres chiffres sur un seul benchmark CT, et d'un nombre de paramètres de 4,69 B qui passerait inaperçu dans n'importe quelle comparaison générale. Sur n'importe quel benchmark général, le modèle phare l'emporte, et la raison en est que le benchmark général est ce pour quoi il a été conçu.

Sur la seule tâche pour laquelle NV-Reason-CT a été conçu — lire un volume TDM thoracique ou abdominal et dire ce qu'il contient, avec une trace que l'on peut vérifier — Qwen3.8 Max n'est pas un concurrent plus faible. Il n'a pas d'encodeur volumétrique, donc il ne peut pas du tout être exécuté sur l'entrée sans que quelqu'un décide d'abord comment aplatir un examen en images. C'est là que se perd l'information spatiale. C'est tout l'intérêt d'un fine-tuning 4B doté d'une voie 3D native et d'un préfixe fixe de 13 824 jetons, et c'est pourquoi ce qui est intéressant dans ce modèle, c'est la petitesse de son backbone plutôt que sa taille.