
NV-Reason-CT vs Kimi K3 : 210 téléchargements et 588 millions de tokens
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 45 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 182 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
L'un de ces modèles a été téléchargé 210 fois depuis Hugging Face. L'autre a fait transiter 588 millions de tokens par notre propre playground au cours des sept derniers jours. Les deux sont à poids ouverts, les deux sont téléchargeables dès maintenant, et l'écart entre ces deux chiffres est l'élément le plus utile de cette comparaison. NV-Reason-CT est le modèle de vision-langage 3D de NVIDIA à 4,69 milliards de paramètres pour la tomodensitométrie thoracique et abdominale, publié sur Hugging Face le 8 septembre 2026 sans aucune annonce. Kimi K3 est le modèle phare de MoonshotAI à 1 048 576 tokens, livré le 15 juillet 2026 et désormais l'un des modèles les plus sollicités de notre réseau. Tous deux sont « ouverts » au sens qui compte pour un formulaire d'achat. Mais ils ne le sont pas du tout de la même manière.
Deux sens de « you can download it »
Commencez par ce que chaque téléchargement dépose réellement sur votre disque, car c’est là que la plupart des comparaisons de modèles à poids ouverts perdent de leur rigueur.
NV-Reason-CT vous fournit model.safetensors d'environ 10,6 Go en BF16, plus un model.py et un substantiel processor.py — 26 Ko de code de traitement personnalisé qui met en œuvre le recadrage anatomique, le rééchantillonnage à 2 mm et le découpage en patchs 3D. Vous le chargez avec trust_remote_code=True, ce qui signifie que vous exécutez le code du dépôt NVIDIA dans votre processus. L'inférence nécessite CUDA PyTorch, et la fiche liste Ampere, Hopper et Lovelace, testés sur H100 et L40S. L'entrée est un volume NIfTI à la fois. Aucune prise en charge du traitement par lots n'est publiée, aucun chiffre de débit, et aucune configuration de service dans le dépôt au-delà d'un inference.py exemple.
Kimi K3 vous offre un modèle de raisonnement polyvalent doté d’une fenêtre de contexte de 1 048 576 tokens, d’une entrée texte et image, d’un appel d’outils natif, de sorties structurées et d’un effort de raisonnement configurable. C’est le modèle vers lequel vous vous tourneriez pour lire une centaine de recommandations cliniques en une seule requête, ou dix ans de rapports d’un service. Son score de rappel en contexte long d’Artificial Analysis est de 88,7 — le plus élevé des modèles de cette série et 8,4 points de plus que les 80,3 de Grok 4.6.
Pour le dire simplement : NV-Reason-CT est un checkpoint spécialisé avec une surface d’entrée étroite et du code personnalisé auquel vous devez faire confiance et que vous devez maintenir. Kimi K3 est un modèle généraliste avec une large surface d’entrée qui se comporte comme une infrastructure. Les deux sont téléchargeables. Un seul d’entre eux s’utilise tel quel.
Les preuves CT, dans leur intégralité, et elles sont courtes.
Tout ce qui est publiquement connu sur la qualité de NV-Reason-CT repose sur un seul tableau de sa propre fiche de modèle : la tâche de classification à 18 libellés de CT-RATE à un seuil uniforme fixe, avec une invite directe de type Oui/Non, sans tête de classification, sans adaptation spécifique à la tâche. Macro-F1 0,614, Macro-AUROC 0,871.
Les lignes de comparaison sont VoxelFM à 0,581/0,870, Pillar-0 à 0,544/0,861, ClinFusion-8B à 0,442, CT-CLIP à 0,398/0,733, Merlin à 0,358/0,662 et MedGemma 1.5 à 0,303. Chacun de ces chiffres est un résultat rapporté par le fournisseur, issu de la fiche de NVIDIA, et aucun n'a encore été reproduit de manière indépendante — l'article n'a que deux jours.
Ce que le tableau établit est limité et mérite d’être énoncé précisément : un modèle génératif 3D sans tête spécifique à la tâche surpasse les modèles de référence de préentraînement contrastif 3D et un modèle de pointe fondé sur des coupes en classification CT à 18 étiquettes. Ce qu’il n’établit pas, c’est quoi que ce soit sur le raisonnement général, quoi que ce soit sur des modalités autres que la tomodensitométrie thoracique et abdominale, et quoi que ce soit sur l’avantage en AUROC — 0,871 contre 0,870, c’est une égalité déguisée en décimale.
Les chiffres de Kimi K3, et la réserve concernant le tableau des modèles à poids ouverts
Artificial Analysis mesure Kimi K3 à un Intelligence Index de 43,6, ce qui le place au 19e rang sur 145 modèles de ce classement dans l'instantané du classement de notre API de modèles. Son score GPQA Diamond est de 93,5, Humanity's Last Exam 46,9, SciCode 59,5, Terminal-Bench 2.1 85,0, AA Coding 76,2 au 9e rang, et 𝜏²-banking 46,0.
Une affirmation de classement mérite de la prudence, car il est facile de se tromper et on s’est déjà trompé auparavant. L’indice d’intelligence AA de Kimi K3, de 44, se place troisième parmi les modèles à poids ouverts du tableau des poids ouverts, derrière MiMo-V2.6-Pro à 46 et GLM-5.3 à 45. Il n’est pas le leader de ce tableau, et il ne concourt pas dans le même tableau que Grok 4.6 — Artificial Analysis classe Grok 4.6 comme propriétaire, donc son 44 appartient au classement général, pas à celui des poids ouverts. Les deux indices semblent identiques et ne le sont pas.
Ce que l'opérateur voit réellement
C'est de là que vient le chiffre de 588 millions, et cela vaut la peine de le préciser, car c'est le seul élément de preuve dans cet article qui soit le nôtre plutôt que celui du marketing de qui que ce soit.
Au cours des sept derniers jours, Kimi K3 a fait transiter 587,8 millions de tokens dans le playground d'OrcaRouter. Son temps médian avant le premier token était de 7,8 secondes, il produisait 42,9 tokens de sortie par seconde, et son taux d'erreur sur cette période était de 0,21 % — un échec sur environ 480 requêtes. Ce taux d'erreur mesuré est ce que vous ne pouvez pas obtenir à partir d'une fiche modèle, et c'est le chiffre qui détermine si un modèle peut être utilisé sans risque derrière une tâche par lots.
Pour NV-Reason-CT, il n'y a pas d'équivalent, car il n'est hébergé nulle part en tant que point de terminaison — c'est un checkpoint que vous exécutez vous-même. Il n'y a pas de p50, pas de taux d'erreur, pas de disponibilité, et personne vers qui basculer. Ce n'est pas une critique ; c'est un fait structurel de l'auto-hébergement, et c'est la raison pour laquelle un groupe de recherche peut adopter NV-Reason-CT un mardi, tandis qu'une équipe de production ne le peut généralement pas.
Si vous exploitez les deux moitiés de cet ensemble — Kimi K3 comme couche générale hébergée et NV-Reason-CT sur votre propre machine GPU —, c'est du côté du routage que la moitié hébergée tire sa résilience. Kimi K3 est servi au prix catalogue de Moonshot lui-même, soit 3,00 $ par million de jetons d'entrée et 15,00 $ par million de jetons de sortie sans marge, son tarif de lecture du cache de 0,30 $ par million correspond à un dixième de celui des entrées, et comme le prix est répercuté sans modification, une baisse du fournisseur se répercute sur votre facture le jour même. Le basculement automatique entre fournisseurs est ce qui maintient une tâche par lots en vie lorsqu'un point de terminaison amont vacille — et avec un taux d'erreur de 0,21 %, les vacillements sont assez rares pour qu'on les oublie facilement jusqu'à ce qu'ils ne le soient plus.
Les formes de coût ne se ressemblent pas entre elles.
• Prix — capex GPU NV-Reason-CT plus votre propre stack de service par rapport à Kimi K3 : 3,00 $ / 15,00 $ par million, 0,30 $ la lecture en cache
• Dépense minimale viable — NV-Reason-CT : un GPU Ampere ou plus récent détenu indéfiniment, contre Kimi K3 : une requête
• Contexte — NV-Reason-CT un volume unique, 13 824 jetons fixes contre Kimi K3 1 048 576 jetons
• Coût marginal de la millième requête — NV-Reason-CT pratiquement nul une fois le GPU payé, contre Kimi K3 linéaire en tokens
• Là où ça casse en premier — débit non vérifié de NV-Reason-CT et absence de stratégie de batching face au coût du contexte long de Kimi K3 à 1 M de tokens par requête
• Modalités — NV-Reason-CT 3D NIfTI, thorax ou abdomen vs Kimi K3 texte et image, n'importe quoi

L’économie s’inverse selon le volume. Kimi K3 ne coûte rien au démarrage et évolue linéairement. NV-Reason-CT coûte un GPU au démarrage, puis évolue de façon presque constante — c’est pourquoi 210 téléchargements ne sont pas un signal d’échec. C’est le nombre correct pour un checkpoint dont le public est constitué d’institutions qui possèdent déjà le matériel, et qui n’apparaîtront jamais dans une statistique de débit de tokens.

Lequel choisissez-vous réellement
Si la tâche consiste à lire un volume CT et à produire une observation structurée avec une trace de raisonnement, Kimi K3 ne peut pas le faire, et NV-Reason-CT le peut. Non pas « il le fait moins bien » — il ne le peut pas, parce qu’il n’existe, nulle part dans son architecture, d’encodeur volumétrique, et que le fait d’aplatir un examen en images élimine d’emblée les relations spatiales que la voie 3D a précisément pour but de préserver.
Si le travail consiste à lire 400 pages de notes de recommandation, à les comparer à un document de protocole et à générer une sortie structurée, NV-Reason-CT n'entre pas dans la conversation et Kimi K3 est l'une des meilleures solutions disponibles, avec un taux d'erreur mesuré inférieur à un quart de pour cent sur notre réseau.

La véritable décision ne se situe pas entre les deux. Elle consiste à savoir si votre problème est un problème de volume ou un problème de texte, et l’écart entre 210 et 588 millions n’est que ce à quoi cette distinction ressemble de l’extérieur. Un modèle est un article accompagné de poids. L’autre est un élément d’infrastructure. Les deux valent la peine d’être possédés ; ni l’un ni l’autre ne remplace l’autre.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
