
NV-Reason-CT vs Kimi K3: 210 downloads en 588 miljoen tokens
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 45 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 182 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Een van deze modellen is 210 keer gedownload van Hugging Face. Het andere verwerkte in de afgelopen zeven dagen 588 miljoen tokens via onze eigen playground. Beide zijn open weights, beide zijn nu downloadbaar, en het gat tussen die twee getallen is het meest bruikbare in deze vergelijking. NV-Reason-CT is het 3D-visie-taalmodel van NVIDIA met 4,69 miljard parameters voor CT van de borstkas en de buik, dat op 8 september 2026 zonder aankondiging op Hugging Face is gepubliceerd. Kimi K3 is het 1.048.576-token vlaggenschip van MoonshotAI, uitgebracht op 15 juli 2026 en nu een van de drukste modellen op ons netwerk. Ze zijn beide "open" in de zin die van belang is voor een inkoopformulier. Ze zijn helemaal niet op dezelfde manier open.
Twee betekenissen van "je kunt het downloaden"
Begin met wat elke download daadwerkelijk op je schijf zet, want dit is waar de meeste vergelijkingen tussen open-weightsmodellen vaag worden.
NV-Reason-CT geeft je model.safetensors van ongeveer 10,6 GB in BF16, plus een model.py en een substantiële processor.py — 26 KB aan aangepaste verwerkingscode die de anatomisch bewuste cropping, de 2 mm-resampling en de 3D-patchificatie implementeert. Je laadt het met trust_remote_code=True, wat betekent dat je NVIDIA's repositorycode binnen je eigen proces uitvoert. Inferentie vereist CUDA PyTorch, en de kaart vermeldt Ampere, Hopper en Lovelace, getest op H100 en L40S. De invoer is één NIfTI-volume per keer. Er is geen batchingverhaal gepubliceerd, geen doorvoercijfer, en geen serveconfiguratie in de repository buiten een inference.py-voorbeeld.
Kimi K3 geeft je een algemeen inzetbaar redeneermodel met een contextvenster van 1.048.576 tokens, tekst- en beeldinvoer, native tool calling, gestructureerde uitvoer en een configureerbare redeneerinspanning. Het is het model waarnaar je grijpt om honderd klinische richtlijnen in één verzoek te lezen, of tien jaar aan rapporten van een afdeling. De score van Artificial Analysis voor recall bij lange contexten is 88,7 — de hoogste van de modellen in deze serie en maar liefst 8,4 punten boven de 80,3 van Grok 4.6.
Simpel gezegd: NV-Reason-CT is een gespecialiseerde checkpoint met een smal invoeroppervlak en aangepaste code die je moet vertrouwen en onderhouden. Kimi K3 is een algemeen model met een breed invoeroppervlak dat zich als infrastructuur gedraagt. Beide zijn te downloaden. Slechts één ervan is direct inzetbaar.
Het CT-bewijs, in zijn geheel, en het is kort.
Alles wat publiekelijk bekend is over de kwaliteit van NV-Reason-CT berust op één enkele tabel in de eigen modelkaart: de 18-labelclassificatietaak van CT-RATE bij een vaste uniforme drempel, directe ja/nee-prompting, geen classificatiehoofd, geen taakspecifieke aanpassing. Macro-F1 0,614, Macro-AUROC 0,871.
De vergelijkingsrijen zijn VoxelFM op 0,581/0,870, Pillar-0 op 0,544/0,861, ClinFusion-8B op 0,442, CT-CLIP op 0,398/0,733, Merlin op 0,358/0,662 en MedGemma 1.5 op 0,303. Elk daarvan is een door de leverancier gerapporteerd cijfer uit de kaart van NVIDIA en geen ervan is tot nu toe onafhankelijk gereproduceerd — het artikel is twee dagen oud.
Wat de tabel aantoont, is beperkt en verdient een exacte formulering: een generatief 3D-model zonder taakspecifieke head verslaat 3D-contrastieve pretrainingsbaselines en een slice-gebaseerd frontiermodel bij CT-classificatie met 18 labels. Wat het niet aantoont, is iets over algemeen redeneren, iets over modaliteiten anders dan thoracale en abdominale CT, en iets over het AUROC-voordeel — 0,871 tegen 0,870 is een gelijkspel dat een decimaalteken draagt.
De cijfers van Kimi K3, en het voorbehoud bij de open-weights-ranglijst
Artificial Analysis meet Kimi K3 met een Intelligence Index van 43,6, wat het in de momentopname van de ranglijst van onze model-API op die lijst de 19e plaats van 145 modellen oplevert. De GPQA Diamond-score ervan is 93,5, Humanity's Last Exam 46,9, SciCode 59,5, Terminal-Bench 2.1 85,0, AA Coding 76,2 op plaats 9, en 𝜏²-banking 46,0.
Eén bewering over de ranglijst verdient zorgvuldigheid, want het is makkelijk om je erin te vergissen, en dat is eerder al gebeurd. Kimi K3's AA Intelligence Index van 44 staat derde onder de open-weightsmodellen op de open-weightsranglijst, achter MiMo-V2.6-Pro met 46 en GLM-5.3 met 45. Het is niet de koploper op die ranglijst, en het dingt niet mee op dezelfde ranglijst als Grok 4.6 — Artificial Analysis registreert Grok 4.6 als propriëtair, dus die 44 hoort bij de algemene ranglijst, niet bij de open-weightsranglijst. De twee indexen lijken identiek en zijn dat niet.
Wat de operator daadwerkelijk ziet
Dit is waar het getal van 588 miljoen vandaan komt, en het is de moeite waard om dit expliciet te maken, want het is het enige stuk bewijs in dit artikel dat van ons is en niet van iemands marketing.
In de afgelopen zeven dagen verwerkte Kimi K3 587,8 miljoen tokens via de playground van OrcaRouter. De mediane tijd tot het eerste token was 7,8 seconden, het produceerde 42,9 outputtokens per seconde, en het foutpercentage in dat venster was 0,21% — één fout op ongeveer 480 verzoeken. Dat gemeten foutpercentage is iets wat je niet uit een modelkaart kunt halen, en het is het getal dat bepaalt of een model veilig achter een batchjob kan worden gezet.
Voor NV-Reason-CT bestaat er geen equivalent, omdat het nergens een gehoste endpoint is — het is een checkpoint dat je zelf draait. Er is geen p50, geen foutpercentage, geen uptime, en er is niemand om naar uit te wijken. Dat is geen kritiek; het is een structureel feit over self-hosting, en het is de reden waarom een onderzoeksgroep NV-Reason-CT op een dinsdag kan adopteren en een productieteam doorgaans niet.
Als je beide helften hiervan draait — Kimi K3 als de gehoste algemene laag en NV-Reason-CT op je eigen GPU-box — dan is het de routeringskant waar de gehoste helft zijn veerkracht aan ontleent. Kimi K3 wordt aangeboden tegen Moonshots eigen lijstprijs van $3,00 per miljoen input en $15,00 per miljoen output zonder markup; het cache-leestarief van $0,30 per miljoen is een tiende van de inputprijs, en omdat de prijs ongewijzigd wordt doorgegeven, bereikt een leverancierskorting je factuur dezelfde dag. Automatische failover tussen aanbieders is wat een batchtaak in leven houdt wanneer een upstream-endpoint hapert — en bij een foutpercentage van 0,21% komen haperingen zo weinig voor dat je ze makkelijk vergeet, totdat dat niet meer zo is.
De kostenvormen lijken niet op elkaar
• Prijs — NV-Reason-CT GPU-capex plus je eigen servingstack vs. Kimi K3 $3,00 / $15,00 per miljoen, $0,30 voor een read uit cache
• Minimaal haalbare besteding — NV-Reason-CT: één GPU van Ampere of nieuwer, voor onbepaalde tijd aangehouden, versus Kimi K3: één verzoek
• Context — NV-Reason-CT één volume, 13.824 vaste tokens vs Kimi K3 1.048.576 tokens
• Marginale kosten van het duizendste verzoek — NV-Reason-CT effectief nul zodra de GPU is betaald vs. Kimi K3 lineair in tokens
• Waar het eerst stukloopt — NV-Reason-CT's ongeverifieerde doorvoer en ontbrekende batchingverhaal vs Kimi K3's lange-contextkosten bij 1M tokens per verzoek
• Modaliteiten — NV-Reason-CT 3D NIfTI, borst of buik vs Kimi K3 tekst en afbeelding, wat dan ook

De economie keert om afhankelijk van het volume. Kimi K3 kost niets om te beginnen en schaalt lineair. NV-Reason-CT kost een GPU om te beginnen en schaalt daarna bijna vlak — daarom is 210 downloads geen faalsignaal. Het is het juiste aantal voor een checkpoint waarvan de doelgroep bestaat uit instellingen die de hardware al bezitten, en die helemaal nooit in een token-doorvoerstatistiek zullen voorkomen.

Welke je eigenlijk kiest
Als de taak is een CT-volume lezen en een gestructureerde bevinding met een redeneerspoor produceren, kan Kimi K3 dat niet en NV-Reason-CT wel. Niet "doet het slechter" — kan het niet, omdat er nergens een volumetrische encoder in zit, en het eerst platslaan van een scan tot afbeeldingen gooit de ruimtelijke relaties weg die het 3D-pad juist moet behouden.
Als de taak erin bestaat 400 pagina's verwijzingsnotities te lezen, ze te matchen met een protocoldocument en gestructureerde output te produceren, dan is NV-Reason-CT niet in beeld en is Kimi K3 een van de betere beschikbare antwoorden, met een gemeten foutpercentage van minder dan een kwart procent op ons netwerk.

De werkelijke beslissing is niet tussen de twee. Het gaat erom of je probleem een volumeprobleem of een tekstprobleem is, en het verschil tussen 210 en 588 miljoen is simpelweg hoe dat onderscheid er van buitenaf uitziet. Het ene model is een paper met gewichten. Het andere is een stuk infrastructuur. Beide zijn het waard om te hebben; geen van beide vervangt het andere.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
