
NV-Reason-CT vs Kimi K3: 210 nedladdningar och 588 miljoner tokens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 45 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 182 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
En av dessa modeller har laddats ner 210 gånger från Hugging Face. Den andra lät 588 miljoner tokens passera genom vår egen playground under de senaste sju dagarna. Båda har öppna vikter, båda går att ladda ner just nu, och gapet mellan de två siffrorna är det mest användbara i den här jämförelsen. NV-Reason-CT är NVIDIAs 3D-vision-språkmodell med 4,69 miljarder parametrar för CT av bröstkorg och buk, publicerad på Hugging Face den 8 september 2026 utan något tillkännagivande. Kimi K3 är MoonshotAIs flaggskepp med 1 048 576 tokens, släppt den 15 juli 2026 och nu en av de mest trafikerade modellerna i vårt nätverk. De är båda "öppna" i den bemärkelse som spelar roll för ett inköpsformulär. De är inte öppna på samma sätt alls.
Två betydelser av "du kan ladda ner det"
Börja med vad varje nedladdning faktiskt lägger på din disk, för det är här de flesta jämförelser av öppna vikter blir slappa.
NV-Reason-CT ger dig model.safetensors på ungefär 10,6 GB i BF16, plus en model.py och en omfattande processor.py – 26 KB anpassad bearbetningskod som implementerar den anatomi-medvetna beskärningen, 2-mm-omsamplingen och 3D-patchifieringen. Du laddar den med trust_remote_code=True, vilket innebär att du kör NVIDIAs repository-kod i din process. Inferens kräver CUDA PyTorch, och kortet listar Ampere, Hopper och Lovelace, testat på H100 och L40S. Indata är en NIfTI-volym i taget. Det finns ingen publicerad batchstrategi, ingen genomströmningssiffra och ingen serveringskonfiguration i repot utöver ett inference.py-exempel.
Kimi K3 ger dig en generell resonemangsmodell med ett kontextfönster på 1 048 576 tokens, text- och bildinmatning, inbyggt verktygsanrop, strukturerade utdata och konfigurerbar resonemangsansträngning. Det är modellen du skulle ta till för att läsa hundra kliniska riktlinjer i en och samma förfrågan, eller tio års rapporter från en avdelning. Dess long-context recall-poäng från Artificial Analysis är 88,7 — högst bland modellerna i den här serien och hela 8,4 poäng över Grok 4.6:s 80,3.
Enkelt uttryckt: NV-Reason-CT är en specialiserad checkpoint med en smal indatayta och anpassad kod som du måste lita på och underhålla. Kimi K3 är en generell modell med en bred indatayta som beter sig som infrastruktur. Båda går att ladda ner. Endast en av dem är en drop-in.
CT-bevisningen, i sin helhet, och den är kort
Allt som är offentligt känt om NV-Reason-CT:s kvalitet vilar på en enda tabell i dess eget modellkort: CT-RATE:s klassificeringsuppgift med 18 etiketter vid ett fast enhetligt tröskelvärde, direkt ja/nej-promptning, inget klassificeringshuvud, ingen uppgiftsspecifik anpassning. Macro-F1 0,614, Macro-AUROC 0,871.
Jämförelseraderna är VoxelFM vid 0,581/0,870, Pillar-0 vid 0,544/0,861, ClinFusion-8B vid 0,442, CT-CLIP vid 0,398/0,733, Merlin vid 0,358/0,662 och MedGemma 1.5 vid 0,303. Vart och ett av dessa är en leverantörsrapporterad siffra från NVIDIAs kort och ingen av dem har ännu reproducerats oberoende – artikeln är två dagar gammal.
Det som tabellen fastställer är snävt och värt att formulera exakt: en generativ 3D-modell utan uppgiftsspecifikt huvud slår baslinjer för 3D-kontrastiv förträning och en skivbaserad frontiermodell vid CT-klassificering med 18 etiketter. Det den inte fastställer är något om allmänt resonemang, något om modaliteter andra än bröstkorgs- och buk-CT, och något om AUROC-fördelen – 0,871 mot 0,870 är ett oavgjort resultat i decimalteckens skrud.
Kimi K3:s siffror, och förbehållet kring open-weights-tavlan
Artificial Analysis mäter Kimi K3 till ett Intelligence Index på 43,6, vilket placerar den på 19:e plats bland 145 modeller på den resultattavlan i ögonblicksbilden av rankingen från vårt modell-API. Dess GPQA Diamond-poäng är 93,5, Humanity's Last Exam 46,9, SciCode 59,5, SciCode 2.1 85,0, AI Coding 76,2 på plats 9, och 𝜏²-banking 46,0.
Ett rankningspåstående kräver försiktighet, för det är lätt att få fel och det har blivit fel förut. Kimi K3:s AA Intelligence Index på 44 ligger på tredje plats bland open-weights-modeller på open-weights-tavlan, bakom MiMo-V2.6-Pro på 46 och GLM-5.3 på 45. Det är inte ledaren på den tavlan, och det tävlar inte på samma tavla som Grok 4.6 — Artificial Analysis registrerar Grok 4.6 som proprietärt, så dess 44 tillhör den allmänna rankningen, inte open-weights-rankingen. De två indexen ser identiska ut och är det inte.
Vad operatören faktiskt ser
Det är här siffran 588 miljoner kommer ifrån, och det är värt att säga uttryckligen, eftersom det är den enda bevisbiten i den här artikeln som är vår snarare än någon annans marknadsföring.
Under de senaste sju dagarna flyttade Kimi K3 587,8 miljoner token genom OrcaRouters playground. Mediantiden till första token var 7,8 sekunder, den producerade 42,9 utdata-token per sekund, och felkvoten under den perioden var 0,21 % – ett fel på ungefär 480 förfrågningar. Den uppmätta felkvoten är det du inte kan få från ett modellkort, och det är siffran som avgör om en modell är säker att sätta bakom ett batchjobb.
För NV-Reason-CT finns ingen motsvarighet, eftersom det inte är en hostad slutpunkt någonstans – det är en checkpoint som du kör själv. Det finns ingen p50, ingen felfrekvens, ingen upptid och ingen att växla över till vid fel. Det är inte en kritik; det är ett strukturellt faktum om självhosting, och det är anledningen till att en forskargrupp kan införa NV-Reason-CT en tisdag medan ett produktionsteam i allmänhet inte kan.
Om du kör båda halvorna av detta – Kimi K3 som det värdbaserade generella lagret och NV-Reason-CT på din egen GPU-burk – är routningssidan där den värdbaserade halvan får sin motståndskraft. Kimi K3 erbjuds till Moonshots eget listpris på 3,00 USD per miljon indata och 15,00 USD per miljon utdata utan påslag, dess cache-läsningspris på 0,30 USD per miljon är en tiondel av indata, och eftersom priset förs vidare oförändrat når en leverantörsavgift din faktura samma dag. Automatisk redundansväxling mellan leverantörer är det som håller ett batchjobb vid liv när en uppströmsändpunkt vacklar – och vid en felfrekvens på 0,21 % är vacklandet så sällsynt att det är lätt att glömma bort tills det inte längre går.
Kostnadsformerna liknar inte varandra
• Pris — NV-Reason-CT GPU-capex plus din egen serving-stack kontra Kimi K3 $3.00 / $15.00 per miljon, $0.30 för cachad läsning
• Minsta möjliga utgift — NV-Reason-CT en Ampere-eller-nyare GPU som behålls på obestämd tid mot Kimi K3 en förfrågan
• Kontext — NV-Reason-CT en volym, 13 824 tokens fast mot Kimi K3 1 048 576 tokens
• Marginalkostnaden för den tusende förfrågan — NV-Reason-CT i praktiken noll när GPU:n väl är betald, jämfört med Kimi K3 som är linjär i tokens
• Där det brister först — NV-Reason-CT overifierad genomströmning och ingen batching-strategi mot Kimi K3:s långkontextkostnad vid 1M tokens per begäran
• Modaliteter — NV-Reason-CT 3D NIfTI, bröstkorg eller buk vs Kimi K3 text och bild, vad som helst

Ekonomin inverteras beroende på volym. Kimi K3 kostar ingenting att starta och skalas linjärt. NV-Reason-CT kostar en GPU att starta och skalas sedan nästan platt – vilket är varför 210 nedladdningar inte är en misslyckandesignal. Det är rätt siffra för en checkpoint vars målgrupp är institutioner som redan äger hårdvaran och som aldrig ens kommer att synas i en statistik över token-genomströmning.

Vilken väljer du egentligen?
Om uppgiften är att läsa en CT-volym och producera ett strukturerat fynd med ett resonemangsspår, kan Kimi K3 inte göra det, medan NV-Reason-CT kan. Inte ”gör det sämre” – kan inte, eftersom det inte finns någon volymetrisk encoder någonstans i den, och att platta till en skanning till bilder först kastar bort de rumsliga relationer som 3D-vägen finns för att bevara.
Om jobbet är att läsa 400 sidor remissanteckningar, matcha dem mot ett protokolldokument och producera strukturerad utdata, är NV-Reason-CT inte med i bilden och Kimi K3 är ett av de bättre svaren som finns tillgängliga, med en uppmätt felkvot på under en fjärdedels procent i vårt nätverk.

Det egentliga beslutet står inte mellan de två. Det är huruvida ditt problem är ett volymproblem eller ett textproblem, och gapet på 210 mot 588 miljoner är helt enkelt hur den distinktionen ser ut utifrån. Den ena modellen är en artikel med vikter. Den andra är en bit infrastruktur. Båda är värda att ha; ingen av dem ersätter den andra.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
