
NV-Reason-CT vs Kimi K3: 210 Unduhan dan 588 Juta Token
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 45 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 182 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Salah satu dari model ini telah diunduh 210 kali dari Hugging Face. Yang lainnya memindahkan 588 juta token melalui playground milik kami sendiri dalam tujuh hari terakhir. Keduanya berbobot terbuka, keduanya dapat diunduh saat ini juga, dan jarak antara kedua angka itu adalah hal yang paling berguna dalam perbandingan ini. NV-Reason-CT adalah model visi-bahasa 3D berparameter 4,69B milik NVIDIA untuk CT dada dan perut, yang dipublikasikan ke Hugging Face pada 8 September 2026 tanpa pengumuman. Kimi K3 adalah model unggulan MoonshotAI dengan 1.048.576 token, yang dirilis 15 Juli 2026 dan kini menjadi salah satu model tersibuk di jaringan kami. Keduanya sama-sama "terbuka" dalam pengertian yang penting untuk formulir pengadaan. Namun, keduanya sama sekali tidak terbuka dengan cara yang sama.
Dua makna dari "Anda dapat mengunduhnya".
Mulailah dari apa yang sebenarnya diletakkan setiap unduhan di disk Anda, karena di sinilah sebagian besar perbandingan open-weights menjadi lemah.
NV-Reason-CT memberi Anda model.safetensors dengan ukuran sekitar 10,6 GB dalam BF16, plus sebuah model.py dan processor.py — 26 KB kode pemrosesan khusus yang mengimplementasikan pemotongan yang sadar anatomi, resampling 2 mm, dan patchifikasi 3D. Anda memuatnya dengan trust_remote_code=True, yang berarti Anda menjalankan kode repositori NVIDIA di dalam proses Anda. Inferensi memerlukan CUDA PyTorch, dan kartu tersebut mencantumkan Ampere, Hopper, dan Lovelace, diuji pada H100 dan L40S. Input adalah satu volume NIfTI pada satu waktu. Tidak ada skenario batching yang dipublikasikan, tidak ada angka throughput, dan tidak ada konfigurasi serving di repositori selain sebuah contoh inference.py.
Kimi K3 memberi Anda model penalaran serbaguna dengan jendela konteks 1.048.576 token, masukan teks dan gambar, pemanggilan alat native, keluaran terstruktur, dan upaya penalaran yang dapat dikonfigurasi. Ini adalah model yang akan Anda gunakan untuk membaca seratus pedoman klinis dalam satu permintaan, atau laporan departemen selama satu dekade. Skor daya ingat konteks panjang Artificial Analysis-nya adalah 88,7 — tertinggi di antara model-model dalam seri ini dan 8,4 poin penuh di atas 80,3 milik Grok 4.6.
Sederhananya: NV-Reason-CT adalah checkpoint spesialis dengan permukaan input yang sempit dan kode kustom yang harus Anda percayai dan pelihara. Kimi K3 adalah model umum dengan permukaan input yang luas yang berperilaku seperti infrastruktur. Keduanya dapat diunduh. Hanya satu di antaranya yang bisa langsung dipakai.
Bukti CT, secara lengkap, dan itu singkat
Semua yang diketahui secara publik tentang kualitas NV-Reason-CT bertumpu pada satu tabel di kartu modelnya sendiri: tugas klasifikasi 18 label CT-RATE pada ambang seragam tetap, pemberian prompt Yes/No secara langsung, tanpa head klasifikasi, tanpa adaptasi khusus tugas. Macro-F1 0.614, Macro-AUROC 0.871.
Baris perbandingan adalah VoxelFM pada 0,581/0,870, Pillar-0 pada 0,544/0,861, ClinFusion-8B pada 0,442, CT-CLIP pada 0,398/0,733, Merlin pada 0,358/0,662, dan MedGemma 1.5 pada 0,303. Semuanya adalah angka yang dilaporkan vendor dari kartu NVIDIA dan belum ada satu pun yang direproduksi secara independen — makalahnya baru berusia dua hari.
Apa yang ditetapkan tabel ini sempit dan layak dinyatakan secara tepat: model 3D generatif tanpa head khusus tugas mengalahkan baseline prapelatihan kontrastif 3D dan model frontier berbasis slice pada klasifikasi CT 18 label. Yang tidak ditetapkannya adalah apa pun tentang penalaran umum, apa pun tentang modalitas selain CT dada dan abdomen, dan apa pun tentang keunggulan AUROC — 0,871 versus 0,870 adalah seri yang mengenakan titik desimal.
Angka-angka Kimi K3, dan catatan untuk papan peringkat open-weights
Artificial Analysis mengukur Kimi K3 pada Intelligence Index 43,6, yang menempatkannya di peringkat ke-19 dari 145 model di papan tersebut dalam snapshot peringkat di API model kami. Skor GPQA Diamond-nya adalah 93,5, Humanity's Last Exam 46,9, SciCode 59,5, Terminal-Bench 2.1 85,0, AA Coding 76,2 pada peringkat 9, dan 𝜏²-banking 46,0.
Satu klaim peringkat perlu kehati-hatian, karena mudah salah dan sebelumnya sudah pernah salah. AA Intelligence Index Kimi K3 sebesar 44 berada di urutan ketiga di antara model open-weights pada papan open-weights, di belakang MiMo-V2.6-Pro dengan 46 dan GLM-5.3 dengan 45. Ini bukan pemimpin di papan itu, dan ia tidak bersaing di papan yang sama dengan Grok 4.6 — Artificial Analysis mencatat Grok 4.6 sebagai proprietary, jadi angka 44-nya termasuk dalam peringkat umum, bukan peringkat open-weights. Kedua indeks itu tampak identik, tetapi sebenarnya tidak.
Apa yang sebenarnya dilihat operator
Dari sinilah angka 588 juta itu berasal, dan perlu dijelaskan secara rinci karena ini adalah satu-satunya bukti dalam artikel ini yang merupakan milik kami sendiri, bukan klaim pemasaran pihak lain.
Selama tujuh hari terakhir, Kimi K3 mengalirkan 587,8 juta token melalui playground OrcaRouter. Waktu mediannya hingga token pertama adalah 7,8 detik, model ini menghasilkan 42,9 token keluaran per detik, dan tingkat kesalahannya selama periode itu adalah 0,21% — satu kegagalan dari sekitar 480 permintaan. Tingkat kesalahan yang terukur itulah hal yang tidak dapat Anda peroleh dari kartu model, dan itulah angka yang menentukan apakah sebuah model aman untuk ditempatkan di balik pekerjaan batch.
Untuk NV-Reason-CT tidak ada padanannya, karena ini bukan endpoint yang dihosting di mana pun — ini adalah checkpoint yang Anda jalankan sendiri. Tidak ada p50, tidak ada tingkat kesalahan, tidak ada uptime, dan tidak ada tujuan failover. Itu bukan sebuah celaan; itu fakta struktural tentang self-hosting, dan itulah alasan sebuah kelompok riset dapat mengadopsi NV-Reason-CT pada hari Selasa sementara tim produksi umumnya tidak bisa.
Jika Anda menjalankan kedua bagian ini — Kimi K3 sebagai lapisan umum yang dihosting dan NV-Reason-CT di mesin GPU Anda sendiri — sisi perutean adalah tempat separuh yang dihosting memperoleh ketahanannya. Kimi K3 dilayani dengan harga daftar milik Moonshot sendiri sebesar $3,00 per juta input dan $15,00 per juta output tanpa markup, tarif baca cache-nya $0,30 per juta adalah sepersepuluh dari input, dan karena harga diteruskan tanpa perubahan, potongan vendor mencapai tagihan Anda pada hari yang sama. Failover otomatis lintas penyedia adalah yang menjaga pekerjaan batch tetap hidup ketika satu endpoint hulu goyah — dan pada tingkat kesalahan 0,21%, goyangan cukup jarang sehingga mudah dilupakan sampai tidak lagi.
Bentuk biaya tidak saling menyerupai
• Harga — belanja modal GPU NV-Reason-CT plus stack penyajian Anda sendiri vs Kimi K3 $3.00 / $15.00 per juta, $0.30 pembacaan cache
• Pengeluaran minimum yang layak — NV-Reason-CT satu GPU Ampere atau lebih baru yang dipertahankan tanpa batas waktu vs Kimi K3 satu permintaan
• Konteks — NV-Reason-CT satu volume, 13,824 token tetap vs Kimi K3 1,048,576 token
• Biaya marjinal permintaan keseribu — NV-Reason-CT praktis nol setelah GPU sudah dibayar, dibandingkan dengan Kimi K3 yang linier dalam token
• Di bagian mana ia gagal lebih dulu — throughput NV-Reason-CT yang belum terverifikasi dan tidak ada solusi batching vs biaya konteks panjang Kimi K3 pada 1M token per permintaan
• Modalitas — NV-Reason-CT 3D NIfTI, dada atau abdomen vs Kimi K3 teks dan gambar, apa pun

Ekonomi ini berbalik bergantung pada volume. Kimi K3 tidak memerlukan biaya apa pun untuk memulai dan berskala secara linear. NV-Reason-CT memerlukan satu GPU untuk memulai lalu skalanya hampir datar — itulah sebabnya 210 unduhan bukanlah sinyal kegagalan. Itu adalah angka yang tepat untuk sebuah checkpoint yang audiensinya adalah institusi yang sudah memiliki perangkat kerasnya sendiri, dan yang tidak akan pernah muncul sama sekali dalam statistik throughput token.

Yang mana yang sebenarnya kamu pilih
Jika pekerjaannya adalah membaca volume CT dan menghasilkan temuan terstruktur dengan jejak penalaran, Kimi K3 tidak dapat melakukannya dan NV-Reason-CT dapat. Bukan "melakukannya dengan lebih buruk" — tidak bisa, karena tidak ada encoder volumetrik di mana pun di dalamnya, dan meratakan pemindaian menjadi gambar terlebih dahulu membuang hubungan spasial yang jalur 3D itu ada untuk mempertahankannya.
Jika pekerjaannya adalah membaca 400 halaman catatan rujukan, mencocokkannya dengan dokumen protokol, dan menghasilkan keluaran terstruktur, NV-Reason-CT tidak masuk hitungan dan Kimi K3 adalah salah satu jawaban yang lebih baik yang tersedia, dengan tingkat kesalahan terukur di bawah seperempat persen di jaringan kami.

Keputusan yang sebenarnya bukanlah di antara keduanya. Keputusan itu adalah apakah masalah Anda merupakan masalah volume atau masalah teks, dan kesenjangan 210 versus 588 juta hanyalah bagaimana pembedaan itu terlihat dari luar. Satu model adalah makalah dengan bobot. Yang lain adalah sepotong infrastruktur. Keduanya layak dimiliki; tidak ada yang menggantikan yang lain.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
