Kartu hero yang dihasilkan berjudul 'NV-Reason-CT vs Kimi K3' dengan subjudul '210 unduhan dan 588 juta token'. Tiga chip membentang di sepanjang bagian bawah: '210 unduhan HF vs 587,8M token / 7 hari', 'kesalahan terukur 0,21% di jaringan kami', dan 'Satu volume vs 1.048.576 token'. Logo OrcaRouter dikompositkan di kanan bawah.
Guides & Insights

NV-Reason-CT vs Kimi K3: 210 Unduhan dan 588 Juta Token

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Salah satu dari model ini telah diunduh 210 kali dari Hugging Face. Yang lainnya memindahkan 588 juta token melalui playground milik kami sendiri dalam tujuh hari terakhir. Keduanya berbobot terbuka, keduanya dapat diunduh saat ini juga, dan jarak antara kedua angka itu adalah hal yang paling berguna dalam perbandingan ini. NV-Reason-CT adalah model visi-bahasa 3D berparameter 4,69B milik NVIDIA untuk CT dada dan perut, yang dipublikasikan ke Hugging Face pada 8 September 2026 tanpa pengumuman. Kimi K3 adalah model unggulan MoonshotAI dengan 1.048.576 token, yang dirilis 15 Juli 2026 dan kini menjadi salah satu model tersibuk di jaringan kami. Keduanya sama-sama "terbuka" dalam pengertian yang penting untuk formulir pengadaan. Namun, keduanya sama sekali tidak terbuka dengan cara yang sama.

Dua makna dari "Anda dapat mengunduhnya".

Mulailah dari apa yang sebenarnya diletakkan setiap unduhan di disk Anda, karena di sinilah sebagian besar perbandingan open-weights menjadi lemah.

NV-Reason-CT memberi Anda model.safetensors dengan ukuran sekitar 10,6 GB dalam BF16, plus sebuah model.py dan processor.py — 26 KB kode pemrosesan khusus yang mengimplementasikan pemotongan yang sadar anatomi, resampling 2 mm, dan patchifikasi 3D. Anda memuatnya dengan trust_remote_code=True, yang berarti Anda menjalankan kode repositori NVIDIA di dalam proses Anda. Inferensi memerlukan CUDA PyTorch, dan kartu tersebut mencantumkan Ampere, Hopper, dan Lovelace, diuji pada H100 dan L40S. Input adalah satu volume NIfTI pada satu waktu. Tidak ada skenario batching yang dipublikasikan, tidak ada angka throughput, dan tidak ada konfigurasi serving di repositori selain sebuah contoh inference.py.

Kimi K3 memberi Anda model penalaran serbaguna dengan jendela konteks 1.048.576 token, masukan teks dan gambar, pemanggilan alat native, keluaran terstruktur, dan upaya penalaran yang dapat dikonfigurasi. Ini adalah model yang akan Anda gunakan untuk membaca seratus pedoman klinis dalam satu permintaan, atau laporan departemen selama satu dekade. Skor daya ingat konteks panjang Artificial Analysis-nya adalah 88,7 — tertinggi di antara model-model dalam seri ini dan 8,4 poin penuh di atas 80,3 milik Grok 4.6.

Sederhananya: NV-Reason-CT adalah checkpoint spesialis dengan permukaan input yang sempit dan kode kustom yang harus Anda percayai dan pelihara. Kimi K3 adalah model umum dengan permukaan input yang luas yang berperilaku seperti infrastruktur. Keduanya dapat diunduh. Hanya satu di antaranya yang bisa langsung dipakai.

Bukti CT, secara lengkap, dan itu singkat

Semua yang diketahui secara publik tentang kualitas NV-Reason-CT bertumpu pada satu tabel di kartu modelnya sendiri: tugas klasifikasi 18 label CT-RATE pada ambang seragam tetap, pemberian prompt Yes/No secara langsung, tanpa head klasifikasi, tanpa adaptasi khusus tugas. Macro-F1 0.614, Macro-AUROC 0.871.

Baris perbandingan adalah VoxelFM pada 0,581/0,870, Pillar-0 pada 0,544/0,861, ClinFusion-8B pada 0,442, CT-CLIP pada 0,398/0,733, Merlin pada 0,358/0,662, dan MedGemma 1.5 pada 0,303. Semuanya adalah angka yang dilaporkan vendor dari kartu NVIDIA dan belum ada satu pun yang direproduksi secara independen — makalahnya baru berusia dua hari.

Apa yang ditetapkan tabel ini sempit dan layak dinyatakan secara tepat: model 3D generatif tanpa head khusus tugas mengalahkan baseline prapelatihan kontrastif 3D dan model frontier berbasis slice pada klasifikasi CT 18 label. Yang tidak ditetapkannya adalah apa pun tentang penalaran umum, apa pun tentang modalitas selain CT dada dan abdomen, dan apa pun tentang keunggulan AUROC — 0,871 versus 0,870 adalah seri yang mengenakan titik desimal.

Angka-angka Kimi K3, dan catatan untuk papan peringkat open-weights

Artificial Analysis mengukur Kimi K3 pada Intelligence Index 43,6, yang menempatkannya di peringkat ke-19 dari 145 model di papan tersebut dalam snapshot peringkat di API model kami. Skor GPQA Diamond-nya adalah 93,5, Humanity's Last Exam 46,9, SciCode 59,5, Terminal-Bench 2.1 85,0, AA Coding 76,2 pada peringkat 9, dan 𝜏²-banking 46,0.

Satu klaim peringkat perlu kehati-hatian, karena mudah salah dan sebelumnya sudah pernah salah. AA Intelligence Index Kimi K3 sebesar 44 berada di urutan ketiga di antara model open-weights pada papan open-weights, di belakang MiMo-V2.6-Pro dengan 46 dan GLM-5.3 dengan 45. Ini bukan pemimpin di papan itu, dan ia tidak bersaing di papan yang sama dengan Grok 4.6 — Artificial Analysis mencatat Grok 4.6 sebagai proprietary, jadi angka 44-nya termasuk dalam peringkat umum, bukan peringkat open-weights. Kedua indeks itu tampak identik, tetapi sebenarnya tidak.

Apa yang sebenarnya dilihat operator

Dari sinilah angka 588 juta itu berasal, dan perlu dijelaskan secara rinci karena ini adalah satu-satunya bukti dalam artikel ini yang merupakan milik kami sendiri, bukan klaim pemasaran pihak lain.

Selama tujuh hari terakhir, Kimi K3 mengalirkan 587,8 juta token melalui playground OrcaRouter. Waktu mediannya hingga token pertama adalah 7,8 detik, model ini menghasilkan 42,9 token keluaran per detik, dan tingkat kesalahannya selama periode itu adalah 0,21% — satu kegagalan dari sekitar 480 permintaan. Tingkat kesalahan yang terukur itulah hal yang tidak dapat Anda peroleh dari kartu model, dan itulah angka yang menentukan apakah sebuah model aman untuk ditempatkan di balik pekerjaan batch.

Untuk NV-Reason-CT tidak ada padanannya, karena ini bukan endpoint yang dihosting di mana pun — ini adalah checkpoint yang Anda jalankan sendiri. Tidak ada p50, tidak ada tingkat kesalahan, tidak ada uptime, dan tidak ada tujuan failover. Itu bukan sebuah celaan; itu fakta struktural tentang self-hosting, dan itulah alasan sebuah kelompok riset dapat mengadopsi NV-Reason-CT pada hari Selasa sementara tim produksi umumnya tidak bisa.

Jika Anda menjalankan kedua bagian ini — Kimi K3 sebagai lapisan umum yang dihosting dan NV-Reason-CT di mesin GPU Anda sendiri — sisi perutean adalah tempat separuh yang dihosting memperoleh ketahanannya. Kimi K3 dilayani dengan harga daftar milik Moonshot sendiri sebesar $3,00 per juta input dan $15,00 per juta output tanpa markup, tarif baca cache-nya $0,30 per juta adalah sepersepuluh dari input, dan karena harga diteruskan tanpa perubahan, potongan vendor mencapai tagihan Anda pada hari yang sama. Failover otomatis lintas penyedia adalah yang menjaga pekerjaan batch tetap hidup ketika satu endpoint hulu goyah — dan pada tingkat kesalahan 0,21%, goyangan cukup jarang sehingga mudah dilupakan sampai tidak lagi.

Bentuk biaya tidak saling menyerupai

• Harga — belanja modal GPU NV-Reason-CT plus stack penyajian Anda sendiri vs Kimi K3 $3.00 / $15.00 per juta, $0.30 pembacaan cache

• Pengeluaran minimum yang layak — NV-Reason-CT satu GPU Ampere atau lebih baru yang dipertahankan tanpa batas waktu vs Kimi K3 satu permintaan

• Konteks — NV-Reason-CT satu volume, 13,824 token tetap vs Kimi K3 1,048,576 token

• Biaya marjinal permintaan keseribu — NV-Reason-CT praktis nol setelah GPU sudah dibayar, dibandingkan dengan Kimi K3 yang linier dalam token

• Di bagian mana ia gagal lebih dulu — throughput NV-Reason-CT yang belum terverifikasi dan tidak ada solusi batching vs biaya konteks panjang Kimi K3 pada 1M token per permintaan

• Modalitas — NV-Reason-CT 3D NIfTI, dada atau abdomen vs Kimi K3 teks dan gambar, apa pun

A generated scoreboard titled 'NV-Reason-CT vs Kimi K3 - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex plus your serving stack; Minimum viable spend one Ampere-or-newer GPU; Context one volume, 13,824 tokens; Marginal cost of request #1000 effectively zero; Breaks first at unverified throughput, no batching; Modalities 3D NIfTI, chest or abdomen. Right column 'Kimi K3': Price $3.00 / $15.00 per M, $0.30 cached read; Minimum viable spend one request; Context 1,048,576 tokens; Marginal cost of request #1000 linear in tokens; Breaks first at long-context cost at 1M per request; Modalities text and image, anything. A footer reads 'Kimi K3 traffic and error rate measured on OrcaRouter's playground over seven days; NV-Reason-CT has no hosted endpoint to measure.'

Ekonomi ini berbalik bergantung pada volume. Kimi K3 tidak memerlukan biaya apa pun untuk memulai dan berskala secara linear. NV-Reason-CT memerlukan satu GPU untuk memulai lalu skalanya hampir datar — itulah sebabnya 210 unduhan bukanlah sinyal kegagalan. Itu adalah angka yang tepat untuk sebuah checkpoint yang audiensinya adalah institusi yang sudah memiliki perangkat kerasnya sendiri, dan yang tidak akan pernah muncul sama sekali dalam statistik throughput token.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Yang mana yang sebenarnya kamu pilih

Jika pekerjaannya adalah membaca volume CT dan menghasilkan temuan terstruktur dengan jejak penalaran, Kimi K3 tidak dapat melakukannya dan NV-Reason-CT dapat. Bukan "melakukannya dengan lebih buruk" — tidak bisa, karena tidak ada encoder volumetrik di mana pun di dalamnya, dan meratakan pemindaian menjadi gambar terlebih dahulu membuang hubungan spasial yang jalur 3D itu ada untuk mempertahankannya.

Jika pekerjaannya adalah membaca 400 halaman catatan rujukan, mencocokkannya dengan dokumen protokol, dan menghasilkan keluaran terstruktur, NV-Reason-CT tidak masuk hitungan dan Kimi K3 adalah salah satu jawaban yang lebih baik yang tersedia, dengan tingkat kesalahan terukur di bawah seperempat persen di jaringan kami.

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier kimi/kimi-k3, input text + image, output text, the Vision, Tools, JSON and Reasoning badges, a 1M-token context window with a p50 time to first token of 7.77 seconds, the description of it as MoonshotAI's 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $3.00 per million input tokens, $15.00 per million output tokens and 591.2M tokens of seven-day traffic.

Keputusan yang sebenarnya bukanlah di antara keduanya. Keputusan itu adalah apakah masalah Anda merupakan masalah volume atau masalah teks, dan kesenjangan 210 versus 588 juta hanyalah bagaimana pembedaan itu terlihat dari luar. Satu model adalah makalah dengan bobot. Yang lain adalah sepotong infrastruktur. Keduanya layak dimiliki; tidak ada yang menggantikan yang lain.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari