Kartu hero yang dihasilkan berjudul 'NV-Reason-CT vs Grok 4.6' dengan subjudul 'Siapa yang membaca pemindaian, dan siapa yang membaca laporan'. Tiga chip membentang di sepanjang bagian bawah: 'Satu volume CT vs 500.000 token', '0,871 vs 0,870 adalah seri', dan 'Grok 4.6: $2,00 / $6,00 per juta'. Logo OrcaRouter dikompositkan di kanan bawah.
Guides & Insights

NV-Reason-CT vs Grok 4.6: Siapa yang Membaca Pemindaian, dan Siapa yang Membaca Laporan

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ada dua cara untuk menempatkan AI pada pipeline CT dan hanya satu di antaranya yang berkaitan dengan citra. NV-Reason-CT adalah yang pertama: model visi-bahasa 3D dengan 4,69 miliar parameter yang membaca volume NIfTI secara langsung dan dipublikasikan ke Hugging Face pada 8 September 2026 tanpa tulisan peluncuran dari NVIDIA. Grok 4.6 adalah yang kedua: model teks-dan-gambar dengan 500.000 token yang dirilis pada 12 Agustus 2026, berbiaya $2,00 per juta token masukan, dan sangat mumpuni pada bagian pekerjaan yang terjadi setelah seseorang telah menuliskan temuannya. Jika keduanya dibandingkan, pertanyaan yang biasa muncul — mana yang lebih baik — ternyata tidak tepat. Keduanya tidak bersaing untuk slot yang sama dalam pipeline. Keduanya bersaing untuk pos anggaran yang sama.

Apa yang sebenarnya sudah dirilis di masing-masing sisi

NV-Reason-CT hadir sebagai repositori, sebuah makalah, dan sebuah Space demo, bukan sebagai produk. Repositori GitHub di bawah NVIDIA-Medtech dibuat pada 2 September 2026; bobot Hugging Face menyusul pada 8 September; praprin arXiv, NV-Reason-CT: Model Bahasa Visual 3D untuk Analisis CT, terbit pada 23 September dengan enam belas penulis dari NVIDIA, NIH, dan University of Zurich. Ruang berita NVIDIA tidak memuat apa pun tentangnya. Kartu model menjelaskan versi 0.1 dan membatasi penggunaannya untuk penelitian dan pendidikan.

Grok 4.6 adalah jenis rilis yang berlawanan. Ini adalah endpoint komersial kelas satu, tercantum sebagai "Latest" dalam dokumentasi developer vendor, diberi harga berdasarkan rate card yang dipublikasikan, dan tersedia sebagai model yang kompatibel dengan OpenAI yang diadopsi oleh integrasi yang ada dengan mengubah base URL. Ini menggantikan Grok 4.5 dengan jendela konteks yang sama, permukaan input yang sama, dan harga dasar yang sama.

Asimetri itulah inti dari perbandingan ini. Yang satu adalah artefak riset yang kebetulan dapat diunduh. Yang lainnya adalah infrastruktur. Membacanya secara berhadapan memberi tahu Anda di mana batas antara "artefak riset" dan "infrastruktur" saat ini berada dalam pencitraan medis — dan batas itu bukan di tempat yang Anda duga.

Pembagian kerja, dalam masukan dan keluaran

• Masukan volumetrik — NV-Reason-CT membaca volume NIfTI .nii/.nii.gz dalam satuan Hounsfield, hanya dada atau perut vs Grok 4.6 membaca teks, gambar, dan berkas, tanpa jalur volumetrik • Penanganan spasial — NV-Reason-CT mengubah volume 384×384×384 mm menjadi kisi 24×24×24 berisi 13.824 token dengan 3D MRoPE, tanpa downsampling vs Grok 4.6 memperlakukan gambar sebagai citra 2D • Konteks — NV-Reason-CT satu volume adalah satu prefiks tetap, tidak ada jendela konteks dalam pengertian biasa vs Grok 4.6 500.000 token • Keluaran — NV-Reason-CT laporan terstruktur, jawaban, atau jejak penalaran dengan thinking yang dapat dinonaktifkan vs Grok 4.6 teks dengan keluaran terstruktur dan pemanggilan alat • Lisensi — NV-Reason-CT OpenMDW-1.1, bobot BF16 10,6 GB vs Grok 4.6 proprieter, hanya API • Harga — NV-Reason-CT belanja modal GPU, tanpa tarif per token vs Grok 4.6 $2,00 / $6,00 per juta, dua kali lipat untuk masukan di atas 200K

A generated scoreboard titled 'NV-Reason-CT vs Grok 4.6 - the scoreboard'. Left column 'NV-Reason-CT': Volumetric input NIfTI, Hounsfield, chest or abdomen; Spatial handling 24x24x24 grid, no downsampling; Context one volume, a fixed prefix; Output report, answer or reasoning trace; Licence OpenMDW-1.1, 10.6 GB BF16; Price GPU capex, no per-token rate. Right column 'Grok 4.6': Volumetric input none - 2D images, text, files; Spatial handling an image is a picture; Context 500,000 tokens; Output text, structured outputs, tools; Licence proprietary, API only; Price $2.00 / $6.00, doubled above 200K. A footer reads 'NV-Reason-CT figures from NVIDIA's model card and paper; Grok 4.6 pricing per the vendor rate card.'

Pasangan ini terbaca sebagai serah terima yang alami. NV-Reason-CT menghasilkan temuan dari volume tersebut; Grok 4.6 adalah model yang akan Anda beri seribu temuan semacam itu, dalam satu jendela konteks, untuk mencari pola di seluruh kohort. Belum ada yang menerbitkan pipeline itu. Ini arsitektur yang jelas, dan patut dikatakan secara terang-terangan bahwa ini belum teruji.

Angka-angka Grok 4.6, dan milik siapa angka-angka itu

Dua angka untuk Grok 4.6 beredar bersama-sama dan keduanya bukan jenis hal yang sama. Skor GPQA Diamond sebesar 94,9 diukur oleh Artificial Analysis, bukan dilaporkan oleh vendor — yang justru lebih dapat dipercaya di antara kedua kategori itu karena pihak ketiga yang menjalankannya. Skor Artificial Analysis Intelligence Index sebesar 44, pada revisi indeks v4.3.2, menempatkan Grok 4.6 di peringkat 28 dari 211 di kelasnya. Artificial Analysis juga mencatat model tersebut sebagai proprietary: bobotnya tidak tersedia untuk publik.

Pada papan yang sama, AA mengukur Terminal-Bench 2.1 pada 88,4, SciCode pada 56,5, Humanity's Last Exam pada 42,9, 𝜏²-banking pada 50,7, dan long-context recall pada 80,3. Itu semua adalah instrumen penalaran umum. Tak satu pun dari itu dapat dijalankan pada volume CT 3D, dan itu bukanlah celaan terhadap Grok 4.6 — itu adalah pernyataan tentang apa yang diukur oleh rangkaian benchmark tersebut.

Sisi CT hanya memiliki satu tabel, dan tabel itu milik para penulis.

Seluruh basis bukti publik NV-Reason-CT adalah satu tabel klasifikasi pada 18 label CT-RATE, pada ambang seragam tetap, menggunakan prompt Ya/Tidak langsung tanpa head klasifikasi. Hasilnya melaporkan Macro-F1 0,614 dan Macro-AUROC 0,871, dibandingkan dengan VoxelFM pada 0,581/0,870, Pillar-0 pada 0,544/0,861, ClinFusion-8B pada 0,442, CT-CLIP pada 0,398/0,733, Merlin pada 0,358/0,662, dan MedGemma 1.5 pada 0,303.

Ini dilaporkan oleh vendor, berasal dari kartu model, dan saya menyebutnya demikian karena belum ada pihak independen yang mereproduksinya. Ada dua hal yang perlu diperhatikan di dalam tabel. Selisih F1 terhadap VoxelFM adalah 0,033, yang merupakan jarak nyata pada 18 label dengan ambang batas tetap. Selisih AUROC terhadap model yang sama adalah 0,001, yang merupakan seri. Kedua angka tersebut muncul di baris yang sama dari tabel yang sama, dan hanya satu di antaranya yang disertai klaim.

Hal lain yang diberitahukan tabel kepada Anda adalah tentang cara makalah ini membingkai dirinya sendiri. Model-model pembandingnya adalah sistem prapelatihan kontrastif 3D, MLLM generatif gabungan 2D/3D, dan model frontier berbasis slice. Para penulis memilih untuk melakukan benchmark terhadap sistem yang menerima volume, karena satu-satunya klaim yang bermakna di sini adalah bahwa model 3D generatif dapat mengalahkan model 3D diskriminatif dalam klasifikasi tanpa head. Ini tidak mengatakan apa pun tentang bagaimana NV-Reason-CT dibandingkan dengan model frontier umum dalam hal apa pun, karena perbandingan itu tidak ada pada sumbu ini.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Ke mana uang itu pergi, dan mengapa batas tier itu penting

Daftar tarif Grok 4.6 memiliki detail yang secara diam-diam menentukan banyak keputusan arsitektur: prompt di atas 200K token input ditagih dua kali tarif dasar — $4.00 masuk, $12.00 keluar, dengan tarif baca cache naik dari $0.50 menjadi $1.00. Tugas peninjauan kohort yang mengakumulasi temuan dalam satu konteks panjang persis merupakan beban kerja yang melewati batas itu. Di bawah ambang itu, tarif baca cache sebesar $0.50 per juta adalah seperempat dari harga input, yang membuat pengulangan prefiks tetap besar pada ribuan laporan menjadi terjangkau, bukan sekadar mungkin.

Melalui OrcaRouter, Grok 4.6 dilayani pada harga daftar penyedia tersebut tanpa markup, jadi aritmetika tier di atas adalah aritmetika yang benar-benar Anda bayar, dan penyesuaian apa pun di masa mendatang terhadapnya akan sampai ke tagihan Anda pada hari yang sama alih-alih pada perpanjangan berikutnya. Alasan untuk merutekan pekerjaan seperti ini alih-alih melakukan hard-code pada satu endpoint adalah bahwa bagian peninjauan kohort dari pipeline klinis adalah tempat Anda ingin mencoba tiga model berbeda sebelum memutuskan — dan pada satu kunci yang kompatibel dengan OpenAI dengan failover otomatis lintas penyedia, eksperimen itu hanya membutuhkan perubahan nama model.

Bagian CT dari pipeline ini tidak memiliki opsi semacam itu. NV-Reason-CT tidak dihosting di OrcaRouter — ini adalah checkpoint 10,6 GB dengan kode model kustom yang Anda jalankan sendiri, pada silikon Ampere, Hopper, atau Lovelace, dengan trust_remote_code=True. Kami tidak akan menyiratkan sebaliknya. Jika Anda membangun pipeline ini, Anda membeli GPU untuk satu bagian dan token untuk bagian lainnya, dan fakta bahwa kedua bagian setidaknya dapat dikelola dari satu konsol adalah satu-satunya klaim integrasi yang layak dibuat.

A screenshot of the OrcaRouter model page for Grok 4.6, showing the identifier grok/grok-4.6, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 500,000-token context window, the description of it as SpaceXAI's smartest model to date and the current flagship listed as Latest in the vendor's own developer docs, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $2.00 per million input tokens and $6.00 per million output tokens.

Berapa Nilai Sebenarnya dari Seorang Pembaca Kedua

Makalah NV-Reason-CT mencakup studi pendahuluan oleh ahli radiologi yang melaporkan "penilaian keyakinan yang favorable untuk tinjauan berbantuan AI" dan pengurangan 50% dalam rata-rata waktu interpretasi dan pelaporan yang dilaporkan. Angka-angka itu kuat dan disertai peringatan yang dinyatakan sendiri oleh makalah tersebut: bersifat pendahuluan, dan menggunakan desain studi dari para penulisnya sendiri. Tidak ada replikasi independen yang dipublikasikan, dan pengurangan waktu 50% dalam studi pembacaan terkontrol adalah persis jenis hasil yang menyusut saat direplikasi. Hal ini layak dilacak. Tidak layak dikutip sebagai hal yang sudah mapan.

Dibandingkan dengan itu, kontribusi Grok 4.6 terhadap alur kerja radiologi sama sekali bukan diagnosis. Ini adalah lapisan yang membaca laporan — antrean triase, surat tindak lanjut, kodefikasi, paket otorisasi awal. Pekerjaan itu berupa teks, volumenya tinggi, murah per unit, dan mode kegagalan jika salah bersifat administratif, bukan klinis. Di sinilah jendela konteks 500K dan pembacaan cache $0.50 benar-benar membuktikan nilainya.

Jadi, pemisahan yang dihasilkan perbandingan ini cukup blak-blakan: NV-Reason-CT memiliki jalur 3D yang nyata dan tidak punya distribusi, tidak punya harga, serta tidak punya verifikasi independen. Grok 4.6 memiliki distribusi, harga, cakupan benchmark independen, dan sama sekali tidak punya jalur volumetrik. Jika Anda perlu pemindaiannya dibaca, hanya salah satu dari ini yang bisa melakukannya. Jika Anda perlu urusan administratif seputar pemindaian itu ditangani, hanya yang satunya lagi yang merupakan produk.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari