
NV-Reason-CT vs GPT-5.6 Sol: 13,824 Token Visual Sebelum Anda Mengetik Satu Kata
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 45 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 182 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Setiap CT scan dada yang Anda kirim ke NV-Reason memakan 13.824 token visual sebelum prompt dimulai. Itu bukan pilihan protokol atau konfigurasi — itu adalah encoder visi 384×384×384 mm native milik model tersebut, yang menerima sebuah volume dan mengubahnya menjadi grid 24×24×24, dan kartu modelnya menyatakan secara eksplisit bahwa seluruh 13.824 token beserta koordinat tiga dimensinya mencapai model bahasa "tanpa downsampling spasial." Bandingkan itu dengan apa yang mungkin sudah Anda bayar selama ini. GPT-5.6 Sol menerima teks, gambar, dan file, dan gambar yang dikirimkan kepadanya adalah citra 2D — sebuah irisan, tangkapan layar penampil DICOM, figur radiologi yang disalin dari sebuah PDF. Salah satu dari model ini memiliki jalur volumetrik. Yang lain memiliki jendela konteks. Sebagian besar perbandingan di antara keduanya runtuh pada perbedaan itu, dan keruntuhan itulah bagian yang menarik.
Rilis yang tak diumumkan siapa pun
NVIDIA belum menerbitkan sepatah kata pun tentang NV-Reason-CT di newsroom miliknya. Tidak ada postingan peluncuran, tidak ada slide keynote, tidak ada siaran pers. Yang ada adalah repositori Hugging Face yang dibuat pada 8 September 2026, repositori GitHub di bawah organisasi NVIDIA-Medtech yang dibuat pada 2 September, Space demo Gradio, dan prapublikasi arXiv — NV-Reason-CT: Model Bahasa Visual 3D untuk Analisis CT — dikirimkan pada 23 September 2026 oleh tim yang terdiri dari enam belas penulis dari NVIDIA dengan rekan penulis di NIH dan University of Zurich.
Itu pola nyata, dan layak diberi nama secara tepat alih-alih dianggap sebagai misteri. Grup pencitraan medis NVIDIA merilis bobot secara diam-diam dan membiarkan makalah serta repositori yang mengumumkannya. Pendahulunya, NV-Reason-CXR-3B, dirilis pada Oktober 2025 dengan cara yang sama. Perbedaannya di sini adalah skala: ini pertama kalinya grup tersebut memperluas resep dari sinar-X 2D ke volume 3D asli, dan makalahnya baru berumur dua hari.
Apa yang dapat diketahui dari repositori: arsitektur, lisensi, data pelatihan, tabel benchmark. Apa yang belum dikonfirmasi: apakah NVIDIA berniat menjadikan ini sebagai lini produk yang didukung, apakah akan ada lebih banyak checkpoint menyusul, dan bagaimana kinerjanya dalam evaluasi siapa pun selain penulisnya. Repositori ini berada di versi 0.1 dan mendeskripsikan dirinya sebagai hanya untuk riset dan pendidikan.
Apa yang sebenarnya diterima masing-masing model
Di sinilah adu langsung menjadi jujur dengan cepat. Kedua model tidak memiliki permukaan input yang sama.
NV-Reason-CT membaca volume NIfTI — .nii atau .nii.gz — dengan intensitas voxel dalam satuan Hounsfield. Secara otomatis melakukan pemotongan ke dada atau perut menggunakan unit Hounsfield paru dan heuristik morfologi 3D, melakukan resampling ke resolusi isotropik 2 mm, dan hanya menerima "chest" atau "abdomen" sebagai nilai anatomi. Ini menghasilkan teks: laporan terstruktur, jawaban, atau jejak penalaran langkah demi langkah, dengan tombol untuk menonaktifkan penalaran untuk jawaban singkat.
GPT-5.6 Sol membaca teks, gambar, dan file, dengan jendela konteks 1.050.000 token dan hingga 128.000 token keluaran dalam satu respons. Ia tidak memiliki encoder volumetrik. Beri ia CT, dan Anda harus terlebih dahulu memutuskan bagaimana meratakan sekitar tiga ratus irisan menjadi sesuatu yang akan diterima oleh encoder gambar 2D — montase, beberapa irisan kunci, proyeksi intensitas maksimum yang dirender. Setiap pilihan itu membuang hubungan spasial yang menjadi tujuan pembangunan jalur 3D.
Jadi perumusan yang jujur bukanlah "model mana yang lebih pintar." Melainkan bahwa jalur gambar Sol dan jalur 3D NV-Reason-CT menjawab pertanyaan yang berbeda. Sol dapat bernalar tentang deskripsi seorang radiolog mengenai hasil pemindaian. NV-Reason-CT dapat bernalar tentang pemindaian itu.
Ada satu tolok ukur, dan hanya satu di antaranya yang memiliki angka padanya.
NV-Reason-CT melaporkan Macro-F1 0,614 dan Macro-AUROC 0,871 pada tugas klasifikasi 18 label CT-RATE, dengan menggunakan prompt Yes/No langsung tanpa head klasifikasi dan tanpa adaptasi khusus tugas. Itu adalah angka penulis sendiri dari kartu model, dan baris perbandingannya adalah bagian yang berguna: VoxelFM pada 0,581 Macro-F1, Pillar-0 pada 0,544, ClinFusion-8B pada 0,442, CT-CLIP pada 0,398, Merlin pada 0,358, MedGemma 1.5 pada 0,303. Pada ambang seragam tetap yang sama, model 3D generatif mengalahkan baseline pra-pelatihan kontrastif 3D dan model frontier berbasis slice.
Satu angka dalam tabel itu patut disikapi dengan skeptisisme, bukan sekadar diulang: selisih AUROC. NV-Reason-CT melaporkan 0,871 berbanding 0,870 milik VoxelFM. Seperseribu poin, pada evaluasi yang dijalankan vendor, bukanlah kemenangan — itu adalah hasil imbang dalam noise apa pun yang dibawa evaluasi tersebut. Selisih Macro-F1 sebesar 0,033 adalah klaim yang didukung bukti.
GPT-5.6 Sol tidak memiliki angka CT-RATE karena CT-RATE bukan tolok ukur yang dapat dijalankannya. Ia memiliki Artificial Analysis Intelligence Index sebesar 47, skor GPQA Diamond yang diukur AA sebesar 94,1, dan skor Humanity's Last Exam sebesar 49,5 — semuanya instrumen penalaran umum. Menempatkan 0,614 Macro-F1 di samping 47 pada Indeks AA berarti berhitung dengan dua penggaris yang berbeda. Saya tidak akan melakukannya, dan Anda sepatutnya tidak mempercayai siapa pun yang melakukannya.
Jejak penalaran, dua produk yang berbeda
Kedua model tersebut menghasilkan penalaran. Itulah satu-satunya tumpang tindih filosofis yang sesungguhnya, dan perbedaannya pun instruktif.
GPT-5.6 Sol menyediakan upaya penalaran yang dapat dikonfigurasi, sehingga Anda menukar latensi dan biaya dengan kedalaman per permintaan, dan Anda dapat meminta penalaran kembali melalui include_reasoning. Ini adalah kemampuan umum yang diterapkan pada apa pun yang Anda kirimkan.
Penalaran NV-Reason-CT sengaja dibuat sempit. Korpus pelatihannya terdiri atas kurang lebih 550.000 contoh tanya jawab terstruktur yang diambil dari 70.111 volume CT unik, dan sebagian di antaranya adalah penalaran yang ditulis oleh ahli radiologi yang dikumpulkan dari interpretasi ahli yang direkam dan ditranskripsikan. Tahap GRPO yang mengikuti SFT menggunakan imbalan yang dapat diverifikasi atas kumpulan kelainan dada dan perut — artinya sinyal imbalannya didasarkan pada apakah temuan yang dinyatakan benar-benar ada dalam volume tersebut, bukan pada apakah prosanya enak dibaca. Kartu model menggambarkan keluarannya sebagai "observasi yang dapat ditinjau, diagnosis banding, dan ketidakpastian," dan kartu itu memuat peringatan eksplisit bahwa penalaran yang dihasilkan "tidak dijamin merepresentasikan komputasi internal model." Peringatan itu benar-benar berfungsi. Itulah perbedaan antara jejak yang dapat Anda periksa terhadap data dan jejak yang hanya bisa Anda kagumi.
Ukuran dan lisensinya, dalam satu kali proses
• Parameter — NV-Reason-CT 4.69B total / 4.35B aktif di jalur CT, dari backbone Qwen3.5-4B ditambah Primus 3D ViT vs GPT-5.6 Sol tidak diungkapkan • Ukuran checkpoint — NV-Reason-CT ~10.6 GB BF16 safetensors, berjalan di Ampere/Hopper/Lovelace vs GPT-5.6 Sol hanya API • Input — volume CT NIfTI 3D dalam satuan Hounsfield vs teks, gambar, file • Konteks — NV-Reason-CT tidak berlaku, satu volume adalah satu prefiks tetap 13,824 token vs Sol 1,050,000 token masuk, 128,000 keluar • Lisensi — OpenMDW-1.1, bobot dapat diunduh vs proprietari, akses API saja • Ketersediaan — repositori vendor dan bobotnya sendiri vs dirutekan di OrcaRouter dengan tarif $4.00 / $20.00 per juta, dengan tarif Sol untuk input di atas 272K token berlipat ganda menjadi $8.00 / $30.00

Apa sebenarnya biaya yang harus Anda tanggung dari perpecahan itu
Perbandingan biaya hanya masuk akal setelah Anda menerima bahwa beban kerjanya berbeda, jadi inilah versi yang memang masuk akal.
Sol ditagih per token dan harganya memiliki tebing: $4,00 per juta input dan $20,00 per juta output hingga 272K token prompt, lalu $8,00 dan $30,00. Di OrcaRouter, layanan ini disediakan dengan harga daftar milik OpenAI sendiri tanpa markup, yang lebih penting daripada kedengarannya — tarif yang Anda lihat adalah tarif yang diterbitkan OpenAI, sehingga setiap perubahan harga mencapai tagihan Anda pada hari yang sama alih-alih pada pembaruan kontrak berikutnya. Tarif baca cache-nya adalah $0,40 per juta, sepersepuluh dari input, yang membuat loop agentik panjang dengan prefiks tetap yang besar dapat bertahan secara aritmetika.
NV-Reason-CT sama sekali tidak memiliki harga per token. Anda mengunduh 10,6 GB dan membayar GPU-nya. Itu pertanyaan capex versus opex, dan hanya ada satu jawaban: pada volume yang cukup tinggi, self-hosting model 4,35B parameter aktif menang dari segi biaya. Di bawah volume itu tidak, dan titik crossover sepenuhnya bergantung pada utilisasi GPU Anda. Belum ada orang di luar NVIDIA yang menerbitkan angka throughput untuk checkpoint ini, jadi siapa pun yang menyebutkan titik crossover kepada Anda sedang menebak.

Yang memang dibantu router di sini adalah bagian alur kerja yang bukan pemindaian. Pipeline riset klinis produksi jarang berupa satu model — pipeline itu adalah ekstraksi, langkah penalaran, langkah peringkasan, kadang opini kedua. OrcaRouter menyediakan 200+ model di balik satu endpoint yang kompatibel dengan OpenAI dengan failover otomatis lintas penyedia, sehingga bagian serbaguna dari pipeline itu dapat ditukar atau dialihkan rutenya tanpa kontrak kedua. NV-Reason-CT bukan salah satu model yang kami rutekan; model itu adalah checkpoint yang Anda jalankan sendiri. Kedua bagian pipeline tetap dapat berada di balik satu kunci.

Pertanyaan terbuka
NV-Reason-CT berusia dua hari sebagai makalah dan tujuh belas hari sebagai repositori, dan bidang yang dinaunginya cukup kecil sehingga titik data berikutnya akan informatif. Perhatikan tiga hal: reproduksi CT-RATE independen, checkpoint kedua dalam keluarga ini, dan tanda apa pun bahwa grup medis NVIDIA memperlakukan ini sebagai lini produk, bukan sekadar makalah. Sampai saat itu, posisi yang dapat dipertahankan itu sempit dan jelas — ini adalah checkpoint penalaran CT 3D native terkuat yang saat ini dapat diunduh, dinilai berdasarkan tabel penulis sendiri, dan ini bukan pengganti model frontier umum untuk apa pun kecuali membaca CT.
