Kartu hero yang dihasilkan berjudul 'NV-Reason-CT vs Claude Opus 5' dengan subjudul 'Kesalahan kategori yang layak ditanggapi serius'. Dua kartu yang saling berhadapan dipisahkan oleh sepasang panah biru: kartu kiri diberi label 'NV-Reason-CT' dengan ikon pemindaian tubuh dan '4,69B parameter - 13.824 token per volume CT - bukan perangkat medis'; kartu kanan diberi label 'Claude Opus 5' dengan ikon chip dan 'konteks 1M - keluaran 128K - $5 / $25 per juta token'. Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

NV-Reason-CT vs Claude Opus 5: Kesalahan Kategori yang Layak Ditanggapi dengan Serius

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Menempatkan NV-Reason-CT dan Claude Opus 5 dalam satu kalimat merupakan kesalahan kategori, dan tetap saja layak dilakukan, karena kesalahan itu memberi pelajaran. NV-Reason-CT adalah model visi-bahasa 3D native dengan 4,69 miliar parameter dari NVIDIA yang menerima volume CT dada atau perut dalam satuan Hounsfield dan menghasilkan uraian terstruktur temuan demi temuan. Ini bukan perangkat medis dan kartu modelnya sendiri menyatakan demikian. Claude Opus 5 adalah model teks dan visi frontier umum dari vendor tersebut, yang dirilis pada 24 Juli 2026, dengan jendela konteks satu juta token, batas keluaran 128.000 token, dan tarif yang dipublikasikan sebesar lima dolar per juta token masukan dan dua puluh lima per juta token keluaran. Salah satunya membaca CT. Yang lainnya membaca segala hal lain.

Alasan perbandingan itu terus dilakukan — dan akan terus terjadi, setiap kali seseorang melihat VLM medis baru dan meraih tolok ukur yang familier — adalah bahwa keduanya menghasilkan prosa tentang sebuah gambar. Kemiripan di permukaan itu benar-benar merusak cara orang menalar tentang keduanya, jadi layak untuk diuraikan secara terperinci.

Sumbu sebenarnya yang mereka miliki bersama, dan sumbu yang tidak mereka miliki bersama.

Mereka tumpang tindih tepat di satu tempat, dan itu lebih sempit daripada yang terlihat.

• Modalitas dalam — NV-Reason-CT menerima volume NIfTI satu saluran dalam satuan Hounsfield melalui pemroses tiga dimensi khusus; Claude Opus 5 menerima teks, gambar, dan file, yang merupakan antarmuka generasi kedua untuk gambar dan tidak dapat menyerap studi CT volumetrik secara native

• Apa yang dikembalikan — daftar temuan yang disusun menurut wilayah anatomis dari NV-Reason-CT, dibandingkan dengan prosa umum, JSON terstruktur, atau pemanggilan alat dari Claude Opus 5

• Satuan pekerjaan — satu volume CT, disampel ulang menjadi isotropik 2 mm, dipotong sesuai anatomi, dipotong menjadi patch 8 x 8 x 8; dibandingkan dengan apa pun yang Anda masukkan ke dalam anggaran token

• Konteks — NV-Reason-CT tidak memiliki jendela obrolan sama sekali; satu volume menjadi 13.824 token visual tanpa downsampling. Claude Opus 5 menampung 1.000.000 token masuk dan mengeluarkan hingga 128.000

• Lisensi — OpenMDW-1.1, model yang dapat diunduh yang Anda jalankan di perangkat keras Anda sendiri; dibandingkan dengan API yang dihosting

• Penggunaan yang dinyatakan — hanya untuk riset dan pendidikan, secara eksplisit bukan perangkat medis, untuk NV-Reason-CT; sebagai kontras dengan bantuan serbaguna untuk Claude Opus 5

• Harga — tidak ada harga daftar, karena tidak ada yang perlu dibeli, hanya bobot untuk dijalankan; dibandingkan $5 dan $25 per juta token, dengan pembacaan cache sebesar $0.50

Baris "modality in" adalah tempat kesalahan kategori lahir. Keduanya menerima gambar, sehingga keduanya tampak seperti model gambar, dan pembaca wajar bertanya mana yang lebih baik dalam hal gambar. Namun, studi CT bukanlah gambar. Itu adalah larik volumetrik dengan skala fisik dalam milimeter, unit densitas terkalibrasi, dan anatomi yang hanya bermakna dalam tiga dimensi. Kemampuan visi Claude Opus 5 benar-benar mumpuni dan ia akan membahas radiograf atau slide patologi secara masuk akal. Itu tugas yang berbeda dari mengintegrasikan kubus nilai Hounsfield berukuran 384 milimeter pada resolusi 2 mm dan melaporkan lobulasi sebuah nodul.

Apa yang sebenarnya diukur oleh angka-angka di setiap sisi

Kedua model itu memiliki catatan tolok ukur yang tidak pernah bersinggungan, dan membacanya berdampingan tanpa menyadari hal itu adalah cara keputusan pengadaan yang buruk dibuat.

NV-Reason-CT melaporkan hasilnya pada benchmark CT dada publik CT-RATE, di seluruh delapan belas label, menggunakan ambang seragam yang tetap dan prompt ya/tidak langsung tanpa classification head dan tanpa adaptasi khusus tugas. Ia mencatat F1 0,614 dan AUROC 0,871, unggul dari VoxelFM dengan 0,581 dan 0,870, Pillar-0 dengan 0,544 dan 0,861, ClinFusion-8B dengan F1 0,442, CT-CLIP dengan 0,398 dan 0,733, Merlin dengan 0,358 dan 0,662, dan MedGemma 1.5 dengan F1 0,303 ketika diberikan hingga 85 irisan aksial. Ada juga macro-F1 turunan laporan sebesar 0,592. Semua angka tersebut berasal dari makalah NVIDIA sendiri. Tidak ada satu pun yang telah direproduksi oleh pihak lain, dan model tersebut sudah dapat diunduh selama beberapa minggu.

Rekam jejak Claude Opus 5 adalah rekam jejak serbaguna dan sebagian besar independen. Artificial Analysis mengukurnya pada 50,8 di Intelligence Index, 78 di Coding Index, 93,2 di GPQA Diamond, dan 54,9 di Humanity's Last Exam, dengan skor recall konteks panjang 79,33. Itu adalah angka pihak ketiga untuk tugas penalaran umum, kode, dan pengetahuan. Tidak ada tolok ukur pencitraan klinis dalam kumpulan itu, dan tidak ada baris CT-RATE di mana pun dalam rekam jejak publik Claude Opus 5.

Jadi, pernyataan yang jujur bukanlah bahwa salah satunya lebih unggul. Melainkan bahwa kedua model tersebut belum pernah diukur pada tugas yang sama oleh siapa pun. Kalimat apa pun yang berbentuk "NV-Reason-CT lebih baik daripada Claude Opus 5 dalam pencitraan medis" tidak dapat difalsifikasi sebagaimana tertulis, karena belum ada yang menjalankan eksperimen itu. Tabel perbandingan milik NVIDIA sendiri tidak memuat model frontier umum mana pun.

A generated scoreboard titled 'NV-Reason-CT vs Claude Opus 5 - what each number measures' with two columns. The left column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI volumes in Hounsfield units; output, structured findings by anatomical region; benchmark, CT-RATE 0.614 F1 and 0.871 AUROC over 18 labels; provenance, authors' own paper, unreproduced; licence, OpenMDW-1.1, self-hosted; use, research and education, not a medical device. The right column, headed 'Claude Opus 5', lists six rows: input, text, images, files; output, general prose, JSON, tool calls; benchmark, AA Intelligence 50.8, GPQA Diamond 93.2, HLE 54.9; provenance, independent, Artificial Analysis; licence, hosted API; use, general purpose. A footer reads 'The two benchmark sets share no task, so neither column can be subtracted from the other.'

Di mana orang salah memahami pertanyaan antarmuka

Satu-satunya tumpang tindih teknis yang benar-benar menarik adalah yang tidak diperdebatkan siapa pun: seperti apa bentuk antarmuka antara model CT dan model teks seharusnya.

Insting yang wajar adalah memberi Claude Opus 5 sekumpulan citra CT atau volume yang di-downsample dan memintanya menalar. Pada 1.000.000 token konteks, itu terdengar berlimpah, dan dibandingkan studi yang hanya 13.824 token visual, itu terdengar seperti ruang yang sangat lapang. Ruangnya bukan masalahnya. Pipeline visi Claude Opus 5 memperlakukan gambar sebagai citra dua dimensi dengan skala piksel. CT dada yang disajikan dengan cara itu kehilangan jarak antarslice yang membuat lesi dapat diukur dan kalibrasi densitas yang membuat "ground-glass" menjadi ambang batas alih-alih deskripsi. Anda dapat memberinya montase irisan aksial dan mendapatkan paragraf yang terdengar koheren. Yang tidak dapat Anda peroleh adalah sebuah pengukuran.

Itulah tepatnya yang menjadi sasaran komputasi desain NV-Reason-CT. Grid 24 x 24 x 24 dari volume 384 milimeter diserahkan kepada model bahasa pada resolusi penuh, tanpa pengurangan sampling spasial dan tanpa lapisan penggabungan, itulah sebabnya jalur aktifnya memiliki 4,35B parameter, bukan sesuatu yang jauh lebih kecil. Arsitektur ini adalah taruhan bahwa mempertahankan detail spasial sepadan dengan biaya token. Ini adalah taruhan tentang representasi, bukan tentang kemampuan berbahasa, dan Claude Opus 5 bukanlah peserta di dalamnya.

Pola yang produktif justru yang membosankan: gunakan model CT untuk pembacaan volumetrik, dan gunakan model teks untuk semua hal di sekitarnya. Pembuatan dan normalisasi laporan, ringkasan kohort, kerangka evaluasi, mengonversi arsip DICOM ke NIfTI dalam skala besar, triase studi mana yang harus diperiksa manusia lebih dulu. Itu adalah pekerjaan dokumen panjang dan kode, dan di situlah model dengan konteks 1M membuktikan bahwa tarifnya sepadan.

Biaya, dalam dua unit yang tidak dapat dikonversi

Claude Opus 5 dikenakan biaya berdasarkan pemakaian. Lima dolar per juta token input dan dua puluh lima dolar per juta output, pembacaan cache lima puluh sen, penulisan cache sepuluh dolar. Untuk pipeline yang menormalisasi korpus laporan atau menulis dan menulis ulang kode evaluasi, itu menghasilkan perkiraan yang dapat Anda susun: token masuk, token keluar, pembacaan cache, dan tagihan yang jauh lebih murah jika Anda menangani caching dengan benar.

NV-Reason-CT tidak memiliki harga. Anda mengunduh 4,69 miliar parameter dan membayar dalam bentuk listrik, jam GPU, dan waktu rekayasa. Tidak ada angka throughput yang dipublikasikan untuk studi lengkap 13.824 token, dan tidak ada varian terkuantisasi yang ditawarkan, jadi biaya per studi untuk menjalankannya adalah angka yang harus Anda ukur sendiri. Itu normal untuk bobot riset dan juga merupakan perbedaan praktis terbesar antara keduanya: yang satu memiliki daftar tarif, yang lain memiliki tagihan yang tidak dapat Anda lihat sampai Anda sudah membayarnya.

Perbandingan yang benar-benar penting adalah per studi, bukan per token. Pembacaan CT adalah satu unit pekerjaan. Proses normalisasi laporan atas kasus yang sama adalah pekerjaan teks yang diukur dalam ribuan token. Memberi angka dolar pada yang pertama berarti mengetahui perangkat keras Anda; memberi angka pada yang kedua hanyalah aritmetika.

Jebakan di tengah perbandingan

Ada satu kesalahan spesifik yang layak disebutkan, karena itulah kesalahan yang diundang oleh perbandingan ini. Kesalahan itu adalah memperlakukan NV-Reason-CT sebagai fine-tune spesialis dari model umum, dan karena itu mengasumsikan model umum akan cukup dekat pada sebagian besar kasus dan jauh lebih fleksibel.

Ini bukan fine-tune. Ini adalah transformer visi 3D bernama Primus, diinisialisasi dari COLIPRI, dipasangkan ke tulang punggung bahasa Qwen3.5-4B dengan penyematan posisi rotary multi-sumbu 3D, dilatih pada sekitar 550.000 contoh tanya-jawab terstruktur yang diambil dari 70.111 volume CT di seluruh CT-RATE, CancerVerse, dan koleksi NIH internal, lalu disetel dengan GRPO terhadap reward yang memberi bobot 2,0 pada F1 kumpulan abnormalitas, 0,5 pada skor struktur laporan spesifik region, dan 1,0 pada penalti panjang lunak. Encoder tiga dimensi adalah inti dari model ini. Front end dua dimensi atau berbasis irisan adalah instrumen yang berbeda, dan perbandingan dalam makalah itu sendiri menunjukkan berapa nilai perbedaan tersebut: MedGemma 1.5 pada 0,303 F1 saat diberi hingga 85 irisan aksial, dibandingkan 0,614 untuk model volumetrik aslinya.

Kesalahan kebalikannya sama umumnya dan sama mahalnya: mengasumsikan bahwa karena NV-Reason-CT terspesialisasi, Anda harus menggunakannya untuk segala hal klinis. Model ini hanya mendukung dada dan perut, pemanggilannya berupa berkas NIfTI, bukan pesan obrolan, dan ketentuan lisensinya menyatakan hanya untuk riset dan pendidikan. Model ini tidak akan membaca slide patologi, menjawab pertanyaan tentang pedoman, atau menulis kode yang memproses konversi DICOM Anda secara batch. Menggunakan model CT untuk pekerjaan teks adalah kesalahan kategori yang sama dengan menggunakan model teks untuk volumetrik, hanya saja arahnya berlawanan.

A generated scoreboard titled 'The two models, at a glance' listing six paired rows. Row one: parameters, 4.69B total and 4.35B active, against undisclosed. Row two: context, 13,824 visual tokens per volume against 1,000,000 input and 128,000 output tokens. Row three: input, one-channel NIfTI in Hounsfield units against text, images and files. Row four: availability, weights downloadable on Hugging Face against hosted API. Row five: price, self-hosted with no rate card against $5 and $25 per million tokens. Row six: status, unannounced research release against generally available. A footer reads 'NV-Reason-CT figures per the authors paper and model card; Claude Opus 5 figures per the provider rate card and Artificial Analysis.'

Bagaimana kedua bagian itu menyatu dalam satu sistem

Tidak ada model yang menggantikan yang lain, dan arsitektur yang masuk akal mencakup keduanya — yang memunculkan pertanyaan praktis tentang bagaimana Anda memanggilnya.

Claude Opus 5 disajikan melalui OrcaRouter sebagai anthropic/claude-opus-5 dengan tarif daftar penyedia Anthropic tanpa markup, di dalam satu API yang mencakup lebih dari 200 model. Hal itu kurang penting bagi satu panggilan tunggal dibandingkan bagi pipeline di sekelilingnya: ketika bagian teks dari sebuah build klinis adalah salah satu model di antara beberapa kandidat, memiliki semuanya di balik satu kunci berarti Anda dapat membandingkannya pada korpus Anda sendiri tanpa kontrak kedua atau perubahan kode, dan DSL routing memungkinkan Anda mengirim permintaan individual ke model yang seharusnya menanganinya sementara failover otomatis melindungi Anda ketika penyedia mengalami degradasi.

NV-Reason-CT tidak ada di platform kami, dan tidak ada model NVIDIA pun. Itu adalah bobot yang Anda unduh dan jalankan di perangkat keras Anda sendiri, yang persis itulah yang diizinkan lisensi untuk Anda lakukan dan, mengingat inputnya adalah data volumetrik yang berasal dari pasien, mungkin memang itu yang Anda inginkan. Kami tidak akan menyiratkan bahwa kami merutekan model yang tidak kami hosting. Sisi teks dari build inilah tempat kami berguna; sisi volumetriknya adalah tempat Anda harus mandiri dengan model 4,69B dan GPU.

A screenshot of the OrcaRouter model page for Claude Opus 5, showing the identifier anthropic/claude-opus-5, the description of it as Anthropic's most capable model for complex reasoning and long-horizon agentic work, a side panel listing a 1,000,000-token context window and 128,000 maximum output tokens with text, image and file input and text output, and a stat strip reading $5.00 per million input tokens, $25.00 per million output tokens, and a p50 time to first token under four seconds.

Vonis yang lolos dari pengujian ketat

Jika Anda perlu volume CT dibaca menjadi temuan terstruktur, ada model untuk itu, berasal dari grup riset NVIDIA, dan itu berupa unduhan, bukan panggilan API. Jika Anda perlu korpus laporan dinormalisasi, harness evaluasi ditulis, pekerjaan konversi DICOM dibuat skripnya, atau kohort diringkas, ada juga model untuk itu, dan model tersebut punya daftar tarif.

Garis yang harus dipertahankan adalah bahwa tidak ada dari keduanya yang terbukti lebih baik daripada yang lain dalam hal apa pun, karena eksperimennya belum dijalankan. Yang telah dibuktikan adalah bahwa antarmuka tiga dimensi native mengalahkan antarmuka berbasis irisan pada benchmark CT dada publik dengan selisih yang menurut para penulis sekitar tiga poin F1, dan bahwa model frontier umum secara independen terukur di puncak bidang ini dalam penalaran, kode, dan pekerjaan konteks panjang. Itu adalah dua pernyataan tentang dua pekerjaan yang berbeda. Membacanya sebagai peringkat adalah kekeliruan kategori, dan itu bertahan sampai seseorang menerbitkan perbandingan head-to-head yang belum diterbitkan siapa pun.