Kartu hero yang dihasilkan berjudul 'NV-Reason-CT vs DeepSeek V4 Pro' dengan subjudul 'Biaya membaca sebuah pemindaian, dan kapan menjalankan batch'. Dua kartu yang saling berhadapan dipisahkan oleh sepasang panah biru: kartu kiri diberi label 'NV-Reason-CT' dengan ikon pemindaian tubuh dan 'satu volume CT - 13.824 token visual - tanpa throughput yang dipublikasikan'; kartu kanan diberi label 'DeepSeek V4 Pro' dengan ikon chip dan 'total 1,6T / MoE aktif 49B - konteks 1M - $0,66 / $1,98 per M, digandakan dalam dua jendela UTC'. Logo OrcaRouter ditempatkan secara komposit di sudut kanan bawah.
Guides & Insights

NV-Reason-CT vs DeepSeek V4 Pro: Biaya Membaca Pemindaian, dan Kapan Menjalankan Batch

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Berikut fakta operasional yang membentuk lebih banyak anggaran pipeline klinis daripada tolok ukur mana pun: DeepSeek V4 Pro berbiaya $0,66 per juta token input dan $1,98 per juta token output, dan tarif tersebut menjadi dua kali lipat selama dua jendela setiap hari, 01:00 hingga 04:00 dan 06:00 hingga 10:00 UTC. Pekerjaan batch yang berjalan di luar jendela tersebut berbiaya setengah dari biaya di dalamnya. Sementara itu NV-Reason-CT, penalar CT 3D dengan 4,69 miliar parameter milik NVIDIA, sama sekali tidak memiliki kartu tarif — model ini adalah sekumpulan bobot yang Anda unduh dan jalankan, tanpa angka throughput yang dipublikasikan untuk satu studi 13.824 token. Salah satu dari model ini Anda jadwalkan. Model lainnya harus Anda ukur sebelum dapat menganggarkannya.

Asimetri itu adalah cara yang berguna untuk memasuki perbandingan ini, karena kedua model berada di ujung berlawanan dari pipeline dan gagal secara finansial dengan cara yang berlawanan. NV-Reason-CT adalah instrumen berbiaya tetap: studi marginal hampir gratis setelah perangkat kerasnya dibeli, tetapi keputusan perangkat kerasnya besar dan latensi per studi tidak terdokumentasi. DeepSeek V4 Pro adalah mesin berbiaya variabel: tidak ada yang perlu dibeli, semuanya diukur, dan meterannya memiliki jadwal yang bisa Anda baca dari kalender.

Apa masing-masing itu, masing-masing dalam satu baris

• Pekerjaan — NV-Reason-CT membaca volume CT dada atau perut dan mengeluarkan temuan terstruktur; DeepSeek V4 Pro membaca dan menulis teks

• Arsitektur — sebuah vision transformer 3D bernama Primus yang diinisialisasi dari COLIPRI, dengan backbone bahasa Qwen3.5-4B dan penyematan posisi rotary multi-sumbu 3D, pada 4,69 miliar parameter yang 4,35 miliar di antaranya aktif; dibandingkan dengan mixture of experts berparameter 1,6 triliun dengan 49 miliar aktif per token

• Masukan — volume NIfTI satu kanal (.nii, .nii.gz) dalam satuan Hounsfield, berorientasi LPS, diresampel ulang menjadi isotropik 2 mm dan dipangkas sesuai anatomi; terhadap teks

• Konteks — satu volume menjadi 13.824 token visual dalam kisi 24 x 24 x 24, tanpa downsampling spasial dan tanpa lapisan penggabungan; dibandingkan dengan 1.048.576 token masuk dan 384.000 token keluar

• Anatomi yang didukung — dada dan perut, dan tidak ada yang lain; dibandingkan dengan segala hal yang dapat dideskripsikan oleh teks

• Harga — tidak ada harga daftar, self-hosted, tidak ada throughput per-studi yang dipublikasikan; dibandingkan $0,66 / $1,98 per juta token, berlipat ganda dalam dua jendela UTC yang disebutkan di atas, dengan pembacaan cache sebesar $0,022

• Latensi terukur — tidak dipublikasikan; dibandingkan dengan median waktu ke token pertama 3.483 milidetik pada 96,01 token keluaran per detik, dengan tingkat kesalahan 0,75%

Ada dua baris di sana yang masing-masing bernilai lebih dari satu baris. Baris konteks adalah yang jelas — satu juta token versus 13.824 — tetapi satuannya tidak dapat dibandingkan dan merupakan kekeliruan untuk membacanya sebagai kesenjangan kemampuan ke arah mana pun. 13.824 token adalah biaya untuk merepresentasikan satu studi CT secara setia. Satu juta token adalah seberapa banyak teks di sekitarnya yang dapat Anda tampung. Angka pertama adalah pernyataan tentang resolusi; angka kedua adalah pernyataan tentang memori.

Baris latensi adalah baris yang dilewati. Median 3,48 detik DeepSeek V4 Pro hingga token pertama dan 96 token per detik adalah angka terukur yang dipublikasikan, dan angka-angka itu memungkinkan Anda memperkirakan ukuran pekerjaan teks di atas kertas. Tidak adanya angka setara apa pun untuk NV-Reason-CT bukanlah kritik terhadap model tersebut; itulah sebabnya pipeline CT tidak dapat dihitung biayanya sebelum seseorang menjalankannya. Model 4,69B pada 13.824 token visual bukanlah komputasi kecil, dan sampai Anda menghitung waktunya di perangkat keras Anda sendiri, Anda hanya menebak.

Membaca dua catatan benchmark tanpa membohongi diri sendiri

Rekor DeepSeek V4 Pro adalah campuran pengukuran independen dan pelaporan vendor, dan campuran itu instruktif karena mengandung satu angka yang tampak mengkhawatirkan padahal tidak.

• Artificial Analysis Intelligence Index — 36, yang berada di persentil ke-72,4 dari model yang diukur

• GPQA Diamond — 92.8, yang berada di dekat puncak bidang ini

• Humanity's Last Exam — 41, dan 41 pada MMLU-Pro, 62,51 pada indeks matematika

• τ²-Bench — 96,20, dengan IFBench pada 76,46 dan tau_banking pada 39,59

• Recall konteks panjang — 80.33

• SciCode dan Terminal-Bench — 51 dan 78.65 pada versi kedua Terminal-Bench

Indeks komposit sebesar 36 yang berdampingan dengan GPQA Diamond sebesar 92,8 terdengar seperti kontradiksi sampai Anda menyadari apa itu indeks. Indeks adalah agregat dari banyak evaluasi, dan model yang unggul dalam segelintir evaluasi namun hanya memadai dalam evaluasi lain akan berada di posisi pertengahan pada totalnya sekaligus memuncaki papan-papan individual. Siapa pun yang mengutip angka 36 saja untuk berargumen bahwa DeepSeek V4 Pro kelas menengah sedang mengutip rata-rata seolah-olah itu nilai maksimum. Siapa pun yang mengutip 92,8 saja untuk berargumen bahwa model itu memimpin bidang sedang mengutip nilai maksimum seolah-olah itu rata-rata. Kedua angka berasal dari Artificial Analysis, dan keduanya benar.

Rekor NV-Reason-CT tidak memiliki campuran seperti itu, dan itulah masalah sebenarnya. Angka CT-RATE-nya — 0.614 F1 dan 0.871 AUROC di delapan belas label, menggunakan ambang batas seragam tetap dan prompt ya/tidak langsung tanpa kepala klasifikasi dan tanpa adaptasi khusus tugas — berasal dari makalah NVIDIA sendiri dan tidak dari tempat lain. Set perbandingan dalam makalah itu (VoxelFM pada 0.581, Pillar-0 pada 0.544, ClinFusion-8B pada 0.442, CT-CLIP pada 0.398, Merlin pada 0.358, MedGemma 1.5 pada 0.303) sepenuhnya adalah model pencitraan lainnya. Tidak ada satu pun model teks umum yang muncul di dalamnya, dan tidak ada pihak ketiga yang mereproduksi angka-angka tersebut.

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

Pertanyaan penjadwalan, yang telah dituntaskan

Penetapan harga berbasis waktu pada DeepSeek V4 Pro adalah hal yang paling dapat ditindaklanjuti secara operasional dari kedua model tersebut, sehingga hal itu layak mendapatkan penjelasan langkah demi langkah yang konkret.

Beban kerja sisi teks yang realistis untuk program CT tidaklah glamor. Itu berarti mengekstrak bidang terstruktur dari korpus laporan historis agar Anda memiliki label untuk digunakan dalam pelatihan, mengonversi pohon direktori DICOM ke NIfTI dalam skala besar, menulis dan menulis ulang harness evaluasi, menormalkan satuan dan terminologi di empat kumpulan data, serta merangkum kohort. Sebut saja seratus juta token masukan dan sepuluh juta token keluaran untuk program berukuran menengah, yang merupakan angka bulat yang sengaja dipakai untuk mewakili "banyak pekerjaan teks".

• Di dalam jendela yang digandakan — $1,32 dan $3,96 per juta, jadi $132 ditambah $39,60 untuk volume tersebut

• Di luar rentang tersebut — $0,66 dan $1,98 per juta, jadi $66 ditambah $19,80

• Selisihnya — sekitar $86, atau 49% dari tagihan off-peak, untuk memindahkan pekerjaan yang secara alami dapat dijalankan secara batch

• Pembacaan cache — $0.022 per juta, yang merupakan seperenam puluh dari tarif input, jadi setiap awalan prompt yang Anda gunakan kembali di seluruh korpus hampir gratis

Itu bukan kesalahan pembulatan, dan itu tersedia karena pekerjaannya asinkron. Ekstraksi laporan tidak perlu terjadi pada pukul 14.00. Tidak ada apa pun dalam pekerjaan konversi DICOM yang peduli jam berapa sekarang. Struktur penetapan harga adalah undangan langsung untuk menjadwalkan, dan pipeline yang mengabaikannya membayar premi 49% demi hak istimewa untuk berjalan kapan pun ia mau. Pembacaan cache penting karena alasan yang sama: prompt sistem bersama atau skema ekstraksi tetap, yang digunakan ulang di ribuan laporan, berada pada seperenam puluh dari tarif input.

NV-Reason-CT tidak memiliki tuas yang setara, karena tidak memiliki meter. Biaya membaca satu pemindaian adalah berapa pun biaya GPU Anda per jam dibagi dengan berapa banyak pemindaian per jam yang dapat Anda dorong melewatinya, dan angka kedua itulah yang belum pernah dipublikasikan siapa pun. Jika satu studi memerlukan dua detik, satu L40S menangani program besar dengan nyaman. Jika perlu dua puluh detik, aritmetika perangkat keras berubah sepenuhnya. NVIDIA menguji pada H100 dan L40S, yang memberi tahu Anda kelas kartu, bukan lajunya.

Jebakan dalam menganggapnya dapat digantikan

Kesalahan yang diundang oleh pertandingan ini lebih halus daripada kesalahan kategori yang lazim, karena ada versi dari kesalahan itu yang tampak masuk akal di atas slide.

DeepSeek V4 Pro menampung 1.048.576 token dan mengeluarkan hingga 384.000. Sebuah volume CT, menurut perhitungan model yang membacanya dengan benar, hanyalah 13.824 token. Jadi model teks dengan jendela satu juta token punya ruang untuk 70-an studi CT pada jumlah token itu. Aritmetikanya benar dan kesimpulannya — bahwa Anda bisa memasukkan data CT ke model teks dan menghemat infrastruktur pencitraan — salah, justru karena alasan angka 13.824 itu ada sejak awal.

Angka itu bukan ringkasan terkompresi dari sebuah pemindaian. Angka itu adalah pemindaian itu sendiri, pada resolusi isotropik 2 mm pada kubus 384 milimeter, dipotong menjadi patch 8 x 8 x 8, dan diserahkan kepada model bahasa tanpa penurunan sampel spasial dan tanpa lapisan penggabungan. Jumlah tokennya tinggi justru karena tidak ada yang dibuang: jarak antaririsan yang membuat nodul dapat diukur, nilai densitas yang membuat tekstur menjadi ambang batas alih-alih kata sifat. Model teks tidak dapat mencerna token-token itu sebagai volume, sama seperti sebuah dokumen juga tidak bisa. Model itu punya anggaran. Model itu tidak punya antarmuka.

Perbandingan internal makalah itu sendiri memberikan angka pada perbedaan tersebut. MedGemma 1.5, yang diberi hingga 85 irisan aksial — hasil terbaik yang secara wajar dapat dilakukan oleh front end dua dimensi atau bertumpuk irisan — memperoleh skor 0,303 F1 berbanding 0,614 untuk model volumetrik native. Kesenjangan itu adalah nilai dari encoder tiga dimensi, dan sebesar apa pun jendela konteksnya, tidak akan bisa menutup kesenjangan itu.

Substitusi balik gagal karena alasan yang lebih sederhana. NV-Reason-CT mendukung dada dan abdomen, menerima file NIfTI alih-alih prompt, tidak memiliki penggunaan alat, dan kartu modelnya membatasinya pada riset dan pendidikan serta menyatakan bahwa ini bukan alat medis dan bahwa keluarannya bisa salah. Ini tidak dapat mengekstrak bidang dari laporan, dan tidak dapat menulis skrip yang membangun korpus Anda.

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

Di mana kami cocok, dan di mana kami sengaja tidak

DeepSeek V4 Pro dilayani melalui OrcaRouter sebagai deepseek/deepseek-v4-pro, dengan tarif daftar dari penyedia tanpa markup, di dalam satu API yang mencakup lebih dari 200 model. Penerusan ini lebih penting daripada biasanya untuk model dengan harga berdasarkan waktu: ketika vendor mengubah tarif atau jendela waktu, tarif di sisi kami berubah pada hari yang sama, karena tidak ada lapisan markup di antaranya yang mempertahankan angka lama. Failover otomatis menangani kasus ketika penyedia mengalami degradasi di tengah batch, yang untuk pekerjaan ekstraksi panjang tanpa pengawasan adalah mode kegagalan yang benar-benar menghabiskan satu malam Anda, dan DSL routing memungkinkan Anda mengirim permintaan individual ke model yang seharusnya menanganinya alih-alih menjalankan semuanya melalui satu endpoint.

NV-Reason-CT tidak ada di platform kami. Tidak ada model NVIDIA pun. Sisi CT dari arsitektur ini adalah perangkat keras Anda sendiri dengan bobot yang Anda unduh sendiri, dan kami tidak akan menulis kalimat yang membuat pembaca berpikir sebaliknya. Mengingat inputnya adalah data volumetrik yang berasal dari pasien dan lisensinya adalah OpenMDW-1.1 tanpa layanan terhosting apa pun yang melekat, eksekusi lokal adalah tempat model itu seharusnya berada, terlepas dari itu.

Apa yang sebenarnya diberitahukan oleh pemasangan itu kepada Anda

Kedua model tersebut tidak bersaing, dan inti dari membandingkannya adalah bahwa keduanya gagal dengan cara yang berbeda. NV-Reason-CT memberi Anda kemampuan yang tidak dimiliki model terbuka lain — penalaran CT tiga dimensi native pada resolusi penuh studi — dan meminta Anda menerima biaya per studi yang tidak dianggarkan, throughput yang tidak dipublikasikan, serta lisensi yang melarang penerapan klinis. DeepSeek V4 Pro memberi Anda mesin terukur dengan latensi yang dipublikasikan, tingkat kesalahan yang dipublikasikan, pengukuran independen, dan harga yang dapat Anda potong setengah hanya dengan melihat jam, tetapi sama sekali tidak dapat melihat hasil pemindaian.

Jika Anda membangunnya sendiri alih-alih membelinya, bentuk yang bertahan saat bersentuhan adalah yang membosankan. Jalankan pembacaan CT secara lokal, anggarkan dengan mengukur alih-alih dengan mengutip, dan letakkan segala sesuatu yang bersifat tekstual di sekitarnya pada pertemuan dengan jendela di luar jam sibuk. Satu jadwal yang tidak boleh ditiru siapa pun adalah jadwal yang menjalankan seratus juta token ekstraksi pada 02:00 UTC karena saat itulah batch kebetulan sudah siap.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.