Kartu hero yang dihasilkan berjudul 'NV-Reason-CT vs Gemini 3.1 Pro' dengan subjudul 'Permukaan input terluas, dan tetap bukan pembaca CT'. Dua kartu yang saling berhadapan dipisahkan oleh sepasang panah biru: kartu kiri diberi label 'NV-Reason-CT' dengan ikon pemindaian tubuh dan 'hanya dada dan perut - 13.824 token visual per volume - OpenMDW-1.1'; kartu kanan diberi label 'Gemini 3.1 Pro' dengan ikon chip dan 'audio, video, gambar, berkas, teks masuk - konteks 1M - tier pratinjau'. Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

NV-Reason-CT vs Gemini 3.1 Pro: Permukaan Input Terluas, dan Tetap Bukan Pembaca CT

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Sembilan puluh empat persen. Itu adalah tingkat kesalahan yang saat ini dicatat katalog kami sendiri untuk satu rute yang melayani Gemini 3.1 Pro — 93,93%, bersama waktu median ke token pertama yang terbaca sebagai batas sepuluh detik dan angka throughput 978 token per detik. Bacalah itu sebagai pernyataan tentang model dan Anda akan menarik kesimpulan yang justru salah. Bacalah itu sebagai pernyataan tentang tier pratinjau yang sedang dibebani dan itu menjadi hal paling berguna di halaman ini, karena itulah yang sebenarnya dialami sebuah pipeline klinis ketika bergantung pada rute yang belum disediakan untuk lalu lintas produksi.

Model di sisi lain perbandingan ini tidak punya masalah semacam itu dan tidak punya pengukuran semacam itu. NV-Reason-CT adalah penalar CT 3D native milik NVIDIA dengan 4,69 miliar parameter, dapat diunduh di bawah OpenMDW-1.1, tanpa angka throughput yang dipublikasikan sama sekali dan tidak di-hosting di mana pun. Jadi satu sisi pertarungan ini memberi Anda permukaan input terluas di bidang ini dengan profil ketersediaan yang harus Anda rancang; sisi lainnya memberi Anda satu kemampuan sempit dengan latensi yang harus Anda ukur sendiri. Keduanya tidak memiliki dasbor pemantauan yang bisa Anda percayai pada hari pertama, dan karena alasan yang berlawanan.

Dua model, dua definisi "multimodal"

Kata itu menjalankan banyak fungsi dalam kedua deskripsi produk, dan hampir tidak ada fungsi itu yang dipakai bersama.

• Input yang diterima — Gemini 3.1 Pro menerima teks, gambar, audio, video, dan file; NV-Reason-CT menerima volume NIfTI satu saluran dalam satuan Hounsfield, dan tidak ada yang lain

• Apa arti "3D" — NV-Reason-CT melakukan resampling ke 2 mm isotropik pada kubus 384 milimeter dan memotongnya menjadi patch 8 x 8 x 8 untuk grid 24 x 24 x 24; masukan video Gemini 3.1 Pro adalah urutan frame dua dimensi dengan linimasa

• Konteks — 1.048.576 token masuk dan 65.536 keluar untuk Gemini 3.1 Pro; satu volume adalah 13.824 token visual untuk NV-Reason-CT, tanpa downsampling dan tanpa lapisan penggabungan, dan tidak ada jendela obrolan di sekitarnya

• Rilis — 19 Februari 2026 untuk Gemini 3.1 Pro, pada slug pratinjau; peluncuran riset yang tidak diumumkan untuk NV-Reason-CT, dengan aktivitas repositori bertanggal 2 hingga 25 September 2026

• Harga — $2 dan $12 per juta token hingga 200.000 token, lalu $4 dan $18, dengan pembacaan cache sebesar $0,20 dan penulisan cache sebesar $0,375; dibandingkan dengan bobot yang di-hosting sendiri tanpa kartu tarif

• Kemampuan — visi, audio, penggunaan alat, keluaran JSON, dan penalaran untuk Gemini 3.1 Pro; temuan terstruktur berdasarkan region anatomi untuk NV-Reason-CT, tanpa alat

• Lisensi dan status — API pratinjau yang dihosting; terhadap bobot OpenMDW-1.1 yang kartu modelnya menyatakan hanya untuk penelitian dan pendidikan serta menyatakan secara tegas bahwa ini bukan perangkat medis

Input video dan input CT volumetrik terlihat berdekatan dari kejauhan dan tidak bisa lebih jauh berbeda saat dilihat dari dekat. Video adalah frame-frame seiring waktu. Studi CT adalah volume statis tunggal dengan tiga sumbu spasial, skala fisik dalam milimeter dan unit densitas terkalibrasi, di mana yang diukur adalah densitas suatu struktur yang ukurannya penting. Gemini 3.1 Pro akan menonton rekaman bedah dan menjelaskan apa yang terjadi. Ia tidak akan mengukur nodul. Itu bukanlah keterbatasan yang gagal diatasi Google; itu adalah masalah berbeda yang belum dipecahkan siapa pun dengan model umum.

Apa yang dicakup oleh kedua catatan benchmark, dan apa yang tidak disertakan.

Gemini 3.1 Pro memiliki rekam jejak independen dan rekam jejak itu bagus pada sumbu yang diukurnya.

• GPQA Diamond — 94,1, angka tertinggi di seluruh rangkaian artikel ini

• Humanity's Last Exam — 47, dengan skor recall konteks panjang 82, lagi-lagi yang tertinggi dalam perbandingan ini

• IFBench dan SciCode — 77,14 dan 58,7

• τ²-Bench — 95,61, dengan tau_banking pada 21,44 dan Terminal-Bench Hard pada 53,79

• Artificial Analysis Kecerdasan dan Pengodean — 29,7 dan 68,8

• Latensi terukur — median sepuluh detik hingga token pertama, yang tampaknya merupakan batas atas, bukan median sebenarnya, pada 978 token per detik dan tingkat galat 93,93%

Perhatikan bentuknya: profil pengetahuan dan konteks panjang di bagian atas perbandingan, indeks kecerdasan di bagian tengah bawah, dan pengukuran ketersediaan yang tidak dapat digunakan. Ketiganya menggambarkan model yang sama pada rute yang sama. GPQA Diamond yang tinggi berarti model ini tahu banyak hal. Komposit 29,7 berarti model ini tidak unggul dalam segala hal. Tingkat kesalahan 93,93% berarti bahwa, pada jalur khusus ini, sebagian besar permintaan Anda tidak akan selesai — dan itu hampir pasti merupakan fakta kapasitas dan penyediaan tentang endpoint pratinjau, bukan properti dari bobotnya. Kita tidak dapat membuktikan yang mana dari luar. Yang dapat kita katakan adalah tidak ada satu pun dari ketiga angka tersebut yang salah ketik dan arsitektur apa pun yang hanya membaca angka pertama akan mengalami minggu yang buruk.

Rekor NV-Reason-CT lebih sempit dan disertai catatan yang berbeda. F1 0,614 dan AUROC 0,871 miliknya pada CT-RATE, di seluruh delapan belas label dengan ambang batas seragam tetap dan prompt ya/tidak langsung serta tanpa kepala klasifikasi atau adaptasi khusus tugas, adalah angka milik NVIDIA sendiri dari makalah NVIDIA sendiri. Kumpulan pembanding di baliknya — VoxelFM pada 0,581, Pillar-0 pada 0,544, ClinFusion-8B pada 0,442, CT-CLIP pada 0,398, Merlin pada 0,358, MedGemma 1.5 pada 0,303 — hanya berisi model pencitraan. Tidak ada model multimodal umum yang muncul, yang berarti pertanyaan "bagaimana performa Gemini 3.1 Pro di CT-RATE" belum diajukan, apalagi dijawab.

A generated scoreboard titled 'Breadth on one side, depth on the other' with two columns. The left column, headed 'Gemini 3.1 Pro', lists six rows: inputs, text, image, audio, video, file; context, 1,048,576 in and 65,536 out; GPQA Diamond 94.1; AA Intelligence 29.7; route reliability, 93.93% measured error rate; price, $2 and $12 per million tokens, doubling past 200k. The right column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI in Hounsfield units; context, 13,824 visual tokens per volume, no chat window; CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; route reliability, not applicable, self-hosted; price, no rate card, no published throughput. A footer reads 'The 93.93% error rate describes a preview route under load, not the quality of the weights.'

Masalah tingkat pratinjau, dirumuskan dengan tepat

Ini adalah bagian dari perbandingan yang sama sekali tidak berkaitan dengan CT dan sepenuhnya berkaitan dengan menjalankan apa pun yang bersifat klinis.

Tingkat kesalahan 93,93% bukanlah degradasi yang halus. Itu adalah jalur di mana sebagian besar panggilan gagal. Reaksi alaminya adalah menyatakan model tersebut tidak dapat digunakan, dan reaksi itu salah karena dua alasan. Pertama, tingkat kesalahan yang diukur pada endpoint pratinjau mencerminkan kapasitas, kuota, dan perutean regional, bukan kemampuan model. Tingkat pratinjau Google terkenal disediakan untuk evaluasi, bukan untuk produksi, dan slug yang dinamai untuk pratinjau adalah slug yang dapat dibatasi tanpa pemberitahuan. Kedua, pengukuran itu adalah snapshot dari satu jalur pada satu momen. Itu akan berubah. Yang tidak akan berubah adalah pelajarannya: ketergantungan pada jalur pratinjau adalah ketergantungan pada keputusan kapasitas yang dibuat oleh orang lain.

Mitigasi tersebut tidak glamor, dan itulah alasan utama routing ada sebagai disiplin, bukan sekadar kemudahan.

• Jangan pernah meng-hard-code slug pratinjau ke dalam jalur produksi — letakkan kemampuan tersebut di balik antarmuka agar model di baliknya dapat ditukar tanpa deploy

• Coba lagi dan beralih ke penyedia atau model yang berbeda — untuk pekerjaan ekstraksi batch, tingkat kegagalan 94% masih dapat ditoleransi jika kegagalannya dialihkan ke tempat lain, dan fatal jika tidak

• Ukur tingkat kesalahan Anda sendiri daripada mewarisi angka dari orang lain — angka 93,93% adalah angka katalog kami untuk satu rute, dan angka Anda akan bergantung pada wilayah Anda, volume Anda, dan bentuk beban kerja Anda

• Jaga model kedua tetap siap untuk apa pun yang berada dalam linimasa klinis — mode kegagalan yang Anda lindungi bukanlah jawaban buruk, melainkan tidak adanya jawaban

Disiplin yang sama berlaku dalam arah sebaliknya di sisi CT, yang tidak memiliki rute sama sekali. Model yang di-host sendiri tidak memiliki tingkat kesalahan penyedia; ia memiliki tingkat kesalahan perangkat keras, beban pemeliharaan, dan plafon kapasitas yang ditentukan oleh berapa banyak GPU yang Anda beli. Mode kegagalannya adalah antrean, dan mitigasinya adalah penjadwalan, bukan failover. Masalah berbeda, aturan sama: ketahui angka mana yang sebenarnya Anda andalkan.

Di mana konteks panjang benar-benar membantu, dan di mana tidak

Jendela 1.048.576 token dan skor recall konteks panjang 82 poin milik Gemini 3.1 Pro adalah keunggulan nyata dan layak digunakan secara sengaja, bukan secara kebetulan.

Tempat manfaatnya terasa dalam program CT bukanlah pemindaiannya. Melainkan segala hal di sekitarnya. Satu proses ekstraksi atas catatan operasi yang panjang dan laporan-laporan terkaitnya, menjaga seluruh dokumen tetap dalam konteks sehingga bidang-bidangnya konsisten satu dengan yang lain. Ringkasan kohort yang harus menampung ratusan narasi pasien sekaligus untuk menemukan pola di antara semuanya. Pekerjaan konversi di mana skema, seratus contoh rekaman, dan log galat semuanya perlu terlihat dalam panggilan yang sama. Itulah pekerjaan-pekerjaan di mana jendela panjang mengubah jawaban, bukan sekadar kenyamanan.

Tempat hal itu tidak membantu adalah pemindaian itu sendiri, dan alasannya layak dinyatakan secara tepat karena itulah kesalahan yang diundang oleh pertarungan ini. CT dada yang direpresentasikan dengan cara NV-Reason-CT merepresentasikannya memakan 13.824 token. Gemini 3.1 Pro dapat menampung tujuh puluh studi semacam itu di dalam jendelanya dengan ruang yang masih tersisa. Kendalanya bukan ruang. Kendalanya adalah bahwa jalur visi Gemini 3.1 Pro memperlakukan citra sebagai gambar dengan skala piksel, sehingga studi yang disajikan dengan cara itu telah kehilangan jarak antarslice dan kalibrasi densitas sebelum token pertama dikeluarkan. Anda dapat menghabiskan satu juta token pada suatu volume dan tetap saja tidak memiliki volume. Perbandingan dari makalah itu sendiri membuat biaya dari hal itu menjadi konkret: MedGemma 1.5 dengan F1 0,303 saat diberi masukan hingga 85 irisan aksial, dibandingkan dengan 0,614 untuk model volumetrik native, yang merupakan selisih sekitar dua kali lipat.

Di mana kita cocok, dan satu hal yang tidak akan kita katakan

Gemini 3.1 Pro dilayani melalui OrcaRouter sebagai google/gemini-3.1-pro-preview dengan tarif daftar penyedia tanpa markup, di dalam satu API yang mencakup lebih dari 200 model. Untuk model yang saat ini berada di tier pratinjau, kombinasi itu lebih berguna daripada yang terdengar. Tanpa markup berarti perubahan tarif vendor tiba di sisi kami pada hari yang sama alih-alih diserap oleh lapisan perantara yang menyimpan angka lama. Failover otomatis berarti rute yang mulai gagal tidak ikut menjatuhkan batch — yang, mengingat tingkat kesalahan terukur di kisaran 90-an pada satu jalur, bukanlah hal hipotetis. Dan DSL perutean untuk mengirim permintaan individual ke model yang seharusnya menanganinya memungkinkan Anda menempatkan pekerjaan konteks panjang pada satu model dan pekerjaan bervolume tinggi yang murah pada model lain tanpa memelihara dua integrasi.

NV-Reason-CT tidak ada di platform kami. Model NVIDIA mana pun juga tidak. Itu adalah bobot yang Anda unduh dan jalankan sendiri, dan penggambaran yang jujur adalah bahwa dua bagian dari arsitektur ini berada di tempat yang sepenuhnya berbeda: satu di balik API dengan daftar harga dan risiko pratinjau, yang lain di perangkat keras Anda sendiri dengan lisensi OpenMDW-1.1 dan angka throughput yang harus Anda hasilkan sendiri.

A generated scoreboard titled 'What each side gives you, and what it costs' listing five paired rows. Row one: widest input surface, audio, video, image and file against text only, one modality at a time. Row two: longest context, 1,048,576 tokens in against 13,824 tokens per volume. Row three: highest benchmark, GPQA Diamond 94.1 against CT-RATE F1 0.614. Row four: weakest measured figure, a 93.93% route error rate against no published throughput at all. Row five: dependency, a hosted preview tier against your own GPUs. A footer reads 'Both sides carry a number nobody should build on without measuring it themselves.'A screenshot of the OrcaRouter model page for Gemini 3.1 Pro, showing the identifier google/gemini-3.1-pro-preview with tags for Vision, Audio, Video, Tools, JSON and Reasoning, the description of it as a multimodal model accepting text, image, audio, video and file input, and a side panel listing a 1,048,576-token context window with up to 65,536 output tokens. A stat strip reads $2.00 per million input tokens, $12.00 per million output tokens, a median time to first token, and an error rate of 93.93 percent.

Keputusan yang bertahan saat bersentuhan dengan produksi

Jika masalah Anda adalah pemahaman teks, audio, video, atau dokumen pada konteks panjang, Gemini 3.1 Pro secara independen terukur berada di puncak bidang ini dalam hal pengetahuan dan recall, dan satu-satunya hal yang menghalangi antara ia dan pipeline produksi adalah keandalan rute — yang merupakan masalah rekayasa yang dapat dipecahkan, bukan masalah model. Tempatkan ia di belakang failover, jangan hard-code slug pratinjau, dan ukur tingkat kesalahan Anda sendiri daripada memercayai milik siapa pun, termasuk milik kami.

Jika masalah Anda adalah volume CT dada atau perut, hanya ada tepat satu model terbuka dalam perbandingan ini yang dapat menanganinya, itu bukan model dengan jendela sejuta token, dan angka yang seharusnya mengatur perencanaan Anda bukanlah skor F1-nya. Itu adalah latensi per studi yang belum dipublikasikan siapa pun. Ukurlah sebelum Anda menjanjikan angka throughput kepada siapa pun.

Perbandingan ini layak dilakukan karena memisahkan dua hal yang terus-menerus dicampuradukkan: keluasan masukan dan kedalaman representasi. Gemini 3.1 Pro memiliki permukaan masukan terluas yang pernah dirilis siapa pun dan daya ingat konteks panjang terbaik dalam kumpulan ini, namun tetap tidak dapat membaca studi CT sebagai studi CT. NV-Reason-CT dapat membaca satu studi dan tidak yang lain. Sebuah pipeline membutuhkan keduanya, membutuhkannya pada infrastruktur yang berbeda, dan perlu mengetahui angka mana dari dua angka di tiap sisi yang akan memanggil Anda pada pukul tiga pagi.