
NV-Reason-CT vs Qwen3.8 Max: Penyetelan Halus dan Keluarga Asalnya
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 45 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 182 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Baris pertama NV-Reason-CT kartu model memberi tahu Anda sesuatu yang dilewatkan sebagian besar orang. Model dasarnya adalah Qwen/Qwen3.5-4B, yang tercantum dalam metadata repositori sebagai relasi fine-tune. Jadi ketika NVIDIA membutuhkan model bahasa untuk memasangkan transformer visi Primus 3D, ia mengambil Qwen. Bandingkan checkpoint itu dengan Qwen3.8 Max — unggulan 1.000.000 token milik Alibaba sendiri, yang dirilis pada 3 Agustus 2026 — dan Anda sedang melihat sebuah fine-tune dan bisnis keluarga. Yang satu adalah spesialis 4,69B yang membaca volume CT dada dan perut dan diterbitkan ke Hugging Face pada 8 September 2026 tanpa pengumuman. Yang lain adalah unggulan umum dengan input teks, gambar, dan video, kartu tarif yang dipublikasikan, dan 37,2 juta token lalu lintas terukur di jaringan kami dalam sepekan terakhir. Pertanyaan yang menarik bukanlah mana yang menang. Melainkan apa yang dapat dilakukan fine-tune 4B yang tidak dapat dilakukan unggulan keluarganya, dan mengapa jawabannya lebih spesifik daripada yang Anda duga.
Apa yang diperoleh dari fine-tune, secara konkret
Cara NVIDIA sendiri membingkai kesenjangan itu luar biasa presisi, dan itulah kalimat paling berguna di repositori: sebagian besar sistem visi-bahasa "entah beroperasi pada gambar 2D atau memampatkan fitur volumetrik sebelum pendekodean bahasa." Itu adalah deskripsi dari seluruh kelas model, dan mencakup setiap model unggulan multimodal serbaguna di pasar.
Perbaikannya bersifat arsitektural, bukan soal skala. Masukan 384×384×384 mm menjadi kisi 24×24×24 yang terdiri dari 13.824 token visual. Token-token itu dan koordinat tiga dimensinya masuk ke model bahasa tanpa penurunan sampel spasial, dan MRoPE 3D mempertahankan hubungan spasial di dalam decoder. Volume masukan dipangkas dengan mempertimbangkan anatomi ke dada atau perut menggunakan unit Hounsfield paru, lalu disampel ulang ke resolusi isotropik 2 mm.
Bacalah itu dengan membandingkannya pada apa yang diterima Qwen3.8 Max. Teks, gambar, dan video — dan video adalah hal yang paling mendekati input volumetrik dalam seri ini, yang menjadikannya titik perbandingan yang jujur, bukan sekadar retoris. Video adalah tumpukan bingkai 2D yang diurutkan berdasarkan waktu. Volume CT adalah tumpukan irisan 2D yang diurutkan berdasarkan posisi fisik sepanjang sumbu z, dalam satuan Hounsfield, dengan jarak milimeter yang diketahui. Keduanya adalah larik tiga dimensi. Hanya salah satunya yang memiliki sistem koordinat fisik yang dapat dijadikan acuan pelokalan temuan seorang radiolog, dan hanya salah satunya yang diukur dalam satuan yang bermakna di luar sensor gambar. Model yang dilatih pada video mempelajari kesinambungan temporal. Model yang dilatih pada volume CT mempelajari bahwa suatu massa pada satu irisan adalah massa yang sama pada irisan berikutnya, delapan milimeter lebih rendah.
Korpus pelatihan adalah pembeda yang sesungguhnya.
Di sinilah kedua model sama sekali tidak lagi bisa dibandingkan, dan inilah bagian yang disembunyikan oleh lembar spesifikasi.
NV-Reason-CT dilatih secara end-to-end dengan fine-tuning terawasi diikuti oleh Group Relative Policy Optimization pada sekitar 550.000 contoh QA terstruktur yang diambil dari 70.111 volume CT unik. Sumbernya adalah CT-RATE — 47.149 kasus dari Istanbul Medipol University Mega Hospital dengan laporan radiologi berpasangan — kumpulan internal NIH berisi 15.991 kasus, dan 22.720 kasus CancerVerse di empat fase kontras dan tiga belas jenis tumor ganas. Korpus ini mencakup laporan terstandardisasi, QA yang berfokus pada kelainan, dialog multi-putaran, dan penalaran yang ditulis oleh ahli radiologi yang ditranskripsikan dari interpretasi ahli yang direkam. Tahap GRPO menggunakan imbalan yang dapat diverifikasi pada kumpulan kelainan toraks dan abdomen, yang berarti sinyal imbalan memeriksa apakah temuan yang dinyatakan ada dalam volume, bukan apakah prosanya terdengar klinis.
Korpus pelatihan Qwen3.8 Max tidak dipublikasikan dengan detail seperti itu, dan itu tidak akan membantu meskipun dipublikasikan, karena kemampuan yang menjadi target bersifat umum. Sebagai gantinya, angka Artificial Analysis-nya adalah bukti yang relevan: Intelligence Index 45,4 yang menempatkannya di peringkat 15 dari 145 model dalam snapshot API kami, AA Coding 76,2 di peringkat 9, Terminal-Bench 2.1 di 88,8, GPQA Diamond 92,8, Humanity's Last Exam 43,1, SciCode 52,1, dan recall konteks panjang 80,3. Itu adalah pengukuran pihak ketiga, bukan klaim vendor, yang menjadikannya angka paling dapat dipercaya di kedua sisi halaman ini.
Output penalaran, dua kontrak yang berbeda
Kedua model mengeluarkan jejak penalaran dan keduanya memungkinkan Anda menonaktifkannya. Kemiripannya berakhir di antarmuka.
Qwen3.8 Max menyediakan enable_thinking dan reasoning_effort, bersama dengan seluruh permukaan sampling — temperature, top_p, seed, penalti, output terstruktur, pemanggilan alat. Ini adalah kemampuan penalaran umum yang dapat Anda arahkan ke apa pun yang Anda miliki. Kemampuan berpikirnya sebaik masalah yang Anda berikan kepadanya, dan ia tidak memiliki cara untuk memverifikasi klaim terhadap apa pun selain teks yang diberikan kepadanya.
NV-Reason-CT memiliki kontrak yang lebih sempit dengan pembaca, dan kartu model menyatakan batasnya secara eksplisit: penalaran yang dihasilkan adalah "output model yang dapat ditinjau dan tidak dijamin merepresentasikan komputasi internal model." Peringatan itu benar-benar berfungsi, dan itu adalah jenis kalimat yang hanya muncul ketika sebuah tim telah memikirkan apa yang akan dilakukan seorang klinisi terhadap jejak yang terdengar masuk akal. Kartu tersebut menggambarkan output sebagai observasi yang dapat ditinjau, diagnosis banding, dan ketidakpastian. Dengan kata lain, jejak yang dapat Anda cocokkan dengan volume, bukan jejak yang hanya dapat Anda baca.
Throughput, dari satu-satunya tempat kita bisa mengukurnya
Qwen3.8 Max memindahkan 37,2 juta token melalui playground milik OrcaRouter sendiri dalam tujuh hari terakhir. Waktu mediannya menuju token pertama adalah 1,96 detik — dengan nyaman menjadi yang tercepat di antara model-model dalam seri ini — pada 53,3 token keluaran per detik. Tingkat kesalahannya selama periode itu adalah 3,5%.
Kedua angka itu menarik ke arah yang berlawanan dan keduanya penting. Latensinya sangat baik dan membuat model ini menyenangkan untuk diiterasi. Tingkat kesalahannya sekitar tujuh belas kali lebih tinggi daripada 0,21% milik Kimi K3 pada jendela waktu yang sama, dan itulah angka yang menentukan apakah Anda menaruhnya di balik panggilan sinkron yang menghadap pengguna atau tugas batch dengan percobaan ulang. Ini adalah perilaku terukur di jaringan kami, bukan tolok ukur, dan ini adalah jenis hal yang tidak pernah diberitahukan oleh daftar harga kepada Anda.
NV-Reason-CT tidak memiliki pengukuran yang setara di mana pun. Ini adalah checkpoint BF16 10,6 GB dengan kode model kustom, dimuat dengan trust_remote_code=True pada perangkat keras Ampere, Hopper, atau Lovelace, diuji oleh NVIDIA pada H100 dan L40S. Tidak ada p50, tidak ada tingkat kesalahan, dan tidak ada angka throughput yang dipublikasikan. Siapa pun yang memberi tahu Anda volume crossover saat self-hosting ini lebih unggul daripada membayar per token sedang menebak.
Harga dan bentuk, berdampingan
• Harga — belanja modal GPU NV-Reason-CT, tidak ada tarif per token vs Qwen3.8 Max $2.00 / $6.00 per juta token, $0.25 baca cache, $2.50 tulis cache
• Masukan — Volume CT NIfTI 3D NV-Reason-CT dalam satuan Hounsfield, hanya dada atau abdomen vs Qwen3.8 Max teks, gambar, dan video
• Konteks — NV-Reason-CT satu volume, prefiks tetap 13.824 token vs Qwen3.8 Max 1.000.000 token
• Parameter — NV-Reason-CT 4,69B total / 4,35B aktif di jalur CT vs Qwen3.8 Max tidak diungkapkan
• Lisensi — NV-Reason-CT OpenMDW-1.1, bobot dipublikasikan vs Qwen3.8 Max proprietary, akses API saja
• Skor independen — NV-Reason-CT tidak ada vs Qwen3.8 Max AA Intelligence Index 45,4, GPQA Diamond 92,8

Ekonomi cache Qwen3.8 Max memberi keuntungan pada pola tertentu: pembacaan cache senilai $0,25 terhadap input baru senilai $2,00 adalah diskon delapan kali lipat, dan penulisan cache senilai $2,50 berarti prefiks panjang yang dapat digunakan kembali akan cepat balik modal. Itulah pola beban kerja dari prompt sistem plus dokumen protokol yang digunakan kembali di ribuan permintaan. NV-Reason-CT memiliki profil biaya yang berlawanan — biaya marginal per pemindaian hampir nol setelah GPU dibeli, dan batas bawah keras berupa satu GPU yang ditahan tanpa batas waktu.

Menjalankan keluarga bersama-sama
Arsitektur yang alami di sini, dan patut dikatakan bahwa belum ada yang mempublikasikannya, adalah fine-tune untuk volume dan model unggulan untuk segala hal di sekitarnya. NV-Reason-CT menghasilkan temuan terstruktur; Qwen3.8 Max menangani teks rujukan, pencocokan protokol, pengodean, surat tindak lanjut — pekerjaan teks bervolume tinggi tempat jendela sejuta token dan diskon cache delapan kali lipat benar-benar membuktikan kegunaannya.
Jika itu pipeline Anda, separuhnya adalah checkpoint yang Anda hosting sendiri dan separuhnya lagi adalah token yang Anda beli, dan paruh kedua itulah tempat router melakukan sesuatu yang tidak bisa dilakukan oleh endpoint satu vendor. Qwen3.8 Max dilayani melalui OrcaRouter dengan harga daftar Alibaba tanpa markup, jadi $2.00 / $6.00 di atas adalah yang Anda bayar dan setiap pergerakan harga di masa depan langsung masuk ke tagihan Anda pada hari yang sama, bukan saat perpanjangan. Failover otomatis antar penyedia jadi lebih penting dari biasanya ketika tingkat kesalahan terukur dari model itu sendiri adalah 3,5% — percobaan ulang yang diarahkan ke endpoint sehat yang berbeda adalah pembeda antara gangguan sesaat dan batch yang gagal. Dan karena paruh umum dari pipeline adalah satu nama model di balik endpoint yang kompatibel dengan OpenAI yang mencakup 200+ model, menukar dengan model lain untuk eksperimen selama seminggu hanya butuh mengubah string, bukan integrasi.
NV-Reason-CT, supaya jelas, tidak ada di OrcaRouter dan tidak akan ada — itu adalah inferensi 3D dengan kode kustom yang Anda jalankan sendiri. Versi jujur dari kisah integrasinya adalah bahwa spesialis yang di-hosting sendiri dan generalis yang dirutekan bisa berada di bawah satu kunci, dan hanya itulah keseluruhan klaimnya.

Putusan yang benar-benar berlaku
Perbandingan ini sering dimasukkan ke kategori "mana yang lebih baik" dan seharusnya tidak demikian. Qwen3.8 Max diukur oleh pihak ketiga pada penalaran umum dan mengalahkan sebagian besar pesaing; NV-Reason-CT hanya punya satu tabel berisi angkanya sendiri pada satu tolok ukur CT, plus jumlah parameter 4,69B yang tidak akan istimewa dalam perbandingan umum mana pun. Pada tolok ukur umum mana pun, model unggulanlah yang menang, dan alasannya adalah karena tolok ukur umum itulah yang menjadi tujuan pembuatannya.
Pada satu tugas yang menjadi alasan NV-Reason-CT dibuat — membaca volume CT dada atau abdomen dan menyebutkan isinya, dengan jejak yang dapat diperiksa seseorang — Qwen3.8 Max bukan pesaing yang lebih lemah. Model ini tidak memiliki encoder volumetrik, sehingga ia sama sekali tidak dapat dijalankan pada input tanpa seseorang terlebih dahulu memutuskan cara meratakan pemindaian menjadi gambar. Keputusan itulah yang menentukan nasib informasi spasial. Itulah inti dari fine-tune 4B dengan jalur 3D native dan prefiks tetap 13.824 token, dan itulah sebabnya hal yang menarik tentang model ini adalah kecilnya backbone-nya, bukan ukurannya.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
